Transformer— Attention Is All You Need
循环模型逐 token 处理——长程依赖越传越淡,而且无法并行。 核心思想:只用注意力、不用循环——每个 token 一步看到所有其他 token,整个序列并行训练。 此后几乎所有大语言模型都建在这套架构上。
行文由这些零件搭成。每一个都只消费 token 的语义层——换一套颜料,它们全部跟着变。本页所有内容都从 astro-inkstone/components/ 按路径导入,用包的默认 token 渲染;组件是纯展示的:数据与标签文案都走 props(默认英文),任何语言的站点传自己的即可。
五个变体;title 覆盖内置标签。引用语法与裸 HTML 两种写法见全要素演示。
行内徽章,标状态或分类,四个变体与 PaperCard 标签、HubCard 徽章共用一套:稳定 测试中 研究 新增——也可传自定义色调做主题色板:自定义色调
一套栅格,三种皮(plain、card、cmp)。卡片:
先 token。引入顺序是契约的一部分:token、内容层、站点 chrome,依次来。
只碰语义层。组件从不写裸色值——换掉色板,它们全体跟着走。
对照皮,专为前后对比:
没有守门——漏了闭合的 ** 以两个字面星号的样子上线。
有守门——构建当场失败,精确到 file:line:column,插标压在肇事标记下面。
竖轨上的 markdown 列表:
file: 依赖。tokens.css 与 base.css,做 wiki 站再加 browse.css。astro.config 里接上 siteMarkdown()。综述工作马——别名、全名、会议标签、作者、链接,外加两个专用槽:
循环模型逐 token 处理——长程依赖越传越淡,而且无法并行。 核心思想:只用注意力、不用循环——每个 token 一步看到所有其他 token,整个序列并行训练。 此后几乎所有大语言模型都建在这套架构上。
深入小节的标题下,可以放一行大白话注解(.speak),先讲清这个模块是干什么的,再进机制:
注意力就是一张软查找表:每个 token 都问一句"谁跟我相关?",拿回一份按相关度加权的混合答案。