术语对照表

论文术语

视频里的说法

Encoder 编码器

左塔 · 负责读懂

Decoder 解码器

右塔 · 负责往外写

Input Embedding 词嵌入

把字变成数字的门票

Positional Encoding 位置编码

号码牌

(Multi-Head) Attention 注意力

(分组)圆桌会议

Q / K / V

我在找什么 / 我是谁 / 我能给什么

Add 残差连接

带着原话进下一层,防跑偏

Norm 层归一化

把发言音量拉齐

Feed Forward 前馈网络

散会后回工位独立消化

Masked Attention 掩码注意力

遮住后面的答案,不许偷看

Cross-Attention 交叉注意力

写每个字前回头看原文

Linear + Softmax

全词表打分 → 分数变概率

同样的楼层盖 N 层

演进术语对照

术语

大白话

大致时间

规则翻译 RBMT

人手写词典+语法规则

1950s–80s

统计翻译 SMT

喂双语对照,靠概率猜(早期谷歌翻译)

1990s–2000s

RNN seq2seq + 注意力

神经网络翻译,注意力当"配角"帮 RNN 别忘词(Bahdanau 2014)

2014

Transformer

扔掉 RNN,注意力当主角

2017

模板匹配

拿字逐个套模板,换字体就失灵

早期

CNN

卷积网络,先切字再逐个认

2012 起

CRNN(CNN+RNN+CTC)

一次读整行,不用先切字

2015

TrOCR

用 Transformer 做文字识别

2021

S01 · 开场

2017年,Google 八个人发了一篇论文,标题起得非常狂——《Attention Is All You Need》,注意力就是你需要的一切。当时不少人觉得这是标题党。八年过去,ChatGPT、Claude、DeepSeek,你现在用的每一个AI,脑子里跑的都是这篇论文的架构。今天我不光讲论文本身,还讲讲我在工作里天天跟它打交道之后,才真正看懂的那部分。

S02 · 传话游戏

先说这篇论文之前的世界。那时候让机器读句子,主流是循环神经网络,RNN。它读句子的方式,像小时候玩的传话游戏:一个字一个字往后传,每个字只能从前一个字手里接消息。句子一长,队尾早就不知道队头说了什么。这就是当年长句子翻译总翻车的原因——不是不聪明,是天生记不住。

S03 · 必须排队

更要命的是第二个问题:必须排队。第一百个字,必须等前九十九个字处理完才轮到它。你买再多显卡也没用,因为活儿没法分下去。当年做翻译系统最头疼的就是这个:效果想上去,训练速度先把人拖死。

S04 · 圆桌会议

这篇论文干的事,说穿了就一个动作:把"排队传话"改成"圆桌会议"。句子里所有的词,同时进会议室,两两对视。每个词都能直接看到其他任何一个词,不用传话,不用排队。第一个字和第一百个字之间,是直连的。这个机制,就叫注意力,Attention。

S05 · Q/K/V 找人办事

那"对视"具体怎么算?论文给每个词发了三样东西:Q、K、V。别被字母吓到,就是找人办事那套:Q 是你在群里喊的那句"谁懂 Nginx?"——我在找什么;K 是每个人头上挂的职位牌——我是谁;V 是匹配上之后人家真正掏出来的干货——我能给什么。你的 Q 跟谁的 K 对得上,就多拿谁的 V。整个注意力机制,就是一场大型的精准找人。

S06 · 苹果的歧义

举个例子。"苹果发布了新手机","苹果"单看是水果还是公司?说不清。但在会议室里它一抬头,看见了"发布"、看见了"手机",立刻明白:这里我是公司。词的意思不是查字典查出来的,是看同桌看出来的。这就是 Transformer 理解语言的根本方式。

对了,顺一句容易混的:把"苹果"变成一串数字,那一步叫词嵌入、embedding,但它是死的——水果和公司拿到的是同一串。真正让它分清自己是公司的,不是 embedding,是注意力。embedding 给出厂设置,注意力管临场发挥。(这一步对应架构图里最底下那个"发门票",别跟注意力搞混。)

S07 · 平方的代价(伏笔)

但这里埋着一个代价,先记住它,后面要考:两两对视,四个人要握 6 次手,八个人要握 28 次。人数翻一倍,握手次数翻四倍——平方级增长。你以后遇到的所有上下文长度限制、AI 太贵的问题,根子都在这 28 次握手里。

S08 · 多头注意力

论文还有几个关键设计。第一个:一场会不够,开八场。同样这些词,分成八个小组同时开会,每组盯的角度不一样——有的组盯语法结构,有的组盯"它"指代谁,有的组盯情感色彩。开完各自汇总。这就是多头注意力:同一句话,八个视角同时看。

S09 · 号码牌

第二个:号码牌。所有词同时进场,有个副作用——谁先谁后这个信息丢了。"狗咬人"和"人咬狗",参会的是同样三个词,意思天差地别。所以进场前,每个词胸口贴一个位置编号。这就是位置编码。顺序不是天生的,是补发的。

S10 · 楼层提炼

第三个:会不止开一轮。一楼开完,结论带到二楼接着开,一路开到顶楼。低楼层看字面——哪个词挨着哪个词;高楼层看含义——这句话是在讽刺还是在夸。一层一层提炼,就是所谓的"深度"。

——你常听到的"深度学习",那个"深"字,说的就是这个:层数多。楼叠得越高,网络越"深",GPT 这类模型动不动几十上百层。所以"深度学习"翻成大白话,就是"用很多层的网络来学"。不过得说清楚:深度学习不是这篇论文发明的,早就有了;Transformer 只是其中一种特别能往高里叠、又能并行开会的盖楼方式。

S11 · 论文架构图 · 全图总览

现在,我把论文里那张最著名的架构图,原样搬出来。别慌——你刚才其实已经把它学完了。这张图是两座塔:左边这座叫编码器,Encoder,负责把输入读懂;右边这座叫解码器,Decoder,负责一个字一个字往外写。你听说过的 GPT,本质上就是只保留了右边这座塔。接下来我们从下往上,把每个方块过一遍,你会发现每个吓人的术语,都对得上刚才的比喻。

S12 · 左塔 · 编码器逐块

先看左塔,从底往上。Input Embedding,词嵌入——把每个字变成一串数字,相当于发进会议室的门票。Positional Encoding,位置编码——刚才发的号码牌,就装在这儿。往上这个橙色块,Multi-Head Attention,多头注意力——八个小组的圆桌会议,开起来。会开完有个 Add & Norm:Add 是残差连接,把开会前的原话跟会议结论一起带走,防止越传越跑偏;Norm 是归一化,把大家的发言音量拉齐,别让嗓门大的说了算。最上面 Feed Forward,前馈网络——散会后每个词回自己工位,独立消化刚听到的东西,这一步互不交流。这一整套重复 N 遍,就是刚才说的一层层楼。

S13 · 右塔 · 解码器的两个新面孔

右塔多了两个新面孔。第一个,Masked Multi-Head Attention,带面具的注意力。解码器是负责写字的,写第五个字的时候,不许偷看第六个字——面具就是把"后面的答案"遮住,只能看已经写出来的部分。文字接龙的规则,就是从这儿来的。第二个新面孔在塔中间:这场会的 Q 来自右塔自己,K 和 V 却来自左塔——写每个字之前,先回头看一眼原文。这叫交叉注意力。你翻译的时候也这样:写一句译文,回头瞟一眼原句。

S14 · 塔顶 · 输出头

塔顶最后两块。Linear,线性层——把会议结果对到整个词表上,几万个候选字,每人领一个分数。Softmax——把分数变成概率。最后从概率最高的那批字里挑一个,吐出来。这就是 AI 一个字一个字往外蹦的全部秘密:每蹦一个字,这套流程就跑一遍。

S15 · 并行放行

好,现在说这篇论文真正改变历史的地方。不是效果好了几个点——是可以并行了。RNN 是单车道,一辆一辆过;Transformer 是全部车道同时放行。训练的时候整句话、整批数据一起算,显卡有多少用多少。

S16a · 翻译模型进化

你可能会问,这么厉害的东西是突然冒出来的吗?不是,它是被"翻译"这个活儿一步步逼出来的。最早的机器翻译,是人手写词典和语法规则,一条一条抠,遇到例外就补规则,死板得很。到九十年代变成统计翻译——喂进海量的双语对照,让机器靠概率猜哪个词该翻成哪个词,早期的谷歌翻译就是这套。真正的转折在 2014 年:神经网络登场,"注意力"这个机制第一次出现——但注意,它当时只是个配角,是给 RNN 打下手、帮它别把前面的词忘光。直到 2017 年,这篇论文干脆说:RNN 别要了,光靠注意力就够了。配角,转正成了主角。

S16b · 文字识别进化

有意思的是,不只是翻译。旁边还有一条完全独立的技术线——文字识别,就是把图片里的字认出来。它自己也走了很像的一段路:最早是模板匹配,拿字一个一个去套模板,字体一换就抓瞎;2012 年之后换成卷积网络,先把字切开、一个一个认;2015 年的 CRNN 更进一步,一次读一整行、不用先切字。然后到 2021 年,微软的 TrOCR 出来了——你猜它用的什么?还是 Transformer。翻译、识图、写字,本来各修各的路,最后全都开进了同一个圆桌会议。这才是它真正吓人的地方:它不是某一个领域的解法,是通用的。

S16 · 规模爆发时间线

既然各条路都归到它了,剩下的事就一件:把它做大。2017 年论文发表,2018 年 GPT-1,2020 年 GPT-3,2022 年 ChatGPT 引爆,一直到今天。架构八年基本没大变,变的全是规模。所以我说,这篇论文最大的贡献不是"更聪明",是"可扩展"——它让大力真的能出奇迹。

S17 · 转场:论文到实战

以上是论文。下面这部分,是我拿着它在工作里跑了很久之后才真正理解的东西——论文里每一个设计,最后都会变成你账单上的一个数字,或者你排查到半夜的一个坑。

S18 · 上下文的账单

第一件事:上下文为什么寸土寸金。还记得那 28 次握手吗?你给 AI 塞的内容翻一倍,它的计算量翻四倍。我自己跑自动化 Agent,一天能把额度烧穿,回头一看,全是没必要塞进去的长上下文。所以上下文不是仓库,是会议室——会议室是按人头的平方收费的。

S19 · 掉在中间

第二件事:长会议有个特点,开头的发言大家记得,最后的发言大家记得,中间那段,全场划水。模型也一样,这个现象研究里叫 lost in the middle,掉在中间。你塞一份超长文档,问它中间那页的事,翻车概率明显更高。

S20 · 座次表

所以我的实战原则是:重要的东西不靠它记,靠你摆。我给自己的机器人做记忆系统,共享记忆永远拼在提示词最前面;关键约束要么放开头、要么放结尾,从不埋中间。这不是玄学,是注意力机制的座次表——你是主持人,谁坐前排你说了算。

S21 · 纪要复用

第三件事:省钱的机制红利。还记得每蹦一个字,整套流程要跑一遍吗?这场会议有个特性——前面完全相同的部分,纪要可以直接复用,不用重新开。平台把这个叫提示词缓存。只要你每次请求的开头一模一样,那部分就几乎不要钱。

S22 · 我的实战:统一开场白

我最近把本机好几个机器人整合的时候,专门干了一件事:所有机器人共用同一段一字不差的系统提示词。就为了让每次调用的"会议开头"完全相同,稳定命中缓存。这一条改完,成本立刻降下来。看懂机制,省钱就是顺手的事。

S23 · 脑子里的知识 vs 桌上的材料

第四件事:分清两种"知道"。模型有两个信息来源:脑子里的知识——训练时写进权重的,出厂就带;桌上的材料——你这次对话喂给它的上下文。它答不上你们公司的业务问题,不是它笨,是它出厂的时候,你们公司的资料不在教材里。

S24 · 把材料递到桌上

解法不是干等一个更大的模型天生"知道",是把材料递到桌上——把相关文档检索出来塞进上下文,它立刻就能答对。行业里管这叫 RAG,说白了就是:开会前把文件摆到桌上,而不是指望与会者天生记得。

S25 · 金句卡

所以整篇论文看下来,我的实战总结就一句话:AI 的能力上限在权重里,你决定不了;但 AI 在这一次对话里的表现,取决于你怎么摆桌上的材料——重要的东西不靠它记,靠你摆。

S26 · 收尾 + 关注

《Attention Is All You Need》,这个当年看着像吹牛的标题,现在看是预言。你跟 AI 说的每一句话,底下都是那场圆桌会议。理解它,你就知道 AI 为什么强、为什么忘、为什么贵。我是一个写了很多年代码的程序员,关注我,带你把 AI 拆开看。

posted on 2026-08-27 13:23  编程一生  阅读(12)  评论(0)    收藏  举报