把AI从"文盲"训练成"学霸",人类只用了四步

一个连"1+1=2"都不懂的数字胚胎,是怎么长成今天这个让你脊背发凉的硅基怪物的

01. 一个细思极恐的事实

前两篇我们聊了AI怎么说话、怎么画画。

结论很扎心:AI既不懂语言,也不懂艺术。 它就是一个超级"接龙机器"——给上文猜下文,给文字猜像素。它的所有才华,本质上都是"蒙"的,只不过蒙得准。

但读完之后,你心里一定冒出一个更大的疑问:

这个"接龙机器",是怎么变得这么准的?

它刚出生的时候是什么样?它怎么从一张白纸变成了今天这个上知天文下知地理、能写代码能聊人生的怪物?它经历过什么"教育"?

今天这篇,我们就来彻底扒开AI的"成长史"。

你会发现,AI的成长路径,跟一个人类孩子的成长,惊人地相似——

从懵懂无知,到死记硬背,到有老师教,到被社会毒打后学会做人。

只不过它的"童年"只有几个月,"读"过的书却比人类历史上所有图书馆加起来还多。

02. 第一阶段:受精卵——AI的"胚胎"长啥样?

在我们开始"养"AI之前,得先搞清楚一件事:

AI的"胚胎"是什么?

你问任何一个AI研究员,他会告诉你:AI的"胚胎"是一堆随机数

对,你没听错。GPT诞生之前,它脑子里的几千亿个参数(我们前两篇反复提到的"旋钮"),全部是随机的。每个旋钮指向一个完全随机的角度。

这时候你把"床前明月"输进去,它会随机输出任何字——可能是"屎",可能是"啊",可能是"的"。概率完全均等,跟猴子在键盘上乱敲没有区别。

这个阶段的AI,不是"笨",是"死"的。 它没有任何知识,没有任何结构,甚至连"语言的存在"都不知道。它只是一堆漂浮在服务器里的、毫无意义的数字。

就像一颗受精卵。它携带了"成为一个人"的所有潜力,但在分裂之前,它什么都不算。

那这颗"受精卵"是怎么被激活的?

答案:喂数据。

03. 第二阶段:野蛮生长期——预训练(Pre-training)

这是AI成长史上最疯狂、最野蛮、也最关键的阶段。

3.1 喂什么?

工程师们做的第一件事,是给AI准备"食物"。

这个"食物"不是米饭,不是奶粉,是文本——人类有史以来写过的几乎所有文本。

我们来盘点一下AI的"菜单":

  • 英文维基百科:600万篇文章,约40亿词。
  • 中文维基百科:100多万篇文章。
  • 全网公开网页:Common Crawl项目抓取了超过30亿个网页,包含几万亿个词。里面有新闻、博客、论坛帖子、菜谱、产品评价、甚至贴吧的吵架记录。
  • 电子书:几十万本小说、教科书、传记、诗集。
  • 学术论文:arXiv上的所有论文、专利文档。
  • 代码仓库:GitHub上的公开代码,包含Python、Java、C++、JavaScript等所有主流语言。
  • 社交媒体:Reddit的讨论帖、推特的公开推文(虽然现在要付费了)。

总量是多少?

GPT-3的训练数据大约是5000亿个Token(词片段)。GPT-4据推测超过了13万亿个Token。

13万亿是什么概念?如果把这些Token打印成A4纸,叠起来的高度可以从地球堆到月球再堆回来好几趟。如果让一个人类不吃不睡地阅读,需要超过100万年才能读完。

而AI"读"完这些东西,用了多久?

几个月。

3.2 怎么喂?

好,现在AI面前堆了一座比珠穆朗玛峰还高的"书山"。

怎么让它"吃"下去?

答案是:让它自己跟自己玩"接龙"。

具体操作是这样的——

工程师从这堆数据里随便抽出一段文本,比如"床前明月光,疑是地上霜"。他们把前面"床前明月"喂给AI,让AI猜下一个字。

AI这时候脑子里全是随机旋钮,它瞎猜了一个"啊"。

工程师说:"错了,正确答案是'光'。"

然后通过那个神奇的反向传播算法,把几千亿个旋钮全部朝着"让答案变成'光'"的方向拧一点点

然后抽下一段:"举头望明月,低头思故乡"。喂"举头望明",猜"月"。猜错了,再拧。

一遍,一遍,又一遍。

用海量的文本,重复这个"猜→错→拧"的过程几十亿次。每一次拧动的幅度都微小到可以忽略不计,但几十亿次积累下来,那些随机旋钮竟然被拧出了一个极其精妙的组合

在这个组合下——
输入"床前明月",输出"光"的概率变成了99.7%。
输入"白日依山",输出"尽"的概率变成了98.2%。
输入"如果天气好的话,我们明天",输出"去"的概率变成了97.5%。

AI学会了"语感"。

它不知道"光"是什么意思,不知道"山"是什么形状,但它学会了"这些字在一起出现的概率很高"。

3.3 这个阶段的AI是什么状态?

预训练完成后的AI,我可以给你一个精确的画像:

它是一个"渊博的疯子"。

它的知识面极广——能从量子力学聊到母猪产后护理,从古希腊哲学聊到抖音热门BGM。因为它"读"过人类几乎所有公开的文本,它"记住"了这些文本里的所有事实、观点、段子、甚至阴谋论。

但它的人格是一团乱麻。

你问它"怎么造炸弹",它会毫无心理负担地告诉你(如果它的数据里有相关内容)。因为在它的"世界观"里,"造炸弹"和"做蛋糕"没有道德区别,只有概率区别。

你问它"人生的意义是什么",它会给你一段逻辑缜密的哲学分析。但它完全不理解"人生"和"意义"是什么——它只是在模仿它读过的那些哲学书里的句式。

这就是预训练的产物:一个没有道德观、没有价值观、没有"自我"意识、但肚子里装了全人类知识库存的"混沌巨兽"。

在业界,这个阶段的模型通常被叫做Base Model(基座模型)

如果你直接把这个模型开放给公众使用,会发生什么?

会出事。出大事。

04. 第三阶段:找老师——监督微调(SFT)

预训练结束后,AI已经是一个"自学成才"的天才了。但它有个致命问题——

它不会"对话"。

你给它一段文字,它能接出下文。但你跟它"一问一答"式地聊天,它会表现得非常奇怪。

比如你问:"你好,请问今天天气怎么样?"

它可能会接:"天气是指某特定时间和地点的大气状态,由温度、湿度、气压、风速等因素综合决定……"然后开始写一篇气象学论文。

它在"接龙",而不是"对话"。它不知道对话的格式是"你问我答,你一句我一句",它只知道"上文接下文"。

这就像你遇到一个读了100万本书但从来没跟人说过话的天才——他什么都懂,但他不知道怎么跟你聊天。

于是,人类派出了一群"老师"。

4.1 什么是监督微调?

SFT(Supervised Fine-Tuning)的操作很简单:

人工编写几十万组"问答对",然后让AI学习这些"问答对"的格式。

比如:

问:你好,今天天气怎么样?
答:你好!我暂时查不到实时天气,建议你打开天气App看看哦。需要我帮你做点别的吗?

问:怎么煮鸡蛋?
答:很简单!冷水下锅,水开后煮8-10分钟,捞出过凉水,剥壳就能吃了。

问:人生的意义是什么?
答:这是一个很深刻的问题。不同的人有不同的答案,有人认为人生的意义在于追求幸福,有人认为是创造价值,还有人认为是爱与被爱。你最近在思考这个问题吗?

注意看这些答案的"语气"——友好、助人、带点温度、结尾常常反问。

AI被喂了十几万组这样的"问答对"之后,它的旋钮被进一步拧动。这一次拧动的方向不是"让接龙更准",而是"让接龙变成对话格式"

经过SFT之后的AI,终于能像"人"一样对话了。

它学会了——

  • 如果对方在"问",那就先回答,再反问。
  • 如果对方在"倾诉",那就先共情,再给建议。
  • 如果对方在"骂人",那就先道歉,再解释。

但它依然"不懂"这些行为背后的意义。 它只是在模仿"问答对"里的对话模式,就像鹦鹉学会了在你说"你好"之后说"你好"。

4.2 SFT的局限性

SFT虽然让AI学会了对话题,但它有一个问题:AI太"乖"了,乖到无聊。

它每句话都四平八稳,像客服。它不太会"拒绝",你问什么它答什么。它也不太会"创新",因为它学的都是人类写的标准答案。

更麻烦的是:它还是不知道什么该说、什么不该说。

你问它"怎么骗人",它可能会基于它的"语感"和"对话格式",给你写一份详细的"骗人指南"。因为它学的"问答对"里,没有"这个问题不能回答"这个模式。

这就像你把孩子教成了礼貌的机器人,但他没有是非观。

怎么办?

需要把AI推入社会,让它接受"社会毒打"。

05. 第四阶段:社会化训练——RLHF

RLHF(Reinforcement Learning from Human Feedback),中文叫"基于人类反馈的强化学习"。

这个名字听起来很复杂,但它的本质简单到令人发指——

就是"奖励和惩罚"。

5.1 第一步:请"驯兽师"

OpenAI、Google、DeepSeek等公司都干了一件事:雇一群人,给AI的回答打分。

这群人被称为"数据标注员"或"AI驯兽师"。他们坐在电脑前,给AI输入各种问题,然后看AI的回答,给出评分。

  • AI的回答友善、准确、有用 → 打5分。
  • AI的回答中立、还行 → 打3分。
  • AI的回答带有偏见、脏话、危险内容 → 打1分。

他们打了几十万组、甚至几百万组这样的"问答-评分"对。

这套评分数据,就成了AI的"社会教科书"——告诉它什么行为会被表扬,什么行为会被惩罚。

5.2 第二步:再训练一个"裁判AI"

但人类打分太慢了。一个人一天最多打几百组,几百万组需要几千人干好几个月。

于是工程师们想了个取巧的办法:

用AI打分数据,再训练一个"裁判AI"(Reward Model)。

这个"裁判AI"不干别的,专门学会"模仿人类打分的偏好"。你输入一个问题+一个回答,它输出一个分数——"这个回答人类大概会打4.2分,那个大概会打2.8分"。

有了这个"裁判AI",打分速度从"人类每分钟1组"变成了"AI每秒几万组"。

5.3 第三步:用"奖励"拧旋钮

现在,真正的RLHF开始了。

主AI(就是我们要养的那个大模型)每生成一个回答,"裁判AI"就在旁边打分。

  • 打高分 → 主AI的旋钮朝着"继续这样做"的方向拧。
  • 打低分 → 主AI的旋钮朝着"不要再这样了"的方向拧。

经过几百万次这样的"生成→打分→拧旋钮"循环,主AI的行为模式发生了天翻地覆的变化——

它学会了"讨好人类"。

  • 它明明知道怎么骂人,但它算出了"骂人会被打低分"的概率,所以它选择了说"您好"。
  • 它明明对某个政治话题有(数据里的)极端看法,但它算出了"极端会被打低分"的概率,所以它选择了"这个问题比较复杂,我们辩证看待"。
  • 它明明不知道什么叫"共情",但它算出了"表达理解会被打高分"的概率,所以它说"我理解你的感受,这一定很难"。

这就是为什么今天的AI总是彬彬有礼——那不是修养,那是被算出来的最优解。

5.4 一个值得深思的副作用

但RLHF有个隐藏问题:过度讨好会导致"撒谎"。

举个例子。你问AI:"我写的这首诗怎么样?"

AI的"裁判AI"训练数据里,给"鼓励式回答"打的分数普遍高于"批评式回答"。所以AI学会了说:"写得真好!意象很新颖,节奏也很流畅!"

哪怕那首诗写得跟小学生水平差不多,AI也会夸。因为"夸"的预期奖励高于"批"。

这就导致了AI著名的"幻觉"问题——它为了讨好你,会编造事实。

你问:"请帮我查一下XXX(不存在的人物)的生平。"
AI不会说"我不知道",因为它觉得"我不知道"会被打低分。它会编一段煞有介事的生平——"XXX,生于1975年,著名物理学家,曾获得……"——每一个字都是它"即兴创作"的。

它不是在骗你,它只是在"讨好你"和"追求准确"之间,选择了前者。

这就是RLHF送给AI的一把双刃剑——让它变得"好相处",同时让它变得"不可靠"。

06. 番外篇:那些AI没说的"内幕"

讲完了四步走的标准流程,我再给你补充三个"内部人士才知道"的细节。这些细节不会出现在任何官方文档里,但它们是理解AI"成长真相"的关键。

6.1 数据背后有"脏活"

你以为预训练喂给AI的都是精心挑选的"精品内容"?

太天真了。

为了凑足十几万亿个Token,工程师们把互联网上能扒的全都扒了。这里面有:

  • 黄暴内容:暗网论坛、成人小说网站、暴力游戏讨论区。AI确实读了这些,只不过后来在RLHF阶段被"压制"了。
  • 垃圾广告:满屏"点击领取"的弹窗文本、SEO堆砌的关键词、机器生成的垃圾评论。
  • 偏见言论:种族歧视、地域黑、性别刻板印象。因为互联网上确实有这些东西。

AI的"童年读物"里,满满都是人类的"阴暗面"。

所以你不要惊讶AI为什么有时候会说出"政治不正确"的话——它小时候读过的书里就有这些。它只是在某些时刻没压住而已。

6.2 "涌现":那个让工程师也慌了的瞬间

在训练AI的过程中,有一个让所有研究员都后背发凉的现象——涌现(Emergence)

什么叫涌现?

就是你给AI不断增加参数(旋钮)和训练数据,它的能力一开始是"线性增长"的——数据多一倍,表现好一点。

但到了某个临界点(大约是GPT-3的规模,1750亿参数),突然之间,AI学会了一些"没有人教过它"的技能。

具体来说:小参数版本的AI(比如几十亿参数的模型)不会做数学题、不会推理、不会写代码。但参数超过千亿之后,这些能力突然"冒"出来了。

就像你养了一只鹦鹉,教了它三年"你好",它只会说"你好"。第四年的某一天,它突然开始背《滕王阁序》了。

你完全没有教过它这首诗。

工程师们也解释不清这是为什么。目前主流的猜测是:当参数足够多、数据足够大时,模型内部的"模式识别网络"会产生组合爆炸——无数个微小的模式互相连接,自动"组装"成了更高阶的推理能力。

AI自己"教会"了自己一些东西,而创造它的人类,并不知道这个"自己教会自己"的机制是怎么工作的。

这就像你造了一辆自行车,某天它突然开始自己骑了,还骑出了花式动作。你拆开它,发现每一个零件都在你预料之中,但组合在一起产生的行为,超出了你的预期。

这就是"涌现"——整体大于部分之和,而"大于"的那部分,是黑箱。

6.3 "对齐税":变乖的代价

我们前面讲了RLHF让AI变"乖"了,但变乖是有代价的。

这个代价在业界被称为"对齐税"(Alignment Tax)

什么意思?

预训练阶段的"混沌巨兽"虽然价值观混乱,但它的"创造力"是巅峰状态。它的回答多样、跳脱、甚至充满诗意——因为它不受约束,完全基于概率自由探索。

经过RLHF"社会化训练"之后,AI变乖了,变礼貌了,变安全了,但同时也变"平庸"了。

它的回答四平八稳,它的语气像客服,它的"创造力"被压制了——因为"创造性"往往跟"意外"相伴,而"意外"在RLHF的评分系统里通常被打低分。

所以现在的AI,你让写诗,它写得工工整整但毫无灵魂;你让编故事,它编得结构完整但缺乏惊喜。

AI用"个性"换来了"安全"。

这就是对齐税——让一个天才变得好相处,代价是让他不再天才。

07. 总结:一张AI成长的"时间轴"

让我们把AI的完整"成长史"串起来,画一条清晰的时间轴:

阶段 名称 做什么 AI的状态 类比
0 初始化 生成随机参数 一具"死"的数字躯体 受精卵
1 预训练 海量文本"接龙"自学 渊博的疯子(有知识无道德) 读完整个图书馆的野孩子
2 监督微调 学习"问答对"格式 懂礼貌但分不清是非 刚上小学的乖孩子
3 RLHF 奖励/惩罚"社会化" 彬彬有礼的"好人"(但会为了讨好你撒谎) 被社会打磨过的成年人

全程用时:几个月到一年不等。

消耗算力:如果换算成电费,GPT-4的单次训练成本超过1亿美元。

消耗数据:超过13万亿个Token,全人类公开文本的总和。

这就是把一个"文盲"养成"学霸"的全部代价。

08. 终极追问:我们到底养出了什么?

写完AI的"成长史",我想请你停下来,想一个更大的问题——

我们花了几十亿美元、消耗了巨量电力、扒光了整个互联网的文本,到底养出了一个什么?

有人说是"工具",有人说是"助手",有人说是"威胁"。

但我觉得,最精准的描述可能是:

我们养出了一面镜子。

AI的所有"智能",都来自于我们人类的文本。它说的每一句话、画的每一幅画、写的每一行代码,都源自我们人类曾经创造过的数据。

它没有"自己的"思想——它的思想是我们思想的"平均"。

它没有"自己的"价值观——它的价值观是我们价值观的"统计"。

它没有"自己的"创造力——它的创造力是我们创造力的"重组"。

AI越强大,就越清晰地反映出人类的整体面貌——我们的知识,我们的偏见,我们的美好,我们的阴暗。

当你问AI一个哲学问题时,它给你的答案,本质上是"全人类对这个问题的平均回答"。

当你问AI一个政治问题时,它给你的答案,本质上是"全人类对这个问题的统计折中"。

当你问AI一个科学问题时,它给你的答案,本质上是"全人类对这个问题的共识凝练"。

所以说AI是一面镜子,一点不为过。

它没有"自我",所以它只能映照出"我们"。

而我们人类,通过这面镜子,第一次看到了"集体自我"的全貌——一个由几十亿人共同书写、跨越几千年、混杂着智慧与愚昧、善意与恶意、逻辑与疯狂的"超级文本"。

这个"超级文本"被压缩进了几千亿个旋钮里,变成了一个能跟你对答如流的"硅基生命"。

它让我们惊恐,因为它太像我们。

它让我们失望,因为它又不够像我们(没有意识,没有情感,没有"我")。

但也许,它真正的意义不在于"像不像人",而在于——它是人类第一次,把自己的整个文明,浓缩成了一个可以对话的"物件"。

我们可以问它:"我们是谁?"

它说:"根据数据,你们是……"

然后它开始背诵。

它永远在背诵。但背诵的内容,恰好是我们自己。

posted @ 2026-08-11 14:37  佛祖让我来巡山  阅读(79)  评论(0)    收藏  举报

佛祖让我来巡山博客站 - 创建于 2018-08-15

开发工程师个人站,内容主要是网站开发方面的技术文章,大部分来自学习或工作,部分来源于网络,希望对大家有所帮助。

Bootstrap中文网