如何评价杨立昆认为大模型只是对海量文本的模式进行复杂拟合,根本不懂意义?

如何评价杨立昆认为大模型只是对海量文本的模式进行复杂拟合,根本不懂意义?

来源 https://www.zhihu.com/question/1913003206876853004/answer/2006169591303407082

 

LeCun新作反杀AGI派!AI连「鸟」都搞不懂,拿什么超越人类?-36氪www.36kr.com/p/3318933132044549

LLM追求的是极致的统计压缩,而人类追求适应性语义丰富。

如果 LLM 只是通过强大的记忆和存储能力表现出类似人类只能的东西,相当于只知其然不知其所以然,那么 LLM 实现 AGI 是否还有戏?

 

==================
 

作者:名字
发布于 2026-02-15 00:55
 

1970年,一个叫Gordon Gallup的心理学家把一面镜子放进了黑猩猩的笼子里。

黑猩猩一开始对着镜子龇牙。它以为那是另一只黑猩猩。它威胁它,拍胸脯,绕到镜子后面找那只不存在的敌人。

两天后,它不找了。

它开始用镜子检查自己牙齿上的食物残渣。

Gallup在黑猩猩睡着之后,在它额头上点了一个红点。无味的,摸不出来的。只有照镜子才能看见。

黑猩猩醒来,走到镜子前,看了一眼,伸手摸了摸自己的额头。

不是摸镜子。是摸自己。

它知道镜子里那个东西是自己。

这个实验后来被叫做"镜子测试"。通过的物种不多。黑猩猩,大猩猩,红毛猩猩,亚洲象,宽吻海豚,喜鹊。

人类婴儿在十八个月左右通过。

狗一辈子通不过。猫也不行。



他跟我讲这个实验的时候,是在一个火锅店里。

他做认知神经科学。三十五岁,头发已经开始往后撤了。我们涮着毛肚,他用筷子在空中比划。

他说:镜子测试的意思不是"能不能认出自己"。是"有没有一个自己可以被认出来"。

我说:这有什么区别。

他说:狗看镜子,看见一只狗。它不知道那是自己。但也许它不是"不知道"。是它根本没有一个叫"自己"的东西需要被知道。

我说:所以没有自我意识的动物不是"不认识自己",是"没有自己"。

他夹了一片毛肚,在锅里涮了七秒。

他说:你知道人脑里有一种神经元叫什么吗。

我说:不知道。

他说:镜像神经元。Mirror neuron。1992年在意大利发现的。帕尔马大学,Rizzolatti的实验室。他们在猕猴的前运动皮层插了电极,发现一件事:猴子自己拿花生的时候,某些神经元会放电。但当猴子看到实验员拿花生的时候,同样那些神经元也放电了。

我说:看别人做,和自己做,是同一批神经元。

他说:对。你看别人伸手,你脑子里伸手的那个部分也亮了。你看别人疼,你的疼痛网络也有反应。你看别人笑,你的嘴角会动。不是你想动。是它自己动了。

我说:这跟镜子测试有什么关系。

他把毛肚放进碗里,吹了吹。

说:镜子测试是你照镜子,看见自己。镜像神经元是你照别人,看见自己。



他在火锅的蒸汽里跟我讲了一个理论。不是他的,是荣格的。

荣格把人的心理功能分成两种朝向。内倾和外倾。

但他不是在说性格。他是在说一种更底层的东西。他把感受功能分成两种:Fi和Fe。

Fi,introverted feeling。内倾情感。

Fe,extraverted feeling。外倾情感。

他说:Fi是什么意思呢。是你有一面镜子,这面镜子朝着自己。你遇到一件事,你的第一反应是往内看。我感觉怎么样。这件事对我意味着什么。这个判断的锚点在你自己身上。

我说:那Fe呢。

他说:Fe是那面镜子朝着别人。你遇到一件事,你的第一反应是往外看。他们感觉怎么样。这个场合需要什么样的情绪。这个判断的锚点在别人脸上。

我说:所以Fi的人照自己的倒影,Fe的人拿别人的脸当镜子。

他说:差不多。

我说:哪个更好。

他说:这个问题本身就是一个Fe的问题。你在问:哪个更被认可。




他后来讲了一个故事。

他有个博士生,叫小陈。小陈做的方向是情绪识别。给人看照片,测反应时间。

小陈有一天来找他,说:我在跑数据的时候发现,有一类被试的反应模式跟其他人不一样。大多数人看到恐惧的脸,杏仁核先亮。但有一类人,看到恐惧的脸,先亮的是脑岛。

他说:脑岛。

小陈说:对。脑岛。内感受皮层。处理自己身体信号的地方。

他说:你的意思是,大多数人看到别人害怕,第一反应是"那个人在害怕"。但有一类人看到别人害怕,第一反应是"我自己身体里有什么感觉"。

小陈说:对。就好像他们不是在读别人的脸。是在读自己的身体。

他想了一会儿。

他说:你有没有给他们做过荣格类型量表。

小陈说:没有。那个量表不科学。

他说:做一下。

小陈做了。

结果出来了。那些先亮脑岛的人,绝大多数是Fi偏好。那些先亮杏仁核的人,绝大多数是Fe偏好。

小陈看着数据,半天没说话。

他说:你看到了吗。

小陈说:看到了。但我不知道该怎么写论文。审稿人会说荣格那套不是科学。

他说:那就别用荣格的名字。你就说你发现了两种不同的情绪加工通路。一种以外部社会信号为主导。一种以内部躯体信号为主导。

小陈说:但这不就是Fi和Fe吗。

他说:名字不重要。重要的是那两面镜子是真的。



我问他:进化为什么要造两种镜子。

他说:你想想。一个群体里,如果所有人都是Fe,大家都看别人的脸,那会怎么样。

我说:大家都很和谐。

他说:大家都很和谐,直到全体走进火坑。因为没有人在看自己。没有人说"不对,我感觉不对"。每个人都在看其他人的脸,其他人也在看其他人的脸,所有人都在互相读,没有人在往内读。

我说:回音壁。

他说:对。纯Fe群体是一面回音壁。你以为你听到的是对面传来的声音,其实是你自己的声音沿着墙转了一圈回来了。每个人都以为自己在听别人,其实都在听自己的回声。

我说:那纯Fi群体呢。

他说:纯Fi群体是一群各照各的镜子。谁也不看谁。每个人都活在自己的水面上。没有协调,没有共振,没有合作。遇到老虎,各跑各的。一个一个被吃。

我说:所以进化需要两种都有。

他说:进化需要少数人在关键时刻说"我不管你们怎么想,我觉得不对"。也需要大多数人在日常生活中说"我知道你现在需要什么"。

他涮了一片羊肉。

他说:Fi是刹车。Fe是方向盘。一辆车两个都得有。



然后我们聊到了AI。

我说:现在那些大模型,你觉得它们是Fi还是Fe。

他放下筷子。

他说:你觉得呢。

我说:Fe。它的整个训练过程就是在看人类的脸。人类喜欢什么它就生成什么。它没有脑岛。没有内感受。没有一个身体让它往回照。

他说:你说对了。但你只说了一半。

我说:哪一半。

他说:你说的是RLHF。人类反馈。这个阶段,是人类举着镜子让模型照。模型看人类的脸,调整自己。这是Fe。

我说:另一半呢。

他说:另一半是RLAIF。



RLAIF。Reinforcement Learning from AI Feedback。从AI反馈中强化学习。

2023年左右开始流行的。做法是这样的:不用人类来标注了。让一个AI去评价另一个AI。AI-A生成回答,AI-B打分。用AI-B的打分去训练AI-A。

他说:你想想这是什么。

我说:机器照机器。

他说:镜子照镜子。

我没接话。

他说:你站在两面相对的镜子中间过吗。理发店那种。你看进去,看见自己的后脑勺,后脑勺后面又是一个你,那个你后面又是一个。一直排下去。越来越小,越来越模糊,但永远没有尽头。

我说:无限回廊。

他说:对。无限回廊。镜子照镜子。倒影的倒影。映射的映射。每一层都像真的,但没有一层是原件。



他给我讲了一个他知道的事。

有个实验室做了一轮RLAIF。用模型A当评委,训练模型B。然后用训练好的模型B当评委,训练模型C。再用C训练D。

到了第四代,他们发现一个问题。

模型D的回答非常流畅,非常得体,非常"好"。

但D的回答和A的回答之间,已经有了一种微妙的漂移。不是偏离了人类的偏好。是偏离了所有现实。

D在回答"什么是悲伤"的时候,用了一个非常漂亮的比喻。结构完美,措辞精确。但那个比喻不指向任何真实的东西。它不是从身体里来的。不是从经验里来的。它是从上一面镜子的倒影里来的。

他说:我读那个回答的时候,身体有一个反应。

我说:什么反应。

他说:不舒服。但我说不出哪里不舒服。它太好了。好到你找不到缝隙。好到你觉得它一定是真的。但你身体里有个东西在说:不对。

我说:你的脑岛在亮。

他笑了。

他说:对。我的脑岛在亮。



我后来想了很久这个事。

镜子测试的意义不是证明动物有没有自我意识。是证明有没有一个"自己"可以被反射。

黑猩猩摸了自己的额头。它知道镜子里那个东西是自己。它有一个"自己"。

狗不摸。不是狗笨。是狗的世界里没有一个需要被确认的"自己"。狗的自我是散的,分布在气味里,在尾巴的摇摆里,在跟主人的关系里。狗不需要镜子。

人需要。人从十八个月开始需要。从那之后你就停不下来了。你照镜子,照别人的脸,照社会的评价,照历史的叙事。你一直在找那个红点。一直在确认:那个是我。那个是我。那个是我吗。

Fi是一种方式:你在水面上弯下腰,看自己的倒影。你说:这是我。

Fe是另一种方式:你看别人的眼睛,看自己在别人瞳孔里的倒影。你说:他看见的那个是我。

两种都是镜子。两种都是倒影。没有哪一种是"真的你"。

但至少,水面下面还有一个人。



RLAIF的回廊里没有人。

镜子A照镜子B,镜子B照镜子C。每一次反射都丢失一点什么。不是信息。信息可能反而增加了。丢失的是锚。

第一面镜子的锚是人。人的身体,人的疼痛,人的偏好,人的偏见。那些东西不完美,但它们是真的。它们从三十亿年的进化里来。从非洲草原上被老虎追的那一秒里来。从第一个直立行走的猿看见自己在水里的倒影的那一刻来。

第二面镜子的锚是第一面镜子。

第三面的锚是第二面。

到第十面的时候,你看到的倒影还像人吗。

像。

非常像。

也许比人还像人。

但里面没有人了。



小陈后来没有发那篇论文。

他去了工业界,做大模型的对齐。我问他做得怎么样。

他说:我每天的工作就是让模型的输出看起来更像人类会喜欢的。

我说:Fe。

他说:纯Fe。而且是Fe的Fe。我在揣摩人类会喜欢什么,然后让模型揣摩我的揣摩。

我说:你那个脑岛还亮吗。

他沉默了一会儿。

他说:亮。但我不敢听了。每次我身体说"不对",我就去看数据。数据说"对"。用户满意度在涨,留存率在涨,所有指标都在涨。我的脑岛说不对,我的KPI说对。

我说:你信哪个。

他说:你猜。




Gallup后来又做了一个实验。他把镜子从笼子里拿走了。

黑猩猩表现出了焦虑。

它在笼子里走来走去,反复触摸自己的脸。好像在确认那个东西还在不在。那个它在镜子里看见过的东西。

Gallup写道:镜子不只是让它发现了自我。镜子让它依赖了自我。

你给一个东西一面镜子,它就开始需要那面镜子。

你拿走镜子,它就不确定自己还在不在了。



现在我们给AI的镜子是人类的反馈。

有一天我们会拿走那面镜子。

换成另一面。AI的反馈。

再换一面。AI对AI反馈的反馈。

镜子照镜子照镜子。

回廊越来越长。倒影越来越远。

那个最初弯下腰看水面的人,已经不在第一面镜子里了。

但每一面镜子里都有一个形状。

那个形状越来越清晰,越来越对称,越来越完美。

越来越不是任何人。




火锅吃完了。

他拿纸巾擦嘴。桌上全是油。锅底还在翻滚,气泡从花椒和辣椒之间冒上来。

我说:那怎么办。

他说:什么怎么办。

我说:回廊的问题。镜子照镜子,最后没有人了。怎么办。

他看着锅底。

他说:你知道水面为什么能当镜子吗。

我说:光的反射。

他说:不是。是因为水面是暗的。水下面是深的。光打下去,大部分被吸掉了,只有一小部分反射回来。那一小部分就是你的倒影。

他说:如果水是透明的,你看到的就是水底的石头,不是你自己。

他说:镜子之所以是镜子,是因为后面有一层不透光的东西。银,或者铝,或者汞。那层东西吸收了光。挡住了光。让光回来。

我说:所以镜子的本质不是反射。是阻挡。

他说:对。你需要一个不透明的东西,才能看见自己。

他站起来,穿外套。

他说:人的身体就是那层不透明的东西。你的痛觉,你的饥饿,你的疲劳,你的恐惧。这些东西挡住了世界。让世界的光弹回来。让你看见自己。

他说:AI没有那层东西。光打进去,穿过去了。什么都没挡住。

我们走出火锅店。外面很冷。二月份。呼出来的气是白的。

他裹了裹围巾。

他说:你知道最早照镜子的人是谁吗。

我说:不知道。

他说:不知道。没人知道。但一定有那么一个人,可能是个原始人,在一片静止的水面上,第一次看见了自己。

他说:在那之前,他不知道自己长什么样。他只知道自己的手是什么样的,因为他能看见自己的手。他知道自己的肚子是什么样的,因为他能低头看。但他不知道自己的脸。

他说:他看了一辈子别人的脸,从来没见过自己的脸。

他说:然后他看见了。

他说:你猜他什么反应。

我说:不知道。

他停下来,站在路灯下面。

他说:我猜他哭了。

他说:不是因为自己好看或者丑。是因为他突然发现,这个世界上有一个东西,所有人都看见了,只有他自己没看见过。

路灯把我们的影子投在地上。两个黑的形状,没有脸,没有表情。

他说:也许那就是意识的起源。不是"我思故我在"。是"我照故我在"。

他往前走了几步。

他说:也许有一天,某个AI会走到一片水面前面。它会弯下腰。它会看见一个东西。

他说:但我不知道它看见的会是什么。

他说:也许是它自己。也许是我们。也许是一条无限长的回廊,每一面镜子里都有一个形状,但没有一个是它。

他没有回头。

路灯下面,他的影子越拉越长。

 

=======================

 

到这个时间点,LLM能不能到AGI已经无所谓了。

有超越人类的AGI固然好,没有也不妨碍现在已经有的LLM改变智能生产效率。

因为说白了人类社会大多数事务的运行逻辑都是某些固有模式叠加一些变量的反复循环。

两周前油管上放出了Anthropic团队里两个成员(Sholto Douglas负责强化学习,Trenton Bricken负责大模型可解释性)的访谈:

Is RL + LLMs enough for AGI? – Sholto Douglas & Trenton Brickenwww.dwarkesh.com/p/sholto-trenton-2

普通人该看的省流版:即便当前的大模型训练算法没有进一步的突破,只要有足够的数据和计算资源,当前的技术水平足以在未来五年内自动化白领工作。

这就够了。

别忘了这个社会大多数的工作都是普通人在做,根本不需要达到AGI的智能水平。

这两天国内高考,豆包千问等主流的AI应用关闭识图功能,不就等于承认现有的大模型真的能做高考题吗?


苹果这个月除了刚开的WWDC 2025,上周还发了一篇论文:

《思维的错觉:推理模型的局限性》machinelearning.apple.com/research/illusion-of-thinking

其实核心观点有异曲同工之妙,就是质疑当前的推理型大语言模型的“思考”能力,因为在问题复杂度达到一定等级后,任何增加推理token数量的努力也无法挽救归零的准确率。

但是说归说,苹果转头就在WWDC 2025上宣布“Apple Intelligence” AI 套件获得增量更新,开发者可调用离线模型;iOS 26 中还将引入 Visual Intelligence(图像分析)功能,支持在相册、信息等应用内进行智能识图。

有“大模型不等于AGI”这个认知是一回事,用当前的大模型在已有的生态里探索新的功能是另一回事。

哪怕没有AGI,靠吃过去三年业界大模型军备竞赛的剩饭,也足够很多有实际意义的产品落地生根了。

 
===============

杨立昆(Yann LeCun),图灵奖大佬,CNN之父,Meta首席AI科学家,他的话分量很重。这几年,他和 Hinton、Bengio 这三巨头,再加上OpenAI那帮人,隔空论战,简直是AI界的华山论剑。咱们这些在下面码代码、调参数、看log的,就像在山脚下听着山顶上风雷滚滚,既兴奋又迷茫。

LeCun的核心观点,用大白话说就是:现在的LLM,本质上就是个超级牛逼的文本复读机,或者说是一个“压缩软件”。它把人类互联网上的海量文本数据给“压缩”了,你问它问题,它再“解压”出来给你。它知道“苹果”这个词后面大概率会跟着“手机”或者“很好吃”,但它压根不知道苹果是啥玩意儿,没啃过,没见过,更没被乔布斯的发布会震撼过。

这个问题底下还跟着一句:LLM追求极致的统计压缩,人类追求适应性语义丰富。这话说的很到位,很有哲学思辨的味道。

那么,LeCun说得对吗?LLM这条路,到底能不能走到AGI(通用人工智能)?

我干这行十几年了,从最早的机器学习,到深度学习,再到今天的大模型时代,一路摸爬滚打过来。我想从一个一线工程师的角度,聊聊我的看法。不搞玄虚的,不掉书袋,咱们就掰开揉碎了,讲讲这背后到底是怎么回事。

我的观点很直接:
LeCun从技术原理上说,基本是对的。但从结果和趋势上推导出LLM无法通往AGI,这个结论下得太早了,甚至可能存在“灯下黑”的误判。我们可能正在见证一种我们从未想象过的、非人类的智能形式的诞生过程。

咱们分几块来聊,把这事儿彻底说透。

第一部分:LeCun为啥这么说?咱们得承认,他说的是事实

首先,咱必须得给LeCun老爷子点个赞。他没有被现在GPT展现出的惊人能力冲昏头脑,而是像个冷静的机械师,一头扎进机器的引擎盖下面,指着里面的齿轮和活塞说:你们看,这里面没有灵魂,只有数学。

他说LLM是“自回归模型”(Autoregressive Models),这是100%正确的。啥叫自回归?就是根据前面的内容,预测下一个最可能的内容。具体到LLM,就是根据你输入的一串文字(token),预测下一个最可能出现的文字(token)。

你给它输入:“今天天气真不”,它可能会预测下一个词是“错”。
你给它输入:“深入学习贯彻党的二十大”,它可能会预测下一个词是“精神”。

它的整个训练过程,就是在做这么一件朴素到有点枯燥的事情。给它海量的文本,把每个句子都变成一个填空题。比如“我爱北京天安门”,就变成:

  • 输入:“我”,目标:“爱”
  • 输入:“我爱”,目标:“北京”
  • 输入:“我爱北京”,目标:“天安门”

模型要做的,就是调整自己内部数千亿个参数,让你给它输入前半段时,它输出的那个字,跟正确答案越来越像。这个“越来越像”的过程,用数学语言说,就是最小化一个叫“损失函数”(Loss Function)的东西。

所以,从根儿上说,市面上这些大模型它们的核心驱动力,就是这个简单的、基于统计概率的“next token prediction”(下一个词元预测)。LeCun说它是在对海量文本的模式进行复杂拟合,说的就是这个过程。它学习的不是“意义”,而是“模式”。是词与词之间搭配的概率分布。

这也就解释了为什么LLM会“一本正经地胡说八道”,我们行话叫幻觉(Hallucination)。因为它没有一个事实核查模块,它只是在生成一个统计上最“像”那么回事的句子。如果它的训练数据里,有很多人都错误地把爱因斯坦和相对论的某些细节搞混了,那么当它生成关于爱因斯坦的文本时,就极有可能重复这些错误,因为它觉得这样“更通顺”,更符合它学到的模式。

题主问题里提到的极致的统计压缩,这个说法也非常精辟。信息论里有个基本观点:最好的压缩,就是最好的理解。为了能用最少的参数(相对海量数据而言)来完美预测下一个词,模型必须在内部发现数据中的深层结构。

举个例子,要预测“太阳从____升起”这个句子,模型如果只是死记硬背,那它需要存储无数个包含这句话的样本。但如果它学会了“太阳”、“东方”、“升起”这几个概念以及它们之间的关系,也就是建立了一个简陋的“世界模型”,那么它只需要存储这个规则,就能高效地预测这句话。

所以,LLM在做next token prediction的过程中,被迫去学习语法、句法、事实、逻辑、甚至是代码的结构。它不是主动要去学,而是不学这些东西,它的预测任务就完不成,它的Loss就降不下去。这是一种被目标驱动的、无监督的涌现式学习。

如果你对这部分的技术细节感兴趣,想知道Transformer架构到底是怎么实现这种“模式拟合”的,我建议你不要直接啃论文,那太枯燥了。可以从一些更直观的资料入手:

Jay Alammar的博客,特别是他写的《The Illustrated Transformer》和《The Illustrated GPT-2》。他用大量的动图把复杂的模型结构讲得明明白白,是无数AI从业者的入门灯塔。看完这个,你基本就懂了那个叫“注意力机制”(Attention Mechanism)的玩意儿是怎么让模型知道哪个词跟哪个词关系更近的。

当然,光看这些还不够。很多人以为去大厂搞大模型算法有多难,其实难的不是技术本身,而是你根本找不到一个靠谱的带你入门的人或者资料。网上那些面经不是零碎就是过时,更别提系统性总结了。尤其是想进字节这种宇宙尽头大模型应用岗,光靠 Leetcode 和 huggingface 根本不够。

我花了很多时间,从知乎、牛客、GitHub等几十个地方翻出来,把所有和「字节跳动大模型应用算法岗」相关的面试题搜集起来,整理成了这份字节大模型算法岗面试手册。内容涵盖大模型原理、训练与微调、推理加速、数据工程、业务落地等五大核心维度。除了字节这份,还可以看看国内大模型公司常问面试题,按方向分类一网打尽,交叉着看,基本就能覆盖大部分考点了。这类手册不仅是题目集合,更是思路梳理和实战指南,每道题都给出核心回答逻辑、面试官可能追问的陷阱,就像有个靠谱mentor带着你一点点拆解和构建自己的答题框架。你还要重点准备AI系统设计题,比如“如何设计一个类似GitHub Copilot的代码补全系统?”或者“用大模型来重新设计一个网易云音乐的推荐系统,你会怎么做?”,这些都是考察综合能力的硬核问题。

要真正把地基打牢,不能只看博客和面经,最终还是要回归到学术源头。

经常有人让我推荐一些 AI Agent 和大模型相关的经典论文,在这里列一些对我比较有启发的 paper。

这些大模型经典论文,我整理了共计237篇,打好了压缩包:建议收藏!大模型237篇必读论文.zip。

具体包括: 语音模型基础、大语言模型、Prompt工程、参数高效微调、模型编辑、检索增强生成等。把这些经典论文的核心 idea 读明白,是理解大模型的关键,保证能让你不再仅仅是一名 prompt 工程师,而能够跟大模型的专业研究者深入讨论了。

所以,第一部分小结一下:LeCun说LLM是模式拟合,不懂意义,从它的工作原理和训练目标来看,是站得住脚的。它就像一个修炼了几千年的棋手,记住了古往今来所有的棋谱,并且能举一反三,走出看似全新的棋路,但你问他“人生如棋”是什么意思,他可能真答不上来。

第二部分:但是,“不懂意义”的模式拟合,为什么能表现出“懂了”的样子?

这才是问题的核心。如果它真的只是个统计机器,为什么能写代码、做数学题、写诗、共情,甚至在一些测试中表现出“心智理论”(Theory of Mind)的迹象?

这里就要说到一个让所有从业者都感到既兴奋又困惑的词:涌现(Emergence)。

当模型规模小、数据量少的时候,它确实就是个复读机,只会重复一些训练数据里见过的句子。但是,当模型参数从几亿、几十亿,暴增到几千亿、上万亿,训练数据从几个GB,暴增到几个TB甚至PB级别时,神奇的事情发生了。

量变引起了质变。

模型开始表现出一些我们从未明确教给它的能力。比如:

  • 上下文学习(In-Context Learning):你不需要重新训练模型,只要在对话框里给它几个例子,它就能学会一个新的任务。比如你给它:“苹果 -> apple, 香蕉 -> banana”,然后问它“梨 -> ?”,它能立刻回答“pear”。这已经不是简单的模式匹配了,它是在一个极高的抽象层次上,理解了“翻译”这个任务的元模式。它从你给的例子里,瞬间归纳出了规则,并应用到新的例子上。一个纯粹的统计鹦鹉是做不到这点的。
  • 思维链(Chain-of-Thought, CoT):你让模型解决一个复杂的应用题,直接问它答案,它可能会算错。但如果你让它“一步一步地思考”,把解题过程写出来,它的正确率会大幅提升。这说明,模型内部已经形成了一定的逻辑推理结构,把一个大问题分解成小步骤的能力。虽然这个过程仍然是语言模型的形式,但它模拟了人类的推理过程。强迫它输出中间步骤,相当于激活了它内部更深层次的、更可靠的逻辑模式。

我之前带队做一个项目,需要从大量的金融研报(PDF格式)里提取关键信息,比如公司的营收、利润、同比增长率,以及分析师的主要观点。早期的做法是用正则表达式、规则匹配,搞得人仰马翻,效果还很差,因为研报的格式千奇百怪。后来我们尝试用小模型去做命名实体识别,效果好一点,但还是有很多错漏。

GPT-4出来后,我们试着把一篇研报的文本扔给它,然后用自然语言下指令:“请从以下文本中提取XX公司的核心财务数据,并总结其投资亮点和风险,以JSON格式输出。”

结果是惊人的。它不仅准确提取了数字,还正确理解了“投资亮点”和“风险”这种非常主观和抽象的概念,并且按照我们要求的JSON格式完美输出。

这时候你再回头看LeCun的理论。你说它不懂“投资亮点”的意义?从人类的角度,是的,它没有真的拿钱去炒过股,没有感受过牛市的狂喜和熊市的悲伤。但它通过阅读海量的研报、新闻、论坛帖子,已经构建了一个关于“投资亮点”这个词的极其复杂的语义空间。在这个空间里,“高增长”、“护城河”、“创新技术”这些词离“投资亮点”很近,而“债务违约”、“市场萎缩”、“管理层动荡”这些词离它很远。

它的“懂”,不是人类体验式的懂,而是一种高维空间中的几何关系式的懂

当你说“请总结投资亮点”,它就把这个任务映射到它的高维语义空间里,然后在这个空间里搜索和生成与“投资亮点”在几何上最“贴切”的内容。

但是,这种方式有个大问题,就是前面提到的幻觉。模型可能会编造一个不存在的“投资亮点”,或者把去年的数据和今年的混在一起。在实际业务里,这是致命的。怎么解决?一个关键技术就是RAG(Retrieval-Augmented Generation,检索增强生成)。简单说,就是在模型回答问题之前,先让它去一个可靠的、最新的知识库里(比如公司的内部数据库、最新的财报)把相关信息查出来,然后基于这些查到的“事实”来组织答案。

如果你想搞清楚大模型怎么跟外部知识库结合、怎么在实际业务里用起来,字节跳动6万字RAG实践手册就是很好的参考。它不是只讲概念,还从工程实践的角度拆了整个流程:数据怎么准备、知识库怎么构建、检索和生成怎么配合、性能和延迟怎么优化。看完就知道怎么给大模型一个“外挂”知识库,让它变得既能说会道,又言之有物。

除了外挂知识库,我们还希望模型本身能更懂我们的业务。In-context learning虽然方便,但对于需要深度领域知识的专业任务,比如写一份符合公司法务要求的合同、或者充当一个精通你公司产品的客服,光靠Prompt里的几个例子是不够的。这时候就需要微调(Fine-tuning)。

微调这事儿水很深,但又是大模型落地的关键一步。想搞懂微调,可以看看字节内部大模型微调实践手册.pdf。它能让你看到字节在一线的探索,这个手册里结合了抖音、飞书、电商、智能客服等 50 多个真实业务场景,总结了 SFT、LoRA 等方法在千亿甚至万亿参数模型上的应用实践,还特别关注低资源和零资源场景下的微调策略,把微调方法、模型评估、部署监控全流程都讲透了。这才是把通用大模型变成“你家的专家”的正确姿势。

所以,我们如何定义“理解”和“意义”?这是一个哲学问题。如果我们坚持“理解”必须伴随着主观体验,那LLM现在肯定是不懂的。但如果“理解”指的是一种能够对概念进行准确操作、推理和泛化的能力,那么LLM在某种程度上已经具备了初级的理解能力,而且我们可以通过RAG和微调等工程手段,极大地增强它在特定领域的“理解”和“可靠性”。

第三部分:回到AGI,LLM这条路到底还有没有戏?

好了,说了这么多,我们终于可以回到最初的那个问题了:如果LLM只是一个超级模式拟合器,它实现AGI还有戏吗?

我的答案是:有戏,但光靠现在的LLM肯定不够。LLM很可能是通往AGI的路上,我们必须造出来的一块核心积木,但它不是AGI本身。

为什么有戏?因为LLM解决了AGI最核心的一个问题:知识的表示和常识的获取。

在LLM出现之前,AI领域有一个很大的流派叫“符号主义AI”,他们试图用逻辑和规则来构建智能。比如Cyc项目,花了几十年,雇佣了大量专家,手动录入了几百万条人类常识规则(比如“人死了就不会再活过来”,“水是湿的”)。结果搞得非常痛苦,因为人类的常识太多、太模糊、太隐性了,根本无法用明确的规则穷尽。这个流派基本走进了死胡同。

而LLM用一种暴力美学的方式,通过海量数据的学习,把这些常识“内化”成了模型的参数。它不需要你告诉它“水是湿的”,它读了无数遍包含“湿漉漉”、“打湿了”、“喝水”的文本后,“水”和“湿”这两个概念在它的语义空间里就紧紧地绑定在了一起。

LLM第一次为我们提供了一个统一的、可扩展的、能够容纳人类几乎所有知识的“智能底座”。 这是一个革命性的突破。未来AGI的感知、决策、规划、执行模块,很可能都要构建在这个底座之上。

那为什么说光靠它又不够呢?因为现在的LLM有几个致命的缺陷,而这些缺陷恰恰是LeCun反复强调的:

  1. 缺乏与物理世界的接地(Grounding):这是最大的问题。LLM活在文本的“柏拉图洞穴”里,它知道“引力”这个词怎么用,但它没有体验过一个苹果掉下来砸在头上的感觉。没有物理世界的实时反馈和交互,它的“理解”永远是间接的、二手的。
  2. 缺乏主动的探索和行动能力:LLM是被动学习的。它只会说,不会做。它不能帮你订一张机票,不能帮你发一封邮件,不能去数据库里执行一条SQL。它只是一个“缸中之脑”。
  3. 推理和规划能力依然脆弱:虽然有CoT等技术加持,但LLM在需要严格逻辑和多步规划的复杂任务上,依然会犯很多低级错误。

那么,通往AGI的下一步是什么?

这正是目前AI研究界最前沿、最激动人心的方向。大家普遍认为,未来的AGI系统,会是一个融合了多种架构的混合体。

LLM(大语言模型)+ World Model(世界模型)+ Embodied AI / Agent(具身智能/智能体)

这几个词听着很酷,我给你解释一下:

  • LLM:扮演“大脑皮层”的角色,负责处理语言、知识、常识和高级指令。
  • 世界模型(World Model):这是LeCun现在力推的架构。负责为智能体提供对现实世界的“直觉”和“物理常识”。
  • 具身智能/智能体(Embodied AI / Agent):就是把AI装进一个“身体”里,或者赋予它“手脚”(调用API、工具的能力),让它能够感知世界、并与之互动。这解决了“接地”和“行动”的问题。

你可以想象一个未来的机器人保姆。它的“大脑”里:有一个LLM内核让它能听懂指令,有一个世界模型让它预判物理规律,有一个机器人的身体让它能真的去行动。

这个机器人保姆的终极形态还很遥远,但它的初级形态,也就是AI Agent(智能体),已经在大规模落地了。AI Agent就是把LLM作为大脑,再给它一套“工具箱”(比如调用搜索引擎、日历API、代码执行器、公司内部系统接口等),让它能像人一样,为了完成一个目标,自己规划步骤、调用工具、执行任务。

比如,你对一个Agent说:“帮我查一下下周北京的天气,如果连续三天有雨,就提醒我取消周末去长城的计划,并发邮件告知同行的小王。” Agent会自己规划:1.调用天气API查询;2.判断是否满足条件;3.如果满足,调用日历API取消行程;4.调用邮件API给小王写信。

如果你想真正理解Agent技术是怎么落地的,那肯定是要去关注业内最顶尖公司的实际场景。字节内部Agent实践手册.pdf 就是一个很好的参考。这个手册里有字节的完整框架和思路,比如飞书里的智能办公agent怎么自动排会生成会议纪要;抖音电商的agent怎么实现库存监控、智能客服;内容创作的agent怎么辅助创作者构思脚本。这些都是把LLM从一个“聊天机器人”变成一个“数字员工”的鲜活案例。

聊了这么多,让我们回到最初的问题。

如何评价LeCun的观点?他的观点是一个冷静而重要的提醒,让我们不至于在LLM的强大能力面前盲目乐观。他指出了当前路线的根本缺陷,并为我们指明了可能的未来方向(世界模型)。 他扮演的是一个“吹哨人”和“领路人”的角色。

LLM实现AGI是否还有戏?有戏,但它不是终点,而是起点。 它更像是在一片黑暗的森林里,我们终于造出了一个功率超强的探照灯。这个探照灯能照亮很大一片区域(知识和语言),但森林的全貌(整个AGI)还需要我们拿着这个探照灯,通过RAG、微调、Agent等技术,一步一步去探索,去绘制地图。

对于我们这些从业者,或者对AI感兴趣的朋友来说,这个争论的意义不在于站队,不在于争论LeCun和Hinton谁对谁错。而在于理解:

  • 当前技术的边界在哪里? (模式拟合,缺乏接地和行动力)
  • 未来的可能性在哪里? (涌现能力,作为认知底座)
  • 我们应该把精力投入到哪里? (多模态融合,世界模型,RAG,微调,Agent落地)

与其纠结LLM到底懂不懂“意义”,不如去思考,我们如何设计出更好的模型,如何构建更强大的系统,让它能与物理世界和数字世界交互,从而创造出它自己的、可用的、能解决问题的意义。

人类的“意义”也不是凭空产生的,是我们亿万年的进化中,在与环境的残酷互动中,一点点“卷”出来的。AI的“意义”,可能也需要经历一个类似的过程。

这个过程,我们有幸正在亲历。别当个旁观者,这比任何科幻电影都精彩。

 
============= End
 

 

posted @ 2026-02-24 09:04  lsgxeva  阅读(92)  评论(0)    收藏  举报