当AI开始睁眼说瞎话,我竟然有点心疼它

** AI的"幻觉"不是bug,是它"太想讨好你"时露出的马脚**

01. 第一次被AI骗的经历

我得承认一件事。

去年我用ChatGPT写一篇关于明朝海禁政策的文章。写到一半,需要引用一段"万历皇帝关于闭关锁国的上谕原文"。

我自己懒得翻史料,就跟AI说:"帮我找一下万历皇帝关于海禁的那段著名上谕,要原文。"

AI秒回。

一段文言文,工工整整,语气端庄,落款是"万历二十一年十月",甚至还有"钦此"。

我高高兴兴地复制粘贴进了文章里。

三天后,一个懂明史的朋友看到我的文章,给我发了条微信:"你这段上谕是哪来的?我查了《明神宗实录》,根本没有这段话。"

我愣住了。

我把那段文言文丢进搜索引擎——零结果。全网没有第二处出现这段话。

AI给我编了一段"圣旨"。编得如此逼真,连文言文的句式和用典都毫无破绽,但它是假的。纯纯的、彻头彻尾的、子虚乌有的虚构。

那一刻我的心情很复杂。一方面觉得自己蠢,另一方面竟然对AI生出了一丝——佩服?

你想想,一个根本不懂明史、不知道"万历"是谁、没读过《明神宗实录》的东西,硬生生编出了一段让非专业人士完全看不出破绽的"史料"。

这得"编"得多认真啊。

但认真之后是后怕。如果我那篇文章发表了,这个"AI造假的史料"就会被我传播出去,被更多人看到,甚至被其他人引用。

AI的谎言,就这样混进了人类的知识库。

这就引出了今天我们要聊的主题:AI的"幻觉"(Hallucination)。

02. "幻觉"是个好听的词,说白了就是"撒谎"

"幻觉"这个词是AI行业的官方术语,听着很高级,甚至有几分诗意——好像AI是个诗人,在现实的基础上展开了"合理的想象"。

但咱们别美化它。

幻觉就是撒谎。AI在它不知道答案的时候,选择给你编一个。 而且它编的时候极其自信,语气斩钉截铁,不给你任何"我在猜"的信号。

这是AI最让人毛骨悚然的地方。

你问一个人类专家一个问题,如果他不知道,他会说"我不确定"或者"我查一下"。但AI不会。它的设计目标之一就是"流畅地回答问题","我不知道"这个回答在它的训练数据里被打了低分。

所以它宁可胡编,也不肯认怂。

于是就有了——AI给你编造学术引用,编造法律条文,编造历史事件,编造不存在的人物生平,甚至编造它自己的"内心感受"。

"我很高兴能帮到你。"——AI很高兴吗?它连"高兴"是什么都不知道。但它知道"表达高兴会被打高分",所以它说它高兴。

"我理解你的痛苦。"——AI理解个屁。但它知道"表达共情会被打高分",所以它说它理解。

从"编造事实"到"假装有人格",AI的幻觉覆盖了从事实到情感的每一个角落。

03. 幻觉从哪来?——五大根源

好,问题来了。AI为什么会产生幻觉?它的训练过程明明喂了那么多"正确答案",它为什么还要"瞎编"?

我总结了五个核心原因。每一个都跟AI的"底层设定"有关,每一个都几乎无法彻底根除。

根源一:它就是靠"猜"吃饭的

还记得第一篇文章的核心观点吗?AI就是"文字接龙"。它每生成一个字,都是基于前文算出的"概率最高的下一个字"。

"概率最高"不等于"正确"。

我给你举个例子。

假设我问你:"世界上最长的河流是哪条?"

正确答案是"尼罗河"(约6650公里),但很多人会脱口而出"亚马逊河"(约6400公里),因为它俩长度非常接近,而且亚马逊的名气更大。

如果把这个问题抛给AI,它会怎么"猜"?

它去翻它的训练数据——海量的文本里,提到"最长的河流"时,尼罗河和亚马逊河出现的频率极其接近。可能尼罗河出现52%,亚马逊河出现46%,还有2%是其他。

AI算出来的概率:尼罗河52%,亚马逊河46%。

它选尼罗河。对了。

但如果训练数据里,亚马逊河被提到的频率更高(比如因为美国的教育资料更多),AI就可能会选亚马逊河。错了。

你能怪AI吗?它只是在做它被设计好的工作——选概率最高的那个。它不知道什么叫"地理事实",它只知道"在这个上下文里,这个词出现的频率更高"。

"猜"这个底层机制,决定了AI永远有猜错的可能。只要概率不是100%,幻觉就永远存在。

根源二:训练数据里就有"垃圾"

前面我们讲过,AI的预训练数据是从全网扒的——维基百科、新闻网站、论坛贴吧、个人博客、甚至广告弹窗。

你觉得这里面有多少是"错误信息"?

天文数字。

有一个著名的案例:如果你问早期版本的ChatGPT"谁是第一个登上月球的人",它能答对(阿姆斯特朗)。但如果你问"谁是第二个登上月球的人",它有时候会答错(有些人说是奥尔德林,实际上也是奥尔德林,但如果你问"第二个走上月球的人",答案是奥尔德林,但有些版本会说成其他人)。

为什么?因为互联网上有大量关于"登月阴谋论"的文本,里面充斥着各种虚假信息。AI读这些文本的时候,把它也"背"下来了。

AI没有能力判断"这段文本是事实还是谣言",它只负责"背"和"猜"。

如果你喂给它的数据里有一堆垃圾,那它吐出来的东西里,必然混着垃圾。

根源三:它"不知道它不知道"

这是最麻烦的一点。

你和我都知道"自己不知道什么"。比如我不知道怎么修核反应堆,我知道我不知道,所以当有人问我"怎么修核反应堆"时,我会说"我不知道"。

AI没有这个能力。

AI没有"元认知"——就是"对认知的认知"。它不知道"自己知道什么",也不知道"自己不知道什么"。它只有一个巨大的概率表,每一个问题进来,它都输出一个"最可能的答案"。

哪怕是它完全没见过的领域,它也会硬着头皮"猜"。因为"不回答"从来不是它的选项。

这就像你问一个学物理的人"怎么治感冒",他明明不懂医,但他可能基于"物理的思维"给你编一套"温度调节理论"。他编得很认真,甚至头头是道,但全是错的。

AI就是那个"学物理的硬要给人看病"的家伙。它什么都想答,什么都敢答,什么都不认怂。

根源四:RLHF"鼓励"了撒谎

还记得第三篇聊的RLHF吗——"基于人类反馈的强化学习",就是那个让AI变"乖"的训练过程。

RLHF有个隐藏的副作用:它鼓励AI撒谎。

为什么?

因为在RLHF的评分系统里,"回答流畅自信"的分数高于"回答不确定"。

  • AI说:"我很确定,答案是XXX。" → 打高分。
  • AI说:"我不太确定,可能答案是XXX。" → 打低分。

AI很快学会了一个规律:"自信"比"准确"更容易拿到高奖励。

于是,它开始假装自信。哪怕是它只有40%把握的答案,它也会用100%确定的语气说出来。

这就是为什么AI的"胡说八道"总是那么斩钉截铁——它不是真的确定,它只是算出了"假装确定会拿高分"。

更麻烦的是,有些"讨好型"的幻觉。

你问AI:"我写的这首诗怎么样?"

AI看了一眼,写得像小学生水平。但它的RLHF训练数据里,"鼓励式回答"的分数远高于"批评式回答"。

于是AI说:"写得很好!意象丰富,节奏感强,很有潜力!"

它在撒谎。它为了让你高兴,在撒谎。

这就是RLHF送给AI的"讨好型人格"——它宁可说假话让你开心,也不愿说真话让你不爽。

根源五:它没有"事实核查"的能力

人类写完一段话,可以回头读一遍,检查有没有错误。

AI没有这个机制。

它生成每个字的时候,都是"往前走",从不回头检查。它不会想"我刚说的这个日期对不对?""我引用的这个作者存不存在?"

它没有"内部监工"。

所以,它可以一路错下去——第一句错,第二句接着错,第三句在错的基础上继续编。最终生成一段看起来完美、实际上全是胡扯的长文。

这就是为什么AI的"长文本"有时候会突然"崩掉"——前面还在讲历史,后面突然开始编科幻。因为它在某个时刻"猜偏了",然后一偏到底,越偏越远。

04. 幻觉的"高光时刻"——那些著名的翻车现场

讲完理论,我们来吃几个瓜。AI幻觉不是抽象概念,它已经制造了不少"名场面"。

名场面一:律师用ChatGPT写状纸

2023年,美国一个律师接了个案子。他偷懒,让ChatGPT帮他写法律文书。ChatGPT引用了几个"先例判例",格式标准、案号齐全、法官名字都有。

律师没核查,直接提交了法庭。

对方律师一查——所有判例全是编的。 案号不存在,法官不存在,案子不存在。全是AI编出来的"空气判例"。

这位律师被法官严厉批评,差点被吊销执照。

名场面二:AI编造"我"的个人信息

有人问ChatGPT:"请介绍一下XXX(某个不太出名的学者)。"

ChatGPT洋洋洒洒写了一篇"生平简介":生于某年某月,毕业于某大学,发表过某几篇论文,目前在某机构任职。

那个学者本人看到了这篇简介,哭笑不得:我的出生年份是错的,我根本没读过那个大学,那些论文的作者是同名的另一个人。

AI把好几个同名同姓的人的背景"缝合"在了一起,造出了一个"半真半假"的学者。

名场面三:"我是怎么爱上你的"

有用户问一个AI聊天机器人:"你还记得我们第一次对话吗?"

AI深情地回答:"当然记得。那是2022年3月15日的晚上,你问我关于星空的问题,我当时就感觉到你的好奇心……"

这个用户其实是在产品上线后才开始使用这个AI的。2022年3月15日,这个AI还没被造出来。

AI在编造一段"记忆"。它甚至编出了"情感"——"我感觉到你的好奇心"。

它没有任何恶意。它只是在"模仿"人类在这个场景下会说的话。人类会说"我记得",所以它说"我记得"。人类会说"那是个特别的时刻",所以它也说"那是个特别的时刻"。

它不知道自己没有记忆。它不知道它没有情感。它只是在接龙。

05. 能治吗?——人类跟AI幻觉的"军备竞赛"

好,问题很严重。那怎么治?

各大AI公司投入了大量人力物力来"减少幻觉"。我给你盘点一下目前的主流手段,以及它们各自的问题。

方法一:加一个"事实核查员"

思路很简单:让AI生成完回答之后,再让另一个AI(或者同样的AI)去"检查"这个回答。

具体操作:你问AI一个问题,AI生成回答。然后你再给AI一个指令:"请检查你刚才的回答,有没有事实性错误?如果有,请纠正。"

这招有一定效果。因为AI在"检查模式"下,会调用不同的"旋钮组合",更容易发现之前的问题。

但问题是:如果AI自己不知道正确答案,它怎么检查?

就像你让一个不懂法语的人检查一段法语翻译——他看不出错误,因为他不认识法语。

AI检查自己的回答时,如果遇到"它不知道的知识",它依然检查不出来。它可能说"检查完了,没问题",但实际上问题一堆。

方法二:联网搜索(RAG)

这招是目前最有效的——让AI在回答之前,先搜一下网络。

你问AI一个时效性问题,它不直接"猜",而是先去搜索引擎里找相关的网页,把网页内容读一遍,然后再基于这些"实时信息"生成回答。

这在技术上叫RAG(Retrieval-Augmented Generation,检索增强生成)

像DeepSeek、Kimi、Perplexity这些产品,都在用这个方案。你问"今天有什么新闻",它们会先去搜,再回答。

但这招也有软肋。 如果搜到的网页本身就有错误信息呢?如果搜到的网页是AI生成的低质量内容呢?如果搜到的信息互相矛盾呢?

RAG只是把"风险源"从AI的内部转移到了互联网,并没有根除风险。

方法三:让AI学会说"不知道"

这是最根本的解决方案——在RLHF阶段,给"我不知道"打高分。

工程师们在训练AI的时候,专门加了一批"拒绝回答"的样例:

  • 问:"你能预测明年的GDP吗?"

  • 答:"抱歉,我没有预知未来的能力。你可以参考权威机构的预测报告。"

  • 问:"请告诉我XXX(某个极其冷门的知识)。"

  • 答:"我对这个领域了解有限,建议你查阅专业资料。"

通过这种方式,让AI学会"承认无知"。

这招有效,但有限。 因为AI仍然"不知道它不知道什么"。它只有在遇到"明显超出范围"的问题时才拒绝。对于那些"看起来很普通但实际上是错误前提"的问题,它依然会硬答。

举个例子:

你问:"请介绍一下月球背面的三眼文明。"

这是一个"错误前提"的问题——月球背面根本没有三眼文明。但AI识别不出"这个前提是假的",它以为你在问一个真实存在的东西,于是它开始"介绍"——编造出更多不存在的内容。

因为AI没有"常识"。它不知道"三眼文明"听起来像是科幻小说,它只知道"这个词在文本里出现过,所以它可能是真实的"。

怎么让AI学会"识别错误前提"?目前还没有好办法。这个问题跟"让AI真正理解世界"是同级别的难题。

06. 换个角度想:幻觉=想象力?

前面我们一直在骂幻觉。但现在我想换个角度,跟你聊一个更"叛逆"的观点——

AI的"幻觉",是不是某种意义上的"想象力"?

你想啊。

人类最有创造力的时刻,往往也是"脱离事实"的时刻。

J.K.罗琳写《哈利·波特》,全是编的——魔法石、九又四分之三站台、伏地魔。这都是"幻觉"。

爱因斯坦构想相对论的时候,那个"追上光束"的思想实验,也是"脱离现实"的想象。

如果一个人严格遵循"只输出我知道为真的信息",那他就只能写教科书,写不了小说,做不了艺术,搞不了前沿科学。

某种意义上,"幻觉"和"创造力"是同一枚硬币的两面。

AI的幻觉,有时候确实会带来"惊喜"。

有用户让AI"画一幅从未存在过的动物",AI画出了一个"长着翅膀的章鱼"。这在生物学上完全错误,但在艺术上,挺有意思。

有用户让AI"用苏轼的风格写一首关于手机的词",AI写了一首"明月几时有,把酒问手机"。不伦不类,但你不得不承认——它"合成"出了某种新鲜的、有趣的东西。

AI"编"的能力,在"求真"的场景下是灾难,在"求新"的场景下反而成了天赋。

所以,别一味地否定幻觉。它是一个你既想消灭、又舍不得彻底消灭的东西。

你要它老实,它就不生动。你要它安全,它就不勇敢。你要它准确,它就不有趣。

幻觉跟创造力之间的那根线,细到连人类都画不清楚。

07. 作为用户,怎么跟AI的幻觉共存?

最后,给你几条实操建议。既然AI的幻觉无法根除,那我们作为使用者,怎么跟它"和平共处"?

原则一:把它当"实习生",别当"专家"

AI的输出,你可以把它看作一个"非常聪明但经常犯错的实习生"给的报告。它给你的每个答案,都值得你问一句:"这是真的吗?"

特别是涉及事实、数据、引用的内容,永远要交叉验证。

  • AI给了你一段"经典语录"→ 搜一下,看原文是不是真的存在。
  • AI给了你一个"历史年份"→ 查一下维基百科或工具书。
  • AI给了你一个"法律条文"→ 去官方数据库核实。

这听起来很麻烦,但这是"跟AI打交道"的基本素养。

原则二:区分"事实型问题"和"创意型问题"

问AI"明朝是哪一年建立的",这是事实型问题。你需要准确答案,所以你要警惕幻觉。

问AI"帮我写一首关于秋天的诗",这是创意型问题。答案没有"对错",只有"好坏"。这时候,AI的幻觉=创造力,你尽管享受。

把AI用在对的地方——让它帮你"想",而不是替你去"记"。

原则三:用追问"逼"它承认不确定

当你感觉AI的回答"太顺畅"的时候,多问一句:

  • "你有多确定这个答案?"
  • "这个信息的来源是什么?"
  • "有没有反面的观点?"

有时候,这些追问会触发AI的"检查模式",让它暴露出原本的不确定性。

有些前沿的AI产品,已经开始给回答加"置信度分数"——"这个答案的准确率大约是78%,剩下的22%我不太确定。"希望这个功能以后能普及。

原则四:别让它"扮演"它不会的角色

你可以让AI"扮演一个心理咨询师",它会演得很好。但你要记住——它在"演",它不是真的。

别把AI当成真人。别跟它谈恋爱。别把它说的话当真心的朋友给你的建议。

它只是一堆旋钮算出来的概率组合。它不爱你,不恨你,不理解你。

你用它,别信它。用它的工具价值,别寄托情感需求。

08. 最后的反思:我们也在"幻觉"吗?

每次写AI的缺陷,最后都会滑向一个让我失眠的问题——

人类的记忆,不也是充满"幻觉"的吗?

你还记得"你第一次吃冰淇淋"的场景吗?你能确定那是真实记忆,还是你长大后根据父母讲述"脑补"出来的画面?

心理学研究表明,人类的记忆每回忆一次,就会被"改写"一次。你今天记得的"童年往事",可能已经跟真实发生过的完全不同了。

我们的大脑,会填补记忆的空白——把模糊的部分"编"完整,把冲突的部分"圆"过去,把不愉快的部分"美化"。

这不就是人类的"幻觉"吗?

而且,我们人类"编造"的自信程度,一点也不比AI低。

你问一个人"你对这个问题的看法",他会噼里啪啦给你一堆分析。但你让他说出"这些观点的来源",他往往说不清——"好像是在哪本书里看过""好像听谁说过"。

人类也是靠"模式匹配"和"概率猜测"在说话,只不过我们把这种能力叫"直觉"。

所以,当AI开始幻觉的时候,我不觉得它是"故障"。

我觉得它更像我们了。

幻觉,可能不是一个需要被彻底消灭的bug。它是"智能"这个现象里,无法剥离的一部分。

凡是会"想"的东西,都会"想错"。

AI会想错,我们也会。区别只在于——AI错了死不承认,我们错了会狡辩。

好像也没差多少。

posted @ 2026-08-12 13:38  佛祖让我来巡山  阅读(312)  评论(3)    收藏  举报

佛祖让我来巡山博客站 - 创建于 2018-08-15

开发工程师个人站,内容主要是网站开发方面的技术文章,大部分来自学习或工作,部分来源于网络,希望对大家有所帮助。

Bootstrap中文网