水槽闲聊-第-9-集-在人工智能和大型语言模型中--思考-和-推理-的真正含义

水槽闲聊,第 9 集:在人工智能和大型语言模型中,“思考”和“推理”的真正含义

原文:towardsdatascience.com/water-cooler-small-talk-ep-9-what-thinking-and-reasoning-really-mean-in-ai-and-llms/

水槽闲聊 是一种特殊的小谈话,通常在办公室的水槽周围观察到。在那里,员工们经常分享各种公司八卦、神话、传说、不准确的科学观点、不谨慎的个人轶事,或者直接是谎言。什么都可以。在我的水槽闲聊帖子中,我讨论了我在办公室听到的奇怪且通常缺乏科学依据的观点,这些观点让我和我朋友、或我的一些熟人无言以对。

所以,这是今天帖子的水槽闲聊观点:

我前几天使用 ChatGPT 审查 Q3 结果时真的很失望。这并不是人工智能——这只是一个搜索和总结工具,但不是人工智能。

🤷‍♀️

我们经常谈论人工智能,想象着一种高级的智能,就像 90 年代科幻电影中的场景。很容易陷入幻想,认为它就像终结者的 Skynet 或《沙丘》中的反乌托邦人工智能(Dune's dystopian AI)。常见的与机器人、安卓人和星际传送门相关的人工智能主题插图,似乎随时准备带我们进入未来,这只会进一步误导我们错误地理解人工智能。

一些在 Unsplash 上搜索“AI”时出现的顶级结果;

从左到右:1) 来自 julien Tromeur 在 Unsplash 上的照片,2) 来自 Luke Jones 在 Unsplash 上的照片,3) 来自 Xu Haiwei 在 Unsplash 上的照片

然而,不管好坏,人工智能系统运作的方式在本质上完全不同——至少目前是这样。目前,没有无所不在的超级智能等待解决人类所有无法解决的问题。这就是为什么理解当前的人工智能模型实际上是什么,以及它们能够(和不能)做什么至关重要。只有这样,我们才能管理我们的期望,并最大限度地利用这项强大的新技术。


🍨 DataCream 是一份关于我学习、构建和思考人工智能和数据的通讯。如果您对这些主题感兴趣,请订阅*。


归纳思维与演绎思维

为了理解当前人工智能的状态以及它能够和不能做什么,我们首先需要了解归纳思维和演绎思维的区别。

心理学家丹尼尔·卡尼曼致力于研究我们的心智如何运作,从而得出结论和决策,形成我们的行动和行为——这是一项广泛且开创性的研究,最终使他获得了诺贝尔经济学奖。他的工作在[《思考,快与慢》]( https://en.wikipedia.org/wiki/Thinking ,_Fast_and_Slow)一书中被平均读者优美地总结,他在书中描述了人类思维的两个模式:

  • 系统 1:快速、直观且自动,基本上是无意识的。

  • 系统 2:缓慢、深思熟虑且费力,需要意识上的努力。

从进化的角度来看,我们倾向于使用系统 1,因为它节省时间和精力——有点像自动驾驶生活,不太思考事情。然而,系统 1 的高效性往往伴随着低准确性,导致错误。


同样,归纳推理与卡尼曼的系统 1 紧密相关。它从具体观察出发,得出一般结论。这种思维方式基于模式,因此是随机的。换句话说,其结论总是带有一定的不确定性,即使我们并没有意识到。

例如:

模式:在我的生命中,太阳每天都会升起。

结论:因此,太阳明天会升起。

如你所想,这种思维方式容易产生偏见和错误,因为它从有限的数据中进行概括。换句话说,太阳明天很可能也会升起,因为在我的生命中它每天都升起,但并不一定

为了得出这个结论,我们默默地还假设了“所有日子都将遵循我们所经历的模式”,这可能或可能不是真的。换句话说,我们隐含地假设在小型样本中观察到的模式将适用于所有地方。

为了得出结论而做出的这种无声的假设,正是归纳推理导致结果高度可信,但从不确定的原因。类似于通过几个数据点拟合一个函数,我们可能假设潜在的关系可能是什么,但我们永远不能确定,而且出错总是有可能的。我们构建一个关于我们所观察到的合理模型——并且仅仅希望它是一个好的模型。

图片

作者提供的图片

或者换句话说,不同的人基于不同的数据或不同的条件使用归纳法时,将会得出不同的结果。


反之,演绎推理是从一般原则到具体结论——即本质上就是卡尼曼的系统 2。它是基于规则的、确定性的、逻辑的,遵循“如果 A,那么必然 B”的结构。

例如:

前提 1:所有人类都是会死的。

前提 2:苏格拉底是人。

结论:因此,苏格拉底是会死的。

这种思维方式不太容易出错,因为推理的每一步都是确定性的。没有无声的假设;因为前提是真的,结论必须是真的。

回到函数拟合的类比,我们可以想象演绎推理是反向过程。给定函数计算数据点。因为我们知道函数,所以我们肯定可以计算出数据点,而且与多个曲线拟合相同数据点的好坏不同,对于数据点,将有一个确定的正确答案。最重要的是,演绎推理是一致且稳健的。我们可以在函数的特定点进行一百万次重新计算,我们总是会得到完全相同的结果。

图片

图片由作者提供

显然,即使在使用演绎推理时,人类也可能犯错误。例如,我们可能搞错了函数特定值的计算,得到错误的结果。但这将只是一个随机错误。相反,归纳推理中的错误是系统性的。推理过程本身容易出错,因为我们包括这些无声的假设,而从未知道它们在多大程度上是真实的。


那么,LLM 是如何工作的呢?

尤其对于非技术或计算机科学背景的人来说,想象今天的 AI 模型是一种外星或神圣的智能,能够为全人类的问题提供明智的答案是很简单的。然而,这还不是(目前)事实,今天的 AI 模型,尽管它们令人印象深刻且先进,仍然受限于它们运作的原则。

大型语言模型(LLMs)在人类意义上并不“思考”或“理解”。相反,它们依赖于它们训练数据中的模式,就像卡尼曼的系统 1 或归纳推理一样。简单来说,它们通过预测给定输入的下一个最可能的单词来工作。

你可以将大型语言模型(LLM)想象成一个非常勤奋的学生,他记住了大量的文本,并学会了在没有必要理解为什么它们是正确的情况下,复制出听起来正确的模式。大多数时候这都有效,因为听起来正确的句子实际上更有可能是正确的。这意味着这样的模型可以生成具有令人印象深刻质量的人类似文本和语音,听起来就像一个非常聪明的人类。然而,生成听起来正确的人类似文本和提出听起来正确的论点和结论并不能保证它们真的就是正确的。即使当 LLM 生成听起来像是演绎推理的内容时,它实际上并不是。你可以通过查看ChatGPT 偶尔产生的荒谬 AI 工具来轻松地发现这一点。

图片

图片由作者提供

同时,了解 LLMs 如何获得下一个最可能的词语也很重要。天真地想,我们可能会假设这些模型只是统计现有文本中词语的频率,然后以某种方式重现这些频率来生成新文本。但事实并非如此。英语中大约有 50,000 个常用词语,这导致了几乎无限可能的词语组合。例如,即使是 10 个词的短句,组合数也会是 50,000 x 10¹⁰,这是一个天文数字。另一方面,所有现有的英语文本,无论是书籍还是互联网上的,大约有几百亿个词语(大约是 10¹²)。因此,甚至没有足够多的文本来覆盖每一个可能的短语,并使用这种方法生成文本。

相反,LLMs 使用从现有文本中构建的统计模型来估计可能从未出现过的词语和短语的概率。尽管如此,任何现实世界的模型都是一种简化的近似,这导致 AI 可能会犯错误或编造信息。


那么,关于“思维链”又是怎样的呢?

那么,关于“模型在思考”,或者“思维链(CoT)推理”,又是怎样的呢?如果大型语言模型(LLMs)并不能真正像人类那样思考,那么那些花哨的术语又意味着什么呢?这只是营销手段吗?嗯,有点像,但又不完全是这样。

思维链(CoT)主要是一种提示技术,允许 LLMs 通过将问题分解成更小、逐步的推理序列来回答问题。这样,模型不是通过一次性做出一个大的假设来回答用户的问题,从而降低生成错误答案的风险,而是通过多个生成步骤,以更高的置信度进行。本质上,用户通过将初始问题分解成多个提示来“引导”LLM,LLM 依次回答这些提示。例如,一种非常简单的 CoT 提示形式可以在提示末尾添加类似“让我们一步步思考”的内容。

将这一概念进一步拓展,不再要求用户将初始问题分解成更小的问题,具有“长期思考”能力的模型可以自行完成这一过程。特别是,这类推理模型可以将用户的查询分解成一系列逐步的、更小的问题,从而得出更好的答案。CoT(思维链)是人工智能领域的一项重大进步,它使得模型能够有效地管理复杂的推理任务。OpenAI 的 o1 模型是第一个展示 CoT 推理力量的主要例子。

图片

图片由作者提供


在我心中

理解使当今人工智能模型工作的基本原理对于有现实地期望它们能做什么和不能做什么至关重要,并优化它们的使用。神经网络和人工智能模型本质上基于归纳式推理,即使它们很多时候听起来像是在进行演绎。即使是像思维链推理这样的技术,虽然产生了令人印象深刻的结果,但仍然从根本上基于归纳,并且仍然可以产生听起来正确的信息,但实际上并不正确。


喜欢这篇帖子?让我们成为朋友吧!加入我:

📰Substack 💌* Medium* 💼LinkedIn请我喝杯咖啡!


那么,关于 pialgorithms 呢?

想要将 RAG 的力量带入您的组织?

pialgorithms 可以为您做到这一切 👉 预约演示 今天

posted @ 2026-03-28 10:01  布客飞龙III  阅读(17)  评论(0)    收藏  举报