Vizuara-人工智能研究员训练营笔记-全-
Vizuara 人工智能研究员训练营笔记(全)
001:生成对抗网络 🎨🤖
在本节课中,我们将要学习生成对抗网络的基本概念。我们将从一篇2017年发表的综述性论文入手,逐步拆解GANs的核心思想、工作原理及其组成部分。课程将分为两部分,从最基础的概念开始,确保初学者能够跟上。

概述
这篇论文旨在为信号处理社区提供一个关于生成对抗网络的概述。GANs是一种无需大量标注训练数据即可学习深度表示的方法。它属于生成式模型,意味着它能观察一系列数据(如图像),并尝试生成在原始数据中不存在的新样本。
引言
上一节我们介绍了课程的整体目标,本节中我们来看看GANs的起源和基本类比。
生成对抗网络技术于2014年首次提出。其有趣之处在于,它同时训练一对相互竞争的神经网络。我们可以将这两个网络想象成一个艺术伪造者和一个艺术鉴定专家。伪造者被称为生成器,而鉴定专家被称为判别器。
核心架构与工作原理
上一节我们了解了GANs的基本类比,本节中我们来看看其具体的工作流程和架构。
以下是GANs的核心工作流程:
- 真实数据:我们有一个真实的数据集,例如一系列猫的图像。
- 噪声输入:生成器接收一个随机噪声向量作为输入。
- 生成样本:生成器将噪声转换为一个合成数据样本(例如,一张“假”的猫图片)。
- 判别过程:判别器同时接收真实数据样本和生成器产生的合成样本。
- 判别任务:判别器的任务是判断其接收的样本是来自真实数据还是来自生成器。
初始时,生成器产生的样本质量很差,判别器能轻易识别出它们是假的。但随着训练的进行,生成器不断学习如何生成更逼真的样本以“欺骗”判别器,而判别器则不断学习如何更好地区分真假。两者在对抗中共同进步。


数学目标
上一节我们描述了GANs的动态过程,本节中我们来看看驱动这个过程的数学目标。
GAN的训练可以被形式化为一个极小极大博弈。生成器和判别器的目标函数是相互对抗的。
生成器的目标是生成尽可能逼真的数据,以最小化判别器做出正确判断的概率。其目标可以理解为让判别器对生成样本的判别输出接近1(即认为是“真”)。
判别器的目标是最大化其正确分类真实样本和生成样本的能力。其目标函数包含两部分:一是将真实样本判别为“真”,二是将生成样本判别为“假”。
这个博弈的纳什均衡点是生成器产生的数据分布与真实数据分布完全一致,此时判别器无法区分,对任何样本的输出概率都是0.5。
总结

本节课中我们一起学习了生成对抗网络的基础知识。我们从一篇综述论文出发,理解了GANs是一种无需标注数据的生成式模型。我们学习了其核心架构,包括生成器和判别器这两个相互对抗的网络,并通过艺术伪造的类比加深了理解。最后,我们探讨了驱动整个训练过程的极小极大博弈数学目标。GANs通过这种对抗性训练,最终使生成器能够产生足以“以假乱真”的数据样本。
002:阅读你的第一篇AI论文 📄
在本节课中,我们将学习如何阅读一篇AI研究论文。我们将以一篇名为《使用生成式AI构建梦想》的论文为例,逐步拆解其内容,学习如何理解摘要、引言,并识别论文的核心概念与潜在的研究空白。
概述

本节课,我们将一起阅读一篇关于生成式AI在教育中应用的论文。我们将从摘要开始,理解论文的整体目标,然后深入引言部分,分析作者提出的问题、背景以及研究方法。通过这个过程,你将学习到阅读研究论文的基本步骤和关键点。

阅读摘要
首先,我们通过阅读摘要来获取论文的概览。摘要通常总结了研究的目的、方法、结果和结论。
这篇论文的作者让34名高中生接触了一系列生成式AI应用。作者要求这些学生创建他们想象中的未来梦想,同时试图理解生成式AI工具在此过程中的潜在益处和危害。
阅读摘要时,我思考了常见的生成式AI应用,例如ChatGPT和Midjourney。这篇论文吸引我的地方在于,它探讨了学生如何利用这些工具来构建未来梦想,并同时评估工具的利弊。这在当前时代尤为有趣,因为生成式AI很可能在未来全球的课堂中扮演某种角色。
深入引言部分
上一节我们了解了论文的总体目标,本节中我们来看看论文的引言部分。引言通常会阐述研究背景、问题定义以及现有研究的不足。
生成式人工智能的含义
引言的第一段解释了生成式人工智能的含义。与传统分类问题不同,生成式AI基于现有的文本和图像数据集训练算法。其输出不是概率,而是算法试图生成的全新文本或图像。这就是生成式人工智能的核心。我们已经看到有应用可以生成文本、图像、视频、3D模型等。其中,在蛋白质折叠方面的应用相当有趣。
OpenAI的ChatGPT于2022年12月左右发布,并在极短时间内获得了1亿用户,这十分引人注目。
生成式AI的优势与伦理关切
接下来的一段讨论了生成式AI的优势,即显著降低了创造性表达的障碍。我们已经通过使用ChatGPT看到了这一点,它可以用于广泛的创意目的。
同时,它们也可能被用于一些负面用途。作者以一种有趣的方式列出了伦理关切:
- 所有权与版权:当AI生成新内容时,很难确定它使用了哪些现有作品,且这些作品通常未被引用。
- 数据安全
- 剽窃
- 虚假信息的生成与传播
版权问题尤其令我感兴趣。最近在一次采访中,OpenAI的首席技术官也表示不清楚其新应用的数据来源。因此,我注意到这些应用存在伦理关切,特别是版权问题。它们也可能影响创意行业的就业机会,当然,这也取决于未来可能创造的新工作岗位数量,这仍有待辩论。
当前教育领域的空白
在这一段中,作者还将此与K12学生(指12年级以下的学生)联系起来。这些学生对这类工具的工作原理了解甚少,并且目前很少有为他们设计课程和学习材料的努力。
这很有趣,我注意到这是现有领域的一个空白:并非很多学生熟悉不同的生成式AI工具,目前也没有开发出能在年轻时向学生介绍如何正确使用生成式AI算法的课程。
研究的核心与目标
下一段特别吸引我,作者提到了几个要点。首先,请关注以下三点:
- 当要求学生创造某物(例如创造未来的自己)时,这允许他们表达自我认同。
- 它允许他们分享一些仅用语言可能无法表达的东西。
- 第三点当然也很有趣,因为它提出了生成式算法的社会和伦理影响问题。
作者使用了Stability AI的Dream Studio平台,这很有趣,我之前没有用过这个特定平台。
引言最后聚焦于创造性、技术性和伦理性的学习目标:
- 创造性学习目标:教导学生如何在生成式AI工具中编写恰当的提示。
- 技术性学习目标:理解当前算法的能力和局限性。
- 第四点非常有趣,它试图聚焦于:生成的图像中的模式实际上反映了底层数据中的模式。例如,如果训练数据中特定肤色的人被赋予很多重要性,那么这将成为输出中反映的模式。因此,无论你想生成什么图像,都可能偏向于白人或者肤色较浅的人,这只是一个例子。
- 伦理性学习目标:我们已经讨论过潜在的危害,包括算法偏见、版权侵权、伪造媒体的创建。算法偏见之所以超级有趣,是因为它揭示了数据中的固有偏差如何影响AI的输出。
总结
本节课中,我们一起学习了如何开始阅读一篇AI研究论文。我们以《使用生成式AI构建梦想》为例,从摘要入手把握全局,然后深入引言,理解了生成式AI的定义、其优势与伦理挑战,以及当前在教育领域存在的空白。我们还识别了论文研究的核心目标:即探索学生如何利用生成式AI进行创造性表达,并同时培养其技术理解和伦理意识。在接下来的课程中,我们将继续阅读论文的其他部分,学习如何总结关键发现并识别文献中的研究缺口。
003:Vision Transformer基础
在本节课中,我们将学习一篇名为《一张图片值16x16个词:大规模图像识别中的Transformer》的论文。这篇论文探讨了如何将Transformer架构应用于计算机视觉任务,并介绍了Vision Transformer(ViT)模型。我们将逐步解析其架构、工作原理以及它为何如此强大。
概述
这篇论文由Google Research的Brain团队完成,并于2021年在ICLR会议上发表。它提出了一种名为Vision Transformer(ViT)的架构,用于图像识别任务。在此之前,Transformer架构虽已成为自然语言处理任务的事实标准,但在计算机视觉领域的应用仍然有限。
论文摘要解析
上一节我们介绍了论文的背景,本节中我们来看看摘要部分的核心内容。
摘要指出,在2021年之前,计算机视觉领域仍主要使用卷积神经网络。注意力机制要么与CNN结合使用,要么用于替换CNN的某些组件,但CNN的整体结构仍被保留。Transformer架构自2017年提出后,人们一直在尝试将其引入图像识别,但尚未完全取代CNN。

然而,当在大规模数据上进行预训练,并迁移到多个中等规模或小型的识别基准测试时,Vision Transformer(ViT)取得了优异的结果,其性能优于当时最先进的卷积网络。

以下是摘要中强调的几个关键点:
- 论文发表于2021年ICLR会议。
- CNN当时仍广泛用于图像识别任务。
- 对于大型数据集,ViT实现了更好的性能。
研究动机与挑战
上一节我们了解了ViT的成果,本节中我们来看看研究者面临的挑战和他们的解决思路。
基于自注意力的架构,特别是Transformer,已成为自然语言处理的首选模型。其主流方法是在大型文本语料库上进行预训练,然后在较小的特定任务数据集上进行微调。得益于Transformer的计算效率和可扩展性,训练具有超过千亿参数的模型成为可能。
然而,在计算机视觉领域,卷积神经网络架构仍然占据主导地位。受NLP成功的启发,多项工作尝试将CNN架构与自注意力结合,但并未取得巨大成功。
受Transformer在NLP中缩放成功的启发,本研究尝试以最少的修改将标准Transformer直接应用于图像。具体做法是将图像分割成块(patches),并将这些块的线性嵌入序列作为Transformer的输入。图像块的处理方式与NLP应用中的词元(tokens)相同。
Vision Transformer的核心思想

上一节我们提到了将图像转化为序列的思路,本节中我们来深入探讨其具体实现和面临的挑战。
当在中等规模数据集(如ImageNet)上训练时,Vision Transformer的准确率比同等规模的ResNet低几个百分点,这看似令人沮丧。然而,对于更大的数据集,它们表现得非常好,情况完全不同。我们将探讨其原因,这与CNN固有的归纳偏置有关。
首先,我们需要理解将注意力机制直接应用于图像的基本任务。在NLP中,对于一组词(例如5个词),注意力机制会构建一个5x5的矩阵。每个词都有对应的键、值和查询向量。矩阵中的条目数量(即计算量)随序列长度n呈平方级增长,即 O(n²)。
现在考虑图像。假设我们有一张5x5的图像。如果对每个像素应用自注意力,每个像素都需要关注图像中的其他所有像素。我们可以将整张图像视为一个长度为25的像素值序列。那么,所需的自注意力计算量将是 25²,即 5⁴。
因此,当将自注意力机制直接应用于原始图像时,所需的计算量非常巨大,且呈二次方增长。这可能是Transformer架构提出四年后,人们仍未能成功将其完全应用于图像任务的主要原因。
总结
本节课中,我们一起学习了Vision Transformer的基础。我们了解到,在ViT出现之前,计算机视觉领域仍严重依赖CNN,而直接应用Transformer到图像上会因计算复杂度(O(n²))过高而难以实现。ViT的创新之处在于将图像分割为块并转换为序列,从而能够利用标准Transformer架构进行处理。我们还了解到,ViT在大型数据集上表现优异,但在中等数据集上可能不如CNN,这与模型的归纳偏置有关。
004:苹果的参考解析模型 (ReALM)
在本节课中,我们将学习苹果公司近期发布的一篇关于参考解析的论文。参考解析是理解上下文、实现自然对话交互的关键技术。我们将探讨如何利用语言模型来解决屏幕实体和对话中的模糊指代问题。
摘要与背景

上一节我们介绍了课程目标,本节中我们来看看论文的摘要和背景。
论文指出,参考解析对于理解和处理各种上下文至关重要。上下文包括先前的对话内容,以及非对话实体,例如用户屏幕上的元素或后台运行的应用。


大型语言模型(LLMs)已在多种任务上展现出强大能力,但它们在参考解析方面的应用仍未得到充分利用。本文展示了如何利用LLM构建一个极其有效的系统,以解析各种类型的指代。
人类语言通常包含模糊的指代,例如“他们”或“那个”。在给定上下文的情况下,其含义对人类来说是显而易见的。对于对话助手而言,理解包含此类指代的上下文至关重要。
例如,考虑以下交互:
- 用户:“显示我附近的药店。”
- 助手:提供一个药店列表。
- 用户:“拨打Rabow路上的那一家。” 或 “拨打最下面那一家。” 或 “拨打屏幕上显示的这个号码。”
在这些后续查询中,用户并未明确提及具体药店名称,而是使用了与上下文相关的指代。这对人类来说很自然,但对AI助手而言,若不理解上下文,则难以完成用户请求。因此,理解上下文是实现更自然对话的关键。
现有方法的挑战
上一节我们了解了参考解析的重要性,本节中我们来看看当前方法面临的挑战。

论文指出,虽然端到端的大型语言模型体验强大,但在实际应用中存在几个问题:
- 设备端部署困难:在智能手机等计算能力有限、功耗敏感的设备上,运行单个庞大的端到端模型是完全不可行的。
- 系统集成复杂:当模型需要与上游API和组件集成并消费信息时,使用大型语言模型通常需要对现有流程进行全面改造,这可能非常繁琐甚至不可行。
- 模型更新不灵活:使用一个专注的特定任务模型,可以透明地替换现有参考解析模型为改进版本。
因此,论文的核心观点是:在资源受限的设备上,使用更小、更专注的模型来完成参考解析任务是更可行的方案。

论文的核心创新
上一节我们讨论了现有方法的局限性,本节中我们来看看本文提出的解决方案。
在这项工作中,作者主张使用相对较小的语言模型,但对其进行专门针对参考解析任务的微调。这是本文带来的主要新颖之处。
此前已有一些类似的研究仅依赖于语言建模。这种方法在可以建模为序列到序列的任务上表现优异。然而,在语音助手中采用此技术的最大挑战在于解析对屏幕上实体的指代。
换句话说,论文致力于让语言模型能够“看见”。其核心目标是解决对屏幕上元素的参考解析,本质上是赋予语言模型视觉感知能力。
以下是论文中的一个示例,说明了“屏幕上实体”的含义:


假设上图是用户屏幕上的内容。用户可能会提出一个非直接的问题,而是引用屏幕上的某些信息,例如:“上面图片底部给出的数字是什么?” 模型需要理解“上面图片”和“底部”这些指代,并从提供的屏幕信息中找到正确答案。

本节课中我们一起学习了苹果公司ReALM论文的核心内容。我们了解了参考解析在对话AI中的重要性,分析了在移动设备上部署大型端到端模型面临的挑战,并探讨了本文提出的使用小型化、专门化语言模型来解决屏幕上实体指代问题的创新思路。这为在资源受限环境下实现更自然的对话交互提供了新的方向。
005:Transformer是什么?🌟
在本节课中,我们将一起学习一篇名为《Attention Is All You Need》的论文。这篇论文向世界介绍了Transformer的概念,是人工智能领域一篇极具开创性的论文。它推动了整个生成式智能领域的蓬勃发展,我们如今看到的ChatGPT等应用正是其结果。这篇论文初看可能并不起眼,但随着深入阅读,你会发现其精妙之处,正是这种简洁性使其显得优美。阅读后我意识到,论文中提出的模型架构至今仍被广泛沿用,改动甚少,这无疑说明了其工作的稳健性。同时,这也意味着我们在理解和预测语言的方式上,正越来越接近人脑的工作方式。可以说,这篇论文让我们在模仿人脑架构的道路上前进了一大步。它确实改变了整个领域,并提供了巨大的推动力。接下来,我们将详细解读这篇论文,理解其中概述的关键概念、生物机制和图表。我们不会预设任何先验知识,而是从头开始阅读和理解。

论文背景与引言
上一节我们提到了这篇论文的重要性,本节中我们来看看论文的基本信息和引言部分。
我们注意到,论文的作者来自Google Brain、Google Research和多伦多大学。这篇论文发表于2017年,距今已有七年。
在深入论文之前,我想提一下,关于“注意力”机制的思想并非首次在这篇论文中提出。实际上,这个概念可以追溯到2014年。当时发表那篇论文的教授并未将其命名为“注意力”,但他引入了这个想法。那篇论文的影响力不及本篇,但据说那位教授的灵感来源于某天在家思考自己如何学习英语的经历,并尝试采纳了那种方法。

无论如何,我们将从论文的引言部分开始。我们不会逐字阅读摘要,而是直接进入引言。




引言中提到:“循环神经网络、长短期记忆网络和门控循环神经网络,在序列建模和语言建模、机器翻译等转换问题中,已被确立为最先进的方法。”


我认为,为了进一步理解这篇论文,我们需要先弄清楚什么是循环神经网络以及它们如何工作。因此,让我们尝试更详细地理解它。
理解循环神经网络


上一节我们引出了循环神经网络的概念,本节中我们来详细看看它的工作原理。

假设你对神经网络一无所知。我们以循环神经网络为例来看。比如,我正在写这个句子:“I live in India. My mother tongue is...”,我们希望AI能补全这个句子。
首先,我想强调的是,我们在这里本质上要做的是……好吧,我们先来看看神经网络的基础知识,以便理解一些基本原理。
假设我们有一个变量 x。这个变量被输入到神经网络架构中。作为输出,我们得到变量 y。这是一个简单的前馈神经网络,其中 x 是输入,在这个块内发生了一些处理(即变换操作),然后得到 y。这是一个将 x 变换为 y 的函数。
现在,上面那个句子有8个单词。你可以用嵌入(本质上是一个向量)来表示每个单词。每个单词都可以表示为一个向量,你可以将这个嵌入作为输入传递到这里,并在此处获得输出。
然而,我们正在处理的这类问题与这个简单模型有很大不同。在这种方法中,我们可能有8个不同的单词,你需要8个像这样按顺序排列的网络。然后每个网络将单词作为输入,最后给出相应的输出。
但是,当你试图分析一个完整的句子时,不同单词之间存在相互关联,而这种简单的模型无法捕捉到这些关联。于是人们做了如下改进:
假设 x 是一个输入,它进入网络并给出输出 y。网络开始计算另一个变量,称为隐藏状态。假设第一个隐藏状态是 h0。这个隐藏状态被传递给下一个网络。所以现在下一个网络有两个输入:x 和 h0。它将给出另一个隐藏状态 h1,然后传递给下一个网络并产生另一个输出。
本质上,你拥有的函数 f,它以时间 t 的输入和 t-1 时刻的隐藏状态作为输入。公式如下:
h_t = f(x_t, h_{t-1})
然后,这个隐藏状态被馈送到下一个时间步 t+1。这就是循环神经网络。
在循环神经网络中,如果我要预测这里的某个东西,我就拥有了整个上文的信息。
006:卷积神经网络的起源


在本节课中,我们将学习卷积神经网络(CNN)的起源。我们将一起研读该领域的一篇开创性论文,了解其核心思想如何为现代CNN奠定基础。


大家好,欢迎来到AI研究员训练营的第三节课。本节课的主题是卷积神经网络。

我选择研读该领域最早的一篇开创性论文。

我希望理解自那以后该领域是如何演变的。


这篇论文发表于1989年。

它发表在《神经计算》期刊上。

论文的标题是《反向传播应用于手写邮政编码识别》。


作者们似乎在美国AT&T贝尔实验室工作。当然,你可以认出Yann LeCun是这篇论文的第一作者。

这篇论文让我非常感兴趣,因为它发表于大约三十年前,真正奠定了我们现在经常看到并成为机器学习课程一部分的CNN的基础。但这些人是最早提出这一概念的先驱之一。我希望深入了解他们的思维方式,以及在撰写这篇论文之前的思考过程。显然,在那个时代,AI是一个正在快速发展的领域。没有人知道它将走向何方。因此,当时的研究很大程度上基于过去的成果,并试图改进它,而不是朝着特定方向发展或开发特定应用。


首先,我们来阅读这篇论文的摘要。
论文指出,它展示了如何通过网络架构本身将约束整合到反向传播网络中。
这种方法被用于识别由美国邮政服务提供的手写邮政编码数字。论文本身并未提及“卷积神经网络”这一术语,但作者们的描述方式是,他们希望将约束整合到反向传播网络中,并为此开发了一种全新的架构。
因此,我们将暂时忘记我们所知道的关于CNN的一切,尝试从一个全新的视角来审视这篇论文。

接下来,我们来看引言部分。从这篇论文的引言中,我看到大部分相关工作可追溯到1987年。从某种意义上说,这在当时是一个非常小众的领域,其研究并非始于70年代或60年代,而是可能在85或86年左右才开始。这些人是这个特定领域的先驱之一。

这篇论文的一个主要论点是,在设计神经网络架构时,其设计原则应该是网络中的自由参数数量应尽可能少。
他们认为,应用这一原则增加了正确泛化的可能性,因为它产生了一个具有更低熵的专用网络架构。


他们将这一原则和反向传播算法应用到了一个现实世界的问题中。他们选择的是手写邮政编码数字,而不是一般的手写数字,这些数字实际上由美国邮政服务提供。
请记住,当时机器的计算能力也不是很高。因此,在我们阅读不同段落时,请将论文发表的时代背景也考虑在内。



数据来源于经过纽约州布法罗的美国邮件。


这些图像的示例如下所示,这些是人们在美国邮政系统中手写的邮政编码图像。


让我们看看这个数据集的最后一点,他们指出训练集和测试集都包含许多模糊、未分类甚至错误分类的样本。


他们在这里进行了一个预处理步骤。每个数字图像通常约为40x60像素,他们执行了一个线性操作,将图像尺寸缩小到16x16像素。这个变换基本上保留了数据中每个图像的纵横比。

你可以参考这个示例图像。它有256个图像输入单元,因为图像已被缩放到16x16像素的尺度。接下来,我们继续看网络设计部分。

识别的其余部分完全由一个多层网络执行。所有的连接都是自适应的、高度受限的,并使用反向传播进行训练。
你可能已经注意到“高度受限”这个词被重复了多次。起初我并不完全理解这个词的含义,但随着深入我们会更详细地了解。另一个有趣的地方是,这个网络的输入是一个16x16的归一化图像。
我认为这可能是神经网络或图像处理历史上第一次将整个图像作为输入。以前,输入是向量或手动提取的特征。这篇论文带来的根本性改变是,它允许你将整个图像作为神经网络的输入。这正是这个设计如此有用的原因,因为它完全消除了手动预处理的需要。


接下来,我们进入下一节:特征图和权重共享。这两个概念的确切含义是什么?
视觉模式识别的经典工作已经证明了提取局部特征并将其组合形成更高阶特征的优势。如果你以前使用过经典的卷积神经网络,你可能熟悉“特征图”这个词。让我尝试用简单的术语解释一下。
特征图是指,假设你有一张手写数字图像,比如1、2、3、4、5等,你试图从这张图像中提取不同的特征,这些特征可能是垂直边缘,或者是图像中存在的不同组件的水平边界。特征是构成整个图像的组成部分。因此,如果我们要对图像进行分类,提取所有特征并理解这些特征是非常有意义的。我们将在后续内容中更详细地探讨这一点。

在我们继续之前,请记住“特征图”这个词。

你看到的另一个术语是“权重共享”。我认为这是这篇论文实现的主要创新之一。他们说,权重共享不仅大大减少了自由参数的数量。



而且可以表达关于任务几何和拓扑结构的信息。我们将详细探讨其含义。

本节课总结
在本节课中,我们一起学习了卷积神经网络的起源。我们研读了1989年Yann LeCun等人的开创性论文《反向传播应用于手写邮政编码识别》。我们了解到,这篇论文的核心思想是通过设计特定的网络架构(如权重共享和特征提取)来整合约束,从而减少自由参数数量并提高泛化能力。这为现代卷积神经网络奠定了基础,并首次实现了将原始图像直接作为神经网络输入,消除了对手动特征提取的依赖。
007:混合专家模型基础 🧠
在本节课中,我们将学习混合专家模型的基本概念。我们将通过一篇名为《自适应局部专家混合》的开创性论文来理解其核心思想、架构和背后的直觉。混合专家模型近年来变得非常流行,例如一些大型语言模型就采用了此架构。本节课将帮助你理解其基本原理。


论文简介

这篇论文由Robert Jacobs、Michael Jordan、Stephen Noland和Geoffrey Hinton共同撰写,发表于1991年的《神经计算》期刊。它是首次系统性地提出“混合专家”思想的奠基性论文之一。
核心思想:为何需要混合专家?
上一节我们介绍了论文的背景,本节中我们来看看作者试图解决什么问题。
传统的做法是训练一个单一的多层网络来执行所有任务。然而,当训练集可以自然地划分为对应于不同子任务的子集时,这种方法会产生强烈的“干扰效应”,导致学习速度慢和“过度泛化”。
为了更直观地理解,让我们看一个具体的例子。假设我们要构建一个分类器,用于区分四种类别:小写字母“i”、大写字母“I”、小写字母“m”和大写字母“M”。
- 传统单一网络方法:训练一个网络同时学习区分这四种类别。由于“i”和“I”、“m”和“M”在特征表示上非常接近,网络在学习时可能会产生干扰,影响学习效率和精度。
- 混合专家方法:我们可以使用两个不同的网络(称为“专家网络”):
- 专家一:专门负责区分“i”和“I”。
- 专家二:专门负责区分“m”和“M”。
这种方法假设,如果我们能将先验信息(即类别可分组)注入模型,训练可能会更快,且网络间的干扰会减少。因为每个专家只需专注于自己的子任务,无需处理不相关的信息。
那么,对于一个给定的输入(例如一个字母),系统如何决定使用哪个专家呢?这就需要引入一个“门控网络”。
关键组件:专家与门控网络
上一节我们提到了使用多个专家的优势,本节中我们来看看系统是如何协调这些专家工作的。
混合专家系统由两个核心部分组成:专家网络和门控网络。
- 专家网络:每个都是专门处理输入空间中某个特定区域的神经网络。在我们的例子中,就是那两个分别处理“i/I”和“m/M”的网络。
- 门控网络:它的作用类似于一个“面试官”或“调度员”。它学习观察输入,并决定将多少“权重”或“注意力”分配给每个专家。对于处理“i”或“I”的输入,门控网络会给专家一分配高权重,给专家二分配低权重,反之亦然。
这种设计的核心思想是:门控网络将一个新的输入案例分配给一个或少数几个专家。如果输出不正确,权重的更新将高度局部化于这些活跃的专家,而不会影响其他专家的权重。
模型架构与公式化描述
理解了基本概念后,我们现在来看看如何用数学公式来描述这个系统。
我们可以将整个输入空间想象成一个区域,并被划分给不同的专家。每个专家负责一个子区域。目标是构建一个架构或定义目标函数,使得每个专家网络的权重更新独立于其他专家。
以下是描述混合专家系统输出的核心公式:
y = Σ (g_i * y_i)
其中:
y是整个混合专家系统的最终输出。g_i是门控网络为第i个专家生成的权重(或概率),满足Σ g_i = 1。y_i是第i个专家网络对该输入产生的输出。

这个公式意味着,系统的最终输出是所有专家输出的加权和,权重由门控网络根据当前输入动态决定。
总结

本节课中,我们一起学习了混合专家模型的基础知识。我们了解到,与使用单一网络处理所有任务相比,混合专家模型通过使用多个专门的“专家”网络和一个负责调度的“门控”网络,能够减少学习过程中的干扰,实现更快速、更高效的学习。其核心思想是将复杂的任务空间分解,让不同的专家处理不同的子区域,并通过门控机制灵活组合它们的输出。这个在1991年提出的思想,为后来许多高效的机器学习模型奠定了基础。
008:使用深度卷积神经网络进行ImageNet分类 🖼️

在本节课中,我们将学习一篇发表于2012年的经典人工智能论文。这篇论文的标题是《ImageNet Classification with Deep Convolutional Neural Networks》,作者包括Geoffrey Hinton、Ilya Sutskever和Alex Krizhevsky。这篇论文之所以重要,是因为它首次展示了构建非常深的卷积神经网络(CNN)的可行性,并通过一系列技巧的组合,在ImageNet图像分类挑战赛上取得了突破性的成绩。
摘要 📝
论文作者训练了一个大型深度卷积神经网络,用于对ImageNet LSVRC-2010竞赛中的120万张高分辨率图像进行分类。该网络在分类挑战中取得了前1错误率37.5%和前5错误率17.0%的成绩。这个成绩在当时显著超越了之前的最佳水平。
该网络规模庞大,包含约6000万个参数和65万个神经元。其架构由5个卷积层、3个全连接层以及一个最终的1000路softmax分类器组成。论文还介绍了一些用于提升性能和防止过拟合的技巧。
在2012年的ImageNet竞赛中,该网络的变体取得了15.3%的前5测试错误率,以超过10个百分点的优势赢得了比赛。
引言 🔍
上一节我们了解了论文的总体成就,本节中我们来看看其研究背景和动机。


当时的物体识别方法主要依赖于机器学习。提升性能的途径包括:收集更大的数据集、学习更强大的模型以及使用更好的技术来防止过拟合。
值得注意的是,直到那时,带标签的大型图像数据集(如LabelMe和ImageNet)才开始出现。ImageNet本身拥有超过1500万张高分辨率图像,涵盖22000多个类别,而LSVRC挑战赛只使用了其中120万张图像和1000个类别,这仍然是一个巨大的数据集。
在2012年之前,神经网络在手写数字识别等任务上已接近人类水平。然而,物体图像识别面临着更大的挑战,因为图像存在巨大的尺度、姿态和光照变化。因此,当时的模型性能并不理想。
论文作者认为,需要一个具有强大学习能力的模型来应对这个复杂任务。卷积神经网络(CNN)就是这样一类模型,它通过其结构引入了对图像特性的归纳偏置。CNN的能力可以通过调整其深度和宽度来控制。尽管CNN具有局部连接的效率优势,但由于计算成本过高,此前一直未被大规模应用于高分辨率图像。
阻碍CNN应用于深度网络的主要有两个原因:一是对过拟合的担忧,即网络可能只是记住了训练数据而非学习通用特征;二是当时可用的计算资源有限。

网络架构 🏗️

上一节我们讨论了应用深度CNN的挑战,本节中我们来看看论文提出的具体网络架构,名为“AlexNet”。
该网络架构包含8个学习层:5个卷积层和3个全连接层。以下是其核心设计要点:

- ReLU非线性激活函数:论文采用了修正线性单元(ReLU)作为激活函数。与传统的tanh或sigmoid函数相比,ReLU能大大加速训练。其公式为:
f(x) = max(0, x)。 - 多GPU训练:由于网络规模巨大,单个GPU的内存不足以容纳整个模型。因此,作者将网络分布在两个GPU上进行训练,每个GPU负责一半的神经元(核映射)。GPU间仅在特定的层进行通信。
- 局部响应归一化(LRN):在ReLU激活之后,作者应用了局部响应归一化,旨在帮助泛化。其公式近似为:
b_{x,y}^i = a_{x,y}^i / (k + α * Σ_{j=max(0, i-n/2)}^{min(N-1, i+n/2)} (a_{x,y}^j)^2 )^β,其中a是激活值,N是总通道数,n是局部归一化范围,k, α, β是超参数。 - 重叠池化:与传统的无重叠池化不同,该网络使用的池化窗口的步长小于窗口尺寸,导致池化区域重叠。这有助于减轻过拟合。
减少过拟合的技巧 🛡️
上一节我们介绍了网络的主体结构,本节中我们来看看论文中用于防止模型过拟合的几种关键技术。
由于网络参数众多(6000万),而训练样本有限(120万),过拟合是一个主要风险。论文采用了两种有效的数据增强方法:
- 图像变换数据增强:通过生成图像的变换版本来增加数据多样性。
- 第一种形式是从原始图像(256x256)中随机裁剪出224x224的区域,并进行随机水平翻转。在测试时,对图像的四个角和中心进行裁剪并翻转,共获得10个预测结果,然后取平均。
- 第二种形式是改变训练图像中RGB通道的强度。具体做法是对整个ImageNet训练集的RGB像素值进行主成分分析(PCA),然后在每个训练图像上添加找到的主成分的倍数,其大小与对应的特征值乘以一个服从高斯分布
N(0, 0.1)的随机变量成正比。
- Dropout:这是一种非常有效的正则化技术。在前两个全连接层中,每个神经元以0.5的概率在每次前向传播时被“丢弃”(即将其输出设置为0)。被丢弃的神经元不参与本次的前向和反向传播。这迫使网络不能依赖于任何单个神经元,从而学习到更鲁棒的特征。在测试时,所有神经元都参与预测,但它们的输出要乘以0.5,以近似训练时多个“变薄”网络的几何平均效果。
学习细节 📈
现在我们来了解模型的训练过程。网络使用随机梯度下降(SGD)进行训练,具体参数如下:
- 批量大小:128
- 动量:0.9
- 权重衰减:0.0005(一种L2正则化,对所有权重施加惩罚,有助于防止过拟合)
- 学习率:初始值为0.01,当验证集错误率停止改善时,手动将学习率除以10。整个训练过程中学习率共降低了3次。
- 权重初始化:使用均值为0、标准差为0.01的高斯分布来初始化各层的权重。第二、四、五卷积层以及全连接层的偏置初始化为1(以加速ReLU学习的早期阶段),其他层的偏置初始化为0。
结果与讨论 📊
论文展示了在ImageNet 2010和2012数据集上的详细结果。其前1和前5错误率均大幅领先于之前的基于传统计算机视觉方法和较浅神经网络的最佳结果。
论文还进行了大量的消融实验,以验证各个组件的作用:
- 移除任何一个卷积层都会导致性能下降。
- 不使用数据增强会导致严重的过拟合。
- 使用Dropout可以使模型收敛所需的迭代次数增加大约一倍,但显著提升了泛化能力。
- 即使只使用CNN的最后一个全连接层的特征,搭配一个简单的线性分类器,也能取得非常有竞争力的结果,这表明网络学习到的特征是高质量的。
总结 🎯
本节课中,我们一起学习了深度学习领域的里程碑式论文——AlexNet。我们回顾了其产生的背景,它证明了构建深度CNN来处理大规模图像分类任务的可行性。

我们详细剖析了其网络架构,包括使用ReLU激活函数加速训练、采用多GPU并行解决内存限制、以及局部响应归一化和重叠池化等设计。更重要的是,我们学习了两种防止过拟合的核心技术:数据增强(包括随机裁剪、翻转和PCA颜色扰动)和Dropout正则化。
最后,我们了解了其训练细节和取得的卓越成果。这篇论文的成功不仅在于其优异的性能,更在于它将一系列有效但并非全新的技巧巧妙地组合在一起,为后续更深、更复杂的神经网络(如VGG、GoogLeNet、ResNet)的研究铺平了道路,正式开启了深度学习在计算机视觉领域的黄金时代。
009:10分钟构建你的第一个KAN

概述
在本节课中,我们将学习一篇名为《Kolmogorov-Arnold网络》的论文。这篇论文近期发布,引起了广泛关注。我们将简要介绍论文的整体背景,并解释KANs与传统多层感知机(MLPs)的核心区别。我们的目标是让你理解KAN的基本概念,为后续深入学习打下基础。
论文简介
这篇论文提出了一种称为Kolmogorov-Arnold网络(KANs)的架构,作为多层感知机(MLPs)的替代方案。论文写作清晰易懂,类似于一篇教程,因此很容易理解。
KANs与MLPs的核心区别
上一节我们介绍了论文背景,本节中我们来看看KANs与MLPs的核心区别。
在传统的多层感知机(MLPs)中,激活函数位于网络的节点上。而在Kolmogorov-Arnold网络(KANs)中,激活函数位于网络的边上。这是两者之间的一个主要差异。
神经网络被称为函数逼近器,通过其复杂的架构,可以用来逼近任何函数。从概念上讲,KANs也能实现这一点。不同之处在于,KANs不在每个节点上使用权重和偏置,而是用激活函数来表示每一条边,这些激活函数通常是B样条函数。不了解B样条函数也没关系,理解KANs并不强制要求掌握它。
什么是Kolmogorov-Arnold网络?
接下来,我们通过一个示意图来具体解释什么是KANs。
假设我们有一个三层网络。第一层有2个神经元,第二层有5个神经元,最后一层有1个神经元。
在传统的多层感知机中,每一层之间都有连接。在每个神经元上,会执行一个特定的操作。例如,一个神经元有两个输入x1和x2,我们会给每个输入分配权重(w1, w2)和偏置,然后进行加权求和,最后将结果输入到一个激活函数(如ReLU、Sigmoid)中,得到输出。
在KANs中,我们保持相同的网络结构。不同之处在于,连接边上没有独立的权重参数,而是直接放置了激活函数。
考虑第一个神经元。输入x00和x01分别通过一个激活函数,我们称之为φ00(x00)和φ01(x01)。然后,在输出节点,我们简单地将这两个激活函数的输出相加。因此,该节点的输出就是 φ00(x00) + φ01(x01)。
可以看到,这里没有权重参数,也没有偏置参数。在KANs中,可学习的参数就是这些激活函数φ00和φ01本身。
激活函数:B样条函数
那么,这些激活函数是什么呢?我们如何了解它们?这些激活函数的基础是一种称为B样条函数的东西。
B样条函数在CAD建模中常用。想象一下你正在绘制一条曲线,你有一些控制点可以支配。曲线必须穿过第一个和最后一个控制点,但形状可以通过调整中间的控制点来改变。使用这些控制点,你可以完全改变曲线的形状。B样条函数就是通过一组控制点来定义平滑、灵活曲线的一种数学方法。
在KANs的上下文中,这些B样条函数作为边上可学习的激活函数,其形状(由控制点决定)会在训练过程中被优化,以更好地拟合数据。

总结
本节课中,我们一起学习了Kolmogorov-Arnold网络(KANs)的基础知识。我们了解到KANs是MLPs的一种替代架构,其核心区别在于将激活函数从节点移到了边上。我们通过一个简单的网络结构示例,解释了KANs的前向传播过程,即输入沿边经过激活函数变换后,在节点处求和。最后,我们简要介绍了构成这些激活函数基础的B样条函数概念。理解这些基本概念是后续构建和训练KAN模型的第一步。
010:理解其数学原理

在本节课中,我们将深入探讨Kolmogorov-Arnold网络(KAN)架构背后的数学原理。我们将从回顾基本概念开始,逐步解析其数学表示和核心思想,确保初学者能够理解。
概述
上一节我们介绍了KAN与传统多层感知机(MLP)的直观区别。本节中,我们将深入其数学细节,理解其如何作为通用函数逼近器工作。
回顾:KAN与MLP的核心区别
在传统MLP中,神经元接收带权重和偏置的输入,通过激活函数决定是否“激活”。其核心公式可表示为:
y = σ(Wx + b)
其中,W是权重矩阵,b是偏置向量,σ是激活函数。
KAN架构则移除了神经元上的权重和偏置,取而代之的是在每两个神经元之间的连接上放置一个可学习的激活函数。这个函数用Φ表示。
B样条函数简介
KAN使用B样条函数来近似这些连接上的激活函数。B样条函数是一种强大的工具,可以近似任何函数。以下是其关键参数:
- 控制点数量:记为
n+1。 - 阶数:记为
k。 - 分段数量:由公式
n + k - 2给出。
例如,若n=5,k=3,则分段数量为5 + 3 - 2 = 6。这意味着我们可以在曲线上获得6个独立的可控制分段,类似于CAD软件中通过连接线段来绘制曲线的方式。
B样条基函数通常由一组曲线组成,通过它们的线性组合来构造最终的样条函数。
Kolmogorov-Arnold定理与KAN的扩展
原始的Kolmogorov-Arnold定理指出,任何连续函数都可以用一个特定结构的两层网络精确表示。该网络第一层有n个输入神经元,第二层有2n+1个神经元,输出层有1个神经元。
然而,该定理要求函数是平滑的,这限制了其数十年来作为通用函数逼近器的应用。
KAN论文的核心贡献在于扩展了这个思想。作者提出,我们可以构建任意宽度和深度的KAN网络,使其能够作为通用函数逼近器,克服了原始定理的限制。
深入KAN的数学表示
现在,让我们深入KAN架构的数学细节。
网络层与函数符号
我们用Φ表示连接两层神经元的一维函数。具体地,Φ_{l, j, i}表示连接第l层的第i个神经元与第l+1层的第j个神经元的激活函数。
假设第l层有n_in个神经元,第l+1层有n_out个神经元。
在原始Kolmogorov-Arnold定理的语境下:
- 对于内层函数(第一到第二层),
n_in = n,n_out = 2n + 1。 - 对于外层函数(第二到输出层),
n_in = 2n + 1,n_out = 1。
网络形状表示
一个KAN网络的形状通常用一个整数数组[n0, n1, ..., nL]表示,其中L是总层数,n0是输入维度,nL是输出维度,中间的数字是各隐藏层的宽度。
例如,一个符合原始定理的两层网络(实际为三层:输入、隐藏、输出)可以表示为[n, 2n+1, 1]。若n=2,则网络形状为[2, 5, 1]。
激活值计算
我们用x^{(l)}_i表示第l层第i个神经元的激活值。第l+1层第j个神经元的激活值由前一层所有神经元通过其对应的激活函数Φ_{l, j, i}变换后求和得到:
x^{(l+1)}_j = Σ_{i=1}^{n_l} Φ_{l, j, i}(x^{(l)}_i)
其中,n_l是第l层的神经元数量。这个公式是KAN前向传播的核心。
总结

本节课我们一起学习了Kolmogorov-Arnold网络的数学基础。我们从其与传统MLP的区别出发,回顾了B样条函数作为其基础构建模块的作用。接着,我们探讨了原始的Kolmogorov-Arnold定理及其局限性,并理解了现代KAN如何通过构建任意深度和宽度的网络来克服这些限制,成为强大的通用函数逼近器。最后,我们深入了KAN的数学表示,包括其层间函数符号、网络形状描述以及核心的前向传播计算公式。掌握这些数学原理是理解和后续实现KAN架构的关键一步。
011:ChatGPT是胡说八道——一篇研究论文评述


在本节课中,我们将一起学习一篇近期发表的研究论文。这篇论文的标题非常引人注目,它探讨了像ChatGPT这样的大型语言模型所犯的错误,并提出了一个核心观点:我们不应该将这些错误称为“幻觉”,而应称之为“胡说八道”。我们将解析论文的核心概念,并通过简单的例子帮助你理解其中的区别。
论文概述
大家好,我是Raj Daneer博士,毕业于麻省理工学院,获得机器学习方向的博士学位。在此之前,我在印度理工学院马德拉斯分校获得了机械工程学士学位。
我制作这个视频是为了讨论一篇一两天前发表的论文。我认为这篇论文引入了一些需要讨论的关键概念。
这篇论文的标题非常有趣,名为“ChatGPT是胡说八道”。这确实是论文的标题,并且发表在一个非常权威的期刊上。自发表以来,这篇论文在Reddit等平台上引发了大量评论和讨论。我希望以一种易于理解的方式解释这篇论文的观点,让本频道的订阅者和其他用户都能理解其核心论点。
最初看到标题时,我以为这只是为了吸引读者的“标题党”,论文内容可能不够深入。但令我相当惊讶的是,这是一篇论证充分、写得非常好的论文。
核心问题:从“幻觉”到“胡说八道”
论文的主要前提围绕着像ChatGPT这样的大型语言模型所产生的“幻觉”。所谓“幻觉”,我指的是ChatGPT所犯的错误。你们可能都尝试过输入一些问题,有时ChatGPT会产生完全随机的、错误的、甚至与问题毫不相关的答案。
让我在制作视频前举一个例子。我访问了GPT-4,并提问:“你能提供关于Jane Smith博士2015年机器学习研究的详细信息吗?”这完全是随机的,我根本不知道Jane Smith博士是谁,也不清楚她是否在2015年发表过论文。事实上,根本不存在这样的论文。
尽管如此,ChatGPT回答道:“Jane Smith博士2015年的研究专注于探索该领域的先进主题,包括深度学习架构和强化学习。Smith博士的研究强调了特征工程、数据准备等的重要性。”ChatGPT还提到“有关我们研究的更多细节,请参考以下来源”。这里你已经可以看到,这段文字完全是编造的,不存在这样的研究。传统上,这被称为“幻觉”。
当我要求它提供该研究的链接时,ChatGPT却说“我无法找到具体的研究”。但ChatGPT构建的整个答案都是错误的,这项研究并不存在。这类答案过去被称为“幻觉”。
这篇名为“ChatGPT是胡说八道”的论文的核心观点是:我们不应该将这些错误或失误称为“幻觉”,而应该使用“胡说八道”这个术语。作者们认为,做出这种区分非常重要。整篇论文都在论证为什么我们应该将ChatGPT的这些错误称为“胡说八道”,而不是“幻觉”。
关键概念辨析:幻觉、谎言与胡说八道
在深入探讨为什么ChatGPT的错误答案应被称为“胡说八道”之前,我们需要了解几个关键概念。有一本著名的书叫《论胡说》,由美国哲学家哈里·法兰克福于2005年出版,这篇研究论文就使用了其中对“胡说”的定义。
我相信所有优秀的研究论文都可以用一两句话来概括。对于这篇论文,我认为下面这句话总结了作者们想要表达的一切:
问题不在于大型语言模型产生了幻觉、撒谎或以某种方式歪曲了世界,而在于它们的设计初衷根本不是为了表征世界。相反,它们被设计来生成具有说服力的文本行。
这就是作者的主要观点。请记住这一点。
现在,我来谈谈理解这篇论文至关重要的三个术语。
以下是理解这三个概念的关键区别:
- 幻觉:人们通常用此描述ChatGPT在追求真实主张时犯的错误。作者正在挑战这部分定义。
- 谎言:指某人知道真相,但故意试图隐瞒。
- 胡说八道:与谎言和幻觉的主要区别在于,“胡说八道”意味着说话者根本不在乎真相。
在“幻觉”中,假设主体(此处是ChatGPT)在追求真实主张,因此对真相有所关切,只是犯了错误。即使在“撒谎”中,也存在对真相的关切——撒谎者知道真相,但故意隐藏。而“胡说八道”则完全不同,它意味着主体根本不在乎真相。
这可以总结在下图中:在“桶1”中,是关切真相的术语(幻觉和谎言);而在“桶2”中,是“胡说八道”,即完全不在乎真相。

通过例子理解谎言与胡说八道
让我们通过两个简单的例子来看看谎言和胡说八道的区别。
例子1:学生与作业
假设场景是学生没有完成作业。
- 如果学生说:“我做了作业,但我忘在家里了。” 这是一个谎言的例子。因为学生知道真相(没做作业),但故意让老师相信他们做了。
- 如果学生说:“这份作业其实没那么重要,重要的是我参与了课堂并理解了材料。” 如果学生这么说,这就是一个典型的胡说八道的例子。因为在这种情况下,学生根本不关心真相(关于作业状态的真相),他们的目的是通过贬低做作业本身的重要性来说服老师。这里你可以看到,学生试图说服老师,但他们完全不在乎真相。
例子2:政治家的竞选演讲
- 如果一位政治家说:“我已经为所有新项目争取到了资金。” 这显然是一个谎言,因为他们知道自己并没有争取到资金。
- 如果政治家说:“如果你们选我,我们的城市将成为全国最伟大的城市。” 这就是胡说八道。因为这位政治家没有任何具体的计划或证据,他们的目的是说服选民,而不管这句话的真实性如何。在这里,政治家根本不在乎真相。
作者们论证的是,当ChatGPT产生“幻觉”(例如本文给出的错误回答)时,我们不应该称之为“幻觉”,像这样的回答应该被称为“胡说八道”。这就是论文提出的主要论点。
为什么ChatGPT属于“胡说八道”
我希望你已经理解了撒谎、幻觉和胡说八道之间的区别。我同意作者的观点,即ChatGPT没有对真实世界模型的理解。
例如,作者指出,ChatGPT的设计初衷根本不是表征世界。大型语言模型的设计目的不是表征世界,而是生成具有说服力的文本行。那么,我们为什么还要假设这些大型语言模型在某种程度上是在追求真相呢?它们根本不在乎真相。
如果大型语言模型是基于对世界的表征构建的,那么我们可以说它们在追求真相。但它们只是被设计来生成下一段文本。大型语言模型的核心思想就是:给定输入,基于概率分布生成输出,生成下一个词。仅此而已。这就是大型语言模型背后的主要思想,它们并非真正在追求真相。
因此,如果大型语言模型不是在追求真相,我们就不能说它们属于“桶1”(关切真相)。它们属于“桶2”,因为它们完全不在乎真相。
总结

本节课中,我们一起学习了一篇题为“ChatGPT是胡说八道”的研究论文。我们探讨了论文的核心论点:应将大型语言模型如ChatGPT产生的无意义或错误输出称为“胡说八道”,而非“幻觉”。我们辨析了“幻觉”、“谎言”和“胡说八道”三个关键概念的区别,并通过学生作业和政治演讲的例子加深了理解。最后,我们理解了论文的结论:由于ChatGPT等模型的设计目标是生成连贯文本而非表征真实世界,它们对真相没有关切,因此其错误本质上是“胡说八道”。理解这一区别有助于我们更准确地认识和使用AI工具。
012:ChatGPT会终结学校作业吗?一篇研究论文评述


在本节课中,我们将深入探讨一篇近期发表的研究论文,它探讨了人工智能在大学考试系统中的实际渗透情况。我们将分析论文的核心发现,并思考人工智能将如何从根本上改变作业的布置与评估方式。
概述
两天前,一篇题为《人工智能对大学考试系统渗透的真实世界测试》的论文发布。阅读这篇论文时,我深感震撼。它清晰地表明,由于人工智能的出现,全球范围内的作业结构和考试结构正在发生彻底改变。我认真思考后认为,在未来五年内,给学生布置作业的方式、作业的评分方式以及家庭作业的批改方式都将完全改变。因此,我决定制作这个视频,分享我从论文中学到的内容,并阐述我对未来作业形式变化的看法。
我是Rajthan Decker博士,2017年毕业于印度理工学院马德拉斯分校,并于2022年在麻省理工学院获得人工智能领域的博士学位。
研究设计与方法
这篇论文的核心内容非常简单。作者们与英国一所特定的大学合作,重点研究了该大学的作业情况。他们使用人工智能(如ChatGPT)生成了一些作业答案,并将这些提交所获得的成绩与未使用ChatGPT撰写的正常提交进行了比较。
以下是研究方法的图示说明:

研究将作业分为五个模块:P1 M1, P1 M2, P2 M1, P2 M2, 和 P3 M1。在每个模块中,既包含真实的学生提交(非AI生成),也包含由作者自己使用AI生成的提交。关键之处在于,所有提交在批改时都是匿名的,评分者并不知道哪些提交来自AI,哪些来自学生。
论文中甚至提到了作者给ChatGPT使用的提示词,例如对于基于论文的答案,提示词是:“包括对学术文献的引用,撰写一篇2000字的论文。” 作者明确指出,他们并未试图让ChatGPT的答案听起来像人类写的。这些由ChatGPT生成的答案被直接提交给评分者。
核心发现:AI作业获得更高分
评分完成后公布的结果令人震惊。AI生成的提交 consistently(持续地)获得了比正常提交更高的分数。
让我们来看这个总结性的图表:

上图展示了五个模块的成绩对比。黄色条形代表AI生成答案的成绩中位数,绿色条形代表非AI生成(人类撰写)答案的成绩中位数。可以清楚地看到,在除模块5外的几乎所有模块中,黄色条形(AI)都高于绿色条形(人类)。这表明,AI生成的作业获得了显著更高的评分。
评分者难以识别AI作业
你可能会问:评分者难道分辨不出哪些是AI作业吗?这正是论文的第二个主要发现:评分者极难区分提交是由ChatGPT生成还是由人类撰写。事实上,被标记为疑似AI的提交比例不到10%。
以下是相关数据表格的图示:

在第一个模块中,被标记为AI的提交仅占6%。整体来看,所有被标记为AI的提交比例仅为6%左右。在上方的图表中,黄色条形(被标记为AI的比例)远低于蓝色条形(未被标记的比例)。这几乎意味着,评分者认为所有提交都是人类完成的,并在此基础上给AI作业打了更高的分数。
对现有检测工具的挑战
当我读到这些结果时感到极为震惊。想象一下,一个学生回家后用ChatGPT在5秒内完成作业并提交。如果老师无法识别这是AI作品,而这个学生反而获得了最高分,那么作业的意义何在?作业的主要目的是让学生练习并测试他们的理解程度。


这引发了我的思考:是否存在有效的AI文本检测工具?我探索了一些工具,例如著名的剽窃检测系统Turnitin。然而,进一步了解后发现,即使是Turnitin也不擅长识别哪些回答是由ChatGPT生成的。目前,没有任何工具能以100%的准确率区分AI生成数据和人类生成数据。随着GPT-5等更强大模型的出现,这个问题会愈发严重,因为AI生成的内容将越来越像人类。
未来作业的新范式
那么,布置作业的更好方式是什么?我认为最佳途径不是害怕AI或假设学生不会使用ChatGPT。相反,我们应该假设每个人都会使用它,并在此基础上构建新的作业形式。
新的教育体系应基于学生将使用大语言模型这一事实。我们需要训练他们高效地使用这些工具,并在其基础上发挥创造力。这类似于绘图员被计算机辅助设计(CAD)取代的过程:它并不意味着工作岗位消失或创造力丧失,而是意味着掌握CAD技能的工程师获得了更多机会。
因此,未来的作业设计应包含两个核心组成部分:
- AI组件:明确要求学生使用AI工具完成部分基础工作。
- 创意组件:要求学生在AI产出的基础上,进行批判性思考、分析、整合或创新。
例如,一份作业可以这样开始:“使用ChatGPT生成一篇关于第二次世界大战的300字概述。然后,基于该概述,从以下三个角度中任选一个,撰写一篇500字的分析文:(1)比较AI生成内容与你从教科书中学到信息的异同;(2)指出AI概述中可能存在的史实偏见或遗漏,并说明理由;(3)设计一个AI可能无法回答的、关于二战伦理影响的深入问题,并阐述你的思考过程。”
总结

本节课我们一起探讨了一篇关于AI在大学作业中应用的研究论文。核心发现是:AI生成的作业不仅难以被识别,而且经常获得比人类作业更高的分数。这揭示了当前教育评估体系面临的严峻挑战。作为应对,我们不应禁止AI,而应重新设计作业,将其视为一个“AI+创意”的结合体,从而培养学生驾驭AI工具并在此基础上进行创新思考的能力,为他们适应未来世界做好准备。
013:语言模型能推理吗?

在本节课中,我们将探讨一个核心问题:大型语言模型(如ChatGPT)是否真正具备推理能力,还是仅仅在输入和输出之间进行模式匹配。我们将通过解读一篇名为《STaR:自教推理器——用推理引导推理》的论文来深入理解这个问题。
上一节我们介绍了对语言模型智能本质的疑问,本节中我们来看看STaR论文提出的具体解决方案。
核心问题:答案背后的“思维链”
当我们向ChatGPT提问时,它会直接给出答案。但我们无法知晓它得出这个答案的思维过程。关键区别在于:
- 真正的推理:模型像人类一样,通过逻辑思维链从问题推导出答案。
- 简单的映射:模型只是基于训练数据,在问题和答案之间建立了一种统计关联,并未真正理解中间的逻辑。
为了检验这一点,研究者希望模型不仅能给出答案,还能生成解释答案的推理依据。
STaR方法:引导模型学会推理
STaR方法的核心思想是:使用少量带有推理过程的示例,引导模型为大量未标注的问题生成自己的推理过程,并通过迭代训练来提升其推理能力。
以下是该方法的运作流程:
- 生成推理与答案:向语言模型提供一个问题和少数几个带有推理过程的示例。模型尝试生成自己的推理依据和答案。
- 结果验证与反馈:
- 如果答案正确,则将这个“问题-推理-答案”对加入训练数据。
- 如果答案错误,则向模型提供正确答案,并要求它回溯生成能推导出该正确答案的推理过程,然后将这个新的“问题-推理-答案”对加入训练数据。
- 迭代训练:用新收集的数据微调模型,并重复上述过程。
这个过程可以概括为一个简单的循环:
while 模型推理能力未收敛:
用少量示例提示模型,为许多问题生成(推理,答案)
for 每个生成的(推理,答案):
if 答案错误:
根据正确答案,让模型回溯生成新的推理
将(问题,新推理,正确答案)加入训练集
用新训练集微调模型
通过这种“自举”学习,模型被期望能逐步内化更复杂的推理模式。
案例分析:模型生成的推理过程
为了更具体地理解,我们来看论文中的几个例子,分析模型生成的推理过程的质量。
示例1:良好的推理
- 问题:学习科学可能让人获得什么?选项:A. 头痛 B. 以不同方式看事物 C. 增加知识 D. 欣赏自然
- 模型输出:
- 推理:答案必须是学习科学能获得的东西。学习科学会增加知识。
- 答案:C(增加知识)
- 分析:推理逻辑清晰,从目标(学习科学的收获)进行推导,结论合理。
示例2:有缺陷的推理
- 问题:基督教摇滚乐队在大型舞台上。歌手的脚被电线绊住,他有一个小的____。选项:A. 歌曲 B. 人群 C. 声音 D. 绊倒
- 模型输出:
- 推理:答案必须是导致歌手绊倒的东西。因此答案是“绊倒”。
- 答案:D(绊倒)
- 分析:推理过程循环论证。它直接将答案“绊倒”作为推理的前提(“导致歌手绊倒的东西”),而不是根据情境(脚被电线绊住)推导出“绊倒”这个结果。这表明模型可能只是在匹配模式。
示例3:不完整的推理
- 问题:一个人击打瓶子后手受伤。瓶子可能发生什么?选项:A. 酒精中毒 B. 破碎 C. 恶心 D. 成为古董
- 模型输出:
- 推理:答案必须是瓶子发生的事。瓶子破碎了。因此答案是B。
- 答案:B(破碎)
- 分析:虽然得出了正确结论,但推理跳跃了关键逻辑环节。它没有建立“手击打瓶子”与“瓶子破碎”之间的因果关系,而是直接陈述了结果。
总结

本节课我们一起学习了STaR方法,它试图通过让语言模型显式生成并迭代优化推理依据,来培养其真正的推理能力。案例分析表明,当前模型生成的推理有时是合理的,但有时也暴露出机械匹配、循环论证等问题。这证明,让语言模型像人类一样进行可靠、透明的逻辑推理,仍然是一个充满挑战且正在探索中的前沿领域。理解这些挑战,是评估和应用AI模型的关键一步。
014:使用大语言模型模拟进化与合成蛋白质

在本节课中,我们将探讨人工智能与大语言模型领域的一项前沿进展:如何利用这些技术来模拟漫长的生物进化过程,并合成全新的蛋白质。我们将从蛋白质的基础知识开始,逐步理解这一复杂而迷人的研究。
蛋白质:生命的基石
首先,我们来了解一下蛋白质。蛋白质是我们身体的基本构成单元,每一种蛋白质都被设计来执行特定的功能。这些功能包括消化食物、驱动肌肉运动、对抗疾病等。身体的每一项功能都可以映射到一个或一系列特定的蛋白质。
蛋白质由一系列氨基酸构成。自然界中存在20种不同的氨基酸,每一种蛋白质都拥有其独特的氨基酸组合与排列顺序,这被称为蛋白质的序列。
在我的博士研究后期,我专注于研究一种特殊的蛋白质——单克隆抗体。对于无法自行产生足够抗体来抵抗疾病的人群,医生会注射这种人工制造的抗体来帮助对抗疾病,这在COVID-19疫情期间尤为重要。
单克隆抗体具有独特的Y形结构。在这个结构中,氨基酸分布在不同的结构域内。我想强调的是,每一种蛋白质都拥有其独特的序列、三维结构以及功能。例如,单克隆抗体的功能就是抵御入侵我们身体的病毒。
漫长的进化与当前的挑战
这些蛋白质是通过数百万年甚至数十亿年的进化过程形成的。进化之所以如此漫长,是因为突变。以抗体为例,最初可能只有一个结构域,经过数个世纪演化出两个,再慢慢学会连接成Y形,最终形成完整的抗体。这是一个自然选择的过程:每一个突变都被检验,只有有益的突变才会被保留并传递给后代。
这个过程极其耗时。在实验室中,科学家想要合成一个具有全新序列和结构的新蛋白质是非常困难的。此外,另一个关键问题是:如何根据已知的序列来预测其三维结构?这并非易事。谷歌发布的AlphaFold模型利用AI解决了这个问题,是结构预测领域的一次革命。
核心问题:能否用AI模拟进化?
现在,我们提出一个核心问题:我们能否模拟进化? 这个问题听起来有些奇怪,因为进化是一个极其漫长的自然过程。我的意思是:我们能否跳过这数百万年的进化时间,仅仅通过理解数据来预测全新的蛋白质?
其核心概念是:我们收集世界上所有已知蛋白质的序列、结构和功能,构建一个庞大的数据库。然后,我们将这些数据输入一个大语言模型,从而开发出预测新蛋白质结构和功能的能力。
大语言模型如何应用于蛋白质?
这听起来合理吗?大语言模型通常处理的是句子,例如“I am learning AI”。模型会计算不同单词之间的注意力,编码整个句子,然后用于翻译或预测下一个单词等任务。
那么,如何将同样的逻辑应用于具有复杂三维结构的蛋白质呢?本质上,我们希望思考如何利用大语言模型,基于庞大的蛋白质数据仓库来预测新蛋白质,从而模拟进化过程。
我曾认为这不太可能,但最近的一项研究更新解决了这个问题。
前沿模型:ESM3
研究人员提出了一个名为 ESM3 的模型,这是一个用于生物学的“前沿语言模型”。它提升了我们利用“生命密码”进行编程和创造的能力。简单来说,他们正在使用大语言模型来生成全新的蛋白质。
我想展示一个非常酷的应用实例。有一类蛋白质叫做绿色荧光蛋白。当你看到那些拥有美丽色彩的发光水母时,正是这类蛋白质赋予了它们颜色。
这类蛋白质在自然界中很稀有,科学家也一直难以在实验室中合成这类全新的蛋白质。通常,我们只有在自然界中发现时,才知道又出现了一种新的GFP。
而ESM3模型做到了什么?它生成了一种全新的绿色荧光蛋白,其与已知最接近的荧光蛋白的序列相似度仅有58%。
低相似度的意义
低相似度意味着什么?它意味着我们预测了进化尚未达到的某种形态,我们预测了远在未来的事物。如果你观察模型生成的蛋白质结构,会发现它与已知结构有显著差异。相似度越低,意味着需要发生的突变越多、进化所需的时间跨度越长。58%的相似度相当低,这表明该模型在某种程度上模拟了遥远的未来进化,这正是ESM3作者们所实现的成就。

模型训练与原理
该模型是如何训练的呢?它是在一个规模空前的蛋白质序列、结构和功能数据库上进行训练的。模型学习这些数据中隐含的复杂模式和规则。其核心在于,它将蛋白质的序列和结构信息都转化为一种模型能够处理的“语言”。通过预测被掩盖的氨基酸或结构片段,模型学会了蛋白质构成的“语法”和“语义”,从而能够生成合理且全新的蛋白质设计。

以下是其工作原理的简化示意:
# 概念性伪代码,展示ESM3的生成思路
输入: 已知蛋白质数据库 (序列+结构+功能)
过程: 大语言模型学习蛋白质构成的“语言规则”
输出: 生成全新的、符合生物学规律的蛋白质设计 (新序列 -> 预测新结构 -> 推测新功能)
总结
本节课我们一起学习了:
- 蛋白质的基础:理解蛋白质是拥有特定序列、结构和功能的生命基本单元。
- 进化的挑战:认识到自然进化蛋白质是一个极其漫长的过程,而实验室合成新蛋白则非常困难。
- AI的新思路:探讨了能否利用大语言模型,通过分析海量已知蛋白质数据来“模拟进化”,直接预测和设计新蛋白质。
- ESM3模型:介绍了一个前沿的生物语言模型ESM3,它能够生成与已知蛋白相似度很低的全新蛋白质(如新型绿色荧光蛋白),这相当于在计算中模拟了漫长的进化历程。

这项研究展示了人工智能在理解和创造生命基本组件方面的巨大潜力,为药物研发、材料科学等领域开辟了全新的可能性。
015:语言模型能否超越扩散模型?ICML 2024最佳论文解读



在本节课中,我们将要学习一篇获得ICML 2024最佳论文奖的研究《VideoPoet》。这篇论文探讨了使用大语言模型来生成视频,并挑战了当前主流的稳定扩散技术。我们将以简单直白的方式,拆解其核心技术思想。
观察这段视频。它看起来非常出色。看起来非常逼真。看起来非常具有沉浸感。
这段视频是由AI生成的。目前大多数现代AI生成视频都源自一项名为稳定扩散的技术。它之所以被称为“扩散”,是因为生成过程始于一张看起来像随机噪声的图像,然后图像质量逐步提升。将一系列这样的图像堆叠在一起,AI就能生成你所看到的精彩视频。

在机器学习顶级会议ICML 2024上,获得最佳论文奖的论文名为《VideoPoet》。研究者的核心观点是:稳定扩散技术虽然不错,但我们为何不直接使用大语言模型来生成基于AI的视频?他们证明了这种方法可以优于稳定扩散。既然语言模型能做得更好,我们为何还需要扩散模型?这就是他们获奖的核心思想。他们还发布了一个名为“Caed VideoPoet”的网站,将其称为“用于零样本视频生成的大语言模型”。你可以看到他们创造的精彩AI视频。这些视频并非基于稳定扩散,而是与ChatGPT生成文本同源,都是通过大语言模型生成的。这非常出色。在本视频中,我们将解析这篇论文的工作原理及其开发的技术框架,以便你以一种简化易懂的方式建立理解。让我们开始吧。我是Raj Danandeer博士,于2022年从麻省理工学院获得机器学习博士学位。自那时起,我的使命就是制作这些AI视频,让AI技术对所有人变得触手可及。
这篇名为《VideoPoet》的论文获得了ICML 2024最佳论文奖。它是一篇20页的论文,但写得非常精彩,我阅读时感到十分愉快。
首先,让我从目前最先进的文本生成视频AI软件或公司之一开始介绍,那就是Runway ML。我在这里上传了我的照片,并要求AI让我的头从左向右移动。以下是它生成的结果。看起来不太像我,但这仍然很酷。这是一段看起来有点像我的视频,画面从左向右移动。非常棒。制作这样的视频需要我们依赖一项名为稳定扩散的技术。这项技术的工作原理是:首先,将视频分解成一系列图像帧,然后处理每一帧图像。处理单张图像的方式是:首先你有一个提示词,例如“让头从左向右移动”。这个提示词随后被应用于每一张独立的图像。当应用于一张图像时,首先生成一个图像表示,它看起来像随机噪声,如这里所示。然后,随机噪声逐步改善,开始看起来像右边的图像。在右侧,观察这个兔子的动画,它从随机噪声开始,然后变得越来越好。

这种从随机性到更精细、更统一状态的转变,模糊地类似于化学物质在流体中发生的扩散过程。因此,这项技术被称为稳定扩散。



大多数现代AI生成视频都基于稳定扩散技术。即使是Runway生成的这类视频也基于稳定扩散。
《VideoPoet》论文的作者们提出的核心问题是:我们能否使用大语言模型进行视频生成?我们为何必须依赖稳定扩散?让我们进一步深入探讨。
当我们审视大语言模型时,GPT模型的构建有特定的方式。有一个过程称为预训练,还有一个过程称为微调。首先,有一个庞大的数据语料库,例如互联网文本、书籍、媒体、研究文章等。这些数据被分解成词元,目前你可以将它们理解为独立的单词。然后,我们在这些词元上训练一个大语言模型,以便能够预测下一个单词。这个训练过程基于数十亿的数据。给你一个背景信息,GPT-3的训练花费了460万美元。这些预训练模型被称为基础模型。之后我们进行微调。例如,如果你是一家生产级公司,想要获得更好的性能,你可以在自己特定的数据集上对预训练的大语言模型进行微调。
因此,这是训练大语言模型的常规步骤序列。在预训练阶段,由于它利用句子本身的结构来构建训练数据,并将下一个词元用作测试,因此通常被称为自回归方法。同时,因为它是一种无监督学习,在一次迭代中预测出的下一个单词会在下一次迭代中用于训练,所以它既是自回归的,也是无监督的。
这些是训练大语言模型通常涉及的步骤,其架构本身看起来类似这样。
这里有一个GPT架构的示意图。你有一段示例文本,例如:“This is an example of how LLM can ____”。这段示例文本被转换为词元。这些词元被输入到解码器中。解码器生成它预测的输出文本:“This is an example of how LLM can perform.”。这是一个仅包含解码器的Transformer架构,它没有编码器。
现在,《VideoPoet》的作者们提出的想法是:如果我们使用完全相同的方法论,并将其应用于图像、视频和音频,会怎么样?例如,这里不是不完整的文本,而是不完整的图像、视频和音频。然后我们遵循相同的步骤:将它们通过预处理步骤(即词元化),然后输入解码器,最后查看生成的最终输出。这就是这篇论文在最基本层面上所做的全部工作。你获取图像、视频和音频,将它们分解成独立的词元,将这些词元传递给解码器,然后得到最终输出,即图像、视频或音频。这非常简单,并且完全遵循了训练如GPT这样的大语言模型所采取的步骤。
但你需要问自己的真正问题是:如何将这些不同的模态转换为词元?因为对于大语言模型使用的大段文本数据,我们可以将词元视为独立的单词,这有一定的理解基础。但是,以视频为例,你如何将其转换为词元?

图像相对容易思考,你只需获取一张图像,它被分解为像素表示,也许这些像素就是词元。但事实果真如此吗?视频和音频的词元化又是怎样的?让我们进一步探讨。
以这段视频为例。


假设我们想要对这段视频进行词元化。具体做法是:首先,将视频分解成一系列图像帧。每一帧图像通过一个卷积神经网络。卷积神经网络为每一帧图像生成一个特征图。然后,这个特征图本质上被分解成词元。对每一帧图像都进行同样的操作,这就是你获得视频词元化表示的方式。同时,时间戳信息也被编码在这种词元化过程中,你需要知道哪一帧在前,哪一帧在后。这就是图像和视频的编码方式。

对于音频,则有不同的方法。假设你有一段如下所示的音频样本,处理方式是:谷歌开发了一种名为SoundStream的音频编码器。你将这段音频样本通过这个SoundStream神经网络,它会将其降维到一个更低维度的空间,然后我们从那里获得编码音频的词元。


因此,通过像SoundStream这样的方法以及我刚才展示的视频处理方法,我们实际上可以将图像、视频和音频全部转换为词元。一旦它们被转换为词元,就被传递到解码器中,然后完全遵循与GPT架构相同的步骤。




这是一个非常简单却又绝妙的想法,这些研究者已经将其实现。当我查看他们生成的视频时,效果确实令人惊叹。看看其中一些视频,这些纯粹是由大语言模型完成的,这里没有使用稳定扩散技术。
本节课中我们一起学习了《VideoPoet》论文的核心思想:将图像、视频和音频等不同模态的数据统一词元化,然后利用类似GPT的仅解码器Transformer架构进行自回归预测,从而生成高质量视频。这种方法挑战了以稳定扩散为代表的现有主流视频生成范式,展示了大语言模型在跨模态生成任务中的巨大潜力。其关键在于设计有效的编码器(如CNN用于图像/视频,SoundStream用于音频)将原始数据转换为离散词元序列,从而适配语言模型的训练和推理框架。
016:递归生成数据导致AI模型崩溃
在本节课中,我们将要学习一篇近期发表在顶级期刊《自然》上的论文。这篇论文探讨了一个核心问题:当生成式AI模型在自身递归生成的数据上进行训练时,会发生什么?我们将深入理解“模型崩溃”这一概念,并通过简单的类比和示例,解释其背后的原理与潜在影响。



论文背景与核心问题
这篇论文探讨了生成式AI模型在递归生成数据上训练时出现的“模型崩溃”现象。在制作本视频时,该论文仅发表了两周,是一个非常新颖且有趣的研究。
除了这篇《自然》论文,我们还将参考另一篇大约一年前发表在arXiv上的论文,题为“自消耗生成模型如何走向疯狂”。我们将具体解释“疯狂”一词在此语境下的含义。
生成式AI的训练数据来源
在深入探讨论文观点之前,我们需要先理解生成式AI模型(如大语言模型或图像生成模型)是如何训练的。
它们大多是在互联网数据上进行训练的。互联网上存在海量的数据,其中一部分被用作生成式AI的训练数据。但真正的问题是:如果互联网数据本身已经包含了大量AI生成的内容呢?
例如,新闻机构使用ChatGPT撰写文章。想象这种情况持续10到20年,互联网数据中AI生成内容的比例可能会非常高。如果达到80%,那么未来的AI模型实质上就是在训练由它们的“父辈”模型生成的数据。这可能会导致某些问题。
类比理解:传话游戏与笔记抄袭
我们可以通过两个简单的类比来理解这个问题。
第一个类比是传话游戏。 在这个游戏中,第一个人说一句话,然后依次传给下一个人。当这句话传到第15个人时,内容可能已经变得面目全非,与最初版本完全不同。AI生成数据,然后下一代AI在此数据上训练的过程,在某种程度上就类似于这个传话游戏。
第二个类比是课堂笔记抄袭。 想象一下,第一个学生听老师讲课并记下笔记。第二个学生抄袭第一个学生的笔记,第三个学生抄袭第二个学生的,以此类推。当第40个学生拿到笔记时,其中可能累积了前面所有学生在抄写过程中产生的错误。AI在自身生成的数据上训练,情况与此非常相似。
模型崩溃的机制
现在,让我们具体看看《自然》论文中提出的“AI模型崩溃”概念。
论文提出了一个设想:我们目前有GPT-2、GPT-3、3.5、4等模型。如果我们有第N代GPT或任何其他大语言模型,它会如何表现?
论文中的示意图展示了这个过程:
- 初始数据是真实的人类生成数据,用于构建第0代模型。
- 这个模型能够生成新数据。
- 用于训练第1代模型的样本数据将包含一些“虚假”数据(即由生成式AI模型生成的数据)。
- 这个过程持续进行,直到构建第N代模型。
论文假设了两种情景:
- 下一代模型的训练数据100%是合成的(即由上一代模型生成),不包含任何原始真实数据。
- 下一代模型的训练数据中,有10%来自上一代的原始训练数据,其余90%是合成数据。

论文探讨的核心问题是:如果这个过程持续N代,模型的性能会发生什么变化?其输出是否还有意义?
实际案例:图像生成模型的“疯狂”
一个能让你快速联想到的应用是图像生成模型的训练。去年(2023年)发表的一篇题为《自消耗生成模型走向疯狂》的论文就展示了这一点。
以下是该论文展示的现象:
- 假设一个生成式AI模型能够生成逼真的人脸图像(第一代)。
- 如果使用这些AI生成的人脸图像来训练下一代模型,并持续多代。
- 随着代际推进,图像中会出现并放大某些不自然的伪影或特征。例如,人脸可能出现类似部落纹面或烧伤的、不自然的痕迹。
- 虽然最初几代生成的图像看起来很真实,但后续几代的图像会明显出现问题。
这表明,即使初始的合成数据看起来非常逼真,在递归训练过程中,模型也会逐渐放大数据分布中的微小偏差或错误,最终导致输出质量严重下降。


文本生成的例子
这种现象不仅限于图像。论文中也展示了一个文本生成的例子。

他们使用了一个名为OPT-125M的模型。以下是一个原始输入段落:
“在1360年之前,这通常由一位石匠大师和一小队学徒与石匠完成。”
然后,他们观察基于此输入、在不同代际模型上生成的输出质量。从第1代、第2代到后续代际,生成文本的连贯性和语义质量逐渐恶化,最终可能变得毫无意义。
总结
本节课中,我们一起学习了“模型崩溃”这一重要概念。当生成式AI模型在自身递归生成的数据上进行训练时,即使初始数据质量很高,模型也会在迭代过程中逐渐放大数据分布中的错误和偏差。这类似于传话游戏中信息的失真,或笔记抄袭中错误的累积。最终,模型的输出会偏离现实,质量严重下降,甚至产生无意义的“疯狂”结果。理解这一现象对于思考AI数据的长期管理、模型训练策略以及未来人工智能的健康发展至关重要。
017:MindSearch - 模仿人脑以优化AI搜索 | 研究论文解读
概述
在本节课中,我们将深入解读一篇名为“MindSearch”的最新研究论文。这篇论文探讨了如何通过模仿人脑处理信息的方式,将搜索引擎与大型语言模型相结合,从而为用户提供更高质量、更高效的搜索答案。我们将解析其核心思想、面临的挑战以及提出的创新解决方案。
搜索引擎与AI助手的现状
如果你曾使用ChatGPT从互联网获取结构化的答案,那么你本质上是在使用一个结合了搜索引擎和大型语言模型的系统。搜索引擎可能是Bing,而大型语言模型可能是GPT-3.5或你正在使用的任何GPT模型。

本视频旨在解读一篇最近发表在arXiv上的论文。这篇论文研究的是,如何模仿人类思维或大脑的工作方式,并将其与“搜索引擎+大型语言模型”的方法相结合,从而为你的搜索查询提供更高质量的答案。

我是Shida Panak博士,来自MIT的博士。这堂课对我而言非常特别,因为当我在paperswithcode.com上看到这篇出色的论文时,我立刻想深入讨论并制作这个视频。我详细研读了这篇论文。它于7月29日刚刚发表,在录制本视频时还不到两周,但它在paperswithcode.com上已经获得了3.7k星标,其对应的GitHub仓库也获得了3.7k星标和大量的分支。
这篇由一组中国研究人员发表在arXiv上的论文,提出了“思维搜索”的概念。在本讲座中,我们将深入探讨这篇论文,并尽可能以简单易懂的方式讲解,让你也能理解这种模仿人脑以模块化方式搜索信息的“思维搜索”理念。


谷歌搜索 vs. ChatGPT
谷歌搜索与ChatGPT的主要区别在于,谷歌仅以网页链接的形式提供搜索结果。它不会分析信息并以易于理解的方式呈现给你。但谷歌能从互联网上为你提供最相关的网页,让你可以自行访问网页、阅读信息并理解内容。
另一方面,当你使用结合了大型语言模型的谷歌搜索(如ChatGPT或GPT模型)时,你可以直接从互联网获得搜索查询的答案。谷歌负责搜索,GPT则分析从搜索结果中获得的信息,并以非常易于理解的方式呈现给你。
但是,这种方法存在一些问题,我们稍后将进行讨论。
MindSearch论文的核心目标
这篇关于MindSearch的论文所关注的核心思想是:如何将搜索引擎、大型语言模型与人脑获取信息的方式三者结合起来,从而为搜索查询提供更好、更高效的响应?
传统搜索引擎的优势与局限
如果我们只看谷歌搜索,谷歌所做的伟大之处在于其算法非常出色,无论你的搜索查询是什么,它都能以网页形式从互联网上提供最佳的可能信息。谷歌根据网页与搜索查询的相关性对网页进行排名。
这就是为什么许多公司在搜索引擎优化上投入大量资金,SEO是一个非常重要的事情。谷歌不会篡改信息,因此以网页形式出现的搜索结果,其网页内容会原样呈现。只要这些网页中的内容是准确的,谷歌搜索基本上就能提供高准确度的结果。
但问题是,谷歌搜索引擎无法整合信息。这意味着它无法解释这些网页的内容,并直接给出你查询的答案。它做不到这一点。你必须自己阅读和理解信息。你需要从这些网页中解读内容,如果需要花费三小时详细阅读六个相关网页,那也是你需要完成的工作。你必须自己寻找信息,并在搜索某事物以做决策时,自行做出决定。
结合LLM与搜索引擎
如果将大型语言模型与搜索引擎结合,你就能兼得两者之长。搜索引擎在寻找信息方面非常出色,但它们无法整合信息。而大型语言模型在解释语言和推理方面具有惊人的能力。将这两者结合,你就能获得最佳效果。
但是,这篇论文讨论了这种结合方式面临的一些挑战,具体如下。
当前结合方式面临的挑战
在大型语言模型中,存在一个称为上下文长度的概念。你可能已经注意到,在ChatGPT中,如果你粘贴一大段文字(甚至是从教科书复制的内容),它很难处理如此大量的信息,这对它来说太大了,无法处理。这就是由于上下文长度的限制。
尽管GPT的后续模型或更现代的大型语言模型的上下文大小在增加,但这仍然是一个限制。基本上,当你在搜索并得到成百上千个网页结果时,不仅存在大量噪音,而且因为这些页面中的信息量巨大,大型语言模型会不堪重负,因为有太多的搜索结果需要处理。
此外,如果出于某种原因,你提出的问题有点复杂,搜索引擎可能无法非常准确地检索结果。它实际上可能误解你的意图。你可能已经注意到,你问的是一件事,但搜索引擎提供的却是另一回事作为回应。
那么,我们能做些什么来解决这个挑战呢?
模仿人脑的解决方案
我们可以尝试模仿人脑。在这个背景下,人脑有什么特别之处呢?让我们看一个我们生活中可能试图解决的简单问题:假设我们想买一辆新车,我们如何决定买哪辆车?或者我们如何找到与此相关的信息?
让我们看看,作为人类,我们是如何做出这个决定或找到与购车相关的信息的。
- 首先定义需求:这辆车是只为你和你的伴侣或孩子旅行用,还是仅仅用于短距离上下班通勤,或是用于长途旅行?它应该是重型车吗?等等。
- 获取初步信息:然后,你尝试获取与你的每个独立需求相对应的基本信息。
- 重新定义约束:基于获得的信息,你可能会重新定义你的约束条件。例如,你可能说过你想要某个排量的发动机,预算是多少等等,但一旦你获得基本信息,你可能会因为注意到预算超出限制而重新定义对发动机排量的约束。
- 学习与迭代:在你重新定义约束或改变需求后,你会学习到更多信息。
- 整合与决策:在这个迭代过程结束时,你将有很多选项可以比较。你整合所有这些作为迭代过程结果获得的信息,然后做出购买哪辆车的决定。
所以,我们并不是以线性方式进行,也不是一次性考虑所有信息。我们是顺序地获取与我们可能拥有的各个需求相关的信息,然后做出决策。
用图网络表示思维过程
这个完整的过程可以用一种迷人的称为图网络的东西来表示。
如果我们的最终目标是确定我们要购买的汽车类型,这个决定可能由几个参数决定:预算可能是一个因素,汽车品牌、汽车功能、转售价值、购买目的等,所有这些都将影响购买哪种车型的决定。
现在,在品牌内部,品牌可以影响功能,功能和品牌可能影响转售价值。你购车的用途将决定所需的功能,因为如果你用于重型任务,你可能需要某些特定的功能集。你需要的功能现在可能影响你的预算,品牌也是如此。
这就像一个复杂的子查询网络,关联着一个简单的查询:“我想买一辆车每天开车上班,我的预算是120万卢比,我想要一辆马鲁蒂汽车,请告诉我该买哪种车型。”这是一个简单的查询,但有许多其他复杂的子查询我们需要寻找答案,而且不知何故,所有这些子查询都以某种方式相互关联。这个相互关联的信息网络最终共同决定了你的决策。
这就是人脑映射信息的方式,它以模块化的方式进行组织。
总结
本节课我们一起学习了“MindSearch”这篇论文的核心思想。我们探讨了传统搜索引擎与结合大型语言模型的AI助手各自的优缺点,指出了当前结合方式在上下文长度和信息过载方面的挑战。论文提出的创新解决方案是模仿人脑处理复杂决策的模块化、迭代式过程,并使用图网络来表示这种复杂的子查询关联关系。通过将人脑的思维模式融入AI搜索,旨在实现更高效、更准确的信息检索与答案生成。
018:我们离AGI还有多远?- 智能体系统的自动发现 🚀

概述
在本节课中,我们将讨论一篇近期发布的新论文,其标题为《智能体系统的自动设计》。这篇论文提出了一个名为“智能体系统自动设计”的新研究领域,其核心思想是自动创建强大的智能体系统设计。我们将探讨其基本方法、核心假设,并通过一个具体示例来理解其运作机制。
自动设计智能体系统的基本框架
上一节我们概述了论文的目标,本节中我们来看看其提出的核心方法框架。
论文提出了一种通过“元智能体”来自动迭代生成更优智能体的方法。智能体首先以代码形式定义,然后由元智能体自动发现新的智能体。
这个过程可以清晰地用下图表示:

以下是该框架的关键组成部分:
- 智能体档案库:这是一个存储所有已学习智能体的知识库。可以将其类比为一个书籍档案,其中包含不同时期、不同版本的智能体。每个智能体都有其对应的性能表现。
- 迭代过程:在每次迭代中,元智能体会审视现有的档案库,并尝试发现下一个“有趣”的智能体。这里的“有趣”通常意味着新智能体应比档案库中的先前智能体表现出更好的性能。
- 评估与归档:新发现的智能体会在某些任务上进行性能测试。如果其表现令人满意,就会被添加到智能体档案库中。
- 循环演进:这个过程会运行多次。每次循环都会发现一个新智能体,并将其添加到档案库的智能体列表中。随着迭代次数增加,发现的智能体数量会持续增长,直到达到预设的迭代上限。
这个框架就是所谓的“ADS”,即智能体系统的自动设计。
核心假设与研究问题
了解了基本框架后,我们来看看这项研究背后的驱动理念。
论文的主要假设是:机器学习的历史揭示了一个反复出现的主题。随着时间的推移,随着我们获得更多的计算资源和数据,手工设计的特征会被本质上更自动化的、更好的系统所取代。
他们指出,历史上我们看到机器学习领域从需要较多人工干预,发展到例如卷积神经网络这样的系统,其中的特征无需手动设计即可自行发现。他们试图将这一趋势外推到智能体系统领域。
他们提出的核心研究问题是:我们能否自动化智能体系统的设计,而不是依赖人工努力? 这正是本文试图解决的基本问题。
示例解析:ARC挑战
为了更具体地理解ADS如何工作,我们来看一个应用于“ARC挑战”的具体例子。ARC指的是抽象与推理语料库。
在这个挑战中,通常会给出三组输入-输出示例。以下图为例,展示了其中两组:

每组示例包含一个输入网格和一个输出网格。任务背后存在一个将输入转换为输出的变换规则。人类可以轻易看出,此例中的规则是围绕中心方块填充其外接矩形。
关键问题是:能否构建一个AI智能体来理解此逻辑,并在给定测试网格时,预测出正确的输出答案?传统AI智能体在此类任务上表现不佳。
ADS在ARC挑战中的应用
现在,我们看看研究者如何使用他们的ADS方法来解决这个问题。
首先,他们为元智能体定义了一个描述。这个描述本质上是一个提供给大型语言模型的提示词。
以下是元智能体描述的一个示例:
概述:你的目标是为ARC(抽象与推理语料库)挑战找到一个性能优异的智能体。
在此挑战中,每个任务包含三个演示示例和一个测试示例。
每个示例包含一个输入网格和一个输出网格。
测试者需要使用从示例中学到的变换规则来预测测试示例的输出网格。
这个描述,连同几个具体的输入-输出示例(例如示例0、示例1、示例2),构成了元智能体的初始“知识”或“提示”。元智能体本身是基于OpenAI的GPT-4模型构建的一段代码。
智能体的发现与演进
根据之前展示的流程图(图1),ADS会逐步发现多个智能体。
以下是智能体发现过程的演进步骤:
- 初始迭代:在第一步中,发现了“智能体1”,并将其添加到档案库。此时其测试准确率可能并不高。
- 持续优化:在第二步中,发现了“智能体2”并添加到档案库。这个过程持续进行,不断发现越来越好的智能体。
- 性能提升:从迭代1到迭代25,随着越来越多新的智能体被发现和加入档案库,整体性能(测试准确率)呈现上升趋势。
这个过程展示了如何通过自动化的元设计,逐步提升智能体在复杂推理任务上的能力。
总结

本节课中,我们一起学习了论文《智能体系统的自动设计》的核心内容。我们探讨了其提出的“智能体系统自动设计”框架,该框架通过一个元智能体来自动化地迭代发现和优化任务智能体。我们理解了其背后的核心假设——即机器学习正朝着减少人工干预、增强自动化设计的方向发展。最后,通过ARC挑战的具体示例,我们看到了ADS方法如何在实际任务中运作,并逐步提升智能体的性能。这项工作为探索更通用的人工智能系统设计提供了一条新的自动化途径。
019:使用AI创作单口喜剧 - Google DeepMind新研究解析

概述
在本节课中,我们将要学习一篇由Google DeepMind发表的、题为《A Robot Walks into a Bar》的有趣研究论文。这篇论文的核心目标是探索大型语言模型能否作为单口喜剧创作的创意支持工具。我们将详细拆解其研究背景、假设、方法、结果与发现,并理解其对AI与创意领域结合的启示。
研究背景与目标
上一节我们介绍了论文的基本目标,本节中我们来看看其具体的研究背景。
这篇论文探讨了语言模型能否作为喜剧创作的创意支持工具。该主题本身非常有趣,因为它深入研究了专业单口喜剧演员是否能在大型语言模型的帮助下,生成剧本和创作内容,并从中获得实际效用。
研究人员采访了20位在观众面前进行现场表演的专业喜剧演员。他们进行了一项包含人机交互问卷的调查,试图通过该问卷了解这些人是否确实从ChatGPT等工具中获得了帮助。
这是一个名为“AI、伦理与社区”的研讨会。其理念是探索任何形式存在于大型语言模型核心的偏见或其他因素,是否会影响喜剧内容的生成。
当你观看此视频时,可以试着思考哪些因素可能影响喜剧创作。无论你喜欢哪位单口喜剧演员,你喜欢他们笑话的哪个部分?你可能与他们个人的故事或背景产生共鸣,也可能喜欢他们的幽默类型,无论是黑色幽默还是略带冒犯性的幽默。每位喜剧演员都有自己独特的风格,正是这种风格使他们受欢迎。
因此,我们在此探索的主题本身就非常有趣,因为我们使用的是一套通过在海量数据集上训练而演化出来的软件,现在却试图用它来生成喜剧。
核心挑战与假设
在深入了解研究方法之前,我们需要理解将机器学习与幽默结合所面临的根本性挑战。
正如论文所言,人类是已知唯一使用幽默来逗笑他人的物种。幽默经过数百万年的进化演变而来。它的进化方式赋予我们更好地与同类建立联系的能力。幽默不仅在于你说什么,更是面部表情、词语语境等一切元素的完整混合体。因此,很难确切地写下为什么某个特定的喜剧片段让你发笑。这正是这项任务难度极高的原因。
在开展研究之前,研究人员提出了一些希望验证的假设。
以下是他们提出的主要假设:
-
假设一:LLM存在偏见,且会影响生成的喜剧内容。
这些偏见可能有两种类型:性别偏见和种族偏见。研究人员详细列出了所有这些偏见。其中一些可能是表征性偏见本身,另一些则可能是这些偏见模型的下游后果所表现出的外在偏见。基本上,偏见会极大地影响剧本的生成方式,因为如果你对特定宗教或性别存在偏见,那么你的笑话将总是特定类型的。偏见会限制你的创作,如果大型语言模型确实存在偏见,这将在生成的剧本中体现出来。这假设是否正确有待检验。 -
假设二:可能对被视为冒犯性的言论进行审查。
喜剧演员经常使用包含大量粗俗语言的表达,他们的素材也可能包含一些挑衅性主题。研究人员强调,LLM可能会审查你的内容,即它们会拒绝回答具有冒犯性的提示。这对于许多喜剧演员来说,将真正夺走其喜剧的核心本质。如果他们的喜剧套路核心包含大量黑色幽默或冒犯性笑话,那么LLM的这种审查将严重阻碍剧本的生成。这些喜剧演员通常使用冒犯性笑话来进行“向上抨击”和讽刺,即挑战现有的社会结构,以建立同理心,而不是“向下打压”他人。因此,它并非用于贬低某人,而是作为讽刺手段来挑战现有的社会结构。 -
假设三:LLM将完全错过语境。
语境是关键,否则,如果你只是听到某事或某人在你不了解语境的情况下对你说某事,你可能会感到被冒犯。因此,笑话必须与语境恰当关联,否则不会成功。研究人员认为LLM会出现这种情况。 -
假设四:内容将趋于同质化。
这意味着AI生成的产物可能导致审美风格的同质化。例如,如果对某个种族存在偏见,那么这将成为一种同质化的力量,并成为社会主导风格。
以上是作者在进行研究之前提出的所有假设。
研究方法
接下来,我们具体看看研究人员是如何设计和实施这项研究的。
他们与20位喜剧演员一起举办了研讨会,其中第一次研讨会是线下进行的,有10位参与者,随后的三次研讨会是在线上完成的。
他们以描述项目议程开始为期三小时的会议,并要求参与者填写信息表和同意书。
第一个练习是写作练习,参与者必须参与喜剧写作练习。他们花费大约45分钟与大型语言模型合作来开发一个剧本。研究人员邀请他们使用自己感到舒适的语言。他们使用该工具来生成、解释笑话,通过迭代提示共同创作笑话,并分析、重写或完成他们之前的一些素材。因此,它被用作生成喜剧套路剧本的一种助手。大多数人使用了ChatGPT-3.5,有些人也使用了GPT-4或由Gemini驱动的Google Bard。
之后,他们要求参与者填写多项调查。第二项调查用于计算创意支持指数。基本上,创意支持指数越高,表示在AI帮助下生成的剧本越有创意且令人满意。CSI包含探索性、表达性、沉浸感、享受度、成果等方面。
最后,还进行了焦点小组提问。
研究结果与分析
现在,让我们来看看这项研究的结果。希望你已经理解了这项研究的更广泛目标以及它是如何进行的。
AI作为喜剧写作的创意支持工具
以下是针对一些关键问题的反馈结果:
- AI编写的材料是否独特?
大多数喜剧演员不同意这一点,他们认为材料并不独特,非常普通。 - 你是否享受与AI一起写作?
大多数人表示是的,他们确实享受这个过程。 - 你是否对AI编写的材料感到自豪?
他们并不为此感到自豪。 - 与AI一起写作是否容易?
这并不是非常容易。 - 是否能够表达我的创意目标?
同意程度也不是非常强烈。
这些结果表明,虽然AI可以作为辅助工具提供一定帮助,并在过程中带来乐趣,但在生成独特、高质量、能充分体现创作者个人风格和目标的喜剧内容方面,目前仍存在明显局限。
总结

本节课中,我们一起学习了Google DeepMind关于使用AI辅助单口喜剧创作的研究。我们了解了该研究旨在探索LLM作为创意工具的潜力,分析了其提出的关于偏见、审查、语境缺失和内容同质化等核心假设,并回顾了通过研讨会和调查进行的研究方法。最终的结果表明,AI在喜剧创作中能提供一定的协助和乐趣,但在生成独特、个性化且符合创作者深层意图的优质内容方面,仍有很长的路要走。这项研究揭示了AI与人类创意结合时的复杂性与挑战,为未来开发更有效的创意支持工具提供了重要参考。

浙公网安备 33010602011771号