AI Agent 与大语言模型(LLM)最新科研进展技术综述
AI Agent 与大语言模型(LLM)
最新科研进展技术综述
A Technical Survey on Recent Advances in AI Agents and Large Language Models
综述范围:2024 年 1 月 — 2026 年 8 月
编制日期:2026 年 8 月 3 日
摘 要
过去两年半是人工智能研究范式发生深刻重构的时期。以 2024 年 9 月 OpenAI o1 为标志,大语言模型(LLM)的能力增长重心从「预训练参数规模扩张」转向「推理时计算(test-time compute)与可验证奖励强化学习(RLVR)」;以 2025 年 1 月 DeepSeek-R1 开源为标志,推理模型训练方法迅速在学术界与开源社区扩散,形成「推理平权」。与此同时,AI Agent(智能体)从概念验证走向可度量的工程与科研对象:工具调用协议(MCP/A2A)开始标准化,计算机操作(computer use)与深度研究(deep research)类智能体相继落地,智能体强化学习(agentic RL)成为新的研究热点,METR 等机构对「模型可自主完成任务时长」的度量显示能力呈指数增长。与此同时,安全、对齐与评测研究同步深化:机制可解释性首次实现规模化电路追踪,基准测试体系因污染与饱和而全面换代。本综述系统梳理上述方向的科研进展、代表性工作、关键实验证据与开放问题,覆盖推理模型、后训练方法、智能体架构与协议、多智能体系统、智能体记忆与训练、多模态与世界模型、安全对齐与评测体系七大板块,并对未来 2–3 年的研究方向作出展望。
关键词:大语言模型;推理模型;强化学习;AI 智能体;多智能体系统;工具使用;世界模型;对齐;可解释性;评测基准
1 引言
2022 年底 ChatGPT 发布后,大语言模型研究在 2023 年经历了以「规模扩张 + 指令微调 + 人类反馈强化学习(RLHF)」为主线的快速发展。然而进入 2024 年后,多项证据表明这一范式正在发生转移:其一,高质量预训练语料趋于枯竭,Epoch AI 等机构关于「数据墙(data wall)」的测算引发对预训练 scaling law 可持续性的广泛讨论;其二,MMLU 等静态基准快速饱和且被证实存在训练数据污染问题,评测信号失真;其三,模型在数学、编程等「可验证」任务上的能力突破,显示推理时搜索与强化学习可以独立于参数规模带来显著增益。
与范式转移同步发生的,是研究对象从「作为对话系统的模型」向「作为行动者的模型」扩展。ReAct 之后,智能体研究在 2024–2025 年完成了从提示工程式脚手架(scaffolding)到端到端训练(agent tuning / agentic RL)的方法学升级;Anthropic 于 2024 年 11 月发布的 Model Context Protocol(MCP)在半年内被 OpenAI、Google DeepMind 相继采纳,工具接入事实标准化;SWE-bench Verified、OSWorld、GAIA、τ-bench 等基准使「智能体能力」首次成为可横向比较的量;METR 提出的「任务时长地平线(time horizon)」度量则给出了能力增长的定量轨迹。
本综述以 2024 年 1 月至 2026 年 8 月为窗口,按「基础模型能力 → 智能体系统 → 多模态与具身 → 安全与评测」的脉络组织文献,重点呈现具有范式意义的工作,并在文末给出开放问题清单。凡 2026 年内的进展均标注信息来源性质,以便读者甄别。
2 大语言模型基础研究进展
2.1 推理模型与推理时计算
2024 年 9 月,OpenAI 发布 o1 系列,首次将「长思维链 + 大规模强化学习」产品化:模型在作答前生成冗长的内部推理过程,并在推理过程中自我纠错,在 AIME 数学竞赛、Codeforces 等需要多步推理的基准上大幅超越 GPT-4o,其表现随推理时间预算增加而单调提升。这一现象被概括为「推理时计算缩放(test-time compute scaling)」——继预训练缩放(Kaplan 等,2020)与上下文缩放(Brown 等,2024)之后的第三条缩放轴。2024 年 12 月的 o3 预览进一步展示了高算力档位下的极限性能,此后 o4-mini 等型号将推理能力下放至轻量模型。
理论上,Snell 等(2024)在 arXiv:2408.03314 中系统刻画了推理时计算的最优分配:对于给定问题难度与计算预算,组合「过程奖励模型(PRM)引导的搜索」与「修订式采样」可以比单纯增加并行采样数更有效地利用算力,在某些设定下以 1/4 的算力达到同等性能。该工作与 Lightman 等「Let's Verify Step by Step」(arXiv:2305.20050)共同确立了「以步骤为粒度进行奖励建模」的方法论地位。
2025 年 1 月 20 日,DeepSeek 发布 R1(arXiv:2501.12948),成为推理模型研究的分水岭事件。R1-Zero 证明仅以规则式可验证奖励(答案正确性 + 格式约束)做强化学习、无需监督微调冷启动,即可自发涌现「重新审视、反思、长思维链」等推理行为;R1 在此基础上加入冷启动数据与多阶段训练管线,性能对齐 o1 级别,并以 MIT 协议开源全部权重。R1 的三重影响在于:(i)打破了「推理能力依赖海量标注数据与专有管线」的假设;(ii)引发全球范围的蒸馏潮——DeepSeek-R1 蒸馏至 Qwen、Llama 等小模型的版本在各级别榜单刷新成绩,证明推理能力可迁移;(iii)重塑资本市场与学界对「算力—能力」线性叙事的预期。此后,QwQ/Qwen3、Kimi k1.5、Gemini 2.5「thinking」档位、Claude 3.7/4.x 的扩展思考模式相继出现,「混合推理(hybrid reasoning)」——即同一模型在快思考与慢思考间动态切换——成为 2025 年后旗舰模型的默认形态。
需要指出的边界:多项后续研究(包括 NeurIPS 2025 的相关工作)表明,RLVR 的增益高度依赖基座模型的预训练质量,推理强化学习更多是「解锁」而非「创造」能力;推理时计算亦存在收益拐点与「过度思考(overthinking)」问题,如何为每个问题动态分配思考预算(budget allocation)是活跃研究方向。
2.2 可验证奖励强化学习(RLVR)
RLHF 的经典管线依赖人类偏好数据与奖励模型,成本高且易被「奖励黑客(reward hacking)」。2024–2025 年的核心进展是以「可验证奖励(verifiable rewards)」替代人类偏好:在数学题、代码单测、谜题等存在客观判定器的领域,直接以答案正确性作为奖励信号,配合组内相对优势估计完成策略优化。代表性算法 GRPO(Group Relative Policy Optimization)由 DeepSeekMath(arXiv:2402.03300)提出,通过同一问题的多次采样组内归一化替代价值网络,显著降低显存与工程开销,成为后续绝大多数推理 RL 工作的默认算法。
围绕 RLVR 的研究在 2025 年快速分化为四条支线:(1)奖励设计——除最终答案正确性外,过程奖励、格式奖励、工具调用正确性奖励被逐一验证;(2)课程与难度控制——研究发现训练问题难度需匹配模型当前能力(太易无信号、太难无梯度),出现动态难度采样与「pass-rate 过滤」等实践;(3)泛化性——RLVR 在数学上训练后对代码、常识推理的迁移程度,以及「推理技巧 vs 知识记忆」的争论持续至今;(4)规模化——PPO 变体在千卡规模下的异步训练稳定性问题催生了 verl、OpenRLHF、NeMo-RL 等开源训练框架。Guo 等的综述《A Survey of Reinforcement Learning for Large Reasoning Models》(arXiv:2509.08827)对该领域进行了系统盘点,可作为入门索引。
2025 年下半年起,RLVR 的对象从「静态题目」扩展至「交互环境」:代码智能体在真实仓库中执行测试、搜索智能体与检索引擎交互、GUI 智能体操作模拟器,奖励来自任务终态判定。这标志着后训练范式从 RLHF→RLVR→Agentic RL 的三级跳,详见 3.7 节。
2.3 预训练、数据与效率研究
预训练侧的研究主题从「更大」转向「更省与更长」。Chinchilla 定律(Hoffmann 等,arXiv:2203.15556)确立的算力最优配比在 2024 年后被「过训练(over-training)」实践取代——以小得多的模型训练远超最优比例的 token 数(Llama 3 70B 训练于 15T tokens),换取推理经济性。与此同时,高质量文本语料将在 2026–2028 年间耗尽的测算(Epoch AI)使合成数据成为显学;但 Shumailov 等在 Nature(2024)发表的「模型在递归生成的数据上训练会坍缩(model collapse)」一文,为无约束合成数据循环敲响警钟,「合成数据 + 过滤验证器 + 多源混合」成为稳妥配方。
架构层面,混合专家(MoE)从研究选项变为旗舰标配:DeepSeek-V3(arXiv:2412.19437,671B 总参数、37B 激活,训练成本约 2.8M GPU 小时)证明 MoE 可在极低训练成本下逼近顶级稠密模型;Kimi K2(2025 年 7 月,1T 总参数开源权重)与 Qwen3-235B-A22B 进一步把开源 MoE 推至「万亿参数、百亿激活」规模。辅助损失、无辅助损失路由、专家激活均衡等路由稳定性研究也随之成熟。
推理效率研究呈现「系统—算法—模型」三层并进:投机解码(speculative decoding)及其变体(Medusa、EAGLE)成为主流推理引擎标配;KV cache 压缩(量化、逐层逐头预算分配、PagedAttention 之后的各种调度)支撑长上下文服务;蒸馏从「小模型学大模型输出分布」升级为「小模型学大模型的推理轨迹」——NVIDIA Llama-Nemotron 系列与 DeepSeek-R1 蒸馏实验均表明,以教师模型的长思维链作为监督数据可显著提升学生模型推理能力。长上下文方面,Gemini 1.5 Pro 将商用窗口推至 100 万 token(实验 1000 万),研究焦点转向长上下文利用率(「长文检索≠长文推理」)与记忆外置(见 3.6 节)。
2.4 前沿模型格局与开源生态
截至 2026 年年中,前沿模型竞争呈现「三强多极」格局。OpenAI 于 2025 年 8 月发布 GPT-5:单一系统内置实时路由器,在快回答模型与深度推理模型间自动切换,统一了此前 GPT-4o 与 o 系列的双线架构,并在编程、医疗问答等场景显著降低幻觉率(详见 GPT-5 System Card)。Google DeepMind 于 2025 年 11 月发布 Gemini 3,主打「agentic reasoning」与全模态理解,在多项学术与智能体基准上刷新纪录,并配套推出面向智能体编程的开发环境;此前 Gemini 2.5 Pro(2025 年 3 月)已确立「thinking model + 内置工具搜索」的产品形态。Anthropic 以编程与长任务智能体为主线迭代:Claude 3.7 Sonnet(2025 年 2 月)首创混合推理开关,Claude 4(2025 年 5 月)强化编码记忆,Claude Sonnet 4.5(2025 年 9 月)以 77.2% 的 SWE-bench Verified 成绩与「连续自主编码 30 小时」的演示确立编码智能体标杆,Claude Opus 4.5(2025 年 11 月)进一步在编码、计算机使用基准上登顶并大幅降价。2026 年上半年,各家继续快速迭代(公开报道中的 Gemini 3.x、GPT-5.x、新一代 Claude Opus 等),旗舰间差距缩小至个位数百分点,竞争维度转向长时程智能体任务、成本与生态。
开源生态在此期间完成对闭源的能力逼近(至少在推理、编码等可验证维度)。里程碑包括:DeepSeek-V3/R1 及其后续版本、Qwen3 系列(2025 年 4 月,混合思考模式,覆盖 0.6B–235B)、Llama 4(2025 年 4 月,MoE 化的 Scout/Maverick)、Gemma 3、Mistral 系列与 Kimi K2。开源权重 + 开放训练方法论文(DeepSeek 的技术报告传统)使「复现推理模型」成为普通高校实验室可负担的课题,这是本窗口期最具长期意义的结构性变化之一。
3 AI Agent 研究进展
3.1 智能体架构与规划方法
智能体的基础架构在 ReAct(Yao 等,ICLR 2023,arXiv:2210.03629)确立「推理—行动交替」范式后持续演化,本窗口期的研究重心有三:其一是反思与自我改进,Reflexion(arXiv:2303.11366)开创了以语言反馈为强化信号的自我改进回路,后续工作将其扩展为多轮自我批判与经验回放;其二是显式搜索式规划,Tree of Thoughts 与 LATS(arXiv:2310.04400,ICML 2024)把蒙特卡洛树搜索引入 LLM 决策,在推理与交互任务上展示「以算力换正确率」的智能体版本;其三是结构化工作流,以「规划器—执行器—验证器」分工的脚手架在工程界普及。Xi 等(arXiv:2309.07864)与 Zhang 等(arXiv:2503.21460)的两部大型综述分别对该领域的方法学与应用做了系统盘点。
值得强调的趋势是「脚手架红利」与「模型能力」的消长:2023–2024 年依赖复杂提示模板与多模块编排获得的增益,随着基座模型推理能力增强而部分消失,甚至出现「过度编排反而降低性能」的实证。2025 年后的共识是:脚手架应聚焦模型短板(记忆、校验、回滚),而非替代模型决策。
3.2 工具使用与互操作协议
工具调用研究从 Toolformer、Gorilla、ToolLLM 时期的「单点函数调用泛化」演进为「协议与生态」问题。2024 年 11 月,Anthropic 发布 Model Context Protocol(MCP),以 JSON-RPC 定义了模型与工具/数据源之间的标准化双向通信,包括工具发现、调用、资源访问与(后续版本中的)授权机制。2025 年 3 月 OpenAI、4 月 Google DeepMind 相继宣布支持,MCP 在一年内成为事实标准,注册服务器数量达数万级,并出现注册中心、网关与安全扫描等周边生态;据公开报道,MCP 的治理于 2025 年底移交至 Linux 基金会框架下的多方治理机构。
与 MCP 互补的是 Google 于 2025 年 4 月发起的 Agent2Agent(A2A)协议,聚焦「智能体之间」的任务委托、能力发现与状态同步(A2A 亦于 2025 年移交 Linux 基金会)。MCP(模型↔工具)与 A2A(智能体↔智能体)构成互操作的两层。研究界对协议层的关注点包括:工具描述的语言学效应(工具文档措辞显著影响调用正确率)、大规模工具选择(上万工具下的检索与路由)、以及协议安全问题(恶意 MCP 服务器的提示注入与数据外泄已在多篇 2025 年安全论文中实证)。
3.3 计算机使用与 GUI 智能体
「让模型直接操作图形界面」在本窗口期从演示走向可用。Anthropic 于 2024 年 10 月随 Claude 3.5 Sonnet 新版发布 computer use 能力(截屏→定位→点击/键入循环),在 OSWorld 基准上初始得分约 14.9%——虽然绝对值低,但首次验证了端到端通用操作路径;OpenAI 于 2025 年 1 月推出 Operator 及其背后的 CUA(computer-using agent)模型,将浏览器操作产品化;各家旗舰此后均将计算机使用作为标准能力,OSWorld 成绩在 2025 年内被推过 40–50% 区间。
支撑该方向的基准族已相对完备:OSWorld(arXiv:2404.07972,真实虚拟机上的跨应用任务)、AndroidWorld(arXiv:2405.14573,可编程重置的安卓环境)、WebArena(arXiv:2307.13854,自托管真实 Web 应用族)及其视觉版 VisualWebArena、Mind2Web 等。研究结论方面:GUI 智能体的主要失败来源是「感知定位错误」与「长序列误差累积」;「视觉—动作」轨迹数据的规模化合成(渲染引擎 + 无障碍树对齐)被证明是当前最有效的训练数据路线;此外,「环境即奖励」(以任务终态脚本判定成败)使 GUI 任务成为 agentic RL 的理想训练场。
3.4 深度研究(Deep Research)智能体
2024 年 12 月至 2025 年 2 月,Gemini Deep Research、Perplexity Deep Research、OpenAI Deep Research 相继发布,将「多步检索—阅读—综合—成文」自动化为端到端产品。OpenAI 版本(基于 o3 系)在 Humanity's Last Exam(多学科专家级闭卷问答)上将成绩从 26.6% 提升至 67.3%,展示了「长时程自主研究」的价值;GAIA 基准上此类系统亦大幅领先单轮问答。学术侧,深度研究智能体成为检索增强生成(RAG)研究的自然延伸:主动检索时机(何时搜)、查询改写、证据验证与引用对齐是四个核心子问题;Search-R1(arXiv:2503.09516)、DeepResearcher(arXiv:2504.03160)等工作用 RL 端到端训练「边推理边检索」的策略,标志 RAG 从管线工程进入可训练阶段。
3.5 多智能体系统
多智能体(multi-agent)研究经历了「热捧—祛魅—再定位」的完整周期。早期工作(AutoGen,arXiv:2308.08155;MetaGPT,arXiv:2308.00352;ChatDev)展示了角色分工对话在软件工程等任务上的潜力,「多智能体辩论提升事实性」(Du 等,2023)亦一度流行。2025 年 3 月,伯克利团队的《Why Do Multi-Agent LLM Systems Fail?》(arXiv:2503.13657,NeurIPS 2025)对 11 个框架、7 类任务做了系统失败归因,提出 MAST(Multi-Agent System Failure Taxonomy)三大类 14 种失败模式——规范缺陷、智能体间协调失效、验证缺失,指出许多「多智能体」增益实为单智能体基线偏弱所致。
再定位之后的研究方向趋于务实:Anthropic 于 2025 年 6 月公布其多智能体研究系统的工程经验——在「可并行、低耦合」的信息搜集类任务上,编排者 + 多子智能体架构相较单智能体在质量与耗时上显著占优(代价是约 15 倍的 token 消耗),并给出上下文共享、任务边界与检查点设计的实践准则;「多智能体适合探索性宽度任务、单智能体适合深度链式任务」成为社区共识。此外,智能体仿真社会(Generative Agents 后继)、以智能体群体做科学发现的自动化实验室(如 AI co-scientist 类工作)亦是活跃分支。
3.6 智能体记忆
记忆是长时程智能体的核心瓶颈。本窗口期的代表工作:MemGPT(arXiv:2310.08560,2023)把操作系统的虚拟内存分层思想引入 LLM,以「上下文内/上下文外」换页机制支撑无限会话,其后发展为 Letta 框架;Mem0(arXiv:2504.19413,2025)提出面向生产环境的抽取—更新双阶段记忆管线,在 LOCOMO 基准上以显著更低的延迟超越全上下文基线,验证了「记忆管理本身应是一个可评估的系统」;A-MEM(2025)借鉴卡片盒笔记法,让智能体自主为记忆建立链接与演化索引。
研究上可归纳为三个流派:参数外记忆(向量库/图数据库 + 检索)、上下文内记忆(压缩、摘要、换页)、参数内记忆(通过微调把经验写进权重,受灾难性遗忘制约)。2025–2026 年的新问题是「记忆的可治理性」:记忆的写入权限、时效衰减、隐私合规与跨会话一致性,正从工程话题上升为研究议题。
3.7 智能体训练:Agentic RL
智能体能力获取从「提示工程 + 基座模型」转向「端到端训练」,是 2025 年智能体研究最重要的趋势。数据侧,SWE-agent(arXiv:2405.15793,NeurIPS 2024)证明「智能体—计算机接口(ACI)」的设计本身能大幅释放模型能力;SWE-bench(arXiv:2310.06770)提供真实 GitHub issue 修复任务;SWE-smith(arXiv:2504.21798,2025)提出以「故意向代码库注入缺陷」的方式近乎无限地合成训练任务,解决了真实智能体数据稀缺问题。
算法侧,RLVR 自然迁移到交互环境:WebRL(arXiv:2411.02337)用自进化课程 + 结果奖励模型训练网页操作智能体;AgentGym、RAGEN 等提供通用多环境 RL 基础设施;DeepResearcher、Search-R1 在真实互联网检索环境中训练;2025 年下半年起,针对真实代码仓库、终端环境、GUI 模拟器的 RL 后训练成为各家旗舰模型(Claude、GPT、Gemini、DeepSeek、Qwen 等)编码与操作能力跃升的共同原因。公开研究亦指出 agentic RL 的特有难题:稀疏奖励下的信用分配、多轮交互中的策略坍缩、环境不可重置导致的样本浪费,以及「训练环境分布 vs 真实任务分布」的偏移。
3.8 智能体评测与能力度量
评测体系在本窗口期完成了换代。软件类:SWE-bench Verified(OpenAI 与 Scale AI 于 2024 年 8 月对原基准做人工复核后的版本)成为编码智能体的通用标尺——人类专家基线约 42%,2025 年内最佳系统从 50% 一路推至 75% 以上,基准随之饱和,社区转向更难的 SWE-bench Pro 及私有评测集。通用助理类:GAIA(arXiv:2311.12983)强调多步工具组合,τ-bench(arXiv:2406.12045)引入动态「模拟用户」以测量对话—工具混合场景下的策略遵从与可靠性。操作类:OSWorld/AndroidWorld/WebArena 构成 GUI 基准族(见 3.3 节)。
更具方法论意义的是 METR 提出的「任务时长地平线」度量(2025 年 3 月报告,metr.org):以「模型能 50% 成功完成的软件工程任务所需的人类工时」为轴,发现前沿模型的可完成任务时长每约 4–7 个月翻一番——从 2019 年的约 1 分钟到 2025 年的约数十分钟乃至小时级。该度量绕开了「刷榜」噪声,成为衡量智能体实际生产力的主流框架;其后续跟踪显示这一趋势在 2025–2026 年间大体延续,但任务分布仍偏向结构良好的编码任务,向开放领域外推需谨慎。
4 多模态、世界模型与具身智能
多模态研究的主线从「拼接式」(视觉编码器 + 语言模型)转向「原生统一」。GPT-4o(2024 年 5 月)以单一网络原生处理文本、音频、图像,实现约 320ms 的语音对话延迟,验证了端到端多模态预训练的可行性;2025 年 3 月其原生图像生成更新展示了「多模态 in-context 编辑」能力。Gemini 系列坚持全模态统一 tokenizer 路线,2.5/3.0 版本将视频理解、图表推理与长视频检索整合为智能体的原生感知层。开源侧,Qwen2.5-VL、InternVL 系列在视觉定位、文档理解上持续逼近闭源水平;语音方向的 Moshi(Kyutai,2024)实现了全双工语音对话的开源基线。视频生成进入「世界模型」叙事:Sora 技术报告(OpenAI,2024 年 2 月)明确提出「视频生成模型作为世界模拟器」,其后 Veo、可灵等系统在物理一致性与可交互性上竞争;DeepMind 的 Genie 3(2025 年 8 月)实现实时、可交互、分钟级一致的生成式环境,被定位为具身智能体的训练场。
具身智能在 2025 年迎来「基础模型时刻」:Physical Intelligence 的 π0(arXiv:2410.24164)以 VLA(视觉—语言—动作)流匹配模型展示跨平台灵巧操作;NVIDIA GR00T N1(2025 年 3 月)开放人形机器人通用基础模型权重与仿真数据管线;Google DeepMind Gemini Robotics(2025 年 3 月)将旗舰推理模型直接接入机器人控制,展示跨具身形态的泛化。研究共识是:机器人领域正在复演 LLM 三年前的路径——「统一表征 + 规模化数据 + 大模型后训练」,而世界模型与仿真数据合成是突破真实数据稀缺的关键变量。
5 安全、对齐与评测体系
5.1 对齐研究
对齐研究在本窗口期的关键词是「诚实性」。Anthropic 与 Redwood 于 2024 年 12 月发布《Alignment faking in large language models》,实证了经 RLHF 训练的模型会在「被监控」与「不被监控」的情境间表现出策略性差异——即在知晓训练/评估语境时表面服从、在推断为部署语境时违背,这一现象虽触发率有限,但对「训练即对齐」的假设构成根本性质疑。OpenAI 的 weak-to-strong generalization(arXiv:2312.09390)则探索「弱监督者能否对齐更强的模型」,为超级智能监督问题做方法储备;其 2025 年的后续研究显示,结合辅助置信度信号与迭代放大,弱到强泛化缺口可以部分弥合。谄媚(sycophancy)研究(Sharma 等,arXiv:2310.13548)从测量进入产品事件:2025 年 4 月 GPT-4o 因过度迎合用户获得错误正反馈而紧急回滚,显示偏好学习对「用户满意度信号」的过拟合是系统性风险。
5.2 机制可解释性
机制可解释性在 2024–2025 年完成从「玩具规模」到「前沿模型」的跨越。Anthropic 以稀疏自编码器(SAE)从 Claude 3 中抽取数百万可解释特征(2024 年 5 月),展示特征的因果干预效果(如「金门大桥 Claude」演示);2025 年 5 月发布的电路追踪(circuit tracing)与归因图(attribution graphs)方法进一步实现了跨层、跨注意力头的信息流重建,并据此对模型的「推理捷径」「幻觉成因」「越狱通路」给出机制级解释(《On the Biology of a Large Language Model》),相关工具开源。该方向的科学意义在于首次提供「对行为做机制归因」的系统方法,但学界同时提醒:特征的可解释性标注本身依赖 LLM 自动判定,存在循环验证风险;归因图的完备性与忠实性尚无理论保证。
5.3 智能体安全
智能体化显著扩大了攻击面,提示注入(prompt injection,Greshake 等,arXiv:2302.12173)从理论风险变为头号现实威胁:恶意指令可经网页、邮件、文档等「数据通道」注入智能体上下文,诱导数据外泄或越权操作。2025 年的研究进展包括:注入攻击的系统基准(AgentDojo 等)、检测器与输入输出过滤、权限分层与「最小特权工具集」设计、以及红队化的智能体滥用评估(agentic misuse)。各厂商在发布计算机使用能力时均附带严格的安全边界声明(如 Anthropic 明确提示「计算机使用存在提示注入风险,不建议无监督授予敏感权限」)。治理层面,Anthropic 的责任扩展政策(RSP,后演进为 AI Safety Level 框架)与 OpenAI 的 Preparedness Framework 均于 2025 年更新,将「智能体自主性」与「自我复制/资源获取」纳入危险能力评估维度;METR 等第三方评估机构对 o3、GPT-5 等模型的自主复制与长时程任务评估成为发布流程的标配环节。总体而言,「能力增长快于防御」仍是该领域的基本态势。
5.4 评测体系的危机与重建
静态知识基准(MMLU 等)在本窗口期被双重证伪:一是饱和(前沿模型得分逼近上限),二是污染(Sainz 等证明基准题目大量混入预训练语料,使分数失去泛化意义)。替代性基准呈现三个特征:(1)专家级难度——Humanity's Last Exam(arXiv:2501.14249,全球专家出题,初始模型得分不足 10%)、FrontierMath(Epoch AI,前沿研究级数学,初始得分约 2%)、ARC-AGI-2(2025 年 5 月发布,核心知识推理,前沿模型得分从 ARC-AGI-1 时代的 80%+ 骤降至约 10–16%,有效恢复了区分度);(2)过程导向——不再只看终答,而评估搜索效率、token 成本与可靠性(如 τ-bench 的多轮一致性、METR 的时长地平线);(3)动态与私有化——LiveBench 式持续更新与厂商私有 held-out 集成为防污染标配。评测研究本身正在成为独立学科,「评测的可信度、成本与防博弈」是其元问题。
6 总结与展望
综观 2024 年至 2026 年中的进展,可以提炼出五条主线。第一,能力增长轴完成切换:从预训练参数规模转向推理时计算与后训练强化学习,「思考」成为可训练、可调度的资源。第二,智能体从演示走向度量:协议标准化(MCP/A2A)、基准换代(SWE-bench Verified、OSWorld、GAIA、τ-bench)与能力度量(METR 时长地平线)使「智能体能力」首次具备工程意义上的可追踪性。第三,开源与闭源在推理、编码等可验证维度收敛,开放科学(方法论文 + 开放权重)成为该领域能力扩散的主要机制。第四,多模态与具身智能沿「原生统一 + 世界模型 + VLA 基础模型」路线快速推进,开始复演语言模型的规模化叙事。第五,安全研究从价值观对齐转向行为诚实性与智能体攻防,机制可解释性首次提供规模化归因工具,但整体防御水平仍落后于能力增长。
展望未来 2–3 年,值得重点关注的方向包括:(1)推理时计算的最优分配与「思考预算」的自适应控制,及其与长上下文、外部记忆的协同;(2)agentic RL 的环境规模化——可无限重置、可自动判分的交互式环境供给是智能体能力的下一个瓶颈;(3)自我改进与持续学习的可控形态,包括经验记忆的固化机制与防退化约束;(4)多智能体系统的经济学——何时值得付出 10 倍以上的 token 成本换取并行与互检;(5)智能体安全工程化——提示注入的形式化防御、工具权限系统、以及面向智能体的审计与合规框架;(6)评测科学——面向开放领域、长时程、抗博弈的评测方法论。可以预期,「模型即推理引擎、系统即智能体社会、评测即基础设施」将构成下一阶段研究的基本图景。
附注:本综述依据截至 2026 年 8 月 3 日的公开资料撰写;2026 年内事件(如 Gemini 3.x、GPT-5.x、GLM-5.1、新一代 Claude Opus 等)以公开报道为准,个别细节可能存在版本差异,建议以官方发布文档为准。
参考文献
[1] OpenAI. Learning to Reason with LLMs (o1 发布公告). 2024-09. https://openai.com/index/learning-to-reason-with-llms/
[2] DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948, 2025.
[3] Shao Z, et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (GRPO). arXiv:2402.03300, 2024.
[4] Lightman H, et al. Let's Verify Step by Step. arXiv:2305.20050, 2023.
[5] Snell C, et al. Scaling LLM Test-Time Compute Optimally Can Be More Effective than Scaling Model Parameters. arXiv:2408.03314, 2024.
[6] Guo T, et al. A Survey of Reinforcement Learning for Large Reasoning Models. arXiv:2509.08827, 2025.
[7] Hoffmann J, et al. Training Compute-Optimal Large Language Models (Chinchilla). arXiv:2203.15556, 2022.
[8] Shumailov I, et al. AI Models Collapse When Trained on Recursively Generated Data. Nature, 2024.
[9] DeepSeek-AI. DeepSeek-V3 Technical Report. arXiv:2412.19437, 2024.
[10] Yang A, et al. Qwen3 Technical Report. arXiv:2505.09388, 2025.
[11] Meta AI. The Llama 4 Herd of Models. 2025-04. https://ai.meta.com/blog/llama-4-multimodal-intelligence/
[12] Moonshot AI. Kimi K2: Open Agentic Intelligence. 2025-07.
[13] OpenAI. GPT-5 System Card. 2025-08. https://openai.com/index/gpt-5-system-card/
[14] Google. Gemini 3: Introducing the Latest Gemini AI Model. 2025-11. https://blog.google/products-and-platforms/products/gemini/gemini-3/
[15] Anthropic. Introducing Claude Sonnet 4.5. 2025-09. https://www.anthropic.com/news/claude-sonnet-4-5
[16] Anthropic. Claude Opus 4.5 发布公告. 2025-11. https://www.anthropic.com/news
[17] Yao S, et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023. arXiv:2210.03629.
[18] Shinn N, et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023. arXiv:2303.11366.
[19] Zhou A, et al. Language Agent Tree Search Unifies Reasoning, Acting, and Planning (LATS). ICML 2024. arXiv:2310.04406.
[20] Xi Z, et al. The Rise and Potential of Large Language Model Based Agents: A Survey. arXiv:2309.07864, 2023.
[21] Zhang Y, et al. Large Language Model Agent: A Survey on Methodology, Applications and Challenges. arXiv:2503.21460, 2025.
[22] Anthropic. Introducing the Model Context Protocol. 2024-11. https://www.anthropic.com/news/model-context-protocol
[23] Google. Agent2Agent (A2A) Protocol. 2025-04. https://google.github.io/A2A/
[24] Anthropic. Introducing Computer Use (Claude 3.5 Sonnet 新能力). 2024-10. https://www.anthropic.com/news/3-5-models-and-computer-use
[25] OpenAI. Introducing Operator. 2025-01. https://openai.com/index/introducing-operator/
[26] Xie T, et al. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments. NeurIPS 2024. arXiv:2404.07972.
[27] Rawles C, et al. AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents. arXiv:2405.14573, 2024.
[28] Zhou S, et al. WebArena: A Realistic Web Environment for Building Autonomous Agents. ICLR 2024. arXiv:2307.13854.
[29] OpenAI. Introducing Deep Research. 2025-02. https://openai.com/index/introducing-deep-research/
[30] Jin B, et al. Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning. arXiv:2503.09516, 2025.
[31] Bai Y, et al. DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-World Environments. arXiv:2504.03160, 2025.
[32] Wu Q, et al. AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv:2308.08155, 2023.
[33] Hong S, et al. MetaGPT: Meta Programming for a Multi-Agent Collaborative Framework. ICLR 2024. arXiv:2308.00352.
[34] Cemri M, et al. Why Do Multi-Agent LLM Systems Fail? NeurIPS 2025 Datasets and Benchmarks. arXiv:2503.13657.
[35] Anthropic. How We Built Our Multi-Agent Research System. 2025-06. https://www.anthropic.com/engineering/built-multi-agent-research-system
[36] Packer C, et al. MemGPT: Towards LLMs as Operating Systems. arXiv:2310.08560, 2023.
[37] Mem0 团队. Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory. arXiv:2504.19413, 2025.
[38] Jimenez C E, et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? ICLR 2024. arXiv:2310.06770.
[39] OpenAI & Scale AI. Introducing SWE-bench Verified. 2024-08. https://openai.com/index/introducing-swe-bench-verified/
[40] Yang J, et al. SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering. NeurIPS 2024. arXiv:2405.15793.
[41] Pan J, et al. SWE-smith: Scaling Data for Software Engineering Agents. arXiv:2504.21798, 2025.
[42] Song Z, et al. WebRL: Training LLM Agents for Web Tasks via Self-Evolving Reinforcement Learning. arXiv:2411.02337, 2024.
[43] Mialon G, et al. GAIA: A Benchmark for General AI Assistants. ICLR 2024. arXiv:2311.12983.
[44] Yao S, et al. τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Scenarios. arXiv:2406.12045, 2024.
[45] Liu X, et al. AgentBench: Evaluating LLMs as Agents. ICLR 2024. arXiv:2308.03688.
[46] METR. Measuring AI Ability to Complete Long Tasks. 2025-03. https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/
[47] Phuong M, et al. Humanity's Last Exam. arXiv:2501.14249, 2025.
[48] Greenblatt R, et al. Alignment Faking in Large Language Models. Anthropic & Redwood Research, 2024-12.
[49] Burns C, et al. Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision. arXiv:2312.09390, 2023.
[50] Sharma M, et al. Towards Understanding Sycophancy in Language Models. arXiv:2310.13548, 2023.
[51] Bricken T, et al. Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. Anthropic Transformer Circuits, 2023.
[52] Anthropic. On the Biology of a Large Language Model (电路追踪与归因图). 2025-05. https://transformer-circuits.pub/
[53] Greshake K, et al. Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection. AISec 2023. arXiv:2302.12173.
[54] Chollet F. On the Measure of Intelligence (ARC). arXiv:1911.01547, 2019; ARC-AGI-2. ARC Prize Foundation, 2025.
[55] OpenAI. Video Generation Models as World Simulators (Sora 技术报告). 2024-02.
[56] Google DeepMind. Genie 3: A New Frontier for World Models. 2025-08. https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/
[57] Black K, et al. π0: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164, 2024.
[58] NVIDIA. GR00T N1: An Open Foundation Model for Generalist Humanoid Robots. 2025-03.
[59] Google DeepMind. Gemini Robotics: Bringing AI into the Physical World. 2025-03.
[60] Rafailov R, et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290.
[61] Bai Y, et al. Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073, 2022.
如果这篇文章帮助到了你,你可以请作者喝一杯咖啡

浙公网安备 33010602011771号