Happy-LLM 学习笔记 10:评测和 Agent,让 LLM 从模型走向系统

学到第七章后,我对“大模型应用”的理解开始从单次问答转向系统工程。RAG 解决的是知识如何进入上下文,而评测和 Agent 关注的是另外两个问题:模型到底能不能被信任,以及模型怎样从“会回答”变成“会做事”。

这两个主题放在一起很自然。没有评测,Agent 的每一步都像黑箱;没有 Agent,评测也容易停留在榜单分数,和真实业务动作之间隔着一层。真正要把 LLM 用起来,不能只问模型有多聪明,还要问它在什么任务上稳定、在哪些边界会失败、失败以后系统有没有兜底。

评测不是看一个总分

Happy-LLM 介绍了 MMLU、GSM8K、MATH、ARC、GPQA、HellaSwag、长文本和多语言等评测集,也提到 Open LLM Leaderboard、Chatbot Arena、OpenCompass 以及金融、法律、医疗等垂直榜单。读这一部分时,我最大的感受是:评测的第一步不是跑数据集,而是先拆清楚自己关心哪种能力。

通用知识、数学推理、工具调用、长上下文、多语言、领域安全,看起来都叫“模型能力”,但对系统的意义完全不同。一个客服机器人未必需要特别强的竞赛数学能力,却很需要稳定遵循流程、识别用户意图和不乱编政策;一个代码助手可能更关心多轮上下文、工具调用和错误修复能力。只看平均分,很容易选到“榜单上好看、业务里别扭”的模型。

所以我更愿意把评测看成验收标准,而不是宣传材料。业务上线前应该有一组自己的 golden set:覆盖高频问题、困难问题、拒答边界、长文本输入、诱导性提问和工具失败场景。公开榜单负责初筛,自建评测负责判断能不能落地。

Agent 把模型放进循环里

LLM Agent 的核心不是换一个更酷的名字,而是把模型放进“理解目标、规划步骤、调用工具、观察结果、继续迭代”的循环里。传统聊天模型多半是一次输入一次输出;Agent 则要维护状态,并且能把语言决策变成外部动作。

教程把 Agent 的能力拆成目标理解、规划、记忆、工具使用和反思。我觉得其中最容易被低估的是工具使用。因为工具一旦接入,模型输出就不只是文本,它可能触发搜索、查询数据库、计算、发送请求甚至修改数据。系统边界从“生成质量”扩展到“动作安全”,工程要求立刻提高。

不同类型的 Agent 也对应不同复杂度。任务导向型 Agent 更像带工具的流程助手,适合客服、查询和简单自动化;规划推理型 Agent 要把大任务拆成多步,需要更强的状态管理;多 Agent 系统则进一步引入角色分工和协作成本。复杂度越高,越需要评测和日志支撑,否则很难知道问题出在模型判断、工具实现、上下文组织还是流程设计。

Tiny-Agent 的关键链路

Tiny-Agent 示例用 OpenAI 兼容接口、工具函数和 tool_calls 串起了一个最小闭环。工具函数先通过 docstring 和类型信息转换成 JSON Schema,模型在需要时返回要调用的函数名和参数,Agent 执行本地函数,再把工具结果作为消息交回模型,让模型生成最终回答。

这个流程看似短,但已经包含 Agent 工程的几个核心接口。第一,工具定义要清晰,函数名、参数和说明会直接影响模型是否会正确调用。第二,工具结果要回到对话历史,否则模型无法基于真实执行结果继续回答。第三,Agent 需要保存历史消息,因为多轮对话里的上下文和工具结果都是后续决策的依据。

我也注意到代码里对工具调用做了更稳妥的处理:把 JSON 参数解析成字典,用 tool_map 根据函数名分发,而不是直接拼字符串执行。这类细节很重要。Agent 系统里,模型返回的是不完全可信的结构化意图,执行层必须把它当成外部输入来校验。参数解析失败、工具不存在、工具返回异常,都应该有明确的错误消息和日志。

工程启发:先把可观察性做出来

如果要把 Tiny-Agent 往业务系统推进,我会优先补三类能力。

第一是可观察性。每一轮模型输入、工具 schema、模型选择的工具、参数、工具返回值、最终回答,都应该能追踪。没有这些记录,Agent 出错时只能猜。

第二是权限和副作用控制。查询时间、统计字符这类工具风险很低,但一旦接入订单、文件、数据库或外部 API,就要区分只读工具和写入工具。高风险动作最好有确认、幂等设计和回滚方案。

第三是面向 Agent 的评测。不能只评最终回答,还要评工具是否选对、参数是否正确、失败时是否停止、是否在不需要工具时过度调用。对 Agent 来说,“答案对”有时只是偶然,过程可控才是系统可靠的基础。

这篇让我把 LLM 应用看得更完整:RAG 让模型接触外部知识,Agent 让模型驱动外部工具,评测则负责告诉我们这套链路是否稳定。模型本身仍然重要,但真正能上线的是模型、数据、工具、权限、日志和评测共同组成的系统。

参考项目:https://github.com/datawhalechina/happy-llm
在线阅读:https://datawhalechina.github.io/happy-llm/

posted @ 2026-07-27 13:46  Hazy_star  阅读(10)  评论(0)    收藏  举报