Agent 学习笔记 26:Agent 应该怎样评估:从 Prompt 调优到回归测试

评价聊天回答可以看正确性和表达,评价 Agent 还要看它是否选对工具、走了多少步骤、有没有恢复失败、成本是否合理,以及副作用是否受控。只看最终文本,会错过大部分真实问题。

把结果指标和过程指标分开

结果指标包括任务成功率、事实正确性和用户接受度;过程指标包括工具选择、参数正确率、步骤数、延迟、token、重试与违规动作。两者结合,才能判断结果是稳定完成还是偶然撞对。

固定任务集 -> 运行 Agent -> 检查最终产物 + 分析轨迹 -> 与基线比较 -> 回归门禁

评测集来自真实失败

除了公开 Benchmark,更重要的是把线上典型任务、边界条件和历史事故沉淀为回归样例。数据要覆盖简单任务、长任务、工具异常、权限不足和对抗输入,并防止评测集泄漏到优化数据中。

Prompt 与模型变更都要做对照

每次修改应与当前线上版本比较,不只看平均分,还看关键切片是否退化。A/B 测试适合观察真实用户行为,但高风险功能不能等线上试验发现安全问题。模型路由也要按任务难度、质量、成本和延迟联合评估。

LLM-as-Judge 需要校准

模型裁判适合规模化评估开放文本,但容易受答案顺序、长度和自身偏好影响。应使用清晰 rubric、随机顺序、多个裁判或人工抽检,并对可程序验证的指标优先使用确定性检查。

这章给我的启发

Agent 评估不是上线前的一次考试,而是贯穿数据、Prompt、工具、模型和运行时的持续反馈系统。能回归的能力,才是真正拥有的能力。

posted @ 2026-09-02 19:36  Hazy_star  阅读(15)  评论(0)    收藏  举报