Agent 学习笔记 29:三个综合项目复盘:编程助手、数据分析与多模态 Agent

学完整套 Agent 技术后,三个综合项目很适合用来检验理解:编程助手操作代码,数据 Agent 操作结构化数据,多模态 Agent 还要处理图像、语音和界面。它们表面不同,底层却共享同一套工程骨架。

编程助手:修改必须可验证

核心链路是仓库探索、定位代码、最小修改、测试和差异审查。代码执行需要沙箱,写入前要理解 Git 状态。它最能体现 Harness 的价值:规则、工具和验证缺一不可。

数据 Agent:语义正确比 SQL 可执行更难

系统要理解指标口径、表关系和权限,再生成查询、校验结果、分析并可视化。只保证 SQL 运行成功远远不够,还要防止全表扫描、敏感字段泄露和图表误导。查询最好先展示计划或在只读副本中执行。

多模态 Agent:每种模态都有自己的证据

图像理解要保留区域与原图引用,语音交互要处理转写置信度和打断,Computer Use 要识别界面状态并限制可点击动作。视频与多模态 RAG 还需要时间戳、关键帧和跨模态索引。

感知输入 -> 结构化表示 -> 任务状态 -> 工具行动 -> 结果验证 -> 可追溯输出

三个项目共同的验收问题

它理解的上下文是否正确?调用是否越权?失败能否恢复?结果能否验证?成本是否可接受?这些问题比“用了哪个最新模型”更决定项目能否长期运行。

这章给我的启发

从 Tool、Memory、Planning 到 RAG、Harness、评估和部署,最终都在综合项目里汇合。Agent 开发不是拼装功能,而是围绕一个可验证目标,组织模型、状态、工具和人类判断。

posted @ 2026-09-03 19:21  Hazy_star  阅读(8)  评论(0)    收藏  举报