Agent 学习笔记 28:把 Agent 部署到生产:服务化、并发、成本与运维

本地运行一个 Agent 只需要 API Key 和脚本,生产系统却要面对并发、长任务、流式响应、模型限流、状态恢复、成本和故障排查。部署不是把 Notebook 包进容器就结束。

在线请求和长任务分开

短问答可以由 API 服务同步或流式返回;研究、批量处理和复杂工具链应进入任务队列,由 Worker 异步执行。API 返回任务 ID,客户端订阅进度,用户也能取消任务。

Client -> API/Auth -> Queue -> Agent Worker -> Model/Tools
                    -> State Store / Trace / Notification

状态与幂等决定能否恢复

长任务的步骤状态、外部调用和产物位置必须持久化。Worker 重启后从 checkpoint 恢复,并通过幂等键避免重复发送、写库或扣费。超时重试要区分网络错误、业务拒绝和不可修复输入。

并发不是只加进程

模型 Provider、数据库和工具都有速率限制。系统需要按租户限流、背压、连接池和熔断。流式连接要处理客户端断开,容器编排还要设置健康检查、优雅退出和资源上限。

成本是可观测指标

记录每个任务、用户和步骤的 token、模型费用、工具费用与耗时。模型路由、缓存、批处理和上下文压缩可以降本,但必须用评测确认没有损害质量。预算超限时应降级或停止,而不是无限继续。

这章给我的启发

生产化的目标不是让 Agent 一直在线,而是让它在压力和故障下仍可控、可恢复、可计费。服务、队列、状态和观测共同构成真正的运行底座。

posted @ 2026-09-03 14:31  Hazy_star  阅读(12)  评论(0)    收藏  举报