Prime Agent:把上下文当变量、会自我改进的开源 Agent
Agent 干长活时最大的敌人不是模型不够聪明,而是上下文窗口:文件越读越多,历史越滚越长,模型开始"忘记"最初的任务目标——这就是被反复验证过的 context rot。主流编码 Agent 的解法是把状态外置到文件系统,再定期用摘要压缩历史;而 Prime Intellect 给出了一个更激进的答案:让模型自己用 Python 管理上下文。他们开源的 Prime Agent 把这套思路做成了产品级 harness,上线五个月拿下 21.6k stars,并附有一篇论文:在 ARC-AGI-3 的 RHAE 评测里,同一个模型换上这个 harness,Best@1 从 30% 直接拉到 95.5%。
本文结构:
- RLM:把 prompt 当变量
- Prime Agent 是什么
- Continual Harness:会自我改进的外壳
- 为长任务而生的工程细节
- 成绩单:30% 到 95.5%
- 上手与生态
一、RLM:把 prompt 当变量
Recursive Language Model(RLM)由 Alex Zhang 在 2025 年 10 月的博客中提出(后扩展为论文 arXiv 2512.24601),核心思想一句话就能说完:不要把输入数据塞进上下文窗口,而是把它作为变量放进一个持久的 Python REPL,让模型按需检索、变换、裁剪,而不是全量阅读。
Prime Intellect 在今年初的博客《Recursive Language Models: the paradigm of 2026》里把这套机制讲得很透。他们的 RLM 实现有几个关键设计:
- 输入不进上下文:prompt 本身进入模型上下文,而附加数据(可能是几百页 PDF、整个数据集)只能通过在 REPL 里写代码来查看。REPL 每回合输出默认截断到 8192 字符,模型想"读完一切"在物理上不可行,只能写代码检索。
- 工具只给子 LLM 用:主模型保持精简,搜索、打开网页这类动辄吐出几万 token 的工具全部下沉到子 LLM 执行,主上下文只收回摘要。
llm_batch支持并行派发一批子任务。 - 答案写在变量里:rollout 开始时初始化
answer = {"content": "", "ready": False},模型在整个推理过程中可以反复修改answer["content"],类似"扩散式"地打磨最终答案,只有显式设置answer["ready"] = True才算交付。
这套设计与 The Bitter Lesson 的方向一致:scaffolding 不再是冻结的提示词工程,而是可以与 RL 训练端到端结合的能力——模型学会管理自己的上下文,而不是被外部脚手架代劳。
二、Prime Agent 是什么
Prime Agent 是 Prime Intellect 开源的 coding 与 research agent,定位是"self-improving RLM harness"——一个可以长期自主运行、并且能从经验中改进自己的 Agent 外壳。仓库用 Rust 写成,MIT 协议,工程结构相当清晰,是一个标准的 Cargo workspace:
crates/
├── pa-cli # 命令行入口
├── pa-tui # 终端界面
├── pa-agent # Agent 核心逻辑
├── pa-core # 基础设施
├── pa-daemon # 后台守护进程
├── pa-ai # 模型接入
├── pa-models # 数据模型
├── pa-telemetry # 遥测
└── pa-types # 共享类型
运行时模型面对的是一个持久化的 IPython REPL——文件操作、shell 命令、工具调用、上下文管理全部通过写代码完成。子 Agent 也不是提示词里的角色扮演,而是真实的进程:rlm.spawn(...) 会拉起真正的 child agent 去做并行或后台工作,结果以编程方式返回。
论文对它的定位说得很好:harness 负责"标准化的执行、恢复、验证与资源核算",把策略留给模型。这层低摩擦、高表达力的"膜",让 harness 的失败不再被误判为模型的失败——评测才能逼近模型真实能力的上限。
三、Continual Harness:会自我改进的外壳
Prime Agent 的第二个核心抽象叫 Continual Harness(对应论文 arXiv 2605.09998):把补充性提示、记忆、技能描述、可复用的子 Agent 规格当作持久状态存下来,并通过小步、有证据支撑的更新持续打磨。
操作入口是 /refine:它回看当前轨迹,把值得沉淀的经验写成新的补充 prompt、memory 或技能描述。三条护栏值得注意——它永远不会改写不可变的基础 system prompt;每次更新都有记录(snapshot 可回滚);默认只作用于当前会话,不会污染全局。
技能(skills)在这里是可导入的 Python 包,内置的 skill creator 可以把重复出现的工作流固化成项目级或个人级技能。这和"记忆"形成了互补:记忆保存事实,技能保存流程。
四、为长任务而生的工程细节
Prime Agent 在"活过终端断开"这件事上做得相当彻底,这也是它区别于一般 TUI Agent 的地方:
- daemon 常驻:会话、REPL 状态、调度、子 Agent 都由后台守护进程托管,终端断开不影响运行,随时
prime-agent attach重新接管。配套的agents、status、doctor --fix命令组成一套服务运维工具。 - 心跳与调度:
/heartbeat和prime-agent schedule可以让会话周期性或在指定时间被重新唤起,适合"挂机跑评测、定时汇报"的场景。 - 持久目标:
/goal让一个目标及其进度跨回合保持活跃,直到完成、暂停或清除。 - 有界自主模式:
/autonomous在配置好的回合数、token 和时间预算内持续推进,并支持用户自定义 quality gate。论文里特别诚实地注明:通过某个 gate 只代表 gate 检查的内容成立,达到预算上限不等于任务成功。 - Agent 直接通信:运行中的 Agent 与保留的子 Agent 可以互相发现、互发消息、互相指挥,不必把所有协调都绕回用户这里。
MERMAID_BLOCK_0
一个值得反复强调的安全提醒:Prime Agent 以你的用户权限执行模型生成的 Python 和项目命令,它的 worker 与 kernel 进程改善的是生命周期隔离与恢复,不是安全沙箱。官方建议在一次性 clone 或干净 worktree 里运行,不受信的代码请放到外部沙箱。
五、成绩单:30% 到 95.5%
论文给出的核心数字是在 ARC-AGI-3 的 RHAE 评测中,Best@1 从 30% 提升到 95.5%——模型没换,换的是 harness。其他基准上,它在长上下文编码、GPU kernel 生成、模拟器构建、自主 nanoGPT speedrun 等任务中持平或超过原生与流行的 harness。
更有意思的是 Factorio 实验里的两个观察:refinement 让智能体实现了持续的技术树推进(改进沉淀下来,越玩越强),而专职子 Agent 让工作得以并行铺开。这两点恰好分别验证了 Continual Harness 和 RLM 子 Agent 两个抽象的实际价值。
六、上手与生态
安装一条命令:
curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh
Windows 走 PowerShell 安装脚本(目前是 beta 渠道)。装完在项目目录运行 prime-agent,首次启动用 /login 选择订阅或 API key 供应商。常用命令一览:
prime-agent agents # 浏览运行中、空闲与已保存的会话
prime-agent attach <agent> # 重新接管一个会话
prime-agent --resume # 浏览或恢复历史会话
prime-agent doctor --fix # 检查并修复后台服务
prime-agent shutdown # 停掉所有 agent 与后台服务
生态上,Prime Agent 是 Prime Intellect 三件套的一环:verifiers 提供环境与 RLM 脚手架(Environments Hub 上已有一批 RLM 环境可直接用),prime-rl 负责训练,Prime Agent 则把 RLM 带进日常编码与研究工作流。他们的下一步也写在博客里:在奖励"有效长程推理"的环境上用 RL 直接训练 RLM 脚手架——如果这条线跑通,"模型自己管理上下文"就不只是一种 harness 设计,而是一种被训练出来的能力。
对纠结于上下文管理的 Agent 开发者来说,Prime Agent 值得放进观察名单:它可能是第一个把 "prompt-as-a-variable" 从论文带进日常终端的产品级实现。
作者: itech001
来源: 公众号:AI人工智能时代(the-ai-era)
网站: https://www.theaiera.top/
关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top
本文首发于 AI人工智能时代,转载请注明出处。

浙公网安备 33010602011771号