LLM · 技术报告速读 | Kimi 系列
技术报告列表
- kimi k2:https://arxiv.org/html/2507.20534v2
- kimi k2.5:https://arxiv.org/html/2602.02276v1
- Kimi-Researcher:
更多参考:
- 知乎 | Kimi 发布并开源 K2.5 模型,哪些信息值得关注?Agent 集群能力能做哪些任务?
- 感觉里面回答质量都很高。
个人收获总结
大家都在用 Muon 优化器了。
react,调 tool,在 agentic 场景是很重要的。
训 RL:有标准答案的问题就 RLVR,没有标准答案就 rubric + LLM as a judge。
k2.5 的 agent swarm,其实就是只训中央的那个统筹调度 agent(“指挥家”Orchestrator),训练它拆分并行任务、调 subagent 的能力。
(感觉 kimi-research 说的 end-to-end RL 会不会有些过于理想化
kimi k2
- 预训练,改写数据(rephrasing,感觉跟 paraphrase 是一样的)。风格重写 + 多语言翻译增强。
- MuonClip 优化器。
- tool:千个真实 MCP 工具 + 万个 llm 生成的(?)工具,以 typescript 形式提供在 prompt 里;生成调 tool 的轨迹,让 agent 学会调 tool
- 有标准答案的问题;没有标准答案的问题:自己生成一些回答,然后按照一套自然语言规则来排序,
kimi k2.5
- 在 k2 的基础上,加了视觉和 agent swarm
- 视觉:先掺入一些视觉数据进行训练;ipython 这一块
- agent swarm:并行不是默认开启,而是学会的。在 RL 训练中,这些高难度任务不会显式地告诉模型“请并行执行”,而是通过任务本身的规模限制,让模型在探索中发现,“创建子智能体并行处理”是唯一能在规定步数(预算)内完成任务的可行路径,从而让模型自行涌现出并行策略。
- 模型学会创造、调用、管理 subagent。
- reward:r_parallel:create_subagent 和 assign_task 工具;r_finish:严格评估被委派的子任务是否被成功完成。它迫使编排者不仅要创造子智能体,还必须要进行有意义的任务分解和描述,确保子任务是可执行的,从而产生有效的工作成果。
- 最终 performance reward 仍然来自于可验证的答案 / 生成式 reward model。
- 关键步骤,借鉴计算图中的概念,是新的 metric。
- Toggle 算法:平衡"推理质量"与"生成长度"
- K2.5 的合成数据 pipeline 强调"按 rubric 过滤",保证每条轨迹都有学习价值
kimi-researcher
主打一个 end-to-end agentic RL。

浙公网安备 33010602011771号