LLM · 技术报告速读 | Kimi 系列


技术报告列表

更多参考:

个人收获总结

大家都在用 Muon 优化器了。

react,调 tool,在 agentic 场景是很重要的。

训 RL:有标准答案的问题就 RLVR,没有标准答案就 rubric + LLM as a judge。

k2.5 的 agent swarm,其实就是只训中央的那个统筹调度 agent(“指挥家”Orchestrator),训练它拆分并行任务、调 subagent 的能力。

(感觉 kimi-research 说的 end-to-end RL 会不会有些过于理想化

kimi k2

  • 预训练,改写数据(rephrasing,感觉跟 paraphrase 是一样的)。风格重写 + 多语言翻译增强。
  • MuonClip 优化器。
  • tool:千个真实 MCP 工具 + 万个 llm 生成的(?)工具,以 typescript 形式提供在 prompt 里;生成调 tool 的轨迹,让 agent 学会调 tool
  • 有标准答案的问题;没有标准答案的问题:自己生成一些回答,然后按照一套自然语言规则来排序,

kimi k2.5

  • 在 k2 的基础上,加了视觉和 agent swarm
  • 视觉:先掺入一些视觉数据进行训练;ipython 这一块
  • agent swarm:并行不是默认开启,而是学会的。在 RL 训练中,这些高难度任务不会显式地告诉模型“请并行执行”,而是通过任务本身的规模限制,让模型在探索中发现,“创建子智能体并行处理”是唯一能在规定步数(预算)内完成任务的可行路径,从而让模型自行涌现出并行策略。
    • 模型学会创造、调用、管理 subagent。
    • reward:r_parallel:create_subagent 和 assign_task 工具;r_finish:严格评估被委派的子任务是否被成功完成。它迫使编排者不仅要创造子智能体,还必须要进行有意义的任务分解和描述,确保子任务是可执行的,从而产生有效的工作成果。
    • 最终 performance reward 仍然来自于可验证的答案 / 生成式 reward model。
    • 关键步骤,借鉴计算图中的概念,是新的 metric。
  • Toggle 算法:平衡"推理质量"与"生成长度"
  • K2.5 的合成数据 pipeline 强调"按 rubric 过滤",保证每条轨迹都有学习价值

kimi-researcher

主打一个 end-to-end agentic RL。



posted @ 2026-05-15 16:46  MoonOut  阅读(73)  评论(0)    收藏  举报