Sina Weibo Inc. 发了篇技术报告,VibeThinker-3B,一个 3B 参数的密集模型。数字不讲道理:AIME26 拿到 94.3,比 DeepSeek V3.2(671B)的 94.2 高,比 Kimi K2.5(1T)的 93.3 高。配合 CLR 测试时扩增冲到 97.1。参数规模差距——DeepSeek V3.2 是它的 223 倍,GLM-5 是 248 倍。
看完整篇论文,真正有意思的是方法论,数字反而在其次。
Spectrum-to-Signal:先铺路再选路
延续年初 1.5B 版本的 Spectrum-to-Signal 范式。核心理念:SFT 阶段不追求单一路径的最优拟合,而是构造一个覆盖多种解法的"频谱";RL 阶段负责从中筛选和放大有效的推理信号。这个区分很关键——如果 SFT 阶段过早收敛到某一种解法模式,RL 就没有探索空间了,只能在一个局部最优附近微调。
SFT 是两阶段 curriculum。第一阶段用全量质量过滤的推理数据集做宽覆盖冷启动——global batch 128,lr 5×10⁻⁵,cosine annealing 到 8×10⁻⁸,5 个 epoch。第二阶段筛选困难样本:仅保留推理链超过 5K token 的问题,然后用 VibeThinker-1.5B 做 8 次独立 rollout,过滤掉错误率低于 0.75 的简单题,再训 2 个 epoch。这个过滤策略很干净——长链 + 高难度双重保障,确保第二阶段的数据都是真正需要深度推理的。
Diversity-Exploring Distillation 值得一提。SFT 阶段定期保存中间 checkpoint,在每个域上用 Pass@K 而非 Pass@1 或 validation loss 来选择最优 checkpoint。Pass@K 更适合评估"产生多样化解法的能力",而非"最确定的单一答案"。每个域选出不同的 specialist checkpoint,保留推理多样性。
数据合成方面,只选有可靠监督信号的种子查询做扩展。数学题必须有明确答案或解析,竞赛编程题必须附带单元测试。用强教师模型多次独立采样、majority voting 生成伪标签。seed 数据不可靠的话,RL 阶段的奖励信号会被污染,reward hacking 几乎必然。
RL 阶段用 MGPO(MaxEnt-Guided Policy Optimization),延续 1.5B 的工作。Offline self-distillation 做知识回滚,防止多领域训练中的梯度干扰。Instruct RL 阶段的构造比较严谨:用规则验证器检查格式、排序、关键词约束,同时用 rubric-based reward models 评估 helpfulness 和 coherence。推理增强后的模型如果没有同时做指令跟随训练,就会出现"会做题但不听话"的缺陷——IFEval 93.4 说明这个问题处理得不错。
CLR:精准打击式的测试时推理扩增
CLR 对完整推理链不做 self-verify,只提取链中的"claim"级逻辑锚点做可靠性加权聚合。每个独立 claim 根据与最终答案的一致性获得权重,按等价类聚类选取加权分最高的答案。相比 trace-level self-verification 需要处理整个 verbose trajectory,CLR 只处理关键断言,token 消耗少得多。8 次独立执行取平均效果稳定——AIME26 从 94.3 提到 97.1,IMO-AnswerBench 从 76.4 提到 80.6,GPQA-Diamond 从 70.2 提到 72.9。
全维度对比
带 CLR 的大模型对比:
| 模型 | 参数量 | AIME26 | BruMO25 | IMO-Ans | LCBv6 |
|---|---|---|---|---|---|
| VibeThinker-3B + CLR | 3B | 97.1 | 99.2 | 80.6 | 80.2 |
| DeepSeek V3.2 | 671B | 94.2 | 96.7 | 78.3 | 80.8 |
| GLM-5 | 744B | 95.8 | — | 82.5 | 85.5 |
| Kimi K2.5 | 1T | 93.3 | 98.3 | 81.8 | 85.0 |
| Gemini 3 Pro | N/A | 91.7 | 98.3 | 83.1 | 87.4 |
3B 在 AIME26 和 BruMO25 上反超千亿级模型。但在 IMO-AnswerBench 和 LCBv6 上,大模型凭借宽知识覆盖仍然占优——特别是 coding 方面,GLM-5 的 85.5 和 Gemini 3 Pro 的 87.4 高出不少,印证了 Parametric Compression-Coverage 假设:推理核可压缩,但代码库知识需要更多参数来记忆。
小模型对比(<14B,无 CLR):
| 模型 | 参数量 | AIME26 | LCBv6 | IFEval | GPQA-D |
|---|---|---|---|---|---|
| VibeThinker-3B | 3B | 94.3 | 80.2 | 93.4 | 70.2 |
| Qwen3.5-4B | 4B | 84.0 | 62.0 | 89.8 | 76.2 |
| Phi4-Reasoning-Plus | 14B | 73.6 | 56.8 | 84.9 | 81.9 |
| Ministral-3-Reasoning | 14B | 85.0 | 66.0 | 73.9 | 71.2 |
3B 在数学和编程上遥遥领先,但 GPQA-D 上不如更大模型——Graduate-level 科学推理需要专业知识储备,这正是"参数覆盖"的领域。
Parametric Compression-Coverage 假设
论文后半段的理论框架:可验证推理(数学证明、代码正确性)可以被压缩到紧凑的推理核中,而开放域知识需要宽参数覆盖来容纳事实、概念和长尾场景。这个假设如果成立,意味着小模型的推理天花板不应该被参数量线性约束——3B 已经足够容纳推理核,瓶颈在训练策略而非模型大小。
这跟今年小模型推理的爆发趋势一致:Qwen3.5-4B Thinking、Olmo-3-Think、Phi4-Reasoning-Plus 都在指向同一个方向。我倾向认为这个假设部分成立——纯逻辑推理确实可压缩(数理逻辑的规则集有限),但"推理+知识"的任务(比如 GPQA-D)仍然需要参数规模。VibeThinker-3B 的 GPQA-D 70.2 就是一个明显短板:知识储备不够,再会推理也没用。
实际意义和局限
一张 RTX 3090(24GB VRAM)就能跑,vLLM 后端。HN 上已有用户用它做源码安全审查替代 GPT-5 Nano,还有人测试在 Taalas HC1 ASIC 上跑——如果 3B 的推理能挑战 671B,专用推理芯片的性价比空间就打开了。对本地部署场景,可以在消费级硬件上获得接近旗舰模型的推理能力,这对隐私敏感的代码审查、离线编程辅助场景是直接利好。
局限也清楚。Python 为主的训练数据让其他语言效果打折——GSlepak 在 HN 测试确认了。安全漏洞挖掘目前不如 Qwen 3.6 和 Gemma 4——SwellJoe 的 bug benchmark 测出来零检出。结构化输出不是强项(IFBench 74.5)。而且最关键:GitHub 仓库(WeiboAI/VibeThinker, 1282 星)目前只有 1.5B 的代码和权重,3B 还没 release——没有权重,所有数字只是论文里的数字。
对做本地部署推理的朋友,值得关注这个仓库的 release 动态。如果 3B 权重开源了,用 vLLM 跑起来,就真正可以在消费级显卡上验证这些数字了。
代码:https://github.com/WeiboAI/VibeThinker
论文:https://arxiv.org/abs/2606.16140
浙公网安备 33010602011771号