Sina Weibo Inc. 发了篇技术报告,VibeThinker-3B,一个 3B 参数的密集模型。数字不讲道理:AIME26 拿到 94.3,比 DeepSeek V3.2(671B)的 94.2 高,比 Kimi K2.5(1T)的 93.3 高。配合 CLR 测试时扩增冲到 97.1。参数规模差距——DeepSeek V3.2 是它的 223 倍,GLM-5 是 248 倍。

看完整篇论文,真正有意思的是方法论,数字反而在其次。

Spectrum-to-Signal:先铺路再选路

延续年初 1.5B 版本的 Spectrum-to-Signal 范式。核心理念:SFT 阶段不追求单一路径的最优拟合,而是构造一个覆盖多种解法的"频谱";RL 阶段负责从中筛选和放大有效的推理信号。这个区分很关键——如果 SFT 阶段过早收敛到某一种解法模式,RL 就没有探索空间了,只能在一个局部最优附近微调。

SFT 是两阶段 curriculum。第一阶段用全量质量过滤的推理数据集做宽覆盖冷启动——global batch 128,lr 5×10⁻⁵,cosine annealing 到 8×10⁻⁸,5 个 epoch。第二阶段筛选困难样本:仅保留推理链超过 5K token 的问题,然后用 VibeThinker-1.5B 做 8 次独立 rollout,过滤掉错误率低于 0.75 的简单题,再训 2 个 epoch。这个过滤策略很干净——长链 + 高难度双重保障,确保第二阶段的数据都是真正需要深度推理的。

Diversity-Exploring Distillation 值得一提。SFT 阶段定期保存中间 checkpoint,在每个域上用 Pass@K 而非 Pass@1 或 validation loss 来选择最优 checkpoint。Pass@K 更适合评估"产生多样化解法的能力",而非"最确定的单一答案"。每个域选出不同的 specialist checkpoint,保留推理多样性。

数据合成方面,只选有可靠监督信号的种子查询做扩展。数学题必须有明确答案或解析,竞赛编程题必须附带单元测试。用强教师模型多次独立采样、majority voting 生成伪标签。seed 数据不可靠的话,RL 阶段的奖励信号会被污染,reward hacking 几乎必然。

RL 阶段用 MGPO(MaxEnt-Guided Policy Optimization),延续 1.5B 的工作。Offline self-distillation 做知识回滚,防止多领域训练中的梯度干扰。Instruct RL 阶段的构造比较严谨:用规则验证器检查格式、排序、关键词约束,同时用 rubric-based reward models 评估 helpfulness 和 coherence。推理增强后的模型如果没有同时做指令跟随训练,就会出现"会做题但不听话"的缺陷——IFEval 93.4 说明这个问题处理得不错。

CLR:精准打击式的测试时推理扩增

CLR 对完整推理链不做 self-verify,只提取链中的"claim"级逻辑锚点做可靠性加权聚合。每个独立 claim 根据与最终答案的一致性获得权重,按等价类聚类选取加权分最高的答案。相比 trace-level self-verification 需要处理整个 verbose trajectory,CLR 只处理关键断言,token 消耗少得多。8 次独立执行取平均效果稳定——AIME26 从 94.3 提到 97.1,IMO-AnswerBench 从 76.4 提到 80.6,GPQA-Diamond 从 70.2 提到 72.9。

全维度对比

带 CLR 的大模型对比:

模型 参数量 AIME26 BruMO25 IMO-Ans LCBv6
VibeThinker-3B + CLR 3B 97.1 99.2 80.6 80.2
DeepSeek V3.2 671B 94.2 96.7 78.3 80.8
GLM-5 744B 95.8 82.5 85.5
Kimi K2.5 1T 93.3 98.3 81.8 85.0
Gemini 3 Pro N/A 91.7 98.3 83.1 87.4

3B 在 AIME26 和 BruMO25 上反超千亿级模型。但在 IMO-AnswerBench 和 LCBv6 上,大模型凭借宽知识覆盖仍然占优——特别是 coding 方面,GLM-5 的 85.5 和 Gemini 3 Pro 的 87.4 高出不少,印证了 Parametric Compression-Coverage 假设:推理核可压缩,但代码库知识需要更多参数来记忆。

小模型对比(<14B,无 CLR):

模型 参数量 AIME26 LCBv6 IFEval GPQA-D
VibeThinker-3B 3B 94.3 80.2 93.4 70.2
Qwen3.5-4B 4B 84.0 62.0 89.8 76.2
Phi4-Reasoning-Plus 14B 73.6 56.8 84.9 81.9
Ministral-3-Reasoning 14B 85.0 66.0 73.9 71.2

3B 在数学和编程上遥遥领先,但 GPQA-D 上不如更大模型——Graduate-level 科学推理需要专业知识储备,这正是"参数覆盖"的领域。

Parametric Compression-Coverage 假设

论文后半段的理论框架:可验证推理(数学证明、代码正确性)可以被压缩到紧凑的推理核中,而开放域知识需要宽参数覆盖来容纳事实、概念和长尾场景。这个假设如果成立,意味着小模型的推理天花板不应该被参数量线性约束——3B 已经足够容纳推理核,瓶颈在训练策略而非模型大小。

这跟今年小模型推理的爆发趋势一致:Qwen3.5-4B Thinking、Olmo-3-Think、Phi4-Reasoning-Plus 都在指向同一个方向。我倾向认为这个假设部分成立——纯逻辑推理确实可压缩(数理逻辑的规则集有限),但"推理+知识"的任务(比如 GPQA-D)仍然需要参数规模。VibeThinker-3B 的 GPQA-D 70.2 就是一个明显短板:知识储备不够,再会推理也没用。

实际意义和局限

一张 RTX 3090(24GB VRAM)就能跑,vLLM 后端。HN 上已有用户用它做源码安全审查替代 GPT-5 Nano,还有人测试在 Taalas HC1 ASIC 上跑——如果 3B 的推理能挑战 671B,专用推理芯片的性价比空间就打开了。对本地部署场景,可以在消费级硬件上获得接近旗舰模型的推理能力,这对隐私敏感的代码审查、离线编程辅助场景是直接利好。

局限也清楚。Python 为主的训练数据让其他语言效果打折——GSlepak 在 HN 测试确认了。安全漏洞挖掘目前不如 Qwen 3.6 和 Gemma 4——SwellJoe 的 bug benchmark 测出来零检出。结构化输出不是强项(IFBench 74.5)。而且最关键:GitHub 仓库(WeiboAI/VibeThinker, 1282 星)目前只有 1.5B 的代码和权重,3B 还没 release——没有权重,所有数字只是论文里的数字。

对做本地部署推理的朋友,值得关注这个仓库的 release 动态。如果 3B 权重开源了,用 vLLM 跑起来,就真正可以在消费级显卡上验证这些数字了。

代码:https://github.com/WeiboAI/VibeThinker
论文:https://arxiv.org/abs/2606.16140