大模型生成文本的方式,过去几年几乎是清一色的自回归——从左到右,一个 token 一个 token 往外蹦。Google DeepMind 新发布的 DiffusionGemma 推翻了这个假设:它把图像生成那套扩散(diffusion)玩法搬到了文本上,一次生成一整块输出。
这篇文章说的是技术原理,不说废话。
自回归 vs 扩散
你用的 GPT、Claude、Llama,全是自回归的。生成一个 token 要看前面所有的 token,顺序执行没法并行。所以推理延迟跟输出长度成正比——写一篇 1000 字的文章,再怎么优化也得跑 1000 步。
DiffusionGemma 完全换了个思路。它借鉴了 Stable Diffusion:先弄一堆占位 token(相当于随机噪声),然后在画布(text canvas)上多次迭代,每次用已经确定的 token 去修正那些还没确定的。最后迭代完,整块文本同时定型。
打个比方:自回归是你一个字一个字写一封信,写一个字才能看下一个字。扩散是你先印一整页模糊的乱码,然后反复调整,每次清晰一点,最后整页同时清晰。
模型规格
| 参数 | 值 |
|---|---|
| 架构 | MoE(Mixture of Experts) |
| 总参数量 | 26B |
| 激活参数量 | 3.8B |
| 推理显存需求 | ~18GB(一块高端游戏卡够用) |
| 推理加速 | 相比同尺寸自回归模型快 4x |
| 开源 | ✅ Gemma 4 家族,Apache 2.0 |
| 硬件支持 | Nvidia DGX / 消费级 GPU |
26B 总参数但只激活 3.8B,这个 MoE 比例(~6.8:1)跟 DeepSeek V2 那种激进比例类似。好处是显存友好——一块 RTX 4090(24GB)或者 RTX 5090 轻松跑。
4x 加速从哪来
加速的核心就一个词:并行。
自回归模型生成 N 个 token 需要 N 步,每一步都是一次完整的前向传播。DiffusionGemma 可以在几步(论文中提到通常 4-8 步)内完成整个序列的生成。所以理论加速比就是 N / steps。
举个例子:生成 1024 个 token。
- 自回归:1024 步
- DiffusionGemma:假设 8 步
- 加速比:128x(理论)
实际受内存带宽、注意力计算等因素影响,Google 报告的实测是 4x。3000 个 token、8 步迭代就能完成,自回归得跑 3000 步。这个差距在长文本场景下会越来越大。
一个被低估的细节:推理总参数量
DiffusionGemma 总参数 26B,激活 3.8B。这意味着你在推理时需要把 26B 参数全部加载到显存里,只不过每次推理只计算其中 3.8B。所以显存需求看的是总参数(26B × 2 字节 = 52GB FP16),而不是激活参数。
等等,那 18GB 显存怎么来的?显然是用了量化。INT4 量化后 26B → ~13GB,加上 KV cache 和其他开销,18GB 很合理。也就是说你要跑 DiffusionGemma,一张 RTX 4090(24GB)或者 RTX 5090(32GB)是必需品。
DiffusionGemma 能干什么
论文给出的基准测试覆盖了:
- 文本补全:给定开头,一次生成完整后续
- 文本填充:类似 BERT 的掩码填充,但规模大得多
- 条件生成:给定特定条件,生成符合约束的文本
- 快速原型:需要快速迭代文案或代码草稿的场景
需要注意的是,这不是一个聊天模型,也不是一个指令跟随模型。它更像是一个文本生成引擎——你给它一段上下文,它给你输出一段补全。Google 没说它适合做对话或 agent 任务。
开发者视角
DiffusionGemma 让我最感兴趣的不是 4x 加速本身,而是它证明了非自回归文本生成这条路是走得通的。
过去几年,业内默认文本生成只能是自回归的。偶尔有非自回归的尝试(比如早期的 Masked Language Model 和部分非自回归翻译模型),但效果始终追不上自回归。DiffusionGemma 是第一个在实用规模上做到可比的非自回归文本模型。
这对本地部署场景尤其有意义。自回归模型的推理延迟在低算力设备上是个硬伤——你不可能让一个 Agent 在手机上跑 200 步自回归生成。扩散模型因为步数固定(且远少于自回归的步数),延迟可预测性更好。
实际使用建议
如果你是在消费级 GPU 上跑推理,DiffusionGemma 值得一试:
- 量化是关键:26B 全参数需要 INT4 才能塞进 24GB 显存
- 框架选择:推荐 vLLM(已支持扩散模型推理)或 Hugging Face Transformers(最新版已集成)
- 场景匹配:适合批量文本生成、代码补全、文案生成,不适合多轮对话
- 加速收益:在长文本(>512 tokens)场景下收益最明显
Google 把 DiffusionGemma 放进了 Gemma 4 家族,Apache 2.0 协议,意味着商用和二次开发都没有障碍。
个人看法
说 DiffusionGemma 能取代自回归模型还为时过早。对话任务、agent 任务、需要严格因果关系的任务——这些场景自回归仍然有不可替代的优势。
但它打开了一扇门。非自回归文本生成在工业界第一次有了可用的基线。下一步很可能是扩散 + 自回归的混合架构:扩散先生成草稿,自回归再精修。类似图像生成里的「扩散 → 超分辨率」流水线。
Google 这手棋下得有点意思。所有人都在卷自回归模型的规模和上下文长度时,DeepMind 选择回头审视推理效率本身。有时候方向真比速度重要。
参考:Ars Technica — Google's latest DiffusionGemma open AI model comes with a 4x speed boost(FreshRSS 缓存)
浙公网安备 33010602011771号