摘要:
mHC_残差流形 1. 先看宏观:mHC 到底改了 Transformer 的哪里? 标准 Transformer 里,每个 Attention 或 FFN/MLP 子层外面都有一个经典残差连接: \[x_{l+1}=x_l+\mathcal{F}(x_l) \]mHC 可以理解成:用一套可学习、受 阅读全文
posted @ 2026-07-18 05:17
然皓
阅读(20)
评论(0)
推荐(0)
摘要:
> 主题:从显式 CoT 到 DiffCoT、LoopLM、Nemotron-Labs-Diffusion 与 TiDAR
> 关注问题:LLM 如何在保持生成质量的同时,获得更强推理能力、更高推理吞吐和更低错误累积。
> 阅读结论:这些论文共同指向一个趋势:未来高效推理模型不会只依赖单纯的自回归生成,而会把“思考”“草稿”“修正”“表达”拆成不同机制,再通过同一个模型或同一套训练目标统一起来。 阅读全文
posted @ 2026-07-18 05:09
然皓
阅读(9)
评论(0)
推荐(0)

浙公网安备 33010602011771号