摘要: mHC_残差流形 1. 先看宏观:mHC 到底改了 Transformer 的哪里? 标准 Transformer 里,每个 Attention 或 FFN/MLP 子层外面都有一个经典残差连接: \[x_{l+1}=x_l+\mathcal{F}(x_l) \]mHC 可以理解成:用一套可学习、受 阅读全文
posted @ 2026-07-18 05:17 然皓 阅读(20) 评论(0) 推荐(0)
摘要: > 主题:从显式 CoT 到 DiffCoT、LoopLM、Nemotron-Labs-Diffusion 与 TiDAR > 关注问题:LLM 如何在保持生成质量的同时,获得更强推理能力、更高推理吞吐和更低错误累积。 > 阅读结论:这些论文共同指向一个趋势:未来高效推理模型不会只依赖单纯的自回归生成,而会把“思考”“草稿”“修正”“表达”拆成不同机制,再通过同一个模型或同一套训练目标统一起来。 阅读全文
posted @ 2026-07-18 05:09 然皓 阅读(9) 评论(0) 推荐(0)
摘要: 快速部署大模型 阅读全文
posted @ 2025-07-28 14:31 然皓 阅读(216) 评论(0) 推荐(0)
摘要: MLA的公式放在这里: \[\begin{align*} \mathbf{c}_t^{KV} &= W^{DKV}\mathbf{h}_t &(1) \\ [\mathbf{k}_{t,1}^C, \mathbf{k}_{t,2}^C, ..., \mathbf{k}_{t,n_h}^C] = \m 阅读全文
posted @ 2025-03-07 16:35 然皓 阅读(172) 评论(0) 推荐(0)
摘要: 反向传播是用来计算损失函数(Loss Function, \(L\))关于网络中各个参数的梯度的过程。这些梯度用于更新参数,从而降低损失函数的值,使网络性能更好。 \(\nabla_y L\): 这是损失函数 \(L\) 关于 \(y\) 的梯度。\(y\) 是前向传播中激活函数的输出。 \(\fr 阅读全文
posted @ 2025-02-26 11:34 然皓 阅读(281) 评论(0) 推荐(0)
摘要: 我觉得最重要的有两点: 处理变长序列的稳定性:BN是在不同样本的同一维度做归一化,因为在seq2seq的场景中,样本数量不是固定的/输入序列是变长的,使用BN会导致不稳定。LN是在同一样本的不同维度做归一化,这样会更稳定。 小批量下的鲁棒性:Batch Norm的性能受批量大小影响显著,小批量可能导 阅读全文
posted @ 2025-01-30 13:10 然皓 阅读(473) 评论(0) 推荐(0)
摘要: 对于AlphaStar 中间的LSTM部分有不解的地方,这里对一些问题和细节做出了解释 阅读全文
posted @ 2024-12-18 18:02 然皓 阅读(213) 评论(0) 推荐(0)
摘要: 在docker或linux中一劳永逸解决matplotlib中文显示问题 安装 mplfonts的安装方法是pip: $ pip install -U mplfonts 使用 安装好mplfonts之后,需要有一个初始化的配置过程 在终端执行$ mplfonts init即可。 测试 import 阅读全文
posted @ 2024-05-16 09:37 然皓 阅读(1337) 评论(0) 推荐(0)
摘要: 自动历史管理 前面的示例将消息显式地传递给链。这是一种完全可接受的方法,但确实需要外部管理新消息。LangChain还包括一个名为RunnableWithMessageHistory的包裹器,能够自动处理这个过程。 为了展示其工作原理,我们稍微修改上面的提示,增加一个最终输入变量,该变量在聊天历史记 阅读全文
posted @ 2024-05-15 17:55 然皓 阅读(2332) 评论(0) 推荐(1)
摘要: from langchain_core.output_parsers import StrOutputParser from langchain_core.runnables import RunnableParallel from langchain_openai import ChatOpenA 阅读全文
posted @ 2024-05-15 17:51 然皓 阅读(842) 评论(0) 推荐(0)