会员
众包
新闻
博问
闪存
赞助商
HarmonyOS
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
gongzb
博客园
首页
新随笔
联系
订阅
管理
2025年10月21日
DeepSeek-MOE原理讲解
摘要: MOE是Mixture of Experts的缩写,也就是混合专家模型。 在预训练一个大模型时,如果你首先设定一个期望损失,也就设定你期望的模型表现效果,那么增大模型的参数量,在达到相同的期望效果时,花费的训练代价会更少,但是在推理阶段时,更大参数量的模型花费会更大。训练只有一次,但是推理是无数次的
阅读全文
posted @ 2025-10-21 17:22 有何m不可
阅读(23)
评论(0)
推荐(0)
公告