摘要:
前言 本文介绍了新加坡国立大学在2022 aaai发布的一篇论文。WideNet是一种参数有效的框架,它的方向是更宽而不是更深。通过混合专家(MoE)代替前馈网络(FFN),使模型沿宽度缩放。使用单独LN用于转换各种语义表示,而不是共享权重。 本文转载自DeepHub IMBA 仅用于学术分享,若侵 阅读全文
posted @ 2023-07-05 18:52
CV技术指南(公众号)
阅读(110)
评论(0)
推荐(0)
浙公网安备 33010602011771号