会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
SHICENT
永远不要停下前进的脚步
博客园
首页
新随笔
联系
订阅
管理
上一页
1
2
3
4
5
6
···
13
下一页
2026年5月1日
从 Ring Attention 到 DeepSpeed Ulysses,再到 USP 统一框架
摘要: 技术日报 2026-04-10 今日主题:序列并行全景深度解析 ——从 Ring Attention 到 DeepSpeed Ulysses,再到 USP 统一框架 彻底搞懂超长上下文训练的"第四维并行" 目录 技术背景:为什么需要序列并行? 核心挑战:注意力的平方诅咒 Ring Attention
阅读全文
posted @ 2026-05-01 23:39 SHICENT
阅读(277)
评论(0)
推荐(0)
2026年4月9日
TriAttention:基于三角级数的高效长推理 KV 压缩
摘要: 论文日报 2026-04-07 精选论文 TriAttention:基于三角级数的高效长推理 KV 压缩 字段 内容 标题 TriAttention: Efficient Long Reasoning with Trigonometric KV Compression arXiv 2604.0492
阅读全文
posted @ 2026-04-09 01:47 SHICENT
阅读(341)
评论(0)
推荐(0)
Apriel-Reasoner: RL Post-Training for General-Purpose and Efficient Reasoning
摘要: 论文日报 2026-04-03 今日精选论文 Apriel-Reasoner: RL Post-Training for General-Purpose and Efficient Reasoning arXiv ID: 2604.02007 发布日期: 2026-04-03 作者: Rafael
阅读全文
posted @ 2026-04-09 01:46 SHICENT
阅读(119)
评论(0)
推荐(0)
注意力机制统一理论 × MoE芯片加速 × 预训练数据科学化
摘要: 论文日报 2026-04-01 精选论文 Tucker Attention:近似注意力机制的统一广义框架 论文信息 字段 内容 标题 Tucker Attention: A generalization of approximate attention mechanisms 作者 Timon Kle
阅读全文
posted @ 2026-04-09 01:45 SHICENT
阅读(89)
评论(0)
推荐(0)
Speculative Decoding(推测解码/投机推断)深度全景解析
摘要: 技术日报 2026-04-01 今日主题:Speculative Decoding(推测解码/投机推断)深度全景解析 摘要 Speculative Decoding(推测解码,又称投机推断/投机解码)是当前 LLM 推理加速领域最重要的技术范式之一。它通过"小模型快速起草 + 大模型并行验证"的两阶
阅读全文
posted @ 2026-04-09 01:43 SHICENT
阅读(1604)
评论(0)
推荐(0)
ReVal:首个基于贝尔曼更新的异策略价值函数 RL 方法用于大语言模型训练
摘要: 论文日报 2026-03-30 今日精选 ReVal:首个基于贝尔曼更新的异策略价值函数 RL 方法用于大语言模型训练 基本信息 字段 内容 论文标题 Off-Policy Value-Based Reinforcement Learning for Large Language Models ar
阅读全文
posted @ 2026-04-09 01:43 SHICENT
阅读(63)
评论(0)
推荐(0)
KV Cache 优化全景解析——从基础原理到工程实践
摘要: 技术日报 2026-03-30 今日主题:KV Cache 优化全景解析——从基础原理到工程实践 📋 目录 技术背景:为什么 KV Cache 是推理瓶颈核心 KV Cache 基础原理:Prefill vs Decode 注意力机制演进:MHA → MQA → GQA 系统级优化:PagedAt
阅读全文
posted @ 2026-04-09 01:42 SHICENT
阅读(2551)
评论(0)
推荐(1)
Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models
摘要: 论文日报 2026-03-29 精选论文 《Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models》 将推理时搜索内化到模型——多答案强化学习新范式 基本信息 字段 内容 论文标题 Reaching B
阅读全文
posted @ 2026-04-09 01:41 SHICENT
阅读(60)
评论(0)
推荐(0)
NCCL 与 AllReduce —— 分布式训练通信的基石
摘要: 技术日报 2026-03-29 一、为什么今天聊 NCCL? 随着大模型训练规模从 7B 到 70B 再到数千亿参数不断扩展,单卡早已无法承载完整的训练任务。我们需要把梯度、参数、激活值在数百乃至数千块 GPU 之间来回同步——而每一次同步的背后,都有 NCCL (NVIDIA Collective
阅读全文
posted @ 2026-04-09 01:41 SHICENT
阅读(611)
评论(0)
推荐(0)
SliderQuant: Accurate Post-Training Quantization for LLMs
摘要: 论文日报 2026-03-27 🏆 今日精选论文 SliderQuant: Accurate Post-Training Quantization for LLMs 🏅 收录会议:ICLR 2026(已接受) 属性 详情 论文标题 SliderQuant: Accurate Post-Train
阅读全文
posted @ 2026-04-09 01:39 SHICENT
阅读(79)
评论(0)
推荐(0)
上一页
1
2
3
4
5
6
···
13
下一页
公告