谷歌“封神”论文变“学术塌房”?AI Infra周报:一篇论文蒸发900亿市值,还带崩了存储股

AI Infra 周刊|第 1 期

2026.03.28–04.03

算力·芯片·集群·数据中心·网络·工程效率


一、全球巨头算力军备竞赛

  1. 03.28 | 微软接管OpenAI德州数据中心项目

微软正式接手OpenAI放弃的超大规模AI数据中心,该项目位于美国德克萨斯州奥斯汀市,原本由OpenAI牵头规划建设,因算力布局调整主动放弃。此次接手后,微软将投入额外资金升级数据中心硬件配置,重点支撑OpenAI GPT-5模型训练与Azure云全球推理服务,后续将逐步扩容至10吉瓦供电规模,适配千亿、万亿参数大模型的规模化部署需求,进一步巩固自身在全球AI算力领域的领先布局优势。

📘 Infra 小科普

巨头接手同类项目,核心是快速补齐算力布局短板,避免基础设施重复建设,同时绑定核心合作伙伴(如OpenAI),实现算力资源与模型生态的双向赋能。

  1. 03.30 | Mistral AI获8.3亿美元债务融资,加码欧洲算力布局

欧洲AI独角兽Mistral AI获得由高盛牵头的8.3亿美元债务融资,融资资金将全部用于采购1.38万块英伟达GB300芯片,在巴黎近郊建设大型AI数据中心,该中心规划供电规模达1.2吉瓦,计划2026年二季度正式投运。此举旨在争夺欧洲区域算力话语权,降低对美系云厂商的算力依赖,同时为Mistral Large 2模型的迭代与商业化落地提供专属算力支撑,预计投运后可满足欧洲超30%的中小企业AI推理算力需求。

📘 Infra 小科普

债务融资是AI初创企业采购高端GPU、搭建算力基础设施的常用方式,可缓解现金流压力,快速完成算力储备,适配大模型迭代与商业化落地需求。

  1. 04.01 | 微软计划2026-2029年投入55亿美元扩建全球 AI 数据中心

微软计划在2026至2029年间投资55亿美元扩展新加坡的云计算和人工智能基础设施。该投资包括为超20万名高等教育学生提供免费Microsoft 365 Premium和Copilot访问权限,推出多项教育和培训计划。微软还将在新加坡设立研究实验室,专注开发医疗、金融和物流等关键领域的AI应用,并与新加坡保健集团合作开发精准医疗AI能力,助力新加坡巩固全球数字中心地位。

📘 Infra 小科普

AI 数据中心与传统数据中心核心差异:单机柜功率更高、互联带宽更大、GPU/TPU 占比极高,更像“专用超算工厂”。


二、芯片与硬件基础设施

  1. 04.03 | 韩国FuriosaAI量产RNGD推理芯片

韩国AI芯片企业FuriosaAI宣布,旗下RNGD推理芯片正式量产,该芯片采用7纳米工艺,主打高性价比AI推理场景,单卡功耗仅150W,其能效为英伟达RTX Pro 6000的2.2–7.4倍,支持多模型混部与动态算力调度。2026年产能计划达2万颗,主要面向终端设备、中小规模AI集群客户,定价仅为同性能英伟达芯片的60%,可有效降低中小厂商的算力部署成本,填补终端、中小集群的推理算力缺口。

📘 Infra 小科普

推理芯片的核心竞争力在于“能效比”,高性价比推理芯片可降低中小厂商的算力部署成本,填补终端、中小集群的推理算力缺口,推动AI推理场景的规模化落地。


三、网络与高速互联

  1. 03.31 | 英伟达20亿美元投资Marvell,推进CPO硅光子技术

英伟达宣布投资20亿美元与Marvell达成战略合作,双方将围绕NVLink Fusion平台联合开发硅光子技术(CPO核心),重点突破1.6T硅光模块封装与高速互联技术,大幅提升数据中心内部带宽,将单链路带宽提升至1.6Tbps,破解大模型分布式训练中的数据传输瓶颈。此次合作将为EB级算力集群的搭建奠定基础,适配万亿参数大模型分布式训练的高带宽需求,预计2027年实现该技术的规模化应用,可降低数据中心互联成本30%以上。

📘 Infra 小科普

CPO(共封装光学)技术是AI集群高速互联的核心,可将光模块与芯片封装在一起,减少信号损耗,提升传输带宽与效率,是下一代超大规模AI集群的标配技术。


四、AI 软件基础设施与工程效率

  1. 03.28 | 谷歌发布TurboQnt内存压缩技术

谷歌通过Google Research官方渠道发布TurboQnt内存压缩技术,该技术采用自适应无损压缩算法,可实现AI推理内存占用无损压缩6倍,在H100芯片上推理速度提升8倍,延迟降低40%。其核心优势是无需修改模型代码,可直接适配主流大模型框架,可推动千亿参数大模型在普通手机、边缘设备等终端本地运行,大幅提升AI工程部署效率,降低终端算力门槛,目前已开放技术开源接口,供行业厂商适配应用。

📘 Infra 小科普

内存压缩技术是推理侧工程效率优化的核心方向,可在不增加硬件投入的前提下,提升显存利用率,降低大模型部署成本,适配端侧、边缘侧等算力有限的场景。


五、AI Infra 重磅八卦

谷歌 TurboQuant 论文:封神 → 炸存储股 → 被指抄袭 → 学术塌房

03.28–03.29 | 谷歌 KV 量化论文引爆千亿市场,旋即陷入抄袭丑闻

  • 03.28 技术发酵:谷歌 ICLR 2026 论文 TurboQuant 持续发酵,其宣称的“无损、免训练,KV 缓存压缩至 1/6、推理速度提升 8 倍”引发行业关注,此前 03.26 发布后已导致全球存储股震荡。

  • 市场余波:美光、西部数据、SK 海力士等存储巨头市值仍在持续波动,累计蒸发超 900 亿美元,凸显 AI Infra 技术突破对资本市场的巨大影响。

  • 03.29 持续反转:苏黎世联邦理工(ETH)华人博士后 高健扬 持续发声,补充证据证明谷歌团队刻意规避引用其 2024 年开源算法 RaBitQ,且实验数据存在刻意美化、无据贬低RaBitQ理论最优性的情况。

  • Infra 本质:KV 缓存优化是推理侧最核心内存/成本瓶颈,直接决定万卡集群规模、HBM 需求与云厂商成本结构,也是当前 AI Infra 竞争的核心赛道之一。

📘 八卦小科普

这篇论文本来是谷歌秀 AI Infra 降本神技,结果变成学术伦理大瓜,还带崩千亿市值,是 2026 年 AI Infra 最出圈、最有话题度的事件,也反映出推理侧 Infra 技术的竞争激烈程度。


六、本周 AI Infra 核心趋势

从本周新闻来看,AI Infra 领域呈现三大核心趋势:

  1. 大厂抢算力不拼规模了,主打区域深耕 + 绑定生态
    微软一边接盘美国的算力中心支撑 OpenAI 大模型,一边砸钱布局新加坡的基建,还联动当地教育、医疗做落地;欧洲企业也自建算力中心,不想再依赖美国的云厂商。大厂的算力布局不再只追求建得大,而是盯着各个区域做深耕,还和当地生态、合作方绑在一起,让算力能真正服务于本地需求。

  2. 软硬件一起发力,核心就是让 AI 推理更省钱、门槛更低
    硬件上出了高性价比的推理芯片,比如韩国这款芯片,能效比比英伟达高不少,价格还便宜 4 成,中小厂商用着更划算;软件上谷歌搞了内存压缩技术,不用额外加硬件,就能让大模型在普通手机、边缘设备上跑,推理的部署成本和门槛都降了。不管硬件还是软件,都是冲着推理侧的降本增效来的。

  3. 核心技术卡位成关键,高速互联和内存优化是两大重点
    现在行业竞争不只是比谁买的硬件多,更是比谁能攻克核心技术。英伟达和伙伴联手搞高速互联技术,解决大模型训练时的数据传输慢问题,能支撑更大规模的算力集群;谷歌则聚焦内存优化,解决推理时的显存不够用难题。这两个技术一个决定了大模型训练的上限,一个决定了推理落地的效率,成了大家争抢的核心赛道。


七、一个 AI Infra 干货科普

KV Cache 到底是什么?为什么它是 AI 推理 Infra 的核心?

KV Cache,也就是键值缓存,是大模型推理环节中用来节约算力、降低延迟的关键底层组件,也是近期谷歌相关论文引发行业热议的核心议题。
简单来说,大模型在逐词生成文本时,会将每一个历史 token 对应的特征 Key 与语义信息 Value 临时缓存起来。当继续生成新 token 时,系统无需重复计算全部历史序列,直接复用缓存中的 KV 数据即可完成推理。

它的核心价值主要体现在两点:

  • 一是显著降低推理延迟,避免大量重复计算,在长文本生成、多轮对话等场景下速度提升尤为明显;

  • 二是有效节省算力资源,减轻 GPU 计算与显存压力,在一定程度上优化集群功耗与硬件投入成本。

也正因如此,谷歌 TurboQuant 论文才会在行业内引发强烈关注。该研究提出可将 KV Cache 实现近乎无损的 1/6 压缩,这意味着同等显存条件下,可支持更长文本序列或更高并发推理,直击当前 AI 推理最突出的显存瓶颈,对基础设施的成本优化具有重要意义。

顺带一提,KV Cache 本身就是当前推理端基础设施优化的核心方向。除了量化压缩,缓存复用、动态调度等技术也在持续落地,行业的共同目标都是在保证模型效果的前提下,进一步提升硬件效率、降低部署成本。

posted @ 2026-04-03 16:11  九章智算云  阅读(57)  评论(0)    收藏  举报