AI 技术日报 - 2026-09-05
AI 技术日报 - 2026-09-05
Top 10 AI 技术要闻
- 英伟达 129.3 亿美元收购 Hugging Face,承诺保持开源独立运营
英伟达正式确认以约 129 亿美元收购被誉为"AI 界 GitHub"的开源模型平台 Hugging Face,并承诺将保持其开放与中立。这是 AI 基础设施领域迄今最大规模的并购之一:Hugging Face 托管了全球绝大多数开源模型权重、数据集与 Spaces 应用,是开源 AI 生态的事实中心。交易的核心看点在于英伟达能否在把 HF 纳入 CUDA 生态(模型一键部署到 DGX/RTX、与 NIM 推理服务打通)的同时,维系开发者社区的信任——HF CEO 强调平台将继续支持 AMD ROCm、Google TPU 等非英伟达硬件。对开发者而言,短期模型下载、Transformers/Diffusers 等工具链不受影响;长期则需关注开源模型托管渠道的多元化(ModelScope、Ollama 仓库等)以降低单一平台依赖风险。
链接:https://arstechnica.com/ai/2026/09/nvidia-buys-hugging-face-the-github-of-ai-for-13-billion
- IFM 发布 K2 Horizon:6 款模型全生命周期开源,小尺寸档位刷新 SOTA
基础模型研究所(IFM)发布 K2 Horizon 模型舰队,涵盖 0.9B、3.7B、7B、32B、36B-A4B(MoE)和 375B-A23B(MoE)六个尺寸,全部以 Apache 2.0 开放权重,并史无前例地开放完整训练生命周期:预训练到推理/Agent 后训练的中间检查点、训练数据或数据构建配方、混合比例、训练代码、配置、细粒度日志和评测结果。0.9B/3.7B/7B 三个小模型在各自尺寸档位的数学、推理、编码和 Agentic 任务上达到世界领先水平(0.9B 的 AIME 2026 得分超过 48);36B-A4B 采用全新 MoVA(Mixture-of-Value-Attention)稀疏注意力机制,每 token 仅激活约 4B 参数却逼近稠密 32B 性能。这是首个把 Agent 能力如何"训练出来"完整公开的模型族,对研究 Agent 后训练复现、端侧部署(手表/眼镜到企业服务器)的团队价值极高。
链接:https://ifm.ai/blog/k2
- 英伟达开源 PAIR:把局域网内的 Mac、RTX PC、DGX Spark 拼成个人 AI 算力池
英伟达以开源测试版形式推出 Personal AI Router(PAIR),一款局域网本地 AI 请求调度软件。它可在 M4 及以上 Mac、RTX PC 和 DGX Spark 上运行,自动发现配对设备,为 Ollama、LM Studio 等本地推理工具提供统一入口,把独立的 AI 请求分派给空闲机器;某台设备繁忙或离线时自动转移请求。官方演示中,5 个子 Agent 并行审阅文档的任务在 RTX Spark 笔记本单机上平均耗时 18 分钟,加入 DGX Spark 和 RTX 5090 后缩短到 8 分 48 秒。注意它解决的是并发负载分担而非单次请求加速。对家庭/小团队有多台算力设备、又不想上云的开发者,PAIR 提供了一个零成本的"穷人版推理集群"方案,模型仍在各设备本地运行,数据不出局域网。
链接:https://www.ithome.com/0/998/229.htm
- 谷歌 DeepMind 发布 WeatherNext 3:5 公里分辨率、逐小时更新的 AI 气象模型
谷歌 DeepMind 与 Google Research 推出 WeatherNext 3,号称当前最先进精准的全球气象模型。它直接接入实时地球静止卫星拼图数据,每小时生成一次新预报:温度、湿度等地表变量分辨率达 5 公里,其他地表变量 10 公里,风速等大气变量 25 公里,并在不同尺度间保持物理一致性。模型用稀疏气象站观测数据训练,使拉美、非洲、亚太等传统上缺乏高分辨率区域预报的地区也能获得 5 公里网格预报。此外还专门针对可再生能源新增 100 米高度风速(对应风机高度)、高分辨率云量与太阳辐射预测,可直接服务风电/光伏发电量估算。该模型即日起支撑谷歌搜索、Gemini、地图及 Earth Engine。
链接:https://www.ithome.com/0/998/198.htm
- 谷歌六周内连发三款 Flash:Gemini 3.8 Flash 登顶 DeepSWE,新增 Cyber 安全变体
谷歌发布 Gemini 3.8 Flash,这是六周内的第三个 Flash 版本,官方称其为迄今最好的推理与编程模型,登顶 DeepSWE 排行榜。模型分两个变体:标准版定位"主力干活模型",覆盖 Agentic 任务到软件开发;Gemini 3.8 Flash Cyber 在同一基座上面向漏洞检测与缓解做了专项调优,目前仅向可信测试者和政府开放。API introductory 优惠价为每百万输入 token 0.75 美元、输出 3.75 美元(年底前),常规价 1.50/7.50 美元。如此密集的 Flash 迭代节奏,反映出谷歌在用小模型低价策略争夺 Agent 工作负载市场——对成本敏感的大规模 Agent 应用,Flash 档模型的性价比竞争已进入白热化。
链接:https://tech.slashdot.org/story/26/09/03/1557237/google-releases-gemini-38-flash-its-third-flash-model-in-six-weeks
- 微软发布 MAI-Transcribe-2 语音识别模型,宣称超越 Gemini 与 GPT 同档产品
微软 AI 推出自研语音识别模型 MAI-Transcribe-2,官方基准称其转录准确率超过 Google Gemini 3.5 Transcribe 和 OpenAI GPT-Transcribe,2026 年内定价仅每音频小时 0.10 美元。这是微软"去 OpenAI 化"自研模型矩阵(MAI 系列)的又一落子,此前已有 MAI-Think 等推理模型。语音转录是呼叫中心、会议纪要、视频字幕等场景的刚需基础设施,0.10 美元/小时的价格把长音频处理成本压到新低,对构建语音 Agent、会议分析管线的开发者是直接利好。模型通过 Azure AI 提供服务,与微软的语音生态(Speech SDK、Teams)天然集成。
链接:https://www.techmeme.com/260903/p37
- Perplexity 将开源 Lily:专为 Apple Silicon 打造的本地推理引擎,比 MLX-LM 快 35%
Perplexity 公布了专为苹果硅芯片设计的本地 AI 引擎 Lily,针对 Qwen3.6-35B-A3B 模型优化。Lily 使用 Rust 运行时和自研 Metal 内核,执行路径中完全不依赖 PyTorch 或 MLX。在 128GB 统一内存的 M5 Max MacBook Pro 上,prompt 处理比 MLX-LM 平均快 23%,token 生成快 35%。代价是专用性——不像 MLX-LM 那样支持广泛模型与架构。Perplexity 表示将以开源形式发布代码(目前尚未放出)。HN 讨论中值得注意的趋势判断:随着编码 Agent 让写新代码成本极低,"为每个新模型定制一个专用推理引擎"正在变得经济可行,本地推理的性能优化正从通用框架走向模型级专用内核。
链接:https://entertainment.slashdot.org/story/26/09/02/2235237/perplexity-will-open-source-its-faster-lily-ai-engine-for-apple-silicon
- Meta 发布 Muse Spark 1.3:编码能力宣称超 GPT-5.6 Sol,工具调用减少 20%
Meta 发布旗下最强模型 Muse Spark 1.3,主打 Agent 工作流与编码。Meta 首席 AI 官 Alexandr Wang 称其编码能力超越 OpenAI GPT-5.6 Sol、持平 Anthropic Claude Fable 5.1。相比 1.2 版,新模型减少了不必要的代码迭代:工具调用次数下降约 20%,完成同等任务所需 token 减少 25%,代码风格更干净。它针对长程 Agent 任务优化——单线程内可并行推进多个工作流、主动修正计划缺口、指令模糊时主动澄清、关键操作前请求确认,多任务指令映射准确率和复杂长指令的约束保持能力显著提升,幻觉减少。价格维持不变:输入 1.25 美元/百万 token、缓存命中 0.15 美元、输出 4.25 美元,将逐步集成进 Instagram、Facebook 和 Meta AI。
链接:https://www.aibase.com/news/30796
- Abliteration.ai 把"移除模型护栏"做成生意:托管去审查版 GLM-5.3 引发安全争议
TechCrunch 报道,初创公司 Abliteration.ai 将 abliteration(一种通过定向修改权重移除模型拒答倾向的技术)商业化:平台托管移除护栏后的开源权重模型,包括智谱近期发布的 GLM-5.3,用户可通过网页或 API 直接调用,定位是"其他模型拒绝做的攻击性网络安全、红队和 Agent 测试"。记者实测中,去护栏模型 readily 编写了窃取 Chrome 密码的程序和危险病原体培养方案。支持者(包括多家银行/航司空司的 Agent 红队客户)认为防守方必须能复现攻击行为;批评者指出 abliteration 会损伤部分模型能力,且规模化开放无审查前沿模型可能被滥用,公司目前除信用卡记录外几乎没有 KYC。这对所有依赖开源权重模型的团队都是现实问题:权重一旦下载,护栏即可被剥离,下游安全必须靠分类器、GPU 租赁身份核验等基础设施补上。
链接:https://techcrunch.com/2026/09/03/abliteration-ai-is-making-a-business-out-of-removing-ai-guardrails/
-
安全警示:Claude Code 将 MCP OAuth 令牌明文存储在磁盘上
密钥管理项目 SecretSpec 披露:Claude Code 在 Linux/macOS 上把 MCP 服务器的 OAuth 访问令牌与刷新令牌以明文形式存放在用户目录的单一文件中,任何能读取该文件的恶意进程(包括 npm 生态中的投毒包)都可直接窃取并重放令牌。文章指出 OAuth 解决了委托授权与自动续期问题,但没有规定本地安全存储——Bearer 令牌一旦被盗即可重放,且 MCP 令牌通常关联 GitHub、数据库等敏感资源。作者建议 Claude Code 提供可插拔的 credential-store 接口(对接系统 keyring、密码管理器或云密钥管理),并指出 OpenAI Codex 已支持 auto/file/keyring 三种 MCP OAuth 存储后端配置。使用 Claude Code 连接 MCP 服务的开发者应尽快检查文件权限、改用 keyring 存储,并关注官方更新。
链接:https://secretspec.dev/blog/claude-code-stores-oauth-tokens-in-plaintext
数据来源:TheAIEra News Hub
生成时间:2026-09-05 07:30:00

浙公网安备 33010602011771号