AI 技术日报 - 2026-08-26
AI 技术日报 - 2026-08-26
Top 10 AI 技术要闻
- 阿里千问预告开源 Qwen3.8-Flash-Next:基于下一代 Qwen4 架构的多模态 MoE
魔搭社区页面显示,阿里千问将于北京时间 8 月 26 日 23:00 开源 Qwen3.8-Flash-Next,同步发布 FP8 量化版本。官方介绍该模型是基于下一代 Qwen4 架构构建的多模态 MoE 模型,提前放出是为了让社区为即将到来的完整 Qwen4 模型家族做好生态准备。这是 Qwen 系列继 Qwen3.8-27B(编程与办公超越 Qwen3.7-Plus)和 Qwen3.8-2.4T-A95B(原生 256K 上下文)之后的又一次快速迭代。对开发者而言,Flash-Next 版本向来以高性价比著称,是本地部署与生产环境的热门选择,新架构的开放也意味着推理框架、微调工具链需要跟进适配。
链接:https://www.ithome.com/0/994/252.htm
- SemiAnalysis 深度解析 OpenAI Jalapeño 芯片:号称优于 Nvidia Blackwell
OpenAI 与博通历时 16 个月联合开发的定制 ASIC 推理芯片 Jalapeño 曝光详细基准测试,SemiAnalysis 的深度分析称其在特定推理负载上优于 Nvidia Blackwell,将直接挑战 GB300 等旗舰产品。该讨论在 Hacker News 获得 265 分、184 条评论,成为当日最热技术话题之一。自研芯片意味着 OpenAI 在推理成本上摆脱对 GPU 供应商的依赖,其大规模部署将显著改变 AI 推理算力市场的格局。对行业观察者来说,这是继 Google TPU、Amazon Trainium 之后又一个超大规模厂商自研芯片落地案例,也预示着推理 ASIC 化趋势正在加速。
链接:https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia
- NVIDIA Vera Rubin 平台首测曝光:DeepSeek 吞吐量暴涨 30 倍
据 36 氪报道,NVIDIA 下一代 Vera Rubin 平台的首轮实测数据流出,运行 DeepSeek 系列模型时吞吐量相比现役平台暴涨约 30 倍。Vera Rubin 是 Blackwell 之后的下一代平台,搭载 Vera CPU 与新一代 GPU,面向大规模 MoE 模型推理场景优化。若数据属实,大模型服务的单位推理成本将再度大幅下探,这对 API 定价、开源模型商业化以及本地部署门槛都有直接影响。推理基础设施的每一轮跃升都在重新定义"模型能做什么"的边界,值得关注后续官方基准与云厂商上线节奏。
链接:https://www.36kr.com/p/3954275398729089
- Anthropic 合并 Claude 聊天与 Cowork 记忆系统,默认开启
Anthropic 宣布将 Claude 聊天与 Claude Cowork 的两套记忆系统合并,聊天历史现在可供 Cowork 会话使用,且默认开启。此前用户在聊天里告诉 Claude 的信息,进入 Cowork 办公场景后会被"遗忘",需要重复交代背景;合并后 Claude 终于能跨场景记住用户的偏好、项目上下文和过往指令。对重度用户来说这是期待已久的能力补齐,也让 Claude 在个人助理定位上更接近"持续共事的同事"。注重隐私的用户可在设置中关闭该功能或管理记忆内容。
链接:https://techcrunch.com/2026/08/25/claude-cowork-finally-remembers-what-you-told-the-app-in-chat
- Perplexity 与 NVIDIA 发布"Portable Computer":完全本地运行的 AI Agent,零 token 成本
Perplexity 联合 NVIDIA 推出本地优先的 Agent 平台"Portable Computer",在 NVIDIA 驱动的 Linux 硬件(如 DGX Spark)上直接运行 AI 模型、文件处理、工具调用与工作流。本地任务不产生任何 token 费用,数据默认留在设备上;当任务需要更强能力时,系统会先征求用户许可再升级到云端模型。这是 NVIDIA 在万亿美元数据中心叙事之外的一次重要表态:本地 AI 已经跨过实用性门槛。对开发者而言,本地 Agent 意味着可预测的成本结构和更强的数据主权,配合 Nemotron 等开源模型,私有化 Agent 工作流又多了一条落地路径。
链接:https://slashdot.org/story/26/08/25/1848204/perplexity-and-nvidia-launch-fully-local-ai-agent-with-zero-token-costs
- Skild AI 发布 S1 机器人基础模型:单个视频演示即可学习全新任务,无需微调
机器人公司 Skild AI 发布机器人基础模型 S1,宣称其能够学习预训练中从未见过的任务:只需一段视频演示,无需任何微调即可执行。这标志着机器人基础模型从"海量数据预训练 + 下游微调"范式向"通用泛化 + 少样本模仿"迈出关键一步。若泛化能力属实,工业产线换任务、家庭场景适配新家具等长尾需求将不再依赖昂贵的采集与训练流程。机器人基础模型赛道近期持续升温,S1 的视频学习路线与物理仿真路线的对比值得关注。
链接:https://www.techmeme.com/260825/p41
- NVIDIA 发布 Jetson Orin Nano 2 边缘 AI 计算机:78 TOPS 推理性能翻倍
NVIDIA 推出新一代边缘 AI 计算机 Jetson Orin Nano 2,官方称推理性能相比上代翻倍,提供 78 TOPS AI 算力,搭载八核 Arm CPU。Jetson 系列是机器人、无人机、智能摄像头等边缘设备的主力计算平台,性能翻倍意味着 VLA 模型、多模态推理可以直接跑在更小的设备上。配合刚刚推出的机器人基础模型热潮,边缘算力的升级将进一步降低具身智能的开发门槛。对硬件开发者而言,Orin Nano 2 的功耗与生态兼容性(延续 CUDA 软件栈)是落地考量的关键。
链接:https://www.techmeme.com/260825/p32
- MulmoTerminal:并行运行多个 Claude Code / Codex 会话的开源终端网格
在 GitHub 斩获 177 星的 MulmoTerminal 提供了一个浏览器端的终端网格,让开发者并行运行多个 Claude Code 和 Codex 会话,实时展示哪个 Agent 需要人工介入。工具基于 tmux、完全本地运行,MIT 协议开源。当多 Agent 并行开发成为日常,"人盯多个终端窗口"成了新痛点——MulmoTerminal 的思路是把注意力分配问题可视化:只有当某个 Agent 卡住或需要确认时才提醒你。对于同时推进多个编码任务的重度 Agent 用户,这是典型的"用工具管理 Agent 农场"实践。
链接:https://github.com/receptron/mulmoterminal
- CarWatch:树莓派 5 + Qwen 打造完全本地的车载 AI 助手
一位开发者用树莓派 5、行车记录仪和本地 Qwen 模型打造了车载 AI 助手 CarWatch,把汽车变成一个"聊天室 Agent",该 Show HN 项目在 Hacker News 获得 81 分讨论。项目完全离线运行,摄像头画面与语音交互都在本地处理,无需联网或订阅任何云服务,是 CodeWatch(手表端本地 AI)的兄弟项目。它展示了端侧小模型 + 创意硬件组合的可能性:不需要昂贵的算力,用现成硬件就能组装出实用的个性化 AI 设备。喜欢动手的开发者可以参考其架构,把同类思路迁移到其他嵌入式场景。
链接:https://github.com/ThinkOffApp/CarWatch
-
Paul Graham"如果我 17 岁,会从零构建 LLM"言论引爆 HN:592 分、670 条讨论
Y Combinator 联合创始人 Paul Graham 表态"如果我 17 岁,我会学习从零开始构建 LLM",这条推文在 Hacker News 引发 592 分、670 条评论的深度讨论。社区围绕"理解原理 vs 使用框架"展开激烈辩论:支持者认为亲手实现 Transformer、训练循环和推理引擎是建立 AI 直觉的最佳路径,Karpathy 的 nanoGPT 式教程正是为此而生;反对者则认为工程价值更多在数据、评估与产品层,底层重复造轮子的边际收益有限。对 AI 学习者而言,这场讨论本身就是一个路线图:无论选择哪条路,社区给出的从零实现资源清单都值得收藏。链接:https://news.ycombinator.com/item?id=49412396
数据来源:TheAIEra News Hub
生成时间:2026-08-26 07:15:00

浙公网安备 33010602011771号