Grok 4.6 连着 Bot 一起发,Manus 恢复独立,NVIDIA 拉来 5000 亿美元

这期的「周一上线」,一边是模型和 Agent 继续往长程执行、真实任务里走,另一边是围绕 AI 的算力、资本和公司关系也在重新排兵布阵。

Grok Bot 开始给 Agent 配上云端电脑,WeLM 走进微信「小微」,GLM-5.3、Gemini 3.7 Flash、DeepSeek V4 Pro 正式版等轮番上阵,继续围绕 Coding、Agent 和端侧能力往前推。另一边,Manus 准备恢复独立运营,林俊旸重新创业,NVIDIA 更是拉上华尔街,准备长期撬动超过 5000 亿美元第三方资本建设 AI 基础设施。

当然,开发者们还是照常整活:手搓雷击探测器、3D版 H100 教学小工具,还有越来越“精简”的软件工程师技能树,一个都没落下。

下面,开始一周回顾。

有点新鲜

「有点新鲜」收录本周 AI / 开发者圈里那些不算大新闻,但挺值得看一眼的新鲜事。

给日历贴点贴纸

日历不只是负责提醒你“今天又有会”。网友 @AlexWeichart 做了个 Hibi Calendar:可以直接在日历上涂鸦、制作日式和纸胶带和贴纸,把每天记成一本电子手账。

1

把 H100 拆开给你看

GPU 看不懂?那就直接做个 3D H100 拆着学。@kylejeong 让 GPT-5.6 Sol 根据 Modal 的 GPU Glossary,用 Three.js 搭了一个可交互的 H100,边玩边看 GPU 到底是怎么工作的。

2

手搓雷击探测器

别人两天写个 Demo,网友 @p1nosaur 和 @embedder_dev 两天直接搓出了一个雷击探测器,还把硬件文件全开源了。

3

整个项目实际投入约 10.5 小时,成品能探测雷电无线电脉冲、估算风暴距离,并通过蜂鸣器提醒。

大模型发版,先过网友这一关

上周 Gemini 3.7 Flash 和 DeepSeek V4 Pro 正式版刚上线,网友二创就跟上了:Gemini 被画成“排名垫底也要独自开香槟”,V4 Pro 则被 Flash0731 小鲸鱼一句“姐姐,你好区啊”直接整沉默。

4

Benchmark 还在看,梗图已经出完了。

一边摇人,一边走人

DeepSeek Harness 组还在杭州继续摇人,研究员、研发、产品、设计、开发者关系等岗位全都招;另一边,OpenAI GPU 老将 Scott Gray 宣布离职。

5

网友已经开始替未来模型操心了:“GPT-6.7 不会要慢两倍吧……”

软件工程师的技能树,砍到只剩 3 个了?

十年前 VS 现在:

6

周五发版

「周五发版」是一个程序梗:一旦版本上线,我们就要开始祈祷一切如期运行。这个模块寓意,所有模型、产品版本更新,都能大吉大利。

LFM2.5-VL-3B:把视觉模型继续塞进端侧

Liquid AI 发布 LFM2.5-VL-3B,一款面向端侧部署的 3B 视觉语言模型,重点提升 屏幕 / UI 理解、Grounding、Function Calling 和多图输入。官方测试中,ScreenSpot-v2 平均得分 80.7,ToolSandbox 从上一代的 26.4 提升到 59.5。

7

模型运行时内存约 3GB,在 Galaxy S26 Ultra 上可达到约 20 Token/s,并已支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX。目前模型权重已开放,可直接下载和本地部署。

Grok Bot 和 Grok 4.6 连发:一边造 Agent,一边补底座

SpaceXAI 连续更新 Agent 产品线。先发布 Grok Bot:每个 Bot 都有自己的云端电脑,可以登录网站和应用、跨工具执行任务,还能学习并重复用户的工作流程;目前仍处于 beta 阶段。

8

随后发布的 Grok 4.6 则继续补强 long-running agents,重点提升长程研究、跨代码库开发和持续验证能力。模型支持 500K Context;在 Artificial Analysis Intelligence Index 中与 GPT-5.6 Sol 基本持平,仍低于 Fable 5。短上下文 API 价格为 $2/百万输入、$6/百万输出 Token。

WeLM 新进展:80B 已进小微,617B 继续向上扩

微信 WeLM 团队近期披露了 80B / 3B 激活和 617B / 23B 激活两种 MoE 规模的进展。其中,80B 模型已用于微信 AI 助手「小微」;617B 则更多出现在团队最新的 Hidden Decoding 研究与评测中,目前仍处于研究和开发阶段。

9

WeLM 这一名称最早可追溯至微信团队 2022 年发布的 10B 中文模型,但目前尚不能确认两代模型是否存在直接架构继承关系。

GLM-5.3 亮相:继续靠后训练补强 Agent

智谱公布 GLM-5.3。这次没有更换基座,能力提升主要来自更大规模的后训练,重点强化 Coding、长程 Agent 和 Cyber。智谱公布的 Benchmark 中,Terminal-Bench 3.0 从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,GDPval-AA v2 从 1508 提升到 1769。

10

目前 GLM-5.3 首批访问主要面向部分 launch partners。智谱表示,计划在完成安全评估和防护强化后,约两周后公开发布模型;其中更敏感的 Cyber 能力将通过 trusted access 向验证用户开放。

Gemini 3.7 Flash:继续补强 Coding 和 Agent

距离 3.6 Flash 发布仅 3 周,Google 又推出 Gemini 3.7 Flash。这一版继续强化 Coding、Web Development 和 Agent Workflow,官方模型卡显示,DeepSWE、FrontierCode、AutomationBench 等开发者相关评测都有明显提升。

11

模型支持约 1M 上下文、64K 输出。截至 2026 年底,API 价格为 $0.75/百万输入、$3.75/百万输出 Token,相当于 3.6 Flash 原始价格的一半。

DeepSeek V4 Pro 正式版:继续补强 Agent

DeepSeek 发布 V4 Pro 正式版,重点提升 Agent 能力,尤其是生产环境中的表现。模型已同步上线 App、网页端和 API,并原生支持 Responses API、适配 Codex。

12

V4 Pro 和 V4 Flash 的 Thinking 现支持 low / high / max 三档。与此同时,DeepSeek API 自 8 月 17 日起启用峰谷定价,闲时价格为高峰时段的一半。

DeepSeek 还开源了自研的 DeepSeek Harness(dsh),采用“Everything is a Plugin”的架构,模型适配、工具、Session 和 Agent Loop 等都可以通过插件替换。目前项目仍处于 Developer Preview 阶段。

Newton 1.5.0:机器人仿真继续补控制与多物理能力

由 Disney Research、Google DeepMind 和 NVIDIA 发起的开源机器人物理引擎 Newton 发布 1.5.0。它基于 NVIDIA Warp,主打 GPU 加速、可微分物理和机器人仿真,目前由 Linux Foundation 管理。

13

这一版新增实验性的 GPU 向量化关节阻抗控制器、ONNX 策略推理,以及更完整的刚体—软体接触、相机深度输出等能力,也继续扩展 Kamino、VBD、MuJoCo Warp 等求解器。

开源雷达

周榜速递

周榜主要根据新增 Star 数进行排名,下面的单项目讲解则偏向新晋项目、实用老项目,标星并非单项目讲解的唯一指标。

14

Semantica:给 Agent 决策补上可追溯链路

Semantica 是一套面向 AI Agent 的图基础设施,可以把多源数据构造成 Context Graph / Knowledge Graph,并将记录进去的决策、因果关系和来源变成可查询、可追溯的图。项目支持自托管,并提供 REST API、MCP 和 CLI,采用 MIT License。

15

Diagram Design:让 Coding Agent 顺手把图也画了

Diagram Design 是一个面向 Claude Code、Codex 和 Pi 的 Agent Skill,提供 27 种图表类型,从架构图、流程图到时序图、ER 图都能生成。它还可以从网站提取品牌色和字体,让后续生成的图表跟着自己的视觉风格走。

16

Switchyard:给不同模型的 API 加一个「换乘站」

NVIDIA NeMo 开源的 Switchyard 是一个 LLM 流量代理,可以在 OpenAI Chat、Responses 和 Anthropic Messages 等格式之间转换,再把 Coding Agent 的请求转给 vLLM、NVIDIA NIM、Ollama 等不同模型后端,也支持按规则进行多模型路由和 A/B 测试。

17

不过项目目前仍处于 pre-alpha 阶段,官方明确标注为实验软件,不建议用于生产环境。

Code-Graph-RAG:先把代码库变成一张知识图谱

Code-Graph-RAG 用 Tree-sitter 解析代码,把函数、类、模块和它们之间的关系存进 Memgraph,再让 Agent 基于这张图查询、理解和修改代码。它支持 Python、TypeScript / JavaScript、Go、Rust、Java、C/C++ 等多种语言,并提供 MCP Server,可以接入 Claude Code 等客户端。

18

相比只靠关键词或向量去「搜代码」,它更强调先把代码之间的结构关系搞清楚。

Needle 2:14MB,也能在端侧调用工具

Needle 2 是一个专门处理 Tool Calling、设备控制和结构化信息提取的 45M 参数模型,整个模型压进单个 14MB binary,完整 session 约占 28MB RAM。

19

模型推理过程无需联网,还自带 confidence gating:置信度够高就执行,不够则可以交给更大的模型或其他流程继续处理。

ToolJet:拖拖拽拽,搭一个自己的内部工具

ToolJet 是一个开源低代码平台,可以通过可视化组件搭 UI,再连接数据库、API、SaaS 和对象存储。Community Edition 提供 60+ UI 组件、80+ 数据源连接,并支持 Docker、Kubernetes 等方式自托管。

20

需要注意,AI App Generation、AI Query Builder 和 Agent Builder 等能力属于 ToolJet AI(Enterprise),不属于开源 Community Edition;开源版本采用 AGPL-3.0。

这周有事

「这周有事」收录本周值得记一下的行业动态、事故、融资、人员流动和基础设施变化。

Mistral AI 开放第三方模型,首个接入 GLM-5.2

Mistral AI 宣布平台开始支持第三方开放模型,首个接入的是智谱 GLM-5.2。第三方模型将与 Mistral 自家模型运行在相同的基础设施和区域控制体系下,企业无需更换平台就能扩展模型选择。

21

同时,Mistral AI 新增美国 / 欧洲推理区域选择,并启动 European Compute Unit alliance program(欧洲算力联盟计划),继续强化其「主权 AI」路线。

NVIDIA 拉上华尔街,要给 AI 算力建一个「资本市场」

黄仁勋宣布,NVIDIA 将与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 合作建立独立融资平台,计划长期撬动 超过 5000 亿美元第三方资本,用于 AI 基础设施建设

22

这里的 5000 亿美元不是 NVIDIA 收入,也不是一个单独基金,而是这些融资平台计划逐步动员的第三方资本。黄仁勋想推动的是:以后 AI Factory 不只是一笔数据中心支出,也可以像电力、交通基础设施一样,成为能够长期融资和投资的资产。

IBM 拿下 2.4 亿美元 AI 算力大单

IBM 与 Together AI 达成一项多年期 2.4 亿美元协议,将在 IBM Cloud 部署 NVIDIA HGX B300 集群,为 Together AI 的开源模型推理服务提供算力,预计 2027 年第一季度投入使用。

23

Together AI 近期刚以 83 亿美元估值完成 8 亿美元 C 轮融资。模型竞争背后,推理基础设施这门生意也越来越大。

Manus 恢复独立运营:Meta 收购进入撤销收尾

近日,Manus 宣布将重新以独立公司形式运营。中国监管部门此前已要求相关方撤销 Meta 对 Manus 的约 20 亿美元收购,目前双方正在推进交易回滚和业务拆分。作为分离的一部分,Manus 还将删除部分收购期间产生的用户数据,并开放备份和后续恢复安排。

24

这场收购从去年底官宣,到今年 4 月被叫停,再到如今进入拆分收尾,兜了一圈,Manus 又回到了独立运营的轨道。

林俊旸创业了:做横跨数字与物理世界的 Agent

从阿里离职约 5 个月后,林俊旸宣布在上海创办 Pragmatik Labs(语用科技,简称 p7k),研究方向是横跨数字世界和物理世界的下一代 Agent。

25

林俊旸同时确认,本轮融资由高榕创投和红杉中国共同领投,腾讯和上海未来产业基金提供支持。据 The Information 此前报道,此轮融资规模达数亿美元,公司投后估值约 20 亿美元;具体金额尚未由公司正式公布。

posted @ 2026-08-17 15:09  小七-七牛开发者  阅读(0)  评论(0)    收藏  举报