2026-07-22 AI 新闻汇总
1. Google 一次性发布三款 Gemini 新模型:3.6 Flash 编程效率大幅提升,Flash Cyber 专攻网络安全
7 月 21 日,Google 发布三款 Gemini 新模型,覆盖通用编程、高吞吐量场景和安全领域:
- Gemini 3.6 Flash:在 3.5 Flash 基础上输出 token 量减少 \(17\%\),DeepSWE 编程基准从 \(37\%\) 跃升至 \(49\%\),MLE Bench(ML 研究)从 \(49.7\%\) 升至 \(63.9\%\)。定价 \(1.50\) 美元 / 百万输入 token、\(7.50\) 美元 / 百万输出 token,低于上一代。已内置 Computer Use 工具,可直接在 Gemini API 中调用。
- Gemini 3.5 Flash-Lite:输出速度达 \(350\) token/s(Artificial Analysis 实测),Terminal-Bench 2.1 得分 \(54\%\)(vs 3.1 Flash-Lite 的 \(31\%\)),SWE-Bench Pro 达 \(54.2\%\)。定价 \(0.30\) 美元 / 百万输入、\(2.50\) 美元 / 百万输出,面向高吞吐量的 Agent 搜索和文档处理场景。
- Gemini 3.5 Flash Cyber:安全专项模型,在 3.5 Flash 基础上微调,配合多 Agent 协同工具 CodeMender,在 CyberGym 基准上达到前沿水平。仅限政府和可信合作伙伴通过 CodeMender 使用,Google 明确表示此举是为了"让防御者抢在攻击者之前"。
Google 同时透露 Gemini 3.5 Pro 正在合作伙伴测试中,而 Gemini 4 已启动"迄今最宏大"的预训练。
HN 上(620 分 / 493 评论)的讨论集中在两点:Flash 系列的编程能力跃升是否可持续,以及 Flash Cyber 仅限政府使用的策略能否真正阻止恶意行为者获取同类能力。
来源: Google Blog | Hacker News(620 分 / 493 评论) | 2026-07-21
2. Poolside 发布 Laguna S 2.1:118B 参数 Agentic Coding 开源模型,以 \(\frac{1}{10}\) 体量挑战千亿级对手
7 月 21 日,AI 编程公司 Poolside 发布 Laguna S 2.1,一款 118B 总参数(8B 激活)的 MoE 开源模型,从训练启动到发布不到 9 周(5 月 22 日起在 \(4,096\) 张 NVIDIA H200 GPU 上预训练)。
核心性能数据:
- Terminal-Bench 2.1: \(70.2\%\),排名第 11,超过 DeepSeek V4-Pro-Max(1.6T 参数,\(64.0\%\))、Inkling(975B,\(63.8\%\))等大得多的模型
- SWE-Bench Multilingual: \(78.5\%\),超越 Qwen 3.7 Max(\(78.3\%\))
- SWE Atlas(Codebase QnA): \(46.2\%\),超过 Claude Fable 5(\(42.2\%\))
- 支持 100 万 token 上下文,Thinking 模式在 DeepSWE 上带来 \(+23.9\%\) 的提升
Poolside 联合创始人 Pengming Wang 将性能提升归结为行为改进而非智力提升:"更多的自我验证、更少的过早宣布成功、更强的持久性和回退意愿。"训练中使用了 \(409\)k 个 Agentic 和非 Agentic 环境(含 \(83\)k 个终端设置和 \(168\)k 个标准 SWE 工作流),并在 FP8 精度下完成 RL。
定价为 \(0.10\) 美元 / 百万输入 token、\(0.20\) 美元 / 百万输出 token(OpenRouter),同时提供免费层。权重以 OpenMDW-1.1 许可在 Hugging Face 开源,支持 TRT-LLM、vLLM、Ollama 等推理引擎。
来源: Poolside Blog | Hacker News(236 分 / 43 评论) | 2026-07-21
3. OpenAI Codex 与 ChatGPT Work 周活用户突破 1000 万,两周内近乎翻倍
7 月 21 日,OpenAI 宣布旗下两款 Agent 产品——编程工具 Codex 和通用任务工具 ChatGPT Work——合并周活跃用户数突破 1000 万,距 ChatGPT Work 上线不到两周。Codex 负责人 Tibo Sottiaux 公开的数据显示:7 月 12 日突破 600 万、随后连续突破 700 万、800 万、900 万,日均新增近百万。
增长轨迹背后的几个数据点:
- Codex 在 2 月周活不足 100 万,6 月初达 500 万,GPT-5.6 上线后加速攀升
- OpenAI 内部 \(97.9\%\) 的员工已使用 Codex,非开发者采用率在 8 个月内增长 \(137 \times\)
- 用户激增导致上下文窗口从 \(37.2\) 万 token 压缩至 \(27.2\) 万 token,OpenAI 多次重置用户额度并临时取消了 Plus、Business、Pro 套餐的 5 小时使用限制
Anthropic 在 OpenAI 宣布突破 700 万用户后数小时内即做出回应:延长 Claude Fable 5 促销定价、将 Claude Code 每周使用限额提升 \(50\%\)。OpenAI 的 1000 万用户数据包含了促销窗口期的"活跃"用户,其衡量口径(合并计数、未区分日活/周活/月活)比 6 月初的 500 万 Codex 周活更宽松。
来源: Bloomberg / 环球市场播报 | Unite.AI | 全天候科技 | 2026-07-21
4. Anthropic \(15\) 亿美元版权和解获法官终审批准:美国 AI 版权纠纷首起重大和解
7 月 20 日,美国加州北区联邦地区法院法官 Araceli Martínez-Olguín 正式批准了 Anthropic 与作家群体的 \(15\) 亿美元版权和解协议,这是美国历史上已知金额最高的版权和解,也是 AI 版权纠纷中首起达成和解的集体诉讼。
案件的核心法律分界线由退休法官 William Alsup 在 2025 年 6 月划定:
- 用合法购买的书籍训练 AI 模型属于合理使用(fair use)。 Alsup 的判词是:"你不能因为小学生学成之后会抢你的饭碗就指责训练写作非法。版权旨在保护并鼓励原创,而非限制竞争。"
- 但从 LibGen、PiLiMi 等盗版网站下载 \(700\) 余万本书籍并存储在"中央图书馆",即使未全部用于训练,也构成版权侵权。
和解条款包括:Anthropic 在 30 天内销毁原始盗版文件,认证所有商用模型所使用的数据集。协议仅覆盖过往使用,不授权未来继续使用这些书籍训练。每部合格作品获赔约 \(3,000\) 美元,覆盖约 \(48.2\) 万至 \(50\) 万部注册作品,\(91\%\) 以上的集体成员已申领赔偿。原告律师费获批约 \(1.01\) 亿美元(申请的 \(1.875\) 亿美元的约 \(\frac{1}{2}\))。
部分作家(包括 Dave Eggers、Vendela Vida 等 25 人以上)选择退出和解,另行起诉。针对 Google、Meta、OpenAI 等公司的同类诉讼仍在推进中。
来源: Reuters / The Star | 中国知识产权报 / 新浪 | InsiderFinance | Hacker News(125 分 / 95 评论) | 2026-07-20
5. Jack Dorsey 发布 Buzz:集成 AI Agent、团队聊天与 Git 的开源工作空间
7 月 21 日,Block(原 Square)创始人 Jack Dorsey 发布 Buzz,一款自托管的开源工作空间,将团队聊天、AI Agent 和 Git 代码托管统一在同一身份体系下,基于 Nostr 签名事件构建。Dorsey 称 Buzz 的目标是减少 Block 对 Slack 和 GitHub 的依赖。
Buzz 的设计有几个不同于现有工具的选择:
- Agent 与人类对等。 AI Agent 拥有自己的密钥对、频道成员资格和审计轨迹,可以搜索历史讨论、打开仓库、提交补丁、审查代码、运行工作流——不是聊天机器人,而是工作空间成员。内置对 Goose、Codex、Claude Code 的 Agent harness,模型选择与工作空间解耦。
- 代码托管内嵌。 功能分支可自动生成对应频道,补丁、CI 结果、评审意见和合并决策都保存在同一事件记录中。仓库、讨论和工作流历史共享一个搜索索引。
- 加密签名事件。 每条消息、反应、工作流步骤和审批都是 Nostr 签名事件,提供归因和审计能力。
当前已具备频道、线程、私信、共享画布、媒体、搜索、审计日志和 YAML 工作流功能,桌面端支持 macOS、Windows、Linux,Apache 2.0 许可开源。但 Block 自身文档多次标注产品为"未完成"——移动端、推送通知和工作流审批门仍在开发中。
在 HN 上(245 分 / 220 评论),讨论集中在两个问题上:将聊天、代码托管和 Agent 编排合并到单一 Relay 中是否合理,以及去中心化的 Nostr 架构在实际部署中退化为中心化 Relay 后还能保留多少"自托管"的意义。
来源: RuntimeWire | Hacker News(245 分 / 220 评论) | Buzz GitHub | 2026-07-21

浙公网安备 33010602011771号