AI 技术日报 - 2026-10-05
AI 技术日报 - 2026-10-05
Top 10 AI 技术要闻
-
OpenAI GPT-6 Sol Codex 系统提示词被完整提取:29.4 万字符、1902 行
爆料者 @elder_plinius 提取了 GPT-6 Sol Codex 的完整系统提示词与工具定义,共 29.4 万字符、1902 行,已公开在 GitHub 的 CL4R1T4S 仓库。这份"内部操作手册"暴露了两件事。一是 OpenAI 自己也在反"AI 味":写作风格部分明确列出 AI 垃圾词汇黑名单(bottom line、significance、delve、foster、leverage、it's worth noting 等),要求模型不准强行热情、不准用废话凑字数、像和同事说话一样沟通。二是极高的自主性授权——原文写着"用户非常讨厌你停下来询问确认或请求许可",只要证据支持下一步就继续干,不要为了省时间或 token 交付"勉强有用"的方案。对 Prompt 工程师来说,这是一份罕见的负面约束样本:高质量输出的第一步可能不是加要求,而是明确禁止套路化表达。链接:https://www.ithome.com/1/009/745.htm
-
数千条 AI"幻觉"漏洞报告压垮维护团队,谷歌暂停开源漏洞奖励计划
谷歌宣布自 2026 年 10 月 1 日起,开源软件漏洞奖励计划(OSS VRP)不再接收产品漏洞提报,此前已提交的不受影响;涉及 Google Cloud 的仓库仍可走 Cloud VRP。据 Tom's Hardware 报道,直接原因是谷歌工程师与开源维护者被数以千计的劣质报告淹没——它们声称发现了严重漏洞,深入排查后全是 AI 生成的幻觉,根本无法实际利用。维护团队把大量精力花在验证虚假代码上,挤压了修复真实高危漏洞的时间。谷歌表示将重组该机制,计划 2027 年第一季度公布进展。这件事的教训值得所有做 AI 辅助安全工作的人记住:当提交成本趋近于零,人工审核成本反而成为系统瓶颈。链接:https://www.ithome.com/1/009/673.htm
-
System76 把"禁止 AI 生成代码"写进 PR 模板,COSMIC 项目开始拦 AI 贡献
System76 更新了 COSMIC 项目的 PR 模板,新增强制检查清单,要求贡献者确认提交内容不含任何 AI 生成的代码、注释与描述,否则无法按要求提交。COSMIC 是 System76 基于 Rust 开发的 Linux 桌面环境。System76 此前就批评 AI 生成代码过于复杂:AI 缺乏理解大型项目深层集成关系所需的完整上下文,容易产出"看似可用、实际难维护"的代码,直接拉长代码审查时间。目前唯一豁免的是 cosmic-flatpak。这不是孤例,Ladybird 浏览器项目今年 6 月已采取类似措施,其维护者发现审查 AI 代码的成本超出了项目承受范围。争议点不在于"AI 代码能不能用",而在于人类维护者要长期承担理解、审查、测试与维护的成本。链接:https://www.ithome.com/1/009/669.htm
-
何恺明团队 VISTA:给模型一双眼睛和一本相册,ARC-AGI-3 从 40 分打到满分
何恺明团队挂上 arXiv 的 VISTA 论文在 X 上引发讨论,核心判断是:模型脑子早就够用,卡住它的是"眼睛和记性"。ARC-AGI-3 是 Keras 之父 François Chollet 与 ARC Prize 基金会推出的交互式像素游戏基准,官方递给模型的却只是一张 64×64 的数字表——4096 个数字,相当于让人闭着眼听别人报坐标玩超级马里奥。VISTA 先把数字表换回图片,其他都不改,GPT-5.6 Sol 的分数就从 13.33 跳到 47.32,能通关的游戏从 1 个变成 9 个;看图还更省算力,一个数字格子约 4000 token,一张 512×512 图片只要 308 个。第二招是无损视觉记忆"相册":每一帧连动画帧都按编号原样存档,模型可随时 inspect 翻看、并排对比、放大、read_pixels 读精确颜色,而且翻相册不计步数。这套"显式注意力"加上后,Claude Opus 5 在 25 个公开游戏上拿到 100 分,步数比第一次玩的人类还少一半多。链接:https://www.36kr.com/p/4011070893871238
-
DeepSeek Harness v0.2.1-alpha.1:加 Claude Code Mods 兼容层,官方称"一切皆插件"
DeepSeek Harness 假期更新到 v0.2.1-alpha.1,新增实验性的 Claude Code Mods 兼容层,作者崔添翼(兼容层作者)回应称:做它主要是验证 Claude Code Mods 提供给插件作者的扩展能力,是否大致是 DSH"一切皆插件"架构所提供能力的子集,目前还无法让所有 Mods 无缝运行,但技术上未来有可能做到。他强调"一切皆插件"从立项、写第一行代码之前就已确立,正如开源自 DeepSeek 成立之初就是初心,"不是被迫或模仿别人才做开放可扩展"。Claude Code 的 Mods 是运行在其内部的 JS/TS 事件处理函数,可在工具调用、提示词提交、界面绘制等时机观察、修改甚至接管某一步;Skill 给 AI 一套办事方法,MCP 接外部工具与数据,Mod 改的是 AI 工具本身的界面和工作行为。DSH v0.2 于 9 月 29 日发布并提供 macOS/Windows 桌面端,新增插件管理页;按官方模型 API 用户口径,约 60% 的 DSH 用户使用了第三方插件。链接:https://www.ithome.com/1/009/701.htm
-
Jev 日处理量破 1 万亿 token:决策模型正在长成一个新类别
据《华尔街日报》报道,问世仅三周的模型 Jev 已在硅谷引发热议,人们开始讨论大语言模型之外的替代路线。它不生成文本,而是借助机器学习把输入归类到一组预设输出中——回答是/否、给出数值评分,或从既定列表里选一个,TypeSafe AI 称之为"面向校准决策的强化学习"。创始人迪奥戈·阿尔梅达曾在 OpenAI 参与 ChatGPT 研发,2024 年离职,公司已从 DCVC 融资 4000 万美元。他表示目前约 25% 的财富 500 强企业正在使用这款模型,"大约一周前,我们每日处理的 token 数量就达到了一万亿",业务仍在指数级增长;《The Information》披露该公司正洽谈目标 10 亿美元以上的新一轮融资,部分意向投资者给出的估值超过 100 亿美元。跟风者已经出现:OpenAI 上线基于 Luna 模型的决策 API(Decisions API),Databricks 发布 ai_decide,Cloudflare 开源 Clef / Clef-flash——用 Qwen3.8-27B 与 Qwen3.5-9B 作冻结基础模型,以专用路由头直接给候选答案打分,不做逐 token 自回归生成。一个分工正在形成:生成式模型负责复杂推理,决策模型负责高频、有限选项的路由与分类。链接:https://www.ithome.com/1/009/744.htm
-
SCM:在 macOS 上对每张照片、每个视频的每一帧做 AI 搜索(256 stars)
GitHub 项目 SCM(Screen Memories)把"逐帧可搜索"做成了本地工具:对 macOS 上任意文件夹里的照片和视频建立深度 AI 搜索,推理全部在本机完成——不需要账号、不上传云端。技术栈是 Electron + transformers.js + 视频处理 + VLM,项目 10 月 3 日创建,两天内拿到约 256 stars。它的参考价值在于"本地优先"的工程路径:用 Web 技术栈把 VLM 推理塞进桌面端,既避开上传隐私数据,也避开云端推理成本。同样的模式可以迁移到截图库、录屏归档、监控回看这类"数据量大、单次查询价值不高、但隐私敏感"的场景。链接:https://github.com/allenv0/SCM
-
"上下文给得越多,编码 Agent 可能越糟":过期记忆会制造自信的 Bug
dev.to 上一篇文章对"多给 AI 上下文"这条流行建议提出反驳:更多上下文不等于更好的理解,有时意味着更多噪音、更多过期假设、更多互相冲突的指令、更多无关文件,以及更多让 Agent 盯错地方的机会。文章切入点很具体——stale memory creates confident bugs:README、AGENTS.md、架构文档、日志、历史决策、跨会话记忆,只要其中一部分已经过时,模型就会拿着旧前提自信地推理,而错误的前提比缺失的前提更难发现。这解释了为什么有些团队越"喂"效果越乱。可操作的方向是给上下文加上所有权和有效期:文档跟代码一起改,记忆要能过期和被删除,而不是只做加法。链接:https://dev.to/robertadam987_/the-more-context-you-give-your-ai-coding-agent-the-worse-it-can-get-4d40
-
英伟达与鸿海展示机器人组装 GB300:母线成功率超 95%
据台媒经济日报,英伟达与鸿海首次对外展示用机器人制造设备的成果:GB300 的母线(Busbar,用于大电流配电传输的导电金属条)以及多组连接器组装等原本依赖人工的复杂工序,已可导入机器人自动化。核心指标:Busbar 组装成功率超过 95%,多连接器插接成功率约 90% 至 95%;Busbar 组装时间目标在 124 秒以内,4 组连接器插接目标 72 秒以内;整体生产周期控制在熟练人工的两倍以内。GB300 NVL72 把 72 颗 Blackwell Ultra GPU 与 36 颗 Grace CPU 整合进单一全液冷机架。鸿海全球 AI 服务器市占率超过 40%,是 GB200 / GB300 NVL72 的主要供应商,与英伟达为联合设计制造关系。这条消息的信号是:AI 硬件的瓶颈正在从芯片本身向组装、供电与散热工艺转移。链接:https://www.ithome.com/1/009/665.htm
-
Baloo:给 GitHub PR 用的自托管 AI 代码审查(MIT,38 stars)
Baloo 是一个自托管的 GitHub App,用 AI 审查 Pull Request,Python 实现,MIT 许可。与把代码发给第三方 SaaS 的方案相比,自托管意味着代码和审查记录留在自己的基础设施里,这对有合规要求或无外网访问的团队是硬需求——前面几条新闻里 AI 代码审查带来的成本与信任问题,恰恰是这类工具要回答的。项目 4 月创建、10 月初仍在更新,技术标签显示支持 Anthropic、Gemini 与通用 LLM 接入,基于 FastAPI 与 GitHub App 机制。适合作为"给现有 PR 流程加一层 AI 审查"的低成本起点:先在单个仓库跑通,再决定要不要自研提示词和规则集。链接:https://github.com/bluebear-io/baloo-bear
数据来源:TheAIEra News Hub
生成时间:2026-10-05 09:40:00

浙公网安备 33010602011771号