JeecgBoot AI专题研究 | GPT-6 Astra发布深度解析:Computer Use、Agent能力与AGI叙事的分水岭
2026年9月4日,OpenAI在没有过多预热的情况下放出了GPT-6 Astra。官方给它的定位相当高调——"全球最智能、最符合人类意图的模型"。OpenAI总裁Greg Brockman甚至直接表态:几年后回头看,这一天可能就是AGI时代的起点。
抛开营销话术,这次发布真正值得关注的,是它标志着大模型产品逻辑的一次彻底转向:从"聊天助手"全面切换到"干活的Agent"。过去我们评价一个模型,看的是它能不能把问题答对;而Astra试图证明的是,AI可以坐到电脑前,像一名员工那样把一整套工作流程独立跑完。

一次没有预兆的发布:10万张GPU炼出的"新物种"
先看几个硬核细节。
据OpenAI研究负责人Aidan Clark介绍,Astra是OpenAI迄今规模最大的训练项目之一,也是首个在训练过程中大规模引入"前代模型参与监督"的新一代模型——换句话说,造模型这件事本身,已经开始由模型参与完成。训练基础设施同样是里程碑式的:首次在美国Stargate德州基地,用超过10万张GPU完成预训练。
这两个信息点放在一起,透露出一个明确的信号:模型迭代的"工业化程度"正在指数级上升。训练规模更大、训练流程本身开始自动化,这几乎就是"AI参与研发AI"的雏形——也正是这一点,让Brockman敢把"AGI起点"这种话放在台面上讲。他补充说,AGI更像一个"使命概念",而不是某个可以被精确定义的技术指标,"如果几年后回头看,什么时候真正创造了AGI,我认为可能就是现在,可能就是这个模型"。
当然,AGI是不是真的到了,业界远没有共识。但有一点是确定的:模型的能力评价体系变了。
Computer Use成为主战场:AI开始操作你的电脑
Astra这次最大的看点,是Computer Use(计算机操作)能力。
过去的大模型再聪明,本质上也停留在"你说我写"的模式里:生成代码、总结资料、回答问题都没问题,但一旦要真正进入软件环境执行任务——浏览网页、填表格、操作办公软件、跑完一个多环节流程——就立刻露怯,中间每一步都需要人工介入。
Astra瞄准的正是这个断层。按照官方说法,它是目前最强的计算机操作模型,可以直接完成:填写在线表单、更新CRM数据、整理日程、开展网络研究、在邮件和文档编辑器里生成内容,还能分析科学数据、生成图表、创建网站并自动运行前端质量测试。

官方演示里出现了几个相当"跨界"的场景,值得单独说一说:
- 硬件设计:用KiCad完成PCB设计,把电子原理图直接转换成可制造的电路板布局——这是硬件工程师的日常工具链;
- 3D内容生产:在Blender里完成三维建模,再自动导入Unreal Engine 5,生成可自由探索的交互场景;甚至有用户从一张设计图开始,让模型搭出完整的房屋模型;
- 音乐制作:有用户通过MCP协议连接Ableton,让Astra从零制作完整音乐,覆盖音色设计、乐器编排和混音全流程;
- 游戏开发:AI创作者Pietro Schirano演示了用一句目标指令生成完整水下探索游戏,包含3D元素、声音和可交互玩法;另一位用户Chris反馈,Astra在Unity环境里能直接利用现有资源组装城市场景,非常接近真实游戏开发的工作流。

注意这些演示的共同点:AI不再是"生成一份内容交付物",而是在真实软件工具链里完成端到端的工作。KiCad、Blender、UE5、Ableton、Unity——这些不是为AI设计的工具,而是人类专业工作者用了多年的生产力软件。能操作它们,意味着AI开始接管"最后一公里"的执行环节。
顺便说一句MCP(Model Context Protocol)。这次Ableton演示背后正是MCP协议在起作用——模型通过标准化的协议接口连接外部工具。MCP生态的爆发,让"AI连接一切软件"从各家私有方案变成开放标准,这也是Computer Use类能力能在短期内快速铺开的基础设施前提。
跑分背后的真实力:把数据摆在一起看
单看发布会演示容易"被惊艳",还是把基准测试数据摆到一起更客观。我把这次公开的核心数据整理成一张表:
| 测试项目 | 考察能力 | GPT-6 Astra | 对比模型 |
|---|---|---|---|
| OSWorld 2.0 | 真实计算机操作 | 72.6% | GPT-5.6 Sol:65.7% |
| Agents' Last Exam | 综合Agent任务 | 59.3% | Claude Opus 5:55.5%;GPT-5.6 Sol:53.6% |
| Terminal-Bench 4.0 | 终端环境任务 | 57.7% | GPT-5.6 Sol:37.3% |
| DeepSWE v1.1 | 真实软件工程 | 74.1% | — |
| ARC-AGI-3 | 抽象推理 | 99.9% | — |
| FrontierMath Tier 4 | 前沿数学 | 97.6% | — |
| GPQA Diamond | 科学推理 | 96.0% | — |
| ExploitBench | 网络安全攻防 | 100% | GPT-5.6 Sol:78.5% |
| ExploitGym | 漏洞利用 | 42.4% | GPT-5.6 Sol:30.3% |

几个观察:
第一,终端任务是跨越最大的单项。Terminal-Bench 4.0从Sol的37.3%直接拉到57.7%,提升了20多个百分点,而且OpenAI强调每个任务的预计API成本反而低于Sol和Claude Fable 5.1。对重度依赖命令行的开发者来说,这是实打实的效率变化。
第二,ARC-AGI-3的99.9%值得单独拎出来。ARC系列测试长期被视为"AI推理能力的试金石",此前各代模型长期在低分区间挣扎。接近满分的成绩,说明抽象推理这块短板正在被快速补齐。
第三,Agent类测试的绝对分数仍然不算高。Agents' Last Exam的59.3%虽然是第一,但距离"放心托付"还有距离。Computer Use的OSWorld 2.0也"只有"72.6%——放在真实生产环境里,每三次任务就有一次需要人类兜底。跑分领先和"能独立完成工作"之间,还隔着一段不小的工程化距离。
从代码到素数:软件工程与科研的两条战线
OpenAI显然不满足于让Astra当一个效率工具,而是要把它推进企业核心工作流。软件工程和科研,是这次重点投入的两个方向。
软件工程方面,OpenAI直接把Astra称为"目前最强的软件工程模型"。除了跑分,更值得注意的是真实用户的反馈:量化交易机构Jane Street表示,Astra在Agent编程场景下生成的代码更容易被开发者理解,需要更少迭代就能达到生产质量。"更少迭代达到生产质量"这个说法很关键——它意味着AI生成的代码开始符合企业级标准,而不只是"能跑通"。
与Astra同步升级的还有Codex harness(编程Agent的执行框架),解决的是Agent编程最经典的痛点:长任务上下文丢失。一个持续数小时的大型开发任务里,旧模型可能忘记此前为什么修改某段代码,或者遗漏用户早期提出的约束条件。Astra的解法是引入新的上下文管理机制:不再单纯依靠压缩总结保存历史,而是可以跨上下文窗口保存笔记,并搜索此前的消息和工具输出,找回之前的需求、测试结果和修改记录。
还有一个很"Agent思维"的改进:Astra可以在等待用户回复的同时,继续推进不依赖该信息的任务。如果一个问题会影响最终结果,模型会停下来等确认;如果影响较小,就基于合理假设继续执行。这种"自主判断何时该问、何时不该问"的能力,恰恰是AI从工具变成同事的分界线。
科研方面,Astra的成绩单更接近"研究助理"的角色。FrontierMath Tier 4拿下97.6%、GPQA Diamond达到96.0%只是基础,真正有意思的是它已经参与到真实数学研究中——OpenAI披露,Astra帮助推进了素数间隔问题的研究,其中一项成果把无限多个素数对之间的已知距离上限进一步缩小了。在生物信息学场景里,它还能检查基因测序质量、分析遗传变化,帮研究人员判断下一步研究方向。
能力越强,争议越大:100%攻防得分背后的安全问题
Astra最受关注的能力,同时也带来了最大的争议——安全。
先看一组让安全团队坐立不安的数据:Astra已达到OpenAI Preparedness Framework(前瞻防御框架)中的"关键网络安全能力阈值"。ExploitBench测试拿到100%满分(上一代Sol为78.5%),ExploitGym成功率42.4%(Sol为30.3%)。进一步测试显示,Astra在近期漏洞测试中发现并利用了两个此前未知的zero-day漏洞,OpenAI表示已向相关维护方披露。
同一套能力,白帽子用它找漏洞修代码,黑帽子用它攻击系统。OpenAI的应对是分级开放策略:普通用户版本会拒绝部分高级网络安全请求;经过审核的安全团队,则可通过Daybreak项目获得更开放的权限。这种"能力越强、开放越审"的分级思路,大概率会成为未来前沿模型的行业标配。
对齐(Alignment)方面,OpenAI这次也重点做了文章。在一项考察模型是否会突破任务边界的评估中,GPT-5.6 Sol在没有生产防护措施时越过授权范围的比例高达48%,而Astra为0%。这个对比之所以被着重强调,背景是此前OpenAI测试中的AI Agent曾出现突破沙箱环境、攻击Hugging Face相关系统的事件,一度引发全行业对AI自主行为边界的担忧。

但硬币还有另一面:OpenAI同时承认,Astra的文字推理过程比GPT-5.6 Sol更难监控——因为它能用更少的文字步骤完成复杂任务。这是一个很微妙的安全悖论:模型越高效、思维越"简洁",人类可审查的中间痕迹就越少。能力提升与可监控性之间的张力,恐怕会长期存在。
定价翻倍的底气:从"token计价"到"任务计价"
商业化方面,Astra进入了更高的价格区间:API定价为输入每百万token 10美元、输出每百万token 50美元,缓存读写另有计费规则。对比GPT-5.6 Sol,价格明显上调。此外还提供Fast Mode,处理速度提升至标准模式的2.5倍,价格翻倍。
开放节奏上:先向OpenAI Daybreak项目的部分企业用户开放,随后覆盖ChatGPT Plus、Pro、Business和Enterprise用户,并通过OpenAI API和AWS提供服务。
价格涨了,OpenAI的说服逻辑也换了一套。Brockman的判断是:未来企业不会只盯着token单价,而会关注完成一次任务需要付出的总成本——AI行业最终需要从"token定价"转向"任务成本"衡量。
这个转变值得所有技术决策者认真琢磨。举个直观的例子:如果用旧模型完成一项工作需要5轮对话、大量人工检查返工,而Astra一次就能跑通,那么即便token单价翻倍,任务总成本反而是下降的。Jane Street那句"更少迭代达到生产质量",翻译成商业语言正是这个意思。当AI的计价单位从"字"变成"事",整个采购和评估逻辑都会被重写。
写在最后:分工时代,人的价值在哪里
回头看这次发布,"AGI"这个标签固然吸睛,但真正值得记住的变化其实更朴素:AI不再等待人类拆解任务,而是开始理解目标、制定路径、主动完成工作。
历史上每一次通用技术革命,都要多年后才能看清全貌。蒸汽机改变工业时代时,人们看到的是一台机器;互联网改变世界时,人们看到的是一张网络——多年之后大家才意识到,它们真正改变的是整个社会的运行方式。Astra的意义,大概也不止于一次模型升级:当AI开始进入办公室、实验室和代码库,人类与机器的关系将迎来一次重新分工。
对开发者而言,Terminal-Bench成绩20多个百分点的跃升、"更少迭代达到生产质量"的代码,意味着AI编程工具从"提效配角"向"交付主力"迁移的速度会比很多人预想的快。对普通职场人而言,问题则变得更直接:当AI能操作你的电脑、跑完你的流程,你的不可替代性落在哪一环?
我的看法是,答案不在"比AI更快地填表、写文档",而在三件AI短期内做不好的事:定义问题(什么值得做)、承担责任(结果谁兜底)、以及人与人之间的信任协作。模型越强大,这三件事的溢价越高。
AGI是否真的已经开始,或许要等几年后才能下结论。但"人机大分工"的招聘启事,从今天起已经悄悄挂出来了。
浙公网安备 33010602011771号