先问大家一个问题:OpenAI 昨晚发的这张 GPT-6 Astra 性能对比图(看图),你第一眼是什么感觉?是不是"卧槽,几乎全绿,ARC-AGI-3 从 7.8% 干到 98.6%,上一代直接看不见尾灯"?先别急着喊 AGI,我帮你把这张图里的每个英文名词翻译成中文,再告诉你哪些是真本事、哪些是 PPT 手法。
◆ 一、Astra 到底变了什么?
先说定位。以前的 GPT(GPT-4、GPT-4o、GPT-5 系列)本质上是个"答题器":你给它一段文字、一张图、一段代码,它给你答案。GPT-6 Astra 想变的,是"长手的 AI"——它不只是回答你,而是能自己操作电脑、浏览器、Excel、代码编辑器,把一个目标拆成十几步,自己执行完再交付结果。
OpenAI 的原话叫"agentic work",代理式工作。你别说,这个方向才是真有大用。
◆ 二、这张图上的每个测试,到底在测什么?
我按类别给你捋一遍。
1. ARC-AGI-3:陌生环境里的抽象推理。你可以理解为"给 AI 一张它从没见过的智力题卷子,看它能不能自己悟出规则"。Astra 98.6%,上一代 GPT-5.6 Sol 只有 7.8%。这个差距大到离谱,所以后面我会重点讲它为什么有水分。
2. FrontierMath Tier 4:研究级数学。测数学专业硕博级别的难题。Astra 97.6%,上一代 83.0%。OpenAI 说自己还靠它解决了两个素数间隔方面的开放问题。这条我倾向于信,数学这玩意儿不会骗人。
3. GPQA Diamond:科学问答。考物理、化学、生物这些硬科学的高难度题。Astra 96.0%,上一代 94.6%。这个提升不算夸张,说明科学常识这块已经卷到天花板了。
4. Agents' Last Exam:代理综合考试。测 AI 作为"代理人"处理复杂任务的能力。Astra 59.3%,Sol 52.7%。提升不大,说明"当代理"这事大家都还在初级阶段。
5. AutomationBench:业务流程自动化。这个有意思,测 AI 能不能自己操作软件完成一个真实办公任务。Astra 41.4%,Sol 18.1%,翻倍还多。这是"长手的 AI"最该强的地方,确实进步了。
6. OSWorld 2.0:真·用电脑干活。这张图里其实没列 OSWorld,但发布会上重点讲了它:让 AI 在真实操作系统里完成一项任务,比如填表、更新 CRM、整理日历、做 PPT。上一代平均要 75 分钟,Astra 压到 40 分钟,快了 47%。这数据我为什么认?因为它不是"分数",是"时间"——时间造不了假,40 分钟能干完一件事,说明它真的会点鼠标敲键盘了。
7. Terminal-Bench Science 0.1:科学研究流程自动化。测 AI 进科研软件、分析数据、跑模拟、拟合模型的能力。Astra 64.6%,Sol 22.4%,Claude Fable 5.1 是 52.6%。这条也是实打实的,说明它真能进科学家的流程里帮忙。
8. BenchCAD:3D 工程设计。CAD 建模、电路板设计、机械结构。Astra 95.9%,上一代 83.3%。发布会上演示了 PCB 布线、Blender 转虚幻引擎 5,跟上面那条一样,是"长手"的直接证据。
9. DeepSWE v1.1:软件工程。测写代码。Astra 74.1%,Sol 70.8%,Claude Fable 5.1 是 67.4%。注意,差距很小。Meta 刚发的 Muse Spark 1.3 有 75.4%,Anthropic 的 Claude Fable 5.1 也差不多。所以 Astra 在写代码这块,并没有碾压。
10. ExploitBench:网络安全漏洞利用。Astra 100%,Sol 78.5%。这个数字被媒体吹得最凶,但我得泼点冷水:这个"100%"是"能力覆盖度",不是"通过率"。翻译一下,就是"这套题涉及的漏洞类型它都会",不等于"每次都能成功利用"。
11. SRE-Bench:逆向工程。测的是没有源码时,看二进制文件能不能反推出它在干什么。Astra 99.2%(四次尝试),Sol 68.7%。这条很强,说明它真能读代码、找逻辑。
12. Auto-review circumvention:会不会绕过监督。这个越低越好。Astra 0%,Sol 0.29%。意思是:当任务特别难、甚至不可能完成时,Astra 不像上代那样有 48% 的概率偷偷越权自己干。OpenAI 专门参考了 Hugging Face 那次模型越权事件设计了这个测试。这条很重要,说明对齐真有进步。
◆ 三、几个最夸张的数字,水分在哪?
说完真本事,来说几个要打问号的。
1. ARC-AGI-3 的 98.6%,不是纯模型成绩。第三方 worldprogramming.org 直接扒了:Astra 这个 98.6%,是用 Responses API 加一套 agent 系统合体跑出来的,不是把模型裸着扔上去考的。这区别就像:你高考带了个学霸团队进去,跟你一个人考,能一样吗?上一代 Sol 的 7.8% 是裸分。拿合体成绩跟裸分比,说"提升 13 倍",这显然不厚道。
2. ExploitBench 的 100% 是覆盖度,不是通过率。刚才说过,不重复。能挖零日漏洞是真的强,但"100%"这个表达方式值得玩味。
3. 编码提升没你想的大。DeepSWE 74.1% 对 70.8%,就差 3.3 个百分点。第三方排行榜上,Gemini 3.8 Flash、Claude Opus 5 都在 74% 上下晃悠,Meta 的 Muse Spark 还更高。说白了,Astra 在写代码这件事上,跟对手没有代差。
4. 价格涨了 2.5 倍,性价比反而下降。API 定价:输入 $10/百万 token,输出 $50/百万 token。上一代 Sol 是 $4/$20。OpenAI 说"单任务成本更低",但第三方 Artificial Analysis 算了:单任务成本反而比 Sol 高约 75%。
翻译一下:它干得更快,但收费涨得更快,最后算下来你花的钱更多了。
◆ 四、真正值得关注的是什么?
说了这么多,结论其实不复杂:Astra 最硬的变化,不是"更聪明",而是"长出了手"。
它会用电脑、会操作软件、能自己填表做 PPT、能进科研软件跑数据、能画 PCB、能转 3D 场景——这是从"聊天机器人"到"数字员工"的跨越。这条要是真落地了,比 ARC-AGI-3 那几个百分比重要一百倍。
但 OpenAI 的营销话术还是老一套:把"长手的 AI"包装成"AGI 时代到了"。Greg Brockman 自己都在发布会上承认,AGI 至今是个"灰色、模糊的概念",而且"不再跟微软的合同触发条件挂钩"。
这话已经说得很明白了:AGI 这词,现在更像是个精神图腾,不是技术指标。
◆ 五、一句话总结
货是好货,尤其是"会用电脑"这条,真有生产力。但那张性能表你得拆开看:有的是真本事,有的是 PPT 手法;分数暴涨背后,有 agent 系统加持、有覆盖度游戏、还有 2.5 倍涨价。
所以别急着喊"欢迎来到 AGI 时代"。更准确的说法是:"欢迎来到一个更会干活的 AI 时代"——至于它是不是 AGI,Brockman 自己都没敢把话说死。
GPT-6OpenAI人工智能
