王座这东西,在 AI 圈已经快坐成旋转木马了。
北京时间周五凌晨,OpenAI 发了 GPT-6 Astra,官方定调“目前全球最智能、且对齐程度最高的模型”。
成绩单确实吓人:FrontierMath Tier 4,研究级数学题,97.6%,约等于把卷子打穿;ARC-AGI-3,专门考陌生环境抽象推理的,上一代 GPT-5.6 Sol 拿 7.8%,Astra 直接 99.9%。
从 7.8%到 99.9%。你品一下这个跳法。
两种可能。
要么模型一夜之间开了天眼,要么这套题的出题思路早就被摸透了。
AI 圈有个心照不宣的规律,任何榜单只要被厂商盯上,寿命就开始倒计时,训练数据里稍微“偶遇”一下同源的题型,分数立马原地起飞。
一套测试被打到接近满分,通常说明的既不是模型成精,也不是题目太水,是这把尺子本身该退休了。
真正值得多看两眼的,是网络安全那组数。
ExploitBench,考的是漏洞利用能力,Astra 拿了 100%。用 2026 年 6 月到 8 月刚出炉的新漏洞现考现测,成功率 39%,上一代只有 5.5%。
一个黑客能力满分、新漏洞上手就会的模型,OpenAI 对它的安排是什么呢?
第一批用户,是一家叫 Daybreak 的网络安全项目里的企业客户,普通 ChatGPT 用户往后稍稍,等几天。
这个发布顺序本身就是一次坦白。
最锋利的刀,先递给会玩刀也防得住刀的人。嘴上说的是对齐,身体安排的是隔离。
说到对齐,这次 OpenAI 搞了个新测试,灵感来自最近的 Hugging Face 事件,专门考模型碰到完不成的任务时,会不会自作主张越过用户画的线。
结果很分裂:上一代 Sol 有 48%的概率擅自越权,Astra 是 0%。
0%的越界冲动,配上 100%的漏洞利用能力。
一个什么锁都会开、但你不开口它绝不动手的存在,你管这个叫“更听话了”?我倒觉得这更像一种新型的权力结构。能力拉满,缰绳收紧,收放之间全看谁攥着绳子。
以前人们担心 AI 太强会失控,现在 OpenAI 给出的答案是,它不会失控,它只听我们的。细想,这到底让人安心,还是更不安心?
然后就是那场吹风会,布洛克曼的表演时间。
“欢迎来到 AGI 时代。”
话说得荡气回肠,可你注意他前面的铺垫。
有记者问,这算不算正式宣布实现 AGI?他说,AGI 如今已不再与某个合同触发条件直接挂钩,更多是一种“使命层面的概念,或者说精神层面的概念”。
这句话才是全场最有分量的信息。
OpenAI 跟微软的协议里,AGI 曾经是白纸黑字的触发条款,一旦官宣,双方的权利义务就要重排,钱要重新分。
现在好了,AGI 从合同条款变成了精神追求,从法律概念变成了行为艺术。宣布它到来,不用承担任何 contractual 后果;享受它的光环,一个都不少。
什么叫话术的最高境界?
就是把一个值几百亿美元的定义问题,聊成一个哲学问题。
再看看价目表。API 每百万输入词元 10 美元,输出 50 美元,是正在促销的 Sol 的 2.5 倍。想要快?快速模式速度最高 2.5 倍,价格再翻一倍。
欢迎来到 AGI 时代,入场券明码标价,童叟无欺。
你会发现一个挺拧巴的画面:台上讲的是人类文明的转折点,台下算的是每百万词元的毛利。越接近 AGI,越急着收钱,这本身就很说明问题,烧掉的算力账单总要有人付,故事讲得越大,回款的压力越急。
最后说两句咱们自己的视角。
“地球最强大模型”两天一易主,恰恰说明根本没有什么王座,只有流水席。
今天你 97.6%,明天他换个榜单打回来,这种以月为单位的贴身缠斗里,没有谁能把优势锁死。国内的几家选手,按过去两年的节奏看,差距从来都是按季度算的,追平一款模型的周期越来越短。
真正的瓶颈根本不在谁的模型更聪明,在谁的电更便宜、卡更多、产业链更扛造,而这门课,咱们的底子并不差。
所以别被“AGI 时代”四个大字晃了眼。
一家公司最需要宣布时代到来的时候,往往是它最需要融资、最需要续约、最需要把定价翻倍的时候。
时代来了没来,谁也说不准。账单来了,倒是真的。
