【大模型/评测】近期大模型发布与评测要点如下:
OpenAI总裁称GPT6开启AGI时代GPT6正式发布 GPT-6 Astra 来了,Greg 说“欢迎来到 AGI 时代” OpenAI 今天(9 月 3 日)发布 GPT-6 Astra,自称“世界上最聪明、对齐最好的模型”。 总裁 Greg Brockman 在发布前的媒体沟通会上说得:他个人认为 OpenAI 已经做到了 AGI,“未来回头看,可能就是这个模型”。 先说大家最关心的问题:什么时候能用、多少钱。 首批只开放给 OpenAI 网络安全项目 Daybreak 的少数机构,未来几天陆续推送到 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 API 和 AWS Bedrock。 用量包含在现有订阅额度里,用完可以买额外积分。 企业版默认关闭,需要管理员手动打开。 API 模型名 gpt-6-astra,每百万输入 Token 10 美元,输出 50 美元,和 Anthropic 的 Claude Fable 5.1 定价完全一样,是 GPT-5.6 Sol 促销价的 2.5 倍。 另有 Fast 模式,速度最高 2.5 倍,价格翻倍。 【1】主打的是替你操作电脑 Astra 这次最强调的能力是电脑操作(computer use),也就是模型自己控制屏幕、点鼠标、填表单、在真实软件里干活。Brockman 的原话是“人在电脑上能做的,Astra 基本都能做”。 OpenAI 给的场景很具体:填网页表单、更新 CRM 客户记录、整理日历、在邮件或文档编辑器里写研究摘要、分析科学数据并画图、建网站并跑前端测试、安装软件并排查屏幕上出现的报错。演示视频里还有它在 KiCad 里做 PCB 电路板布线,在 Blender 里建房子模型再导入虚幻引擎 5 变成可行走场景。 速度是另一个重点。在 OSWorld 2.0 的延迟模拟里,Astra 完成一个任务约 40 分钟,得分 72.6%,GPT-5.6 Sol 要 75 分钟,得分 65.7%。配合更新后的 Codex 框架,Mind2Web 上的任务完成速度是 Sol 的 1.9 倍。 办公场景上,OpenAI 说 Astra 是它目前最擅长"按模板做 PPT"的模型,能沿用公司现有模板的排版和语气,做出来的文档、表格、幻灯片直接能用,而且学会了只把相关信息放进产出物,不再把无关内容一股脑塞进去。 【2】编程:多数基准领先,但不是全面碾压 OpenAI 称 Astra 是“迄今为止最好的软件工程模型”。Terminal-Bench 4.0 得分 57.7%,Claude Fable 5.1 是 55.8%,GPT-5.6 Sol 只有 37.3%。OpenAI 还强调单任务 API 成本比 Fable 5.1 低约 63%。 但看 OpenAI 自己贴的完整表格,情况没那么一边倒。 DeepSWE v1.1 上 Astra 74.1%,Claude Opus 5 是 73.7%,几乎持平; FrontierCode 1.1 两项,Claude Fable 5 都略高于 Astra; Artificial Analysis 的编程智能体指数,Astra 67.0 反而低于 Opus 5 的 68.1。 Jane Street 的 John Crepezzi 给了背书,说 Astra 生成的代码需要更少迭代就能达到上线质量,沟通方式也更容易让开发者跟上。 对开发者比较实用的一个变化在 Codex:以前长会话上下文(context)满了,模型只能把过…
OpenAI 今天发布了 GPT-6 Astra,官方口径是“代际跃迁”。总裁布罗克曼在媒体吹风会收尾时说:“欢迎来到 AGI 时代。”他还补充,几年后回头看,AGI 的起点“可能就是这个模型,就我个人而言,我认为我们已经达到了”。 不得不说,GPT-6 Astra 能力的提升,这次有实据,也有第三方的部分背书。ARC-AGI-3 是今年 3 月发布的交互式推理测试,模型要在没有任何规则的陌生游戏环境里自己摸索机制、规划行动,3 月发布时,最强的模型只有 0.51%。Astra 在 OpenAI 自设的“保留推理状态+上下文压缩”框架下做到 99.9%,上一代 GPT-5.6 Sol 在默认设置下只有 7.8%。ARC Prize 的独立复测确认了“阶跃式变化”,还给出一个更少被提及的数字,在 96% 的关卡上,Astra 用的动作比大多数人类更少,平均少 51.7%。它不是在模仿人类解题,而是自己发明了一套代数符号笔记,找到了另一条解题路径。数学上,Epoch AI 的 Frontier