【天风海外】OpenAI GPT6 Astra :Looped Transformer大模型AGI首秀?科学与三维能力大幅增强,长程Token大幅下降
OpenAI于9月3日发布GPT6,目前仅向合作伙伴开放,
定价为$10 / $50 每百万 token,Sol 的 2.5 倍,与 Fable 5.1 持平;训练为Stargate 德州站点 10 万颗以上 GPU,OpenAI 史上最大训练运行;首次由前代模型大规模参与监督训练。
模型架构:OpenAI系统卡未明确表述,但 此前变相承认采用Looped transformer/Recurrent Depth。
模型能力“达到AGI时代”:科学/几何/3D/电脑使用能力大幅增强,ARCAGI达到99%,相比5.6Sol 的7.8%大幅提升
Token量大幅下降:从各种任务实测来看,我们认为单任务相比5.6 Sol下降量2-6X, 且能力大幅提升。OpenAI表示在Codex中Codex 中 Astra 不再压缩每个对话,而是用跨窗口笔记替代压缩,旧窗口可检索。
我们认为什么影响?1、大模型每次前向传播里的计算更多,"不容易用语言表达的推理类型"能力大幅提升, 乐谱、零件多视图、GUI 截图、科研数据很难写成清晰文字,这些地方能力提升10倍,极度接近人类,因此OpenAI 总裁Greg表示进入AGI时代
2、Astra参数量/单Token成本已经相比5.6Sol大幅提升,但参数量可能略低于Fable,scale 加长程 RL 提升的是"做",不是"知";知识容量的增长是另一条曲线,而且在那条曲线上 Anthropic (AA评测)仍然领先。OpenAI已经在训练更大参数量模型
3、输入侧的前缀缓存池在扩大,输出侧 KV 增长放缓,Token我们认为下降2-6X,我们认为模型转向更加Compute Bound而非Memory Bound。。
4、OpenAI额外投入推理20%算力实现监控
5、从硬件来看,我们认为对GPU/ScaleUp,CPX,SRAM未来需求大幅提升,而DRAM需求被短期压缩,从应用来看,科学CADUnityEDA等能力大幅提升,有物理验证壁垒的环节受益:自驱实验室,抗体数据,先进工艺的签核、仿真,传统RPA最受损。Agent监控与网安受益。