🔥GPT-6:循环架构升级,抬升智能上限 | 中信证券计算机
[玫瑰]GPT-6 Astra推出,端到端任务与自主操作能力显著加强
与前代GPT-5.6 Sol相比,Astra在推理与执行上实现了代际跨越:ARC-AGI-3测试从个位数跃升至99.9%,FrontierMath Tier 4达98%,OSWorld 2.0任务完成率从65.7%提升至72.6%且耗时从75分钟锐减至40分钟。
其核心优势在于端到端任务执行,GPT-6 Astra能直接操作电脑界面,将检索、分析、代码执行到交付物制作整合为完整工作流,在Terminal-Bench 4.0(57.9% vs 55.8%)、AutomationBench(41.4% vs 31.4%)等长程Agent测试中已超越Claude Fable 5.1等竞品。
[玫瑰]或采用循环Transformer的升级架构,有望抬升智能上限
根据the information等媒体报导,GPT-6 核心技术迭代核心为循环Transformer(Recurrent Transformer)架构升级,引入层内循环迭代+持久化KV记忆机制,无需大幅增加物理层数与参数量,通过单层网络的多次隐空间迭代就可以提升有效推理深度。同时,模型多数复杂推理步骤在隐状态内部完成,无需输出大量中间思维链Token,且持久化KV可跨时间步、跨迭代复用,彻底改变了传统架构逐层单向计算、KV实时重算即用即弃的模式。
[玫瑰]架构迭代带来算力与IO需求结构的切换,对高算力服务器硬件需求进一步抬升
一方面,内部迭代使单Token计算量小幅上升;另一方面,有效压缩任务整体Token输出量,且持久化KV缓存大幅缓解长序列场景下显存与IO带宽压力。整体来看,大模型推理瓶颈从显存IO带宽约束,一定程度上转向芯片算力利用率约束。因此,循环transformer有望拉升高算力服务器需求。
[玫瑰]循环Transformer增加思维链获取难度,理性看待对蒸馏的影响
循环Transformer架构将显式思维链转为隐空间计算,导致通过外部蒸馏手段获取模型思维链的难度增加。这对需要获取教师模型思维链过程的软蒸馏有影响,对只需要取得答案的硬蒸馏无影响。此外,随着以GPT-6为代表的模型走向端到端任务与CoWork场景,真实操作日志、执行轨迹等过程数据,其反哺价值已超越静态Benchmark答案。具备完整开发者生态与商业用户池的头部厂商,可通过真实数据闭环与RL迭代巩固优势,合成数据(RSI)则进一步放大其算法先发优势。
[玫瑰]建议关注海外算力、云产业链、国产模型及算力的相关公司:
1)海外算力,包括工业富联等;
2)云产业链,包括深信服、金山云等;
3)国产模型与国产算力,包括智谱、海光信息、中科曙光、浪潮信息等。
券商观点,仅供参考!!