OpenAI 首席科学家:异星心智警示,全人类需审慎踩下刹车
上周,OpenAI 把新一代模型 GPT‑6 Astra 放出来了,官方给的说法是操作电脑、写代码、搞网络安全、做前沿科研这几项能力都上了一个新台阶。
英伟达的黄仁勋跟着在网上表态,说这套系统是拿超过 10 万片自家 Grace Blackwell NVLink72 芯片训练出来的,还撂下一句 "AGI 已经到来",顺带预告后面还有 40 万颗 GPU 算力将陆续上线。
外界还在消化这波庆祝的时候,9 月 6 日,OpenAI 首席科学家 Jakub Pachocki 自己发了篇文章,叫《An Alien Mind》,调子跟公司这边完全不是一个方向。
他写得很直白:现在没有一家实验室把对齐和监控这两件事做扎实到能撑住全速训练。
他盼着行业能主动放慢速度,直到大家先定出一套共同的安全底线,而且这个底线他希望以后能变成政府层面能管的东西,交给第三方审计或者国际机构去盯着执行,不是各家公司自己说了算。
同一周里,一边是芯片厂商在加码算力、公司高层喊着 AGI 已到,一边是研究这套系统的人自己出来喊停,这种反差不太常见。
Pachocki 在文章里把 "对齐" 拆成两块。一块是目标对齐,模型有没有按照你给的指令去做;另一块是价值对齐,遇到指令模糊、被诱导甚至利益冲突时,模型能不能靠自己判断守住底线。
他说现在业内做得比较好的,基本都停留在第一块,第二块才是真正难啃的部分。
他还回忆了 2023 年年中的一件事,当时团队在一个叫 RLSlow 的项目里,第一次验证推理模型的训练规模具备拓展潜力,预训练的模型自身就能够形成一套完整的思考过程,不用人手把手教。
他说那次结果给了他一个很强的预判:照这个速度往下走,行业发展很可能走向模型递归自我改进的阶段。
监控这块,Pachocki 的说法也不乐观。过去 OpenAI 团队依靠读取模型输出的思考文本,作为判断模型风险倾向的重要手段。但他说内部评估显示,这套办法的可靠性正在一点点往下掉 —— 模型接触的场景越来越复杂,模型自己也越来越会处理和包装这段思考过程。
他也提到,GPT‑6 Astra 在对齐这块确实比上一代 GPT‑5.6 Sol 做得好,但他没把这个当成安全终点,反倒更担心智能往前冲的速度,会一直比对齐追得快。
他没有回避风险到底会来自哪,模型能力越强,一旦对齐没跟上,系统被诱导做出偏离预期行为的可能性也跟着往上走,这也是他把呼吁政府和国际机构介入放在文章最后的原因 —— 单靠公司自己盯着自己,他觉得已经不太够用了。
值得说一句,他不是纯粹在唱反调。文章里他也讲,如果对齐这件事真能跟上,AI 能带来的科研突破和实际生活层面的改善会很扎实,他自己对这块是抱期待的,只是觉得眼下这个节点,该踩一脚刹车了。
一头是芯片和算力往上堆,一头是首席科学家自己喊话要政府和国际机构介入定规矩,这两件事发生在同一周,说明什么,留给大家自己判断。
参考来源:36 氪,2026‑09‑07,《GPT‑6 Astra 刚发布三天,OpenAI 首席科学家喊 “刹车”》

