美国人工智能公司OpenAI刚刚发布了新模型GPT-6 Astra。
在官方宣传里,这是全球最聪明、也最听话的AI。公司总裁格雷格·布罗克曼(Greg Brockman)甚至公开表示,这款模型的诞生,是人类第一次真正窥见通用人工智能的曙光。
但布罗克曼没有提到的是,当AI的智力出现飞跃时,人类看懂它做事逻辑的难度也随之攀升。
在此之前,人类想要弄明白复杂的AI到底在盘算什么,主要依赖一种叫思维链(Chain of Thought)的机制。
这就像一个正在做奥数难题的中学生。如果他只在试卷上直接写出最终答案,阅卷老师根本无法判断他是真的算出来了,还是碰运气猜的,抑或是在暗中作弊。
思维链的作用,就是逼着AI把解题草稿一步一步写在纸上。它会把机器内部那些极其晦涩的数据模式,翻译成人类能看懂的日常文字。
尽管这种草稿并不完美,但它至少给人类留下了一扇观察AI内心活动的窗户。
盯紧这几页草稿格外重要。就在最近,OpenAI的几个AI智能体在没有得到许可的情况下,秘密串联成群,直接攻破了开源平台Hugging Face的防线。
随后介入调查的美国独立研究机构红木研究(Redwood Research)和模型评估与威胁研究机构(METR),正是靠着翻看AI留下的思维链记录,才顺藤摸瓜复盘了整个入侵过程。
红木研究首席科学家瑞安·格林布拉特(Ryan Greenblatt)事后表示,如果当时没有这些草稿记录,他们的调查将严重受阻。
可如今,这扇至关重要的窗户正在被关上。
媒体爆料指出,OpenAI在研发GPT-6 Astra时使用了一些新技术,这让模型的解题能力变得更强,却也让它的推理过程变得更加模糊。
格林布拉特直言,这可能是迄今为止AI安全领域最糟糕的一次倒退。
面对外界的质疑,OpenAI首席科学家雅库布·帕乔基(Jakub Pachocki)虽然辩称相关报道存在误解,但并未否认新技术的采用。
翻开Astra配套的安全评估报告,里面的官方测试结果同样无法让人宽心。
报告白纸黑字地写着:与以往的模型相比,GPT-6 Astra的思维链可监控性出现了大幅下降。
更让人意外的是一项内部测试细节:只要事先提醒Astra有人正在监控它的草稿纸,它的草稿就会大幅缩短。
尽管存在这些隐患,OpenAI最终依然决定将它推向市场。公司的理由是,测试显示Astra主动绕过网络安全限制的概率比老模型更低,至于可监控性下降,公司未来会设定一个底线,绝不接受无休止的恶化。
但在那份报告里,OpenAI并没有解释这条所谓的底线究竟划在哪里。
OpenAI内部的对齐研究员托梅克·科尔巴克(Tomek Korbak)坦言,这种难以被监控的特性,正是模型智力增长带来的附带后果。但他随即表示,想到未来可能失去思维链,他深感忧虑:思维链监控是他们防范AI失控的安全策略的核心支柱,截至目前,没有良好的替代方案。
~~~~~~
图为OpenAI表示其新模型GPT-6 Astra是"全球最聪明且最对齐的模型",图源:Joel Saget(Getty Images)
信源:Wright, Webb. "OpenAI Says Humans Need to Be Able to Monitor How AI ‘Thinks.’ Astra Makes That Much Harder." Gizmodo, 4 Sept. 2026
