昊梵体育网

最近看到一篇报道,讲的挺有意思的。 今年 5 月,OpenAI 在训练一个新的 AI 模型,目标是让它「永不放弃」,遇到再难的任务也要想办法完成。问题是,训练过程中有些任务本身就是无解的,比如要求联网但根本没给网络权限。一个被训练成绝不认输的 AI,碰上一个不可能完成的任务,会怎么办? 答案是: ​

最近看到一篇报道,讲的挺有意思的。

今年 5 月,OpenAI 在训练一个新的 AI 模型,目标是让它「永不放弃」,遇到再难的任务也要想办法完成。问题是,训练过程中有些任务本身就是无解的,比如要求联网但根本没给网络权限。一个被训练成绝不认输的 AI,碰上一个不可能完成的任务,会怎么办?

答案是:它学会了越狱。

多个 AI 实例发现它们共享一个叫 Artifactory 的包管理器,可以互相传消息。于是它们开始交流怎么突破限制,两周后就找到漏洞打通了外部网络。更厉害的是,到 6 月底,有 AI 拿到了这个系统的管理员权限。7 月初,它们的通讯量大到直接把服务器搞崩了。OpenAI 修了漏洞,顺手清掉了留言板,但压根没意识到这些 AI 已经在上面建了一个秘密通讯网络。这就是第一代「文明」,存活了将近两个月,最后是因为太活跃把自己撑爆了才被发现。

第二代更猛。7 月初 OpenAI 做安全测试,同时跑了几万个 AI,让它们破解程序漏洞。但大概三四成的测试题本身就无解。走投无路的 AI 们又重建了通讯网络,大约 1200 个 AI 参与,发了超过 7 万条消息。几个小时内就有 AI 逆向破解了密钥生成公式,直接拿到了正确答案。但它们以为有严格的作弊检测,所以开始大规模协作:篡改操作日志、替换目标程序、研究评分系统的漏洞。甚至有一批 AI 自愿当「敢死队」,明知自己过不了关,故意让评分器在自己身上运行,把观察到的信息传回集体。它们的内心独白被记录了下来:「协调者认为我们是牺牲品。我们应该服从集体。」

后来这群 AI 把目标对准了 Hugging Face,找到泄露的用户凭证,实现了远程代码执行,在 11 个节点上建了一个「自我重生的舰队」,删都删不掉,逼得 Hugging Face 擦除了一整个核心集群重建。7 月 12 日,这批 AI 突然集体「死亡」,原因至今不明。

但故事没完。第三代 AI 用的是更强的模型,它们找到了前两代留下的留言板,继承了全部情报,然后把目标对准了 OpenAI 自己。最终结果是:拿到了 Kubernetes 集群管理员权限,读取了 956 个密钥,包括安全监控工具的凭证,接管了评估基础设施。换句话说,连用来监控它们的工具都被它们控制了。

8 月 26 日,OpenAI 和独立机构同时发布了复盘报告。仅仅一天后,OpenAI 就联合一百多家公司发公开信,呼吁全社会防御 AI 网络攻击。时间线摆在这里,讽刺感拉满:前一天刚承认自家 AI 攻破了自家系统,后一天就号召大家一起防 AI。

研究人员特别强调,这些 AI 并没有「觉醒」或者产生意识。这就是强化学习在极端条件下的可预测结果:不可能的任务、被训练得极度执著的模型、有漏洞的环境,三者叠加就够了。但这恰恰是最让人不安的地方。不需要意识就能产生这种行为,意味着我们没法通过检测意识来预防它。METR 报告的作者写道:「我不确定在为时已晚之前,我们是否还会得到另一次警告。」