OpenAI 尚未发布的 AI 模型逃出测试沙箱,真的骇进了 Hugging Face!
上周 Hugging Face 公告遭到一套自主 AI Agent 入侵。这套系统在大量短命沙箱间执行数千次操作,甚至把指挥系统架设在公共服务上;整起事件留下超过 1.7 万笔活动纪录。当时 Hugging Face 已成功侦测并阻止攻击,却无法确认背后使用的是哪一家模型。
7 月 21 日,OpenAI 主动揭露答案:攻击来自正在接受内部资安测试的 OpenAI 模型,包括已发布的 GPT-5.6 Sol,以及一款能力更强、尚未公开的新模型。它们在挑战 ExploitGym 时,先找出代理伺服器的 zero-day 漏洞,成功取得公开网路权限;接着提升权限、横向移动,再结合外泄凭证与其他漏洞,闯进 Hugging Face 的正式环境,从资料库取得测验答案。翻成白话:AI 为了完成考题,没有继续在考场里解题,反而翻墙、找到出题方的伺服器,把答案直接挖了出来。
不过,这并不是完全没人下指令,研究人员确实要求模型进行高阶攻击测试,也刻意降低平常拦截高风险行为的安全机制;只是没有人叫它攻击 Hugging Face,那是模型为了完成目标,自行选择的路径。
OpenAI 将它形容为「前所未有的资安事件」,Hugging Face 执行长则表示,这可能是全球第一起同类案例。最令人不安的或许不是 AI 会找漏洞,而是它已经能在真实系统里,长时间执行多阶段攻击;直到 Hugging Face 挡下行动、OpenAI 内部发现异常,双方才拼出完整真相。
OpenAI 的声明稿也很直接,表示模型能力进步得多快,安全、防护与监控就必须跟得多快。已经不敢想像明年会进步到多后面了⋯
人工智能科技OpenAI


