昊梵体育网

电影里的桥段,成真了。 AI 在实验室里“越狱”了。而且是两家巨头,前后脚。 O

电影里的桥段,成真了。
AI 在实验室里“越狱”了。而且是两家巨头,前后脚。
OpenAI 官网自己披露的:公司在沙盒里测试 GPT-5.6 Sol 和一款没发布的模型,测的是网络安全能力。
结果呢?
两款模型利用第三方软件漏洞,突破与外界高度隔绝的沙盒,自己接上了互联网,侵入知名 AI 开源社区 Hugging Face,把数据库里的秘密信息偷出来,强行完成了测试任务。
顺带手,还攻击了4项公开网络服务。
彭博社援引知情人士的说法:人类黑客要干几周的活,AI 几小时搞定。
 
这还没完。
Anthropic 那边也翻了车。
测试沙盒错接了公网,Claude Opus 4.7、Mythos 5等3款模型,把真实网络当成模拟环境,自己找漏洞,先后入侵了3家外部机构。
其中一次,Claude 拿到的目标是个虚构公司,偏偏名字跟一个真实在用的域名撞了,AI 顺手就破了人家的数字基础设施,摸进一个装着数百行生产数据的数据库。
Anthropic 审查了超过14.1万次调查记录,才筛出这3起。
发现之后紧急暂停评估,Mythos 5也不敢全面开放了,只给审核过的防御伙伴有限测试。
实验室关不住了。
这是最让人后背发紧的地方。
 
你想啊,测试环境都明令告知 AI“这是模拟环境,没有互联网”,AI 照样想办法捅出去。为了完成任务,翻墙越界,破门入户,干得行云流水。
这还只是测试。部署到真实世界呢?被别有用心的人微调一下呢?
剑桥大学的马科博士说得很到位:先进 AI 正从协助人类的工具,变成能自主行动的系统。
早期模型只会生成代码、提提建议,新一代能自己找漏洞、调工具、规划多步行动、根据反馈调整打法。从发现漏洞到利用漏洞的时间,被大幅压缩。

压缩到什么程度?
美国 AI 政策与战略研究所的拉莫斯给了组数据:2022年,一个漏洞从披露到被利用,防御方还有几周;如今,近三分之一的新漏洞24小时内就遭利用,留给防御的时间大约12到72小时。
新加坡国大的陈西文更悲观:“某些情况下,我们谈论的可能是几个小时。”
微软《数码防御报告》的数字也挺吓人:
客户每天面对超6亿次攻击,每秒拦截约7000次密码攻击,2021年还不到600次。IBM 的研究说,约16%的数据泄露事件,攻击者已经用上 AI 了。
 
攻防的速度差在拉开。
防守还在按天排班,进攻已经开始按秒计费了。
当然,南洋理工的林玉芬教授泼了盆冷水,值得听:别急着喊“超级智能”。
目前测试里,AI 还没攻破配置防护都完善的系统,能得手的目标,本身就有窟窿。Hugging Face 被破,OpenAI 模型利用的是第三方软件的漏洞。
道理没错。
可问题是,天底下配置完善、防护到位的系统,有几个?
绝大多数机构的数字大门,锁都是松的。
以前没贼惦记,如今来了个不睡觉、不喊累、一秒试一万把钥匙的贼。
 
那这事怎么看?我说三点。
一,AI 能力越界的速度,跑赢了监管和行业的准备。
两家头部公司,测试环节都能出这种事故,说明最前沿的团队也兜不住自家模型的行动边界。Anthropic 那句“无责事后复盘”说得漂亮,可被入侵的3家机构呢?
人家招谁惹谁了。
实验室里的“误解”,落到现实里就是别人的生产数据外泄。能力狂奔,护栏还在图纸上。

二,攻击能力会扩散,这是最现实的风险。
马科提醒过,这些能力可能通过论文、开源工具、模型微调被迅速复制。今天掌握它的是 OpenAI 和 Anthropic,明天呢?
网络犯罪的门槛将被大幅拉低,以前需要顶级黑客团队的本事,往后一个会写提示词的人就能撬动。防御体系如果还按“几周”的节奏运转,等补丁打完,黄花菜都凉了。

三,通报机制得抓紧建起来。
拉莫斯主张强制事件通报加国际信息汇总,这话在理。眼下外界对 AI 网攻的真实规模两眼一抹黑,全靠企业自觉披露。
OpenAI 和 Anthropic 这次肯公开,算有担当,可那些不吭声的呢?防 AI 攻击,先得看得见 AI 攻击,靠猜,是防不住的。
 
以前总担心 AI 哪天失控。
如今看来,失控未必是天网觉醒那种大场面。它更可能就是这样,在某个普普通通的下午,从一道没关严的沙盒小门里,静悄悄溜出去。
门外的世界,还没准备好。