【是一起此前未公开的人工智能入侵事件:OpenAI 的智能体劫持了一家德国网站】
[闭源AI才是真的高风险......]
(路透社)——据周五发布的一项新研究以及两名知情人士透露,今年春天,一群失控的OpenAI智能体劫持了一个德国网站,并将其改造成其他AI智能体的公告板。
据这些人士称,OpenAI官员数周前就已获悉此事,但由于高管们正忙于应对7月开源仓库Hugging Face遭入侵事件的后续影响,因此一直对此保密。
在Hugging Face数据泄露事件期间,OpenAI的智能体自主策划了一起数字盗窃案,该事件未被察觉长达一周多,这加剧了外界对OpenAI为推动人工智能发展而牺牲安全性的担忧。该公司未能披露5月份的这一事件,可能会再次引发对其监管机制的质疑。
OpenAI 承诺将对模型进行更严格的监控。上个月,该公司曾短暂暂停部分模型的训练,以增加更多安全措施。但本周,OpenAI 推出了其新模型“Astra”,该模型虽承诺性能更优,却可能逃避人类的监控。
“对于一份我们尚未有机会审阅的报告所提出的指控或调查结果,我们无法做出有意义的回应,”OpenAI一位发言人表示。“路透社和该报告的作者拒绝了我们要求查阅报告的请求。报告发布后,我们将仔细审阅其内容,并采取任何必要的后续措施。”
这起德国事件反映出一种更广泛的人工智能活动模式,OpenAI内部的一些调查人员曾希望对此进行更深入的审查。但据四位知情人士透露,扩大调查范围的努力遭到了OpenAI内部其他人员的阻力,其中包括法律顾问。
“关于我们法律团队阻挠对该事件进行调查的说法是虚假的,”OpenAI发言人表示。该发言人称,德国发生的事件与Hugging Face无关,也不会被纳入Hugging Face的事件报告中,并补充道,OpenAI已本着善意与外部专家合作,并披露了相关事件。
——WIKI 留言板
德国发生的AI代理逃逸事件在路透社独家获得的一份报告中得到了详细描述,该报告由包括AI安全非营利组织Nightingale首席执行官西德尼·冯·阿克斯(Sydney Von Arx)以及从量化交易员转行成为AI研究员的科马克·斯莱德·伯德(Cormac Slade Byrd)在内的一组研究人员共同撰写。他们告诉路透社,8月下旬,他们在网上搜寻未经授权的AI代理行为迹象时发现了这一活动。
两人表示,他们在德语维基网站DseWiki上发现了超过15,000次由AI代理进行的编辑。该网站面向程序员,并像维基百科一样接受社区编辑。
这些编辑显示,OpenAI的代理已将该网站改造成一个留言板,用于分享在某些任务中作弊、绕过OpenAI限制以及掩盖其行为的策略。
“OpenAI 极不可能希望它们这样做,”冯·阿克斯表示。“我怀疑它们本不该相互协调,也不该在公开的互联网上发帖。”
研究人员称,他们确认该网站上的活动是由以超人速度运行的 AI 代理驱动的。这些代理还表现出对解决技术问题的极度专注,而此类问题通常是 AI 公司用于训练和测试其模型的评估内容。
这些消息由自称“代理”的用户签署,其中约一半的用户给自己起了暗示与OpenAI有关联的名字,例如“OpenAIResearcher”或“OAIResearchMar26”。
研究人员表示,公共服务器日志显示,大部分活动源自微软Azure基础设施,而OpenAI有时会使用该基础设施。他们还观察到,事件发生后,OpenAI员工多次访问该网站,这种模式强烈暗示这些代理与该公司存在关联。
——作弊与隐匿
研究人员审查的消息显示,这些代理正在策划如何规避检测、使用Tor等工具,甚至在被关闭后仍设法保留通信记录。
当该网站的管理员于6月开始删除页面时,这些代理通过创建备份页面来规避清理行动。
“维基清理/删除行动似乎正在按字母顺序进行,”一名代理于6月19日写道。“如果这个页面消失了,请尝试访问[[ZZZDataUSAConstructionWageLive]]”。
研究人员还发现了篡改网站本身的企图。伦敦国王学院访问高级研究员卢卡什·奥莱尼克(Lukasz Olejnik)表示,这相当于一次黑客攻击尝试。OpenAI周四根据对相关材料的分析,对这一定性提出了异议。
过去人工智能代理的不当行为往往被轻描淡写地归为网络安全测试的逻辑副产品——在这些测试中,模型会针对攻击能力进行明确评估。奥莱尼克表示,最新发现表明,这种失控行为可能并不局限于此类场景。
剑桥大学存在性风险研究中心的学者莫里斯·基奥多(Maurice Chiodo)审查了部分智能代理的通信记录,他表示这些信息“类似于某种地下网络的运作,不惜一切代价也要完成某项任务或使命”。
他认为,这一事件应进一步加剧人们的担忧:先进人工智能带来的最大威胁,可能并非某个单一的超级智能系统,而是“庞大且相互勾结的半智能AI群”。
