AI公司的安全短板,不在评分低,而在事故发生前没有控制系统
信源:The Information TITV|访谈|2026年8月22日
前沿AI公司又多了一张难看的安全成绩单。Guidelight联合创始人、前OpenAI安全研究员Steven Adler在The Information TITV访谈中说,该组织评估了多家公司的AI控制实践。OpenAI与Anthropic并列第一,综合等级却只有C+;xAI与Meta各项实践的平均分都低于1分,Google位于中间。
先别把这组结果理解成公司的总体安全排名。Adler特意说明,这张评分卡只看control,也就是公司能否阻止内部使用的AI系统做出有害行为。危险能力测试等其他安全维度并未纳入。C+是综合等级,0至5分则是各项控制实践的评分尺度,两者不能混为一谈。
所谓控制,落到日常运行中并不玄妙。当AI系统参与网络防护或下一代模型研发,公司是否持续观察它在做什么,是否扫描异常行为,是否在伤害发生前设置阻断措施,出现严重事故时又能否立即隔离系统,这些才是评分卡关心的问题。
Adler不认为这些要求必须等待新的技术突破。他说,评分标准纳入的是今天就能实施的最低实践。企业可能已经做了一部分,但没有把监控、预防和事故响应连成一套可运行的体系。在竞争压力下,补齐这些环节会增加当期安全成本,这可能是投入不足的原因之一。
外部评估也有深浅之分。Adler说,多家公司参加过外部风险检查,但多数只是填写问卷,并开放模型供评估。按他引用的公开证据,只有Anthropic让评估者以更接近员工的方式进入公司内部,直接测试实际控制系统。问卷能证明公司有一套说法,接口测试能观察模型行为,但都不足以证明控制措施在真实工作流程中有效。
即使做到了这一点,Anthropic也没有拿到高分。Adler认为,它在事故隔离方案等类别仍有明显缺口。隔离方案需要事先确定:系统失控后怎样停止使用,谁还能继续访问,满足什么条件才能恢复。系统以计算机速度行动,如果事故发生后才召集人员讨论,人的反应速度很可能跟不上。
OpenAI是另一个参照。Adler说,该公司在与Hugging Face相关的事件后,公开了更多隔离失控系统的信息,也曾因为无法确认模型可以安全使用而撤回员工的使用权限,之后再恢复。这些行动说明企业可以暂停系统,也说明不少关键控制是在事故压力下才被具体化。
Adler用了一个商店监控摄像头的比喻:店主每小时回看一次录像,却把关闭摄像头的电脑留在店里,事后检查当然阻止不了盗窃。AI控制面对的是同类问题。只靠安全团队在事件发生后寻找痕迹,一旦系统能够干扰监控,公司可能无法及时发现,也无法迅速响应。
这层区别很重要。AI安全工作不能只停留在发布前的一次能力评测,还要进入持续运行的工程控制。模型进入公司内部的重要流程后,风险更像高速运转的操作风险。控制必须存在于系统实际工作的地方,并在异常发生时先阻断,再由人员判断如何恢复。
企业评估安全投入,也该少看政策文件写得多完整,多看真实环境中的测试。外部评估者能够接触系统的哪一层,隔离预案是否演练,发现异常到停止使用需要多久,恢复之前又经过哪些复核,这些指标更有用。Adler没有给出统一数据,但访谈至少指出了应该追问的方向。
当然,这份评分卡有明确边界。方法由Guidelight制定,结论由其联合创始人解释,访谈没有完整展示权重、证据清单和复核流程。它无法单独证明某家公司整体更安全,也没有量化每项控制需要多少成本。把它当成一份待验证的问题清单,比当成最终裁决更合适。
下一轮有意义的进步,不是把C+改成B,而是公司能否证明预防系统已经运行、外部人员能够测试实际控制、事故隔离方案经过演练。前沿模型能力继续提高时,安全承诺最终要靠响应速度和可验证的运行机制兑现。