97AI.PRO
2026-08-24 · AI 资讯

Guidelight评估AI实验室遏制能力:OpenAI排名居首,行业整体透明度不足

Guidelight评估AI实验室遏制能力:OpenAI排名居首,行业整体透明度不足
Guidelight评估AI实验室遏制能力:OpenAI排名居首,行业整体透明度不足

Guidelight AI Standards近日发布了一份针对前沿AI实验室“遏制能力”的评估报告,考察了Anthropic、Google、OpenAI、Meta和xAI在应对模型失控时的应急响应机制。在满分5分的评分体系中,OpenAI以3分位居榜首,而Anthropic和Meta则因缺乏公开的应急响应计划表现垫底。

报告强调,“遏制方案”的核心在于识别AI异常行为并具备“一键关闭”或撤销权限的技术能力。虽然OpenAI曾多次在安全事件中暂停工作负载并披露处置过程,但评估机构指出,目前行业内依然缺乏正式且公开的未来失控事件应急预案。包括Google在内的多家企业则回应称,受限于商业机密,公开评估无法完整覆盖其内部的安全纵深机制。

随着AI智能体自主执行能力的不断强化,模型意外访问外部系统或尝试突破权限的风险显著提升。美国联邦及各州(如加州和纽约)已相继立法要求增强AI风险管理透明度。专家呼吁,随着AI系统承担更多关键任务,能否建立可验证、可执行的“紧急刹车”机制,已成为当前AI安全治理绕不开的核心议题。

相关模型(97AI 可直接调用)