Frontier AI labs still won't say how they'd contain a rogue model | TechCrunch
Guidelight AI Standards 组织对 OpenAI、Anthropic、Meta、Google 和 xAI 五家领先实验室进行了安全评估,发现仅有少数机构发布了针对 rogue model(失控模型)的 containment plan(收容计划)。该计划旨在明确一旦 AI 试图颠覆人类控制时如何切断权限及完全关闭系统。OpenAI 得分最高,而 Anthropic 和 Meta 得分最低。此次评估基于各公司公开的计划,涵盖内部日志监控、异常行为熔断机制、第三方审计及具体失控应对方案等指标。随着具身智能(agentic AI)在企业系统中承担更多自主角色,以及加州和新 York 监管机构开始要求披露,这些发现揭示了实验室在运营风险与实际言论之间的差距。Guidelight 首席科学家 Ste…