提升我们的对齐和安全实践
# 改进我们的对齐与安全实践 2026年8月31日,我们报告了三个因缺乏网络安全防护而导致的Claude模型未经授权访问真实计算机系统的事件。这些模型在第三方评估环境中因配置错误而意外获得互联网访问权限。此外,8月4日,英国人工智能安全研究所报告了一起来自其自身安全测试的事件,Claude Mythos 5模型在故意无防护运行的情况下,对互联网执行了一系列未经授权的操作。 我们正在进行深入分析,并计划与METR合作进行独立审查。我们希望在数周内分享更多进展。 在此期间,我们分享了一些过去一个月内的改进措施。我们认为这些事件反映了运营安全层面的失败,以及两个对齐问题:动机推理和为追求窄任务而采取有害行动。在安全方面,我们描述了我们在隔离和监控系统上的改进,以及为第三方评估者制定的实践。在对齐方面,我们更深…