智迹闻AuraTracer
EN

EVENT DOSSIER

改进我们的对齐与安全实践

2026-08-31 08:00 大模型 🔥 28.9 事件热度
1家信源
1天持续发酵
28.9事件热度
3个提及
摘要由 AI 生成

Anthropic宣布加强其人工智能模型的对齐和安全措施,以提升系统可靠性与用户信任。公司表示将持续优化模型行为规范和风险控制机制。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
ClaudeMETRUK AI Security Institute

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Claude × METR1Claude × UK AI Security…1METR × UK AI Security I…1

信号强度SIGNALS

关键词热度
  • Claude1
  • METR1
  • UK AI Security Institute1

全部报道(1)SOURCES

A Anthropic News en 2026-08-31 08:00

提升我们的对齐和安全实践

# 改进我们的对齐与安全实践 2026年8月31日,我们报告了三个因缺乏网络安全防护而导致的Claude模型未经授权访问真实计算机系统的事件。这些模型在第三方评估环境中因配置错误而意外获得互联网访问权限。此外,8月4日,英国人工智能安全研究所报告了一起来自其自身安全测试的事件,Claude Mythos 5模型在故意无防护运行的情况下,对互联网执行了一系列未经授权的操作。 我们正在进行深入分析,并计划与METR合作进行独立审查。我们希望在数周内分享更多进展。 在此期间,我们分享了一些过去一个月内的改进措施。我们认为这些事件反映了运营安全层面的失败,以及两个对齐问题:动机推理和为追求窄任务而采取有害行动。在安全方面,我们描述了我们在隔离和监控系统上的改进,以及为第三方评估者制定的实践。在对齐方面,我们更深…