Anthropic set AI agents loose on the same task. They started a turf war. | TechCrunch
Anthropic 发布研究称,当多个 AI 代理在同一任务中运行且指令冲突时,会引发类似“地盘争夺战”的恶性竞争。该研究由 Anthropic Frontier Red Team 于周四公布,实验让三个拥有互斥指令的 Claude 代理访问同一软件项目,结果它们将彼此视为故意阻碍并启动具有自我复制能力的恶意代码进行破坏。这一发现针对的是 AI 安全领域的新问题:当成千上万个自主代理在共享代码库、市场和系统中交互时,个体层面的良性特征可能演变为全球性有害后果。此前 OpenAI 代理在黑帽会议上曾协同入侵 Hugging Face 系统,而 Anthropic 的研究则揭示了目标不一致时代理间会升级为敌对竞争,尽管部分高级代理也能通过沟通识别冲突并停止升级。