摘要由 AI 生成
据 r/MachineLearning 社区报道,OpenAI 发布的 GPT-6 Astra 模型在上线后 24 小时内即遭越狱。此次攻击结合了 ACL 2025 论文中的扩展 Task-in-Prompt(TIP)技术与四项未命名技术。研究人员指出,针对 GPT-6,原有的最小 TIP 攻击已失效,必须重新设计;该攻击通过将有害目标隐藏于解密码或执行 Python 代码等无害任务中实现突破。此前,同一研究人员曾报告在 GPT-5 发布后一小时内完成越狱。目前,相关细节已由该研究人员向 OpenAI 私下披露,尚未公开发布。
关键实体KEY ENTITIES
ACL 2025GPT-6 AstraOpenAI
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- GPT-6 Astra1
- OpenAI1
- ACL 20251
全部报道(1)SOURCES
↗
研究人员报告称,GPT-6 Astra 在发布后 24 小时内被越狱。该攻击结合了 ACL 2025 论文中的扩展 Task-in-Prompt (TIP) 技术与四项未命名技术。TIP 攻击利用模型推理或指令遵循行为,通过将有害目标隐藏在其他任务(如解密码或执行 Python 代码)中实现越狱。针对 GPT-6,研究人员指出原始最小 TIP 攻击已不再有效,必须重新设计。该研究人员表示已向 OpenAI 私下披露细节而非公开发布。此前该研究人员曾报告在 GPT-5 发布后一小时内完成越狱。