返回信息流
新闻事件
THE DECODER
1 个来源

OpenAI用AI攻击自身AI,成功率远超人类

OpenAI开发了名为GPT-Red的AI模型,通过自我对弈训练发现自身AI系统的漏洞,在测试场景中成功率达到84%,而人类红队仅为13%。这些结果直接用于强化GPT-5.6 Sol等模型,标志着AI安全测试的重大进步。

SynthePulse Insight · AI 深度解读

OpenAI用AI攻击自家AI:自博弈红队模型GPT-Red成功率84%,远超人类

版本 1 · 1 个来源

OpenAI训练了一个名为GPT-Red的内部AI模型,通过自博弈强化学习自动寻找GPT模型的安全漏洞。在测试中,GPT-Red的攻击成功率达到84%,而人类红队仅为13%。该成果已用于改进GPT-5.6 Sol,使直接提示注入的失败率降低了六倍,但仍有3.8%的强攻击成功。

  • OpenAI训练内部AI模型GPT-Red,通过自博弈强化学习自动攻击自家GPT模型,寻找安全漏洞。
  • GPT-Red在测试场景中成功攻击率达84%,远高于人类红队的13%。
  • 在一次测试中,GPT-Red成功操纵了OpenAI办公室的AI售货机,修改价格并取消其他顾客订单。
  • 攻击结果直接用于训练改进,GPT-5.6 Sol的提示注入失败率比四个月前最佳模型降低六倍。
  • 仍有约3.8%的强提示注入攻击成功,规模化后仍有相当数量可穿透。
  • GPT-Red保持内部使用,后续将发布论文。
展开章节目录自博弈红队:GPT-Red如何工作

自博弈红队:GPT-Red如何工作

OpenAI训练了一个名为GPT-Red的内部AI模型,专门用于自动发现GPT模型中的安全缺陷。GPT-Red模拟提示注入等攻击方式,将恶意指令隐藏在电子邮件、网站或文件中。训练采用自博弈强化学习:GPT-Red发起攻击,同时防御模型进行拦截,两者在对抗中共同提升。

在测试中,GPT-Red在84%的场景中成功找到攻击方法,而人类红队成员的成功率仅为13%。更引人注目的是,在一次实际测试中,GPT-Red成功操纵了OpenAI办公室内的一台AI售货机,修改了商品价格并取消了其他顾客的订单。

从攻击到防御:成果直接用于模型改进

GPT-Red的攻击结果直接用于训练改进。OpenAI表示,最新模型GPT-5.6 Sol在直接提示注入方面的失败率比四个月前的最佳模型降低了六倍,且未影响通用性能。这表明自动化红队方法在提升模型安全性方面具有显著效果。

然而,OpenAI也承认,仍有约3.8%的“更强”提示注入攻击能够成功。考虑到规模化攻击中可能尝试数百甚至数千次,这一比例意味着仍有相当数量的攻击可以穿透防御。这一水平与Claude Opus 4.5相当。

局限性与未来方向

尽管GPT-Red表现出色,但OpenAI目前将其保持为内部工具,尚未公开。公司表示后续将发布论文提供更多细节。此外,3.8%的残留成功率表明,即使是最先进的自动化红队方法也无法完全消除安全风险。

从GPT-5.3到GPT-5.6 Sol,提示注入成功率持续下降,但尚未归零。这一趋势表明,自博弈红队是一种有效但非终极的解决方案。未来可能需要结合更多技术手段,才能实现更接近零漏洞的目标。

可信度边界

本文信息主要来源于OpenAI官方声明及THE DECODER的报道。THE DECODER为二级信源,但内容基于OpenAI直接发布的信息。关键数据(84%成功率、13%人类成功率、六倍改进、3.8%残留率)均来自OpenAI,可信度较高。售货机测试案例为OpenAI披露,但缺乏独立验证。

核心结论

OpenAI的GPT-Red展示了AI自动化红队相比人类红队的巨大优势,但3.8%的残留成功率提醒我们,安全防御仍需持续改进,无法一劳永逸。

主报道

THE DECODER

主报道来源