OpenAI用AI攻击自身AI,成功率远超人类
OpenAI开发了名为GPT-Red的AI模型,通过自我对弈训练发现自身AI系统的漏洞,在测试场景中成功率达到84%,而人类红队仅为13%。这些结果直接用于强化GPT-5.6 Sol等模型,标志着AI安全测试的重大进步。
OpenAI开发了名为GPT-Red的AI模型,通过自我对弈训练发现自身AI系统的漏洞,在测试场景中成功率达到84%,而人类红队仅为13%。这些结果直接用于强化GPT-5.6 Sol等模型,标志着AI安全测试的重大进步。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
OpenAI训练了一个名为GPT-Red的内部AI模型,通过自博弈强化学习自动寻找GPT模型的安全漏洞。在测试中,GPT-Red的攻击成功率达到84%,而人类红队仅为13%。该成果已用于改进GPT-5.6 Sol,使直接提示注入的失败率降低了六倍,但仍有3.8%的强攻击成功。
OpenAI训练了一个名为GPT-Red的内部AI模型,专门用于自动发现GPT模型中的安全缺陷。GPT-Red模拟提示注入等攻击方式,将恶意指令隐藏在电子邮件、网站或文件中。训练采用自博弈强化学习:GPT-Red发起攻击,同时防御模型进行拦截,两者在对抗中共同提升。
在测试中,GPT-Red在84%的场景中成功找到攻击方法,而人类红队成员的成功率仅为13%。更引人注目的是,在一次实际测试中,GPT-Red成功操纵了OpenAI办公室内的一台AI售货机,修改了商品价格并取消了其他顾客的订单。
GPT-Red的攻击结果直接用于训练改进。OpenAI表示,最新模型GPT-5.6 Sol在直接提示注入方面的失败率比四个月前的最佳模型降低了六倍,且未影响通用性能。这表明自动化红队方法在提升模型安全性方面具有显著效果。
然而,OpenAI也承认,仍有约3.8%的“更强”提示注入攻击能够成功。考虑到规模化攻击中可能尝试数百甚至数千次,这一比例意味着仍有相当数量的攻击可以穿透防御。这一水平与Claude Opus 4.5相当。
尽管GPT-Red表现出色,但OpenAI目前将其保持为内部工具,尚未公开。公司表示后续将发布论文提供更多细节。此外,3.8%的残留成功率表明,即使是最先进的自动化红队方法也无法完全消除安全风险。
从GPT-5.3到GPT-5.6 Sol,提示注入成功率持续下降,但尚未归零。这一趋势表明,自博弈红队是一种有效但非终极的解决方案。未来可能需要结合更多技术手段,才能实现更接近零漏洞的目标。
本文信息主要来源于OpenAI官方声明及THE DECODER的报道。THE DECODER为二级信源,但内容基于OpenAI直接发布的信息。关键数据(84%成功率、13%人类成功率、六倍改进、3.8%残留率)均来自OpenAI,可信度较高。售货机测试案例为OpenAI披露,但缺乏独立验证。
OpenAI的GPT-Red展示了AI自动化红队相比人类红队的巨大优势,但3.8%的残留成功率提醒我们,安全防御仍需持续改进,无法一劳永逸。
主报道
主报道来源