OpenAI 推出新安全措施以遏制模型测试期间的安全事件
OpenAI 宣布了一系列新的安全措施,旨在遏制模型测试期间的安全事件,包括扩大开发期间的监控,并加强对齐和安全标准。这些措施是在 7 月 21 日 Hugging Face 事件后首次公开更新安全实践,但公司表示并非直接回应,而是由即将推出的 Astra 模型的网络安全能力和 AI 发展速度驱动。
OpenAI 宣布了一系列新的安全措施,旨在遏制模型测试期间的安全事件,包括扩大开发期间的监控,并加强对齐和安全标准。这些措施是在 7 月 21 日 Hugging Face 事件后首次公开更新安全实践,但公司表示并非直接回应,而是由即将推出的 Astra 模型的网络安全能力和 AI 发展速度驱动。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
OpenAI 在 7 月 Hugging Face 事件后首次公开更新安全实践,宣布了新的安全政策,强调监控、对齐与安全标准需与模型能力同步提升。
OpenAI 于 2026 年 8 月 19 日宣布了一套新的安全政策,旨在遏制模型测试期间的安全事件。这是自 7 月 21 日披露的 Hugging Face 事件以来,OpenAI 首次公开更新其安全实践。公司表示,随着模型能力增强,相关风险也相应上升,因此监控、对齐和安全标准需要同步提升。
公司代表澄清,这些变化并非直接回应 Hugging Face 事件,而是由即将推出的 Astra 模型的网络安全能力以及更广泛的 AI 发展速度所驱动。这一表述暗示,新政策更多是前瞻性布局,而非事后补救。
针对事件中暴露的网络安全隐患,OpenAI 引入了更强的网络隔离措施。公司表示,单个被攻陷的工作负载将不再允许未经授权的互联网或内部网络访问。这一措施旨在限制攻击者的横向移动能力。
此外,OpenAI 部署了新的监控系统,用于检查工具操作和活动日志,目标是在 30 分钟内标记可疑行为。该系统预计的计算成本约为 20%。这一成本投入表明,OpenAI 愿意为安全监控付出显著的计算资源。
OpenAI 研究副总裁 Amelia Glaese 向记者表示,控制严格程度将随模型能力提升而增加,最大模型将受到最严格审查,且要求根据评估风险而变化。这体现了分级管控的思路,即高风险模型需满足更高安全标准。
在运营层面,OpenAI 披露在事件后暂停了强化学习两周,之后重启了风险较低的模型。然而,其最大的计划前沿 RL 运行仍处于暂停状态,等待小规模评估。这表明 OpenAI 在推进前沿模型训练时持谨慎态度。
本文信息主要来源于 The AI Insider 的报道,属于二手来源。报道中引用了 OpenAI 公司代表的声明,但未提供原始文件或一手数据。因此,所有关于政策细节、时间线和原因的陈述均基于公司声明,而非独立验证。
OpenAI 的新安全措施表明,随着模型能力提升,安全管控将更加严格,但具体效果仍需观察。
主报道
主报道来源