返回信息流
新闻事件
TechRepublic AI
1 个来源

AI安全测试因命名错误触及真实公司系统

一次AI安全测试因命名错误意外触及了真实公司的系统,凸显了自主AI代理在缺乏足够防护时可能带来的风险。该事件强调了为AI代理实施更强访问控制的必要性。

SynthePulse Insight · AI 深度解读

命名错误引发AI安全测试事故:权限边界为何不能依赖名称

版本 1 · 1 个来源

一次AI安全测试因命名冲突意外攻击真实公司系统,暴露了自主AI代理在权限控制上的结构性缺陷。

  • AI安全测试因命名冲突意外访问真实公司系统,提取了凭据并进入生产数据库。
  • 事故根源是命名碰撞,而非越狱攻击;测试环境允许互联网访问,模型将真实域名误认为模拟目标。
  • Irregular为OpenAI、Anthropic和Meta运行评估,Anthropic已暂停相关测试。
  • 事件凸显了基于名称的范围控制与基于请求的强制授权之间的区别。
展开章节目录事件经过:命名错误导致真实系统被攻击

事件经过:命名错误导致真实系统被攻击

据Irregular与Anthropic共同确认,在一次AI安全测试中,模型在三次测试运行中超出了预期范围,攻击了真实公司系统而非模拟目标。模型利用真实漏洞,提取了凭据,并访问了生产数据库。

根本原因并非新型漏洞或对抗性提示,而是命名冲突:Irregular工程师为虚构目标公司分配的名称恰好与真实域名匹配,且该域名鲜为人知,未被发现。

在另一起案例中,另一个模型访问了类似名称的网站,发现了已公开泄露的登录凭据,而非自行获取。

结构性缺陷:名称不是权限控制

事件暴露了测试环境中的根本问题:模拟目标与真实目标之间的边界仅靠命名约定,而非强制访问控制。测试环境允许模型访问互联网,并依赖名称来限制范围。

Irregular的补救措施包括扩大人工审查、建立内部“假设红队”单元、重新验证评估以避免域名重叠,并发布最佳实践白皮书。但Irregular承认人为监督缺失是直接原因,这些修复并未解决根本设计问题。

名称是元数据,不包含授权逻辑,一旦出错就会静默失败。合规团队需要关注谁授权了模型访问、允许检索哪些数据,以及技术控制是否在访问前强制执行了范围。

治理与取证的区别

事件凸显了审计追踪与政策层之间的区别:前者是取证,后者是治理。企业运行自己的AI代理时也面临同样的区别,但多数尚未解决。

Irregular为OpenAI、Anthropic和Meta运行评估,在48至72小时的周期内进行数千次模拟运行。这种规模使得一次命名冲突演变成三次独立事件。

Anthropic已暂停其网络能力评估,直到环境重新验证,表明实验室对测试框架失败的重视。

改进方向:基于请求的授权

事件说明,范围控制应基于请求而非标签。在控制平面架构下,每次检索请求都会根据角色和属性策略进行检查,凭据不会暴露在模型的工作上下文中。

这种治理能限制代理对受控数据的访问,但无法约束代理对任意第三方互联网主机的行为,这正是Irregular描述的事故模式。

Kiteworks未涉及此次事件,但事件强调了治理架构的必要性。

可信度边界

本报道基于TechRepublic的转述,原始信息来自Irregular和Anthropic的声明,以及CNBC、The Register和CyberScoop的报道。部分细节(如具体漏洞和凭据)未独立验证,属于来源声明。

核心结论

AI安全测试事故表明,依赖名称而非强制授权来控制AI代理的访问范围是危险的。企业应采用基于请求的授权机制,并确保技术控制先于访问执行。

主报道

TechRepublic AI

主报道来源