返回信息流
新闻事件
A重点72
Hacker News (AI filter)
1 个来源

人类在批准AI代理命令时漏掉了三分之一的威胁

一项涉及4万次游戏运行的研究发现,人类在批准AI代理命令时漏掉了三分之一的威胁。这表明依赖人类监督可能不足以确保AI代理的安全,需要更强大的保障措施。

SynthePulse Insight · AI 深度解读会员精读

人类监督AI代理的盲点:40,000次游戏运行揭示的三分之一威胁漏检率

版本 1 · 1 个来源

一项基于40,000次游戏运行的研究显示,人类在审批AI代理命令时平均漏掉了三分之一的威胁,且最危险的凭据窃取类命令漏检率是明显破坏性命令的三倍。

  • 平均玩家漏掉三分之一的威胁,准确率仅66.3%。
  • 32.9%的会话以负分结束,惩罚超过了正确操作。
  • 35.2%的玩家抓住了所有威胁,但只有20.8%在误拦不超过五分之一安全命令的情况下做到。
展开章节目录研究背景与核心数据

研究背景与核心数据

Scale X发布了一款浏览器游戏,模拟人类在环中审批AI编码代理的命令,在时间压力下决定批准或拒绝。游戏收集了超过40,000次运行和409,000个单独批准/拒绝决策的数据。

核心发现是平均玩家漏掉了三分之一的威胁,平均准确率66.3%。此外,32.9%的会话以负分结束,意味着批准威胁和拦截安全命令的惩罚超过了正确操作。

值得注意的是,35.2%的玩家抓住了所有威胁,但其中只有20.8%在误拦不超过五分之一安全命令的情况下做到,其余玩家可能通过过度拦截获得高分。另有7%的玩家批准了所有命令,被戏称为“危险跳过权限”的粉丝。

限时免费

继续阅读完整分析

还有 5 节深入分析和完整结论

加载中

可信度边界

本报告基于Scale X发布的游戏数据,数据来源为游戏运行记录,但游戏环境与真实场景存在差异(如威胁比例较高、用户知道被测试)。部分结论(如疲劳效应)参考了Anthropic的观察,但游戏数据本身是来源声明。

主报道

Hacker News (AI filter)

主报道来源