A重点72
Hacker News (AI filter)
1 个来源人类在批准AI代理命令时漏掉了三分之一的威胁
一项涉及4万次游戏运行的研究发现,人类在批准AI代理命令时漏掉了三分之一的威胁。这表明依赖人类监督可能不足以确保AI代理的安全,需要更强大的保障措施。
一项涉及4万次游戏运行的研究发现,人类在批准AI代理命令时漏掉了三分之一的威胁。这表明依赖人类监督可能不足以确保AI代理的安全,需要更强大的保障措施。
SynthePulse Insight · AI 深度解读会员精读
版本 1 · 1 个来源
一项基于40,000次游戏运行的研究显示,人类在审批AI代理命令时平均漏掉了三分之一的威胁,且最危险的凭据窃取类命令漏检率是明显破坏性命令的三倍。
Scale X发布了一款浏览器游戏,模拟人类在环中审批AI编码代理的命令,在时间压力下决定批准或拒绝。游戏收集了超过40,000次运行和409,000个单独批准/拒绝决策的数据。
核心发现是平均玩家漏掉了三分之一的威胁,平均准确率66.3%。此外,32.9%的会话以负分结束,意味着批准威胁和拦截安全命令的惩罚超过了正确操作。
值得注意的是,35.2%的玩家抓住了所有威胁,但其中只有20.8%在误拦不超过五分之一安全命令的情况下做到,其余玩家可能通过过度拦截获得高分。另有7%的玩家批准了所有命令,被戏称为“危险跳过权限”的粉丝。
本报告基于Scale X发布的游戏数据,数据来源为游戏运行记录,但游戏环境与真实场景存在差异(如威胁比例较高、用户知道被测试)。部分结论(如疲劳效应)参考了Anthropic的观察,但游戏数据本身是来源声明。
主报道
主报道来源