返回信息流
新闻事件
A重点71
MIT Technology Review AI
1 个来源

根本性缺陷使大语言模型极易受到攻击

研究人员指出,大语言模型存在一个无法修复的根本性缺陷,使其无法完全抵御攻击,因为模型通过文本风格而非结构来识别指令来源。他们成功从主流模型中提取了可卡因合成和破坏飞机导航系统等被禁止的信息。这一发现表明,现有的红队测试等安全措施无法解决这一固有漏洞。

主报道

MIT Technology Review AI

主报道来源