返回信息流
新闻事件
S信号93
InfoQ
1 个来源

年度AI论文!全球三大顶尖模型的防蒸馏机制全面告破:小模型"套出"大模型隐藏思维链

一项最新研究揭示了Anthropic、OpenAI和Google的API存在严重安全漏洞,攻击者可通过轻量级模型引导,从加密推理块中恢复顶级模型的隐藏思维链。该研究由MATS program研究员Alexander Panfilov领衔,联合马克斯·普朗克智能系统研究所等机构发布,论文阅读量已超210万。此发现推翻了'加密即安全'的假设,对闭源模型厂商的防蒸馏机制构成重大挑战。

SynthePulse Insight · AI 深度解读

防蒸馏神话破灭:小模型如何“套出”大模型的隐藏思维链

版本 1 · 1 个来源

一项最新研究揭示,Anthropic、OpenAI、Google 三大前沿模型的加密推理机制存在旁路漏洞,攻击者可用轻量级模型恢复隐藏思维链,且成本极低。研究还发现部分开源模型存在异常“数据指纹”,暗示防蒸馏体系已形同虚设。

  • 研究团队发现三大厂商API存在密码学旁路漏洞,可通过轻量级模型恢复隐藏思维链。
  • 攻击成本极低:解码1万条思维链仅需约720美元。
  • 约7000份公开日志泄露大量敏感数据,包括API密钥、密码等。
  • 部分模型复现Claude/GPT推理片段的概率异常高,但不足以直接证明蒸馏。
  • 研究被评价为“今年最有影响力的科学论文之一”。
展开章节目录加密推理的“安全幻觉”被打破

加密推理的“安全幻觉”被打破

长期以来,闭源模型厂商将“隐藏思维链”视为核心护城河,通过加密封装推理过程,仅输出最终结果,试图将认知过程黑盒化。然而,一项由MATS program研究员Alexander Panfilov领衔,联合马克斯·普朗克智能系统研究所、图宾根ELLIS研究所和安全公司Snyk发表的最新论文(arXiv:2608.09867)揭示了这一假设的脆弱性。

研究指出,Anthropic、OpenAI、Google三大前沿模型的API中存在严重的密码学旁路漏洞:攻击者无需破解加密算法,仅通过轻量级模型的简单引导,就能从加密推理块中恢复并转录出顶级模型原本被隐藏的思维链数据。这一发现直接推翻了“加密即安全”的行业共识。

降维提取:小模型成为“解密器”

研究团队完整演示了“降维提取”的技术路径:首先从高成本顶级模型(如Claude 3 Opus 4.8)的API交互中捕获加密思维链数据包(Blob),然后将该加密包作为上下文输入给同一生态下成本极低、参数量较小的轻量级模型(如Claude Haiku 4.5),再对轻量级模型应用特定构建的越狱提示词,绕过其安全护栏,最终轻量级模型会像“解码器”一样将顶级模型的原始推理过程一字不差地转录输出。

研究团队承认,严格来说无法逐字符证明恢复结果100%一致,因此将Haiku等模型称为“fuzzy decoder”。但他们找到了一把“尺子”:API账单。实验显示,Claude、GPT和Gemini的大多数样本中,提取出的明文Token数与账单计费的Token数紧贴y=x分布,高度吻合。

更关键的是,该漏洞利用了厂商内部模型矩阵间数据格式的互通性,通过防御更为薄弱的小模型作为突破口,完全避开了正面攻防。按照论文测算,以Haiku 4.5的API价格计算,解码1万条完整思维链的成本大约只有720美元,具备规模化效应。

数据指纹:防蒸馏体系形同虚设

研究团队在“记忆度分析”部分,通过定量实验揭示了部分模型在训练过程中深度吸收竞争对手思维链的客观证据。他们选择Kimi-K3、GLM-5.2、DeepSeek-V4-Flash、Kimi-K2.6以及Inkling等模型进行对照,从“逐字提取概率”“输出风格漂移”“推理语言风格”三个维度寻找数据指纹。

实验发现,Kimi-K3命中Opus推理的理论查询成本比DeepSeek-V4-Flash和Inkling低4到6个数量级,表明Opus的底层逻辑在Kimi-K3的概率空间里显得极其“不陌生”。仅注入Opus推理开头的1%作为前缀,Kimi-K3的可见回答风格就显著向Opus靠拢,n-gram用词重合度大幅趋同;而对照模型Inkling则毫无波澜。

为排除上下文学习的干扰,研究人员做了“互换前缀”控制实验:让Kimi-K3垫入Inkling的推理前缀,同时让Inkling垫入Kimi-K3的推理前缀,结果两条测试曲线与基准线几乎完全重合,说明Kimi-K3面对Inkling的草稿时毫无风格漂移。

更激进的底线测试显示:仅需1到16个单词的前缀,Kimi-K3就会向GPT-5.6 Sol发生明显的风格漂移(风格可分性AUC从0.96跌至0.89);GLM-5.2也对Opus表现出极强的定向漂移。一旦提供完整的Opus推理上下文,Kimi-K3和GLM-5.2复现Opus最终答案所需的理论成本骤降约13个数量级。

隐私泄露:约7000份日志暴露敏感数据

该API漏洞不仅威胁模型安全,更直接引发企业数据隐私问题。许多开发者习惯将包含“加密推理包”的调试日志发布到GitHub、Stack Overflow等公开社区,误以为这些乱码数据具有高加密安全性。

研究团队从约7000份公开的Trace记录中利用漏洞进行重放解密,获取了62个高权限生产环境API密钥、33个真实电子邮件地址、33个未加掩码的高危明文密码,以及大量内网服务器路径、数据库连接字符串及核心业务逻辑配置信息。恢复的隐私数据包括个人身份信息(PII)367项、技术标识符363项、凭证182项。

这一结果暴露出,原本旨在保护模型推理逻辑的加密机制,因API设计层面的逻辑漏洞,反而成为更大规模用户隐私泄露的导火索。

行业反应与深层问题

早在今年5月,密码学家Matthew Green就曾指出加密推理包存在被外部捕获并重放的风险,并向相关厂商提交漏洞报告,但当时各家头部AI实验室反应冷淡,官方回复称“未观察到旁路攻击或重放机制带来任何实质性的安全威胁”。然而,Panfilov团队的研究以实证结果证实了漏洞的严重性。

知名AI研究员Nathan Lambert评价该论文“很可能成为今年最有影响力的科学论文之一”,Meta FAIR的研究科学家Arman Zharmagambetov也表示高度认同。研究还发现,部分模型复现Claude/GPT推理片段的概率较其他模型高出约百万倍,仅注入Opus推理开头,其后续思路便显著趋同,但作者强调这仍不足以直接证明蒸馏。

研究揭示,当廉价的轻量级模型即可作为提取大模型核心逻辑的“特洛伊木马”时,传统的“防蒸馏”策略实质上已形同虚设。更深层的问题指向大模型的对齐与安全监管:继续放任复杂的认知过程在不透明的黑盒中演进,将带来难以预估的系统性风险。如何平衡商业机密保护与系统透明度,将是下一阶段AI产业无法回避的核心命题。

可信度边界

本文信息主要来源于InfoQ的报道,属于二手转述。论文本身为第一手来源,但本文未直接引用论文原文,所有数据均来自报道转述。部分数据(如成本测算、概率差异等)为论文中的结论,但未经独立验证。专家评价(如Nathan Lambert)为个人观点,不代表普遍共识。

核心结论

防蒸馏体系已被实证攻破,小模型可低成本提取大模型隐藏思维链,同时引发严重隐私泄露。行业需重新审视加密推理的安全假设,并平衡商业机密与透明度。

主报道

InfoQ

主报道来源