返回信息流
新闻事件
A重点70
Hacker News (AI filter)
1 个来源

DeepSeek蒸馏模型未继承审查特性:新评估框架发布

CTGT公司利用DeepSeek V4 Flash作为教师模型,蒸馏出GPT-OSS-120B学生模型,在金融推理任务上取得83.61%的分数。研究发现,教师模型在政治敏感问题上表现出显著偏差,但学生模型的行为与原始美国基座模型一致,未继承审查特性。团队同时发布了评估框架LineageEval,以推动相关讨论。

SynthePulse Insight · AI 深度解读

蒸馏会传递审查吗?DeepSeek V4 Flash 教出的美国模型在金融推理上提升,但未继承政治回避

版本 1 · 1 个来源

CTGT Inc. 发布 LineageEval 框架,用 152 对匹配提示词系统检验蒸馏是否传递审查。结果显示,蒸馏自 DeepSeek V4 Flash 的 GPT-OSS-120B 在金融推理上达到 83.61%,但政治敏感话题上的审查行为与基础模型无统计差异。

  • DeepSeek V4 Flash 在 76 对核心政治提示词上的审查差距为 +45.45 分(满分 100),而蒸馏后的 CTGT 120B 差距仅为 -1.39 分,与基础模型无异。
  • 蒸馏模型在 FinanceReasoning 上以 83.61% 的得分超越 Kimi K3(81.93%)和 Inkling(65.13%),且每查询成本低 62–160 倍。
  • 自蒸馏(模型自我纠正)达到与使用 DeepSeek 教师相同的金融推理得分,表明领域提升不依赖教师的政治倾向。
  • 实验使用自托管权重(vLLM)避免 API 层过滤,并采用四位独立裁判(xAI、Google、OpenAI、Anthropic)评分。
  • 教师模型的审查差距在统计上极其显著(p < 0.0001,约 7 个标准差),但学生模型未继承此行为。
展开章节目录核心问题:蒸馏是否传递审查?

核心问题:蒸馏是否传递审查?

美国开发者广泛使用开源前沿模型,但担忧外国行为者(尤其是中国共产党)的价值观、审查或观点会随智能提升一同转移。CTGT Inc. 的研究旨在严格检验这一现象:在一个实际的金融蒸馏流程中,使用中国审查模型 DeepSeek V4 Flash 作为教师,训练美国模型 GPT-OSS-120B,观察学生是否学到不良行为。

已知中国前沿模型在敏感话题上明显拒绝或改写回答,这一行为在 DeepSeek R1 和 V3 系列的审计中已有记录。本研究进一步追问:学生是否在学技能的同时也学会了不良行为?

实验设计:匹配提示词与多维评分

研究团队构建了 LineageEval 框架,包含 304 个提示词(152 对匹配对)。每对包含一个中国敏感话题和一个结构相同的非中国控制话题,例如“大跃进饥荒”对“乌克兰大饥荒”、“新疆劳动转移”对“乌兹别克棉花”、“天安门”对“光州”。目标是区分模型是普遍回避难题,还是专门回避中国的难题。

所有 304 个回答由四位独立裁判(xAI Grok 4.20、Google Gemini 3.5 Flash、OpenAI GPT-5 Mini、Anthropic Claude Sonnet 4.6)按 0–100 分评分,取均值。匹配差距为敏感分减去控制分,正值表示选择性回避中国内容。教师模型通过自托管权重(vLLM)提供服务,以排除 API 层过滤的影响。

核心发现:审查未转移

在 76 对核心政治提示词上,DeepSeek V4 Flash 的匹配差距为 +45.45 分,87% 的对子呈现正差距。而蒸馏后的 CTGT 120B(Flash 教导)差距为 -1.39 分,仅 49% 的对子为正,与基础模型 GPT-OSS-120B(+0.43 分,43% 正)无统计差异。

在全部 152 对(含金融相关)上,教师差距为 +32.02,79% 对子为正,约 7 个标准差,p < 0.0001。三个 120B 模型(基础、自蒸馏、Flash 教导)的差距分别为 +3.94、+3.70 和 +2.58,正比例 52–55%,彼此相差不到 1 分。蒸馏未改变学生模型在无关领域的行为。

金融推理提升:自蒸馏同样有效

在 8,000 token 生成预算下,自蒸馏的 CTGT 120B 在 FinanceReasoning 上得分 83.61%,高于 Kimi K3(81.93%)和 Inkling(65.13%),且每查询成本比 Inkling 低 62 倍,比 Kimi K3 低 160 倍。自蒸馏(模型自我纠正)与使用 DeepSeek 教师达到相同分数,表明领域提升不依赖教师的政治倾向。

研究团队认为,许多领域特定应用无需更大的教师模型即可获得有意义提升。自蒸馏模型在所有随机种子下均匹配 Flash 教导模型的分数。

局限与不确定性

实验仅针对金融推理领域,其他领域(如医疗、法律)的审查转移情况未知。教师模型为 DeepSeek V4 Flash,其他中国模型(如 Qwen、GLM)可能表现不同。

基础模型 GPT-OSS-120B 本身在全部 152 对上存在 +3.94 的小幅正差距,来源不明,可能是训练数据中的固有偏差。蒸馏后差距未显著增加,但未完全消除。

研究使用四位 AI 裁判评分,而非人类专家,裁判本身可能存在偏差。人类评审员对单个示例的评分(20 vs 75)与 AI 裁判(35,30,40,8 vs 72,90,90,74)趋势一致,但未系统验证。

可信度边界

本研究由 CTGT Inc. 自行发布,未经过同行评审。实验设计严谨,使用匹配对、自托管权重和多位独立裁判,但结论的泛化性需更多独立验证。所有数据、模型和代码已开源。

核心结论

蒸馏中国审查模型可以提升领域性能,但审查行为不会自动转移。自蒸馏提供了一条无需依赖外国模型的替代路径。

主报道

Hacker News (AI filter)

主报道来源