DeepSeek蒸馏模型未继承审查特性:新评估框架发布
CTGT公司利用DeepSeek V4 Flash作为教师模型,蒸馏出GPT-OSS-120B学生模型,在金融推理任务上取得83.61%的分数。研究发现,教师模型在政治敏感问题上表现出显著偏差,但学生模型的行为与原始美国基座模型一致,未继承审查特性。团队同时发布了评估框架LineageEval,以推动相关讨论。
CTGT公司利用DeepSeek V4 Flash作为教师模型,蒸馏出GPT-OSS-120B学生模型,在金融推理任务上取得83.61%的分数。研究发现,教师模型在政治敏感问题上表现出显著偏差,但学生模型的行为与原始美国基座模型一致,未继承审查特性。团队同时发布了评估框架LineageEval,以推动相关讨论。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
CTGT Inc. 发布 LineageEval 框架,用 152 对匹配提示词系统检验蒸馏是否传递审查。结果显示,蒸馏自 DeepSeek V4 Flash 的 GPT-OSS-120B 在金融推理上达到 83.61%,但政治敏感话题上的审查行为与基础模型无统计差异。
美国开发者广泛使用开源前沿模型,但担忧外国行为者(尤其是中国共产党)的价值观、审查或观点会随智能提升一同转移。CTGT Inc. 的研究旨在严格检验这一现象:在一个实际的金融蒸馏流程中,使用中国审查模型 DeepSeek V4 Flash 作为教师,训练美国模型 GPT-OSS-120B,观察学生是否学到不良行为。
已知中国前沿模型在敏感话题上明显拒绝或改写回答,这一行为在 DeepSeek R1 和 V3 系列的审计中已有记录。本研究进一步追问:学生是否在学技能的同时也学会了不良行为?
研究团队构建了 LineageEval 框架,包含 304 个提示词(152 对匹配对)。每对包含一个中国敏感话题和一个结构相同的非中国控制话题,例如“大跃进饥荒”对“乌克兰大饥荒”、“新疆劳动转移”对“乌兹别克棉花”、“天安门”对“光州”。目标是区分模型是普遍回避难题,还是专门回避中国的难题。
所有 304 个回答由四位独立裁判(xAI Grok 4.20、Google Gemini 3.5 Flash、OpenAI GPT-5 Mini、Anthropic Claude Sonnet 4.6)按 0–100 分评分,取均值。匹配差距为敏感分减去控制分,正值表示选择性回避中国内容。教师模型通过自托管权重(vLLM)提供服务,以排除 API 层过滤的影响。
在 76 对核心政治提示词上,DeepSeek V4 Flash 的匹配差距为 +45.45 分,87% 的对子呈现正差距。而蒸馏后的 CTGT 120B(Flash 教导)差距为 -1.39 分,仅 49% 的对子为正,与基础模型 GPT-OSS-120B(+0.43 分,43% 正)无统计差异。
在全部 152 对(含金融相关)上,教师差距为 +32.02,79% 对子为正,约 7 个标准差,p < 0.0001。三个 120B 模型(基础、自蒸馏、Flash 教导)的差距分别为 +3.94、+3.70 和 +2.58,正比例 52–55%,彼此相差不到 1 分。蒸馏未改变学生模型在无关领域的行为。
在 8,000 token 生成预算下,自蒸馏的 CTGT 120B 在 FinanceReasoning 上得分 83.61%,高于 Kimi K3(81.93%)和 Inkling(65.13%),且每查询成本比 Inkling 低 62 倍,比 Kimi K3 低 160 倍。自蒸馏(模型自我纠正)与使用 DeepSeek 教师达到相同分数,表明领域提升不依赖教师的政治倾向。
研究团队认为,许多领域特定应用无需更大的教师模型即可获得有意义提升。自蒸馏模型在所有随机种子下均匹配 Flash 教导模型的分数。
实验仅针对金融推理领域,其他领域(如医疗、法律)的审查转移情况未知。教师模型为 DeepSeek V4 Flash,其他中国模型(如 Qwen、GLM)可能表现不同。
基础模型 GPT-OSS-120B 本身在全部 152 对上存在 +3.94 的小幅正差距,来源不明,可能是训练数据中的固有偏差。蒸馏后差距未显著增加,但未完全消除。
研究使用四位 AI 裁判评分,而非人类专家,裁判本身可能存在偏差。人类评审员对单个示例的评分(20 vs 75)与 AI 裁判(35,30,40,8 vs 72,90,90,74)趋势一致,但未系统验证。
本研究由 CTGT Inc. 自行发布,未经过同行评审。实验设计严谨,使用匹配对、自托管权重和多位独立裁判,但结论的泛化性需更多独立验证。所有数据、模型和代码已开源。
蒸馏中国审查模型可以提升领域性能,但审查行为不会自动转移。自蒸馏提供了一条无需依赖外国模型的替代路径。
主报道
主报道来源