返回信息流
新闻事件
S信号86
Anthropic News
1 个来源

改进Fable 5安全防护措施

Anthropic正在更新Claude Fable 5的生物安全防护措施,以大幅减少回退情况。这些更改旨在通过减少不必要的安全回退来提高模型性能。

SynthePulse Insight · AI 深度解读

Anthropic 更新 Fable 5 生物安全防护:误报减少 85%,但双用途领域仍受限

版本 1 · 1 个来源

Anthropic 宣布对 Claude Fable 5 的生物安全防护进行更新,大幅减少良性生物相关查询的误报,但模型在病毒学、毒理学等双用途领域仍会回退到 Opus 5。

  • Anthropic 更新了 Fable 5 的生物安全防护,使生物相关回退减少约 85%。
  • 更新后,Fable 5 能处理更多日常健康和教育类生物问题,但专业研究仍受限。
  • Fable 5 在病毒学、毒理学和分子设计等双用途领域仍回退到 Opus 5。
  • Anthropic 强调生物能力可能被恶意利用,并引用美国情报界威胁评估。
  • 更新通过重写分类器规则、收集专家反馈并重新训练实现。
展开章节目录更新内容与效果

更新内容与效果

Anthropic 于 2026 年 8 月 7 日宣布对 Claude Fable 5 的生物安全防护进行更新,旨在大幅减少误报。据其测试,此次更新使生物相关回退(即系统切换到能力较弱的模型)减少了约 85%。

用户在日常健康和生物教育问题上(如解读化验结果、理解症状)将看到更少的回退,医疗专业人员也能在临床任务上获得更多支持。

安全防护的初衷与权衡

Anthropic 表示,Fable 5 在部分复杂生物任务上已能超越专家,但也可能被恶意行为者用于开发生物武器。因此,他们最初几乎屏蔽了所有生物查询,以换取其他领域的可用性,尽管这导致大量误报。

公司认为,生物和医学是 AI 产生积极影响的最大机会,但必须管理风险。他们提到,区分有益和有害用途很困难,例如研发活疫苗需要培养病原体,而某些药物(如卡托普利)的研发需要分离蛇毒中的有毒成分。

分类器的工作原理与更新过程

Fable 5 使用安全分类器检测受保护的生物任务或有害输出。当分类器触发时,请求会被重定向到 Opus 5,该模型不具备同等生物能力。

更新过程中,Anthropic 重写了分类器的“宪法”(规则集合),详细划定了良性用途,征求了内外部专家意见,开发了新的训练数据并重新训练分类器,同时验证其对有害和双用途内容仍能触发。

当前限制与未来方向

尽管更新后误报减少,但 Fable 5 在病毒学、毒理学和分子设计等双用途领域仍会回退到 Opus 5,因此尚不能用于专业生物研究和药物开发。

Anthropic 表示致力于通过可信访问途径缩小这一差距,为前沿生物能力提供负责任的访问。

可信度边界

本文信息主要来自 Anthropic 官方新闻稿,属于第一方来源。文中引用的美国情报界威胁评估为转述,未提供原文链接。所有数据(如 85% 的减少)均为 Anthropic 自述,未经独立验证。

核心结论

Anthropic 在生物安全防护上采取了渐进式策略,通过优化分类器减少误报,同时保持对高风险领域的谨慎限制。这一更新平衡了可用性与安全性,但专业生物研究仍受限于双用途领域的回退机制。

主报道

Anthropic News

主报道来源