返回信息流
新闻事件
A重点76
THE DECODER
1 个来源

Anthropic 称任何实验室现在都可以让语言模型代理运行整个蛋白质设计流程

Anthropic 宣布其 Claude 模型能够自主设计小蛋白,并成功对接体内靶标结构,命中率高达 35%,远超行业平均的 10-15%。Claude 仅操控现有专业工具,但独立评审尚未进行。

SynthePulse Insight · AI 深度解读

Anthropic让Claude接管蛋白质设计全流程:命中率26.8%,但独立验证仍缺位

版本 1 · 1 个来源

Anthropic公布两项实验,让Claude模型自主运行整个蛋白质设计流程,在16个靶点中成功14个,实验室命中率26.8%,远超行业常见的10-15%。但独立评审尚未进行,且部分靶点完全失败,置信度分数未能预警。

  • Claude在16个靶点中成功设计14个,1,320个设计中354个在实验室验证中结合,命中率26.8%。
  • 单靶点模式下Mythos Preview命中率升至35.1%,但计算预算增加2.8倍。
  • 对比行业基准:Anthropic引用公开数据库proteinbase.com,典型命中率为10-15%。
  • Claude未使用自研蛋白质模型,而是编排开源工具如PXDesign、RFdiffusion3等,并排除AlphaFold-3等因许可限制。
  • 在RBX1靶点上,Claude最佳设计结合强度3.9 nM,比公开竞赛冠军的45 nM强约10倍。
  • 两个靶点完全失败:MBP无设计结合,BBF-14仅3个弱结合,且置信度分数未预警。
展开章节目录实验设计与核心结果

实验设计与核心结果

Anthropic在两项实验中让Claude模型承担早期药物发现任务。第一项实验聚焦于设计微型结合蛋白(minibinders),即能锁定靶蛋白并改变其功能的小蛋白。模型Mythos Preview和Opus 4.8针对16个靶蛋白进行设计,其中15个产生可用测量数据,Claude在14个靶点上成功。

在实验室测试中,1,320个设计中354个实际结合靶点,命中率26.8%;若仅看Claude自行排名第一的设计,命中率升至49%。多靶点模式(48小时内处理所有靶点)下,Mythos Preview和Opus 4.8的命中率分别为26.7%和22.6%。单靶点模式下,Mythos Preview命中率提升至35.1%,但计算预算增加2.8倍,作者承认专注度和预算无法分离。

作为对比,Anthropic引用proteinbase.com数据库中公开记录的典型命中率为10-15%。

技术栈与自主性

Claude并未使用自研蛋白质模型,而是安装并运行了领域内已有的开源专业软件。蛋白质骨架来自PXDesign(358个设计)、RFdiffusion3(267个)、Genie 3(185个)等;氨基酸序列主要由SolubleMPNN计算。筛选和排序使用ESMFold2、ESMFold2-Fast和Protenix v2。AlphaFold-3权重、Rosetta和ESM3因许可原因被排除。

系统提示词约16,000词,其中仅三分之一是科学指导,其余涉及调度、子代理委派、验证和预算纪律。提示词未指定任何靶点的表位(攻击位点)。计算预算为每多靶点活动5万美元,每单靶点1万美元,通过云服务商Modal运行。人类仅负责选择靶点、编写提示词、订购合成和解释数据,中间仅需简短的非技术指令恢复中断。

Anthropic声称,由于所有使用的模型均为开源,任何实验室都能开展此类活动。

验证与对比

验证由付费合同实验室Adaptyv Bio和Twist Bioscience完成,他们独立测量设计是否结合及结合强度(KD值,单位nM)。结果因靶点而异:TREM2有72/90结合,VEGF-A有54/90。最引人注目的是RBX1靶点:公开设计竞赛中245个新设计仅9个结合,而Claude的90个设计中28个结合。Anthropic将竞赛冠军设计重建并在同一测定板上测试,其结合强度为45 nM,而Claude最佳设计为3.9 nM,约强10倍。

TNFα被认为特别困难,此前多种方法报告零命中。Claude在150个设计中产生12个结合物,全部来自Opus 4.8,但追溯至仅4个不同骨架,独立性有限。此外,233个测试结合物中130个也结合小鼠同源靶点,这对动物实验有实际意义。

两个靶点暴露明显局限:BBF-14是计算机发明的桶状蛋白,无进化历史可参考;MBP表面光滑亲水,难以结合。BBF-14仅3个弱结合设计,MBP则90个设计全部失败。Anthropic表示,折叠预测的置信度分数未预警这些失败,失败靶点的分数与成功靶点几乎相同。

化学分析实验

第二项实验中,Opus 5解读了合同实验室的原始数据,包括核磁共振波谱(NMR)和液相色谱-质谱联用(LC-MS)。这些仪器输出专有格式,通常需人工在制造商软件中分析。Claude从原始文件和1-3句提示词出发,分别在23分钟和19分钟内给出结果。

对于LC-MS文件,模型未找到合适的读取程序,自行解码格式,并精确复现了仪器存储的2,664个测量点的汇总值。在NMR分析中,Claude提出了与实验室在首次测量三天后独立运行的相同后续实验,并纠正了自身错误:最初报告4个缺失信号,内部检查后修正为2个。

报告指出,常被引用的纯度值96.4%与96.33%基于不同基线;按实验室方法计算,Claude的结果为98.8%。

意义与局限

Anthropic强调,蛋白质结构预测和生成并非新事物,AlphaFold、RFdiffusion和BindCraft已确立。真正的新颖之处在于上层:通用语言模型研究靶点生物学、选择对接位点、自行安装程序、组合24种不同工作流,并在无人类干预设计决策的情况下给出最终排名。

然而,独立评审尚未进行,结果未经第三方验证。此外,失败案例表明置信度分数不可靠,且部分靶点完全失败,说明方法仍有局限。

Anthropic声称任何实验室都能复制,但计算预算(每靶点1万美元)和合同实验室验证成本可能构成实际门槛。

可信度边界

本报道基于Anthropic发布的技术报告和THE DECODER的转述。所有数据均为Anthropic自称,独立评审尚未进行。部分对比数据(如行业命中率10-15%)来自Anthropic引用的proteinbase.com数据库,未经独立核实。

核心结论

Anthropic展示了通用语言模型在蛋白质设计中的自主能力,命中率显著高于行业基准,但独立验证缺失、失败案例未预警,且成本高昂,实际可复制性存疑。

主报道

THE DECODER

主报道来源