单卡可跑18万原子!分子模拟的"规模焦虑"该终结了
至知创新研究院UBio团队发布了UBio-MolFM v1.5,这是一个以量子化学精度进行生物大分子分子动力学模拟的机器学习原子间势函数。该模型在推理时能以接近经典力场的速度提供接近量子化学精度的预测,无需针对新体系重新调参,并通过两个实测案例展示了其在离子通道和药物分子模拟中的优势。
至知创新研究院UBio团队发布了UBio-MolFM v1.5,这是一个以量子化学精度进行生物大分子分子动力学模拟的机器学习原子间势函数。该模型在推理时能以接近经典力场的速度提供接近量子化学精度的预测,无需针对新体系重新调参,并通过两个实测案例展示了其在离子通道和药物分子模拟中的优势。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
至知创新研究院UBio团队发布UBio-MolFM v1.5,以量子化学精度模拟生物大分子,单卡可跑18万原子,速度提升8.3倍,误差降低45%。
分子动力学模拟长期面临精度与规模不可兼得的矛盾:量子化学方法(如DFT)准确但计算成本高,通常限于数百个原子;经典力场可模拟数十万至百万原子,但参数近似,误差难以先验评估。
UBio-MolFM旨在同时满足两者,以量子化学精度进行生物大分子模拟,推理速度接近经典力场,且无需针对新体系重新调参。
在KcsA钾离子通道模拟中(108964个原子,含真实脂双层与生理盐水),UBio-MolFM的五条独立轨迹中,滤器深处相邻钾离子形成无水直接接触,平均距离3.32 Å,四条轨迹全程维持;而两种经典力场共十条轨迹中,该接触从未出现(0%)。
在环孢素A构象自由能模拟中,UBio-MolFM解出落差5.51 kcal/mol的漏斗状地形,穿膜构象能量代价约3.5 kcal/mol;经典力场落差仅1.51 kcal/mol,地形近乎平坦。模型预测经100个去相关构象的DFT单点验证,能量偏差0.44 kcal/mol,小于三个DFT参考方法间的分歧(最小1.18)。
这些案例表明,经典力场的局限可能超越定量误差,导致定性层面的误判。
架构采用E2Former-V2等变Transformer,满足旋转等变性、非共价距离感受野和单GPU硬件效率。通过SO(3)→SO(2)基变换、节点中心Wigner-6j分解和Triton流式注意力,实现接近线性的计算复杂度。骨干叠加四层混合截断半径:三层5Å短程注意力覆盖全部原子,第四层8Å排除氢,有效感受野约23Å。
训练数据约1.6亿条量子化学标签,来自OMol25(约1.4亿条)和自建UBio-Mol26(约1900万条)。UBio-Mol26富集亚甲基和酰胺基团,原子对距离在5-6Å外仍宽泛,覆盖生物大分子特征。约6.4万条周期性凝聚相数据用于校准水密度等热力学性质。
三阶段课程学习总计约1000 GPU-day:第一阶段用独立力头训练,第二阶段改用自动微分(F=-∇E),第三阶段引入生物大分子数据,仅监督力向量,剔除DFT系统性能量偏移。
在基线模型训练分布(OMol-Bio-10k)上,UMA-S-1p2误差最低,UBio-MolFM未超过但属第一梯队。在held-out生物大分子片段和超大规模场景下,UBio-MolFM受力误差比最佳基线低40%-45%,各类化学环境降低21%-64%。
同一测试流程(标准密度立方水盒子,单张141GB H20)下,标准模式UBio-MolFM约37K原子/s,最大支持约65000原子;激活重计算模式下支持12万原子,吞吐25.1对3.0千原子/秒,即速度提升8.3倍。显存增长斜率:UBio-MolFM每千原子0.73GB(激活重计算)或1.97GB(标准),UMA标准模式17.5GB,接近9倍。
按斜率计算,单卡理论可装19.3万原子,实测18万原子;8卡节点可扩展至144万原子。
模型权重、代码和技术报告已开源,链接见原文。
UBio-MolFM的适用场景是基线训练分布之外:需要显式溶剂与生物大分子环境的体系,直至百万原子规模。在数百原子的小分子体系内,UMA-S-1p2仍有精度优势。
本文信息主要来自量子位发布的投稿文章,属于第二手来源。所有性能数据、案例结果均来自该文章,未经独立验证。文章未提及与其他模型的第三方独立对比,也未提供完整技术报告细节。
UBio-MolFM v1.5在精度和规模上取得突破,但需注意其性能数据来自团队自身报告,实际应用效果有待独立复现。
主报道
主报道来源