🌊问题背景:静态结构预测与构象动力学之间的鸿沟

近年来,机器学习模型在从氨基酸序列预测蛋白质结构方面取得了极高精度——AlphaFold 2/3、RoseTTAFold、ESMFold、Boltz-1、Chai-1等利用共进化信息或蛋白质语言模型(PLM)实现了原子级结构预测。然而,蛋白质始终以构象系综形式存在于热力学平衡中:结构是理解功能的基础,但动力学才是连接结构与功能的关键枢纽。从别构调节、分子马达到酶催化,功能依赖于构象涨落。

当前结构预测模型存在一个根本局限:模式坍缩。即使一个序列可映射到多个稳定构象,模型也倾向于输出单一高概率预测。现有解决思路包括:

ESMDynamic的核心洞察是:结构预测模型引入了学习蛋白质动力学的强归纳偏置——结构知识约束了构象涨落的物理合理范围,而编码结构信息的进化信号同样可能编码动力学信息。与其生成完整构象系综(计算昂贵),不如直接预测动态接触图——一种紧凑但信息丰富的构象变异性表示。

🎯ESMDynamic核心设计:三头预测与两阶段训练

ESMDynamic以ESMFold为基座模型。ESMFold基于ESM2蛋白质语言模型,无需MSA即可从单序列提取共进化信号并推断结构,因此天然支持高通量预测。ESMDynamic采用两阶段训练

  1. 预训练阶段:在实验解析结构(PDB + AlphaFold DB)的88,294个序列对齐簇(>95%簇内一致性)上训练分类头。这些簇包含来自598,144个独立解析结构的946,397条蛋白链,每蛋白中位数4个构象体。结构变异用于推断动态接触。
  2. 微调阶段:在mdCATH数据集上微调全部三个预测头。mdCATH覆盖5,398个可溶结构域,平均轨迹长度464 ns,温度范围320–450 K。

三个预测头分别对应互补目标:

  1. 动态接触分类头:预测残基对在热涨落下形成接触的概率,区分波动接触与静态/非相互作用对。附带置信度模块估计每位点预期准确率。
  2. 接触占据率回归头:预测接触占据率——接触形成的帧占比,反映接触稳定性。附带误差预测模块估计每对的预期回归误差。
  3. 动力学预测头:将接触形成时间(off-time)和接触持续时间(on-time)分类到离散分箱:恒开/恒关、1–10 ns、10–100 ns、100–300 ns、>300 ns、未定义。附带置信度预测模块。

所有预测在mdCATH的五个温度设置(320–450 K)下均可获得。三者共同捕捉接触形成概率、持续性和粗粒度动力学。

📊数据特征化:动态接触、占据率与动力学

3.1 动态接触分类

动态接触定义为残基对在构象系综中跨接触阈值波动的对——在一个构象中Cα距离<7.5 Å,在另一个中>8.5 Å(引入0.5 Å裕度减少小涨落导致的误分类)。这与基于单一静态结构定义的天然接触不同:动态接触不一定是天然接触的子集,短寿命或不稳定相互作用也算。

在mdCATH(320 K)中,64.6%的天然接触也是动态的,而27.3%的动态接触也是天然的。高温下动态接触中天然接触占比下降,反映结构无序增加和非天然相互作用增多。

实验结构簇衍生的动态接触比MD模拟衍生的更为稀疏:实验簇中动态接触占所有残基对不到1%,而MD模拟中约15%(mdCATH 320 K)。因此实验簇仅用于预训练阶段暴露模型于多样构象,最终微调完全在MD数据上进行。

3.2 接触占据率回归

对每个残基对,计算模拟帧中接触形成的占比。在频率主义意义上,这近似接触在模拟热力学条件下的边际形成概率。与二值分类标签不同,这一连续量反映了系综内相互作用的相对稳定性。占据率在额外采样下相对稳定(补充表2),表明它是稳健的学习目标。

3.3 动力学预测

从MD轨迹计算每个残基对的on-time(接触持续平均时间)和off-time(接触形成平均等待时间)。由于连续回归固有噪声大且受有限轨迹长度限制,ESMDynamic将时间离散为粗粒度分箱。分布偏向短寿命接触——大多数形成和断裂事件发生在几ns时间尺度,反映数据集富含快速局部涨落。与Dyna-1(基于NMR的残基柔性预测器)的交叉分析表明,涉及高Dyna-1分数残基的接触倾向于展现更长寿命。

🏗️模型架构:ESMFold基座与动态接触模块

ESMDynamic(图1)构建于ESMFold框架之上。结构预测模型为推断蛋白质动力学提供了强大的先验——3D几何知识约束了构象涨落的物理合理方式。ESMFold的额外优势是从单一输入序列提取进化和结构特征,无需计算昂贵的MSA。

ESMFold提供对建模构象变异性特别有用的辅助信号:

ESMDynamic通过将这些辅助信号偏置ESMFold最后一个Evoformer块的最终序列和成对表示来整合它们。这些增强特征随后由三个独立的动态接触模块(DCM)处理,每个对应一个预测头。Evoformer架构适合这些任务,因为它使用注意力机制建模残基间复杂的上下文依赖关系。

消融实验表明,即使移除DCM(直接使用ESMFold成对表示),模型仍能达到不错的性能——ESMFold衍生特征可直接用于预测动态接触。但完整模型在困难样本上的表现更好,表明需要额外参数正确预测复杂例子。一个有趣的例外是on-time动力学预测,无DCM模型略优于完整模型(差异<1%)。

📈性能与消融:匹配生成模型但快数个数量级

5.1 mdCATH测试集

在序列一致性感知的测试分割(训练/验证/测试簇间<20%一致性)上,ESMDynamic在320 K下达到:

5.2 与生成式集成模型对比

ESMDynamic与三个SOTA集成预测模型对比:BioEmu(基于AlphaFold2+MSA,训练于~200 ms MD数据)、AlphaFlow(基于AlphaFold2+MSA)、ESMFlow(基于ESMFold)。后两者为流匹配模型。

模型 mdCATH平衡准确率 ATLAS平衡准确率 F1 占据率RMSE 推理方式
ESMDynamic ~80%(与BioEmu相当) 87% 57% 7.6% 单次前向
BioEmu ~80% ~69% 60% 6.3% 250次采样
AlphaFlow 69% ~69% 4.4% 250次采样
ESMFlow <69% <87% 250次采样

关键发现:在ATLAS测试集(ESMDynamic训练时未见的数据)上,ESMDynamic以87%平衡准确率显著超越所有流模型和BioEmu。流模型倾向于高精确率/低召回率预测——AlphaFlow精确率84%但召回率仅40%。这是因为流模型的结构模块约束采样偏向高概率构象,限制了表示低概率接触断裂态的能力。ESMDynamic不强制结构一致性,可为多个潜在不兼容接触态分配高概率。

ESMDynamic的预测与ESM2的无监督接触概率无有意义相关性(补充图11),证明它学习的是动力学特异信号而非简单恢复静态结构模式。

5.3 推理速度

ESMDynamic仅需单次前向传播,推理时间从几毫秒到几分钟(取决于蛋白长度),与ESMFold几乎相同。生成方法需数百次前向传播。ESMDynamic在所有评估蛋白长度范围内一致地更快。BioEmu训练于~200 ms MD数据(其中46 ms来自CATH序列),而ESMDynamic和流模型仅训练于几ms蛋白轨迹。

🧬超出训练分布的泛化:转运蛋白、de novo设计与二聚体界面

6.1 ASCT2/SLC1A5跨膜转运蛋白

ASCT2是上调于癌症的中性氨基酸转运蛋白,也是逆转录病毒受体。其序列与训练集(预训练和微调)共享不到20%一致性,且mdCATH缺乏膜蛋白——这是严格的分布外测试。

分析内向(PDB 6GCT)和外向(PDB 7BCQ)两个实验构象定义的149个实验验证动态接触:

这证明ESMDynamic能捕捉功能相关、状态依赖的相互作用,这些在静态天然接触中不存在。模型对膜蛋白的泛化能力暗示ESMFold通过同源序列提供了强结构先验。

6.2 De novo设计多态蛋白(troponin C N端域I89变体)

这是一个工程化的钙结合蛋白变体,设计为在标准热力学条件下采用两种替代构象,钙结合后平衡在两态间切换。该蛋白在ESMDynamic训练后存入PDB且为de novo设计,代表特别困难的分布外测试。与强调域间大尺度重排的设计不同,该系统经历域内构象变化,适合评估对细微接触重排的敏感性。

从apo结构(PDB 9CIG/9CID)衍生的49个实验动态接触:

6.3 HIV-1蛋白酶同源二聚体界面(涌现能力)

ESMDynamic未在多聚蛋白或蛋白界面上显式训练,但继承了ESMFold对多聚体结构预测的涌现能力。HIV-1蛋白酶是同源二聚体,其功能依赖二聚体界面动力学,特别是I47–F53区域构成结合口袋门控的一部分。

利用闭合和开放构象的实验结构定义界面动态接触:

这表明ESMDynamic将从静态结构预测到动态接触推断的涌现能力延伸至多聚体系统的蛋白界面。

🔬自动集体变量选择:从序列到马尔可夫状态模型

ESMDynamic的一个关键应用是利用预测的动态接触图自动选择MD模拟的集体变量(CV)。在水稻SWEET2b转运蛋白145 µs无偏MD轨迹上验证——该蛋白被排除在训练集外,无20%以上同源序列。

自动CV选择流水线:

  1. 过滤残基对,仅保留序列间隔≥40位的高阶动态接触(去除局部接触)
  2. 对剩余残基对施加层次聚类(L1距离单链接,限制9个簇以与专家CV公平比较)
  3. 从每簇选择最高概率动态接触,追踪对应残基间距作为CV
  4. 用CV特征化MD轨迹 → tICA降维 → 构建MSM

结果:ESMDynamic选择的CV构建的MSM恢复了与专家手工选择CV相同的定性转变机制——交替访问机制的六个亚稳态(Ext-IF、IF、OC-IF、OC、OC-OF、OF),IF→OF循环约6 µs,能垒~4 kcal/mol。VAMP-2得分比较:

ESMFold天然接触CV无法捕捉关键门控运动,导致MSM不解析完整转运循环。MD衍生CV虽正确识别门控运动,但聚类选择引入变异性导致自由能面扭曲。ESMDynamic在无需轨迹数据的情况下达到了与专家设计CV同等甚至更优的水平。

🌐蛋白质组规模:18,238蛋白48 GPU小时

ESMDynamic相对于生成方法的核心优势是计算效率,使其可应用于蛋白质组规模数据集。应用于人类蛋白质组(UniProt UP000005640),受RTX 4090 24GB显存限制施加1000残基截断——仍覆盖约88%的人类蛋白(18,238/20,659)。

这一计算成本比生成可比构象系综所需的MD模拟或生成模型低数个数量级,使ESMDynamic适合高通量应用:识别柔性区域、优先排序模拟目标、注释大型蛋白数据集。

🧪AI4Science趋势:动力学预测的新范式

ESMDynamic代表了AI4Science中一个重要的范式转移,可从以下几个维度理解:

1. 从"生成系综"到"预测摘要"

此前预测蛋白质构象多样性的方法(AlphaFlow、BioEmu、ESMFlow)通过生成完整结构系综来捕捉变异性,需数百次采样。ESMDynamic转而预测构象变异性的紧凑摘要——动态接触图——仅需单次前向传播。这不是替代生成方法,而是互补:动态接触图可作为下游模拟和分析的先验,而生成方法在需要完整坐标时仍有价值。

2. 结构预测模型作为动力学学习的基座

ESMDynamic证明结构预测模型可通过微调学习动力学。结构知识提供了推断动力学的强归纳偏置——3D几何约束了构象涨落的物理合理范围。这与蛋白质语言模型训练于生物物理动力学可指导突变效应预测(Hou et al. PNAS 2026)的发现一致。结构预测模型的进化信号可能同时编码结构和动力学信息。

3. 从序列到模拟先验

ESMDynamic选择的CV在SWEET2b上构建的MSM超越专家手工CV,意味着仅从序列即可获得功能相关的自由度。这对增强采样协议具有直接价值——传统上CV选择依赖专家知识或试错,ESMDynamic提供了一个自动化、可扩展的替代方案。对FRET/DEER实验的标记位点选择和突变研究的目标残基选择同样具有指导意义。

4. 蛋白质组规模动力学注释

18,238蛋白48 GPU小时意味着构象变异性注释可像结构预测一样规模化。AlphaFold DB为2亿+蛋白提供了静态结构;ESMDynamic为18K+人类蛋白提供了动态接触图。随着更长序列的支持和更高效的推理,全蛋白质组动力学注释成为可能。

5. 涌现能力的迁移

ESMDynamic在膜蛋白、de novo设计蛋白和多聚体界面上的泛化能力——均超出训练分布——表明ESMFold的结构先验通过微调可迁移到动力学预测。这种"结构先验→动力学微调"的迁移学习路径可能适用于其他结构预测基座(AlphaFold 3、Boltz-2、Chai-1)。

6. 对药物发现与蛋白设计的启示

动态接触图可直接服务于:识别别构位点和柔性调控区域、优先排序增强采样目标、指导FRET/DEER实验设计、评估de novo设计蛋白的构象多态性、注释蛋白-蛋白界面动力学。对于药物发现,动态接触可帮助识别隐藏的别构口袋——仅在特定构象下开放的结合位点。

📄关键数据速览与诚实声明

模型与训练:

· 基座:ESMFold(ESM2 PLM,冻结权重)

· 预训练:88,294实验结构簇(946,397链,598,144结构,中位4构象体/蛋白)

· 微调:mdCATH 5,398可溶结构域,平均464 ns轨迹,320–450 K

· 硬件:单块NVIDIA RTX 4090(24GB)

· 数据分割:90/5/5,MMseqs2聚类,簇间<20%一致性

性能(mdCATH 320 K测试集):

· 分类:平衡准确率80%,召回率77%,精确率51%

· 占据率:RMSE 7.6%

· 动力学:macro召回率34%/43%(on/off-time,6类,随机基线16.6%)

· >90%正预测落在真阳性5残基以内

· ATLAS(未见数据):平衡准确率87%,显著超越所有生成模型

分布外泛化(案例研究):

· ASCT2转运蛋白(<20%同源性,膜蛋白):召回率90%,平衡准确率93%

· De novo I89变体(训练后存入):召回率96%,平衡准确率88%

· HIV-1蛋白酶二聚体界面(涌现):召回率100%,平衡准确率96%

应用:

· SWEET2b MSM:VAMP-2 89%(理论最大值),超越专家CV 86%

· 人类蛋白质组:18,238蛋白,48 GPU小时(RTX 4090)

· 代码:https://github.com/ShuklaGroup/esmdynamic

· 数据:https://doi.org/10.13012/B2IDB-3773897_V2

· Colab:https://colab.research.google.com/github/ShuklaGroup/esmdynamic

AI4Science趋势:

· 从生成系综到预测摘要——单次前向 vs 数百次采样

· 结构预测模型作为动力学学习基座——结构先验→动力学微调迁移

· 从序列到模拟先验——自动CV选择超越专家手工

· 蛋白质组规模动力学注释——18K蛋白48 GPU小时

· 涌现能力迁移——膜蛋白/de novo/多聚体界面

· 药物发现:别构口袋识别、增强采样目标优先排序

诚实声明:

· 本报告所有数值均来自论文原文(Nature Communications, DOI 10.1038/s41467-026-76361-2),已逐项核对

· 论文诚实声明局限:训练数据主要来自有序单体可溶蛋白的MD模拟(~500 ns轨迹),偏向该regime;固有无序蛋白和低结构置信度体系性能下降

· 动力学预测限于ns时间尺度,不直接探测µs–ms慢构象过程

· 预测量提供构象变异性的粗粒度摘要,不直接编码详细机制信息,可能隐藏全局几何位移

· 案例研究基于有限样本而非系统基准,泛化结论应谨慎解读

· 精确率在案例研究中普遍偏低(3–9%),反映从少量实验构象衍生的动态接触极端稀疏性

· BioEmu训练数据中46 ms来自CATH序列,与mdCATH测试集的潜在重叠不能排除

· AI4Science趋势部分为基于论文设计的合理推论,部分尚未在真实药物发现流程中验证