问题:蛋白质开关从头设计的根本困难
蛋白质的功能与其三维结构紧密相关。虽然 AlphaFold2/3 等工具革命性地提升了结构预测能力,并使从头蛋白设计(de novo protein design)成为现实,但一个根本局限仍存在:当前方法很大程度上忽略或仅部分捕获蛋白质动力学。构象柔性对许多蛋白功能至关重要——酶、受体、离子通道通过在 distinct 构象间转换来工作。包含结构"开关"(响应特定刺激改变构象的元件)的蛋白在调控与信号转导中扮演关键角色。
蛋白质开关可由多种刺激触发:配体结合、变构调控、磷酸化等翻译后修饰、蛋白-蛋白相互作用、pH 或温度变化。设计这类开关需要一条氨基酸序列,其能量景观支持至少两个稳定构象并在刺激下可逆转换。这比设计单一稳定折叠困难得多——后者已是当前流水线的主要目标。
现有从头设计流水线分三阶段:(1) 骨架生成(从扩散模型采样);(2) 序列设计(逆折叠);(3) 结构预测验证。多态逆折叠方法(ProteinMPNN-MSD、Caliby、DynamicMPNN)能设计兼容多个骨架的序列,但其成功关键依赖于合适骨架系综的可用性。实践中,这些系综并非系统生成,而是通过手工设计、领域专家知识或基于物理的弛豫构造——难以获取且难以扩展。
另一方面,蛋白骨架扩散模型通过大规模训练已学到蛋白构象空间的丰富知识。Diff-Switch 的核心洞见是:利用这些预训练扩散模型的构象空间知识来生成开关式骨架系综,从而绕过手工骨架构造的瓶颈。
背景:蛋白质开关、从头设计与元动力学
2.1 蛋白质开关的形式化
蛋白骨架结构 x ∈ X = R^{L×4×3}(L 个氨基酸,每个 4 个骨架原子 N/Cα/C/O,每个 3D 坐标)。蛋白序列 s = (s₁, ..., s_L)。大多数序列采用一个稳定折叠,但蛋白质开关的序列编码至少两个稳定构象,并在生化刺激下可逆转换。形式化:序列 s 是开关当且仅当存在骨架结构 x, x' ∈ X 都可被 s 采用,且存在可逆开关机制使蛋白在两构象间转换。
2.2 奖励倾斜扩散采样
预训练骨架扩散模型扮演先验 p(x) 的角色——决定什么是物理现实的骨架。在设计任务中,从 p 直接采样很少有用。通常有目标属性,由奖励函数 r: X → R 捕获。自然要采样的对象是奖励倾斜后验分布:
π(x) ∝ p(x) exp(r(x))
先验继续提供结构现实性,指数倾斜将质量集中到高奖励配置。Diff-Switch 使用 twisted diffusion sampler (TDS)——结合奖励引导扩散与序列蒙特卡洛(SMC)在 N 个粒子上,在 N→∞ 极限下对 π 精确。
2.3 Well-tempered metadynamics
元动力学(metadynamics)是分子动力学社区开发的增强采样技术,用于加速复杂生物分子自由能景观的探索。方法将系统动力学投影到少量集体变量(CVs)ξ: X → R^d(d ≪ dim X)上,逐步构建历史依赖偏置势 V(ξ),排斥系统离开已采样区域,促进亚稳态间转换。
Well-tempered metadynamics 中偏置分批构建。从 V₀(ξ)=0 开始,给定在 V_k 下采样的 N 个样本批次,每个样本沉积一个 tempered Gaussian hill:
V_{k+1}(ξ) = V_k(ξ) + Σ_n w_k^(n) exp(-‖ξ - ξ(x_k^(n))‖² / (2σ²))
其中 hill 宽度 σ、初始高度 w、偏置因子 γ > 1 控制已采样区域中后续 hill 的抑制强度。低 γ 快速收敛但可能探索不足;高 γ 更彻底探索但收敛更慢。当 k→∞,ξ 在偏置分布下的边际收敛到 well-tempered 目标 p_wt(ξ) ∝ p(ξ)^{1/γ},展平 ξ 的势阱但不擦除。
Diff-Switch 方法:奖励倾斜扩散 + 元动力学偏置
Diff-Switch 要生成的骨架系综需满足两个准则:(1) 每个域内高局部结构相似性;(2) 域级排列的多样性。方法将两个要求分别实例化,然后在统一框架中结合。
3.1 局部结构相似性:奖励倾斜
为保持每个域的局部结构,实例化奖励函数:
r_ref(x) = -λ D(x, x_ref)
其中 x_ref 是参考骨架,D(·, x_ref) 是域级结构距离(如每个域刚性对齐后的 per-domain RMSD 之和),λ > 0 控制域匹配参考的严格程度。对应目标 π_ref(x) ∝ p(x) exp(r_ref(x))。这个奖励确保采样的骨架在域内保持与参考一致,但域间相对排列可自由变化。
3.2 全局域排列多样性:元动力学偏置
为鼓励域级排列多样性,在 CV 空间施加历史依赖偏置。CV ξ 捕获域间相对排列(如两域质心距离)。偏置 V_k(ξ) 沿 CV 排斥已采样区域,驱动采样器探索新的全局排列。这直接借鉴 well-tempered metadynamics,但作用对象从 MD 轨迹变为扩散模型采样批次。
3.3 统一框架:Diff-Switch
将两个目标合并为单一奖励:
r_k(x) = -λ D(x, x_ref) - V_k ∘ ξ
第一项保持域内局部几何,第二项在 CV 空间施加元动力学偏置。在低 λ 或 ξ 与 D 解耦的机制下,V_k 可直接解释为 π_ref 的 CV 空间边际上的元动力学偏置。
Algorithm 1 (Diff-Switch):输入预训练扩散模型 p、参考骨架 x_ref、结构距离 D、相似强度 λ、集体变量 ξ、迭代数 K、批大小 N、多态逆折叠模型 IF。
- V₀ ← 0, E ← ∅
- 对 k = 0, ..., K-1:从 π_k 经 TDS 采样 N 个骨架 {x_k^(n)},奖励 r_k = -λD(·,x_ref) - V_k∘ξ;用样本更新 V_{k+1};将样本加入 E
- 从 E 中选择 x_alt = 与 x_ref 最不相似的骨架
- 生成 S = IF(x_ref, x_alt)(多态逆折叠产出候选开关序列)
- 返回系综 E、选定对 (x_ref, x_alt)、候选序列 S
关键设计选择:(1) 单一起始构象——只需提供 closed 或 open 之一作为参考,方法自动探索另一状态;(2) 统一超参数——20 个蛋白和两种逆折叠后端共用一套 Diff-Switch 超参数,per-protein 变异性反映基础扩散模型的固有波动而非调参差异;(3) CV 的灵活性——CV 必须反映设计者指定的期望开关行为,不同运动类型需要不同 CV。
完整流水线:从参考骨架到候选开关序列
Diff-Switch 嵌入在完整的从头蛋白开关设计流水线中,分三阶段:
阶段一:骨架生成(Diff-Switch)。输入参考骨架 x_ref 与域注释。Diff-Switch 结合奖励倾斜扩散与 well-tempered metadynamics 产出骨架系综 E,从中选择替代骨架 x_alt。选择标准:与 x_ref 最不相似(如 RMSD 或 CV 空间距离最大)。{x_ref, x_alt} 代表设计开关应采用的两个构象。
阶段二:序列选择(多态逆折叠)。将 {x_ref, x_alt} 传入多态逆折叠模型(ProteinMPNN-MSD 或 Caliby),生成一组候选开关序列 S。这些序列被设计为同时兼容两个构象。
阶段三:评估与过滤(结构预测)。每个候选序列在两种触发条件下用 AlphaFold3 评估(如磷酸化/非磷酸化),检查预测结构是否重现两个预期构象。成功的开关设计应满足:无刺激时接近状态 A(如 closed),有刺激时接近状态 B(如 open)。
这个三阶段流水线的关键创新在阶段一:Diff-Switch 自动生成合适的骨架系综,替代了传统流水线中需要专家手工构造的步骤。阶段二和三使用现有工具,但因其输入质量提升而产出更好的结果。
验证一:20 个域重排蛋白开关
5.1 数据集与设置
使用 Kalakoti & Wallner (2025) 的两态域运动蛋白数据集,模拟域重排蛋白开关的运动。数据集包含 20 个蛋白,长度 109–801 aa(平均 398),各有 distinct 的 open 与 closed 构象(均在 PDB 中可用),涵盖从配体结合到酶活性位点闭合的多种开关机制。
为模拟真实设计场景(仅知一个状态),只提供单一起始骨架构象(closed 或 open)。方法然后采样多样骨架系综,应包含起始构象与替代状态构象及过渡态。CV 选择为各蛋白域间质心距离(一维),直觉上能分离 open 与 closed 构象。
5.2 对照设计
对每个蛋白比较两种设计策略:
- 基线:参考骨架 x_ref 直接传入逆折叠方法生成候选序列。即使单骨架也可能偶尔产出开关兼容序列,因为蛋白固有动力学使优化序列可瞬时访问类替代构象。
- Diff-Switch:先用 Diff-Switch 生成系综,选 x_alt,再用 {x_ref, x_alt} 传入逆折叠。
两种逆折叠后端:ProteinMPNN 与 Caliby。评估指标:scRMSD_switch(预测结构与目标构象的骨架 RMSD)与 scTM_switch(结构相似性 TM-score 变体)。成功阈值 τ = 5 Å scRMSD_switch。用 AlphaFold3 在两种条件下预测每个候选序列的结构。
5.3 结果
Diff-Switch 在所有设置下显著提升成功率:
| 设置 | 基线 AUC | Diff-Switch AUC | 提升 | Wilcoxon p (scRMSD) |
|---|---|---|---|---|
| Open ref · ProteinMPNN | 0.61±0.01 | 0.70±0.00 | +0.09 | 0.016 |
| Open ref · Caliby | 0.59±0.01 | 0.68±0.01 | +0.09 | 0.005 |
| Closed ref · ProteinMPNN | 0.62±0.02 | 0.71±0.01 | +0.09 | 0.002 |
| Closed ref · Caliby | 0.51±0.02 | 0.68±0.02 | +0.17 | 0.002 |
关键观察:
- 一致提升:Diff-Switch 在所有 4 个设置下都提升 AUC,最大提升 0.17(closed ref · Caliby,0.51→0.68),几乎弥合 Caliby-ProteinMPNN 差距。
- 统计显著:单侧配对 Wilcoxon 符号秩检验在所有设置下确认显著改进(scRMSD 与 scTM 指标均 p < 0.05)。
- 双向鲁棒:从 open 或 closed 起始均有效,凸显方法鲁棒性——设计者不必知道哪个状态作为起点。
- 统一超参数:20 个蛋白和两种后端共用一套超参数,per-protein 变异性反映基础扩散模型固有波动而非调参差异。
scTM_switch 的 per-protein 差异分析显示,大多数蛋白 Diff-Switch 优于基线(正值),仅少数蛋白(如 P21589)出现噪声或负值——这是 CV 选择的失败案例,详见第 7 节。
验证二:磷酸化诱导蛋白开关的真实设计
6.1 设计任务
为展示方法在真实设计问题上的适用性,应用于磷酸化诱导蛋白开关设计(基于 Buckley et al. 2025 的工作)。设计目标:一条序列在未磷酸化时保持 closed 状态(磷酸化位点 helix 与 scaffold 紧密 packed),在磷酸化后转换为 open 状态(helix 远离 scaffold,暴露界面供潜在分子伙伴结合)。
CV 定义为磷酸化位点 helix(残基 90-102)与剩余 scaffold(残基 1-83)的质心距离。生成的系综经过滤选择候选 open 构象——保持高局部结构质量同时增加磷酸化位点暴露。
6.2 评估协议
对选定的 closed/open 骨架对,用 Caliby 设计 16 条兼容两构象的序列。然后用 AlphaFold3 在两种条件下评估:(1) 未修饰(丝氨酸);(2) 磷酸化(残基 95 从丝氨酸转为磷酸丝氨酸)。
成功设计需满足两条标准:
- 未磷酸化:预测结构接近 closed 状态,scaffold 与 helix 界面 packed。
- 磷酸化:预测结构打开,界面完全暴露。
两个互补量化指标:(1) 磷酸化位点 helix 与 scaffold 的质心距离(衡量结构多开放);(2) 界面残基的 buried interface area(SASA 变化,值越大界面越 closed,零表示完全暴露)。
6.3 结果
Diff-Switch 设计的序列在磷酸化条件下展示出明显的 closed→open 转换行为。关键发现:
- 同一序列在未磷酸化(light orange triangles)与磷酸化(dark orange circles)条件下的质心距离显著不同——磷酸化推动 helix 远离 scaffold。
- buried interface area 在磷酸化后显著降低——界面从 packed 转为暴露。
- 与基线(仅用单骨架)相比,Diff-Switch 设计的序列展示更明显的开关行为。
这是 Diff-Switch 在真实设计任务上的首批实证——不仅能在基准数据集上提升指标,还能产出具有功能意义的磷酸化依赖构象转换序列。
局限与失败案例分析
报告的诚实之处在于明确分析失败案例与局限,而非只展示成功。
7.1 CV 选择的失败案例:P21589
在少数蛋白上,质心距离 CV 失败。P21589 是典型例子:其 open 与 closed 状态主要通过域间旋转区分,而质心距离近似不变——因此元动力学偏置无法驱动采样器跨越构象转换。这导致图 3 中 P21589 的不稳定表现。
关键的是,即使在受影响蛋白上,影响也是有限的:Diff-Switch 仅在 closed-reference Caliby 配置下 scTM_switch 低于基线。这暗示即使 CV 不完美,奖励倾斜的局部保持仍提供一定保护。
7.2 CV 选择的本质要求
报告强调:在从头设计设定中,CV 必须反映设计者指定的期望开关行为。例如,若期望蛋白域旋转而非打开,质心距离是次优 CV,应选择捕获旋转的变量(如域间取向角)。这是 Diff-Switch 框架的灵活性的代价——它不自动发现反应坐标,而依赖设计者指定。
7.3 其他局限
- 触发类型扩展:当前真实设计任务聚焦磷酸化触发,扩展到其他触发(如蛋白-蛋白相互作用)仍是重要未来方向。
- CV 自动发现:简单几何 CV(质心距离)在多数情况下有效,但旋转等运动需要更复杂 CV。自动发现合适 CV 是开放问题。
- 基础扩散模型限制:per-protein 变异性反映基础扩散模型的固有波动,Diff-Switch 的改进受限于扩散模型对构象空间的覆盖质量。
- 评估依赖 AlphaFold3:最终过滤用 AF3 预测结构,其对多构象蛋白的预测能力本身有限——AFsample2 等工作显示 AF2 可预测多构象,但这是活跃研究领域。
对蛋白设计与 AI4Science 的启示
Diff-Switch 对三类读者有不同启示。
对蛋白设计实践者,Diff-Switch 填补了从头开关设计流水线的关键空白——自动生成多态骨架系综。此前,多态逆折叠方法(ProteinMPNN-MSD、Caliby)的能力受限于输入骨架质量,而合适骨架需专家手工构造。Diff-Switch 使这一步骤自动化、可扩展,且只需单一起始构象。建议的工作流:提供参考结构与域注释,选择反映期望开关运动的 CV,运行 Diff-Switch 生成系综,选 x_alt,传入 Caliby/ProteinMPNN-MSD 设计序列,用 AF3 在两种触发条件下过滤。关键实践点:CV 选择需反映设计意图——open/close 运动用质心距离,旋转运动用取向角。对磷酸化开关,参考 Buckley et al. 2025 的设计原理。
对 AI4Science 研究者,Diff-Switch 展示了将物理增强采样技术(元动力学)与生成模型(扩散)结合的方法论价值。这不是简单套用——元动力学原本在 MD 轨迹上工作,Diff-Switch 将其适配到扩散采样批次上,用 well-tempered 偏置替代 MD 中的高斯 hill 沉积。这种"物理先验 + 生成模型"的混合范式可迁移到其他需要探索多态系综的场景:核酸构象系综、配体-蛋白结合路径、变构调控网络。关键方法论洞见:(1) 奖励倾斜(reward-tilting)保持局部结构现实性,元动力学偏置驱动全局多样性——两者解耦但统一在单一奖励中;(2) well-tempered 形式提供收敛保证(p_wt ∝ p^{1/γ}),使偏置不会完全擦除势阱;(3) 统一超参数跨系统工作,暗示方法的鲁棒性。
对 DeepResearch2AGI 关注的蛋白设计与合成生物学读者,Diff-Switch 与本站已解读的多个工作形成有趣对照。与 RFdiffusion/BoltzGen 等 binder 设计工具相比,Diff-Switch 不是设计 binder,而是设计开关蛋白本身——这是不同的功能类别,关注构象动力学而非结合亲和力。与 ProteinMPNN/Caliby 等逆折叠工具相比,Diff-Switch 位于其上游——它生成逆折叠的输入(多态骨架对),而非替代逆折叠。与 Nesso-1 等亲和力预测工具相比,Diff-Switch 解决的是"设计什么"而非"评估什么"——但两者可串联:Diff-Switch 设计开关序列,Nesso-1 评估其与靶点的结合亲和力变化。与 Buckley et al. 2025 的磷酸化开关工作相比,Diff-Switch 提供了自动化骨架生成,而 Buckley 依赖手工构造的 open/closed 对——Diff-Switch 使这类设计可扩展。
对合成生物学的更广启示:蛋白质开关是合成信号回路的关键元件。能从头设计响应特定刺激(磷酸化、配体、PPI)的开关,意味着可构建定制信号通路——这对细胞治疗、生物传感器、智能药物递送系统都有直接价值。Diff-Switch 使这一设计能力从"专家手工、案例驱动"走向"自动化、可扩展"。
报告末尾提到的并发工作值得追踪:Xie et al. 2026(well-tempered metadynamics + 预训练扩散模型用于分子系统稀有事件采样与自由能估计)、Lam et al. 2026(MetaDiffusion,生物分子扩散模型的推理时 meta-energy 偏置)、Ohnuki & Okazaki 2025、Nam et al. 2025。这条"扩散+元动力学"的研究线正在快速形成,Diff-Switch 是其在蛋白开关设计方向的首批应用之一。
参考信息
原文:Omidi, He, Bui, Gsponer, Syed. "De Novo Design of Protein Switches with Diffusion-Based Ensemble Sampling." bioRxiv 2026.07.20.739027, July 2026. biorxiv.org/content/10.64898/2026.07.20.739027v1
PDF:biorxiv.org/content/10.64898/2026.07.20.739027v1.full.pdf
机构:University of British Columbia (UBC) · University of Cambridge
核心贡献者:Alireza Omidi(UBC,第一作者)、Jiajun He(Cambridge,共同)、Jennifer M. Bui(UBC)、Jörg Gsponer(UBC,通讯)、Saifuddin Syed(UBC,通讯)
许可证:bioRxiv 预印本,CC-BY 4.0 International
关键技术关联:
· AlphaFold2 (Jumper et al., 2021) / AlphaFold3 (Abramson et al., 2024) — 结构预测与设计验证
· ProteinMPNN (Dauparas et al., 2022) / ProteinMPNN-MSD (Wicky et al., 2022) — 逆折叠与多态序列设计
· Caliby (Shuai et al., 2025) — 系综条件蛋白序列设计
· DynamicMPNN (Abrudan et al., 2026) — 多态蛋白序列设计
· RFdiffusion / Proteina (Geffner et al., 2025) — 蛋白骨架扩散模型(Diff-Switch 的先验来源)
· Genie 2 (Lin et al., 2024) — 蛋白骨架扩散模型
· SE(3) diffusion (Yim et al., 2023) — SE(3) 等变扩散用于蛋白骨架生成
· Well-tempered metadynamics (Barducci et al., 2008) — Diff-Switch 的元动力学基础
· Metadynamics (Laio & Parrinello, 2002) — 增强采样技术起源
· Twisted diffusion sampler (Wu et al., 2023) — 奖励倾斜扩散采样器
· Buckley et al. 2025 — 磷酸化诱导蛋白开关的从头设计(Diff-Switch 真实任务基础)
· Kalakoti & Wallner 2025 / AFsample2 — 多构象 AlphaFold2 与域运动数据集
· Langan et al. 2019 — 生物活性蛋白开关的从头设计(Nature)
· Praetorius et al. 2023 — 铰链式构象开关的从头设计
· Xie et al. 2026 — 并发工作:扩散模型 + 元动力学用于稀有事件采样(arXiv 2602.16634)
· Lam et al. 2026 — MetaDiffusion:生物分子扩散模型推理时 meta-energy 偏置
· Alberstein et al. 2022 — 蛋白开关设计原理综述(Curr Opin Struct Biol)
· Yang et al. 2026 — 从头蛋白设计的过去、现在与未来(Nature)