当前位置:首页>排行榜>AlphaFold 3突变结构评测:生成结构和预测变化是两道题

AlphaFold 3突变结构评测:生成结构和预测变化是两道题

  • 更新时间 2026-09-23 08:14:41
AlphaFold 3突变结构评测:生成结构和预测变化是两道题

把一条突变后的蛋白序列交给AlphaFold 3,它可以生成一套完整的三维结构。图像可能很合理,整体折叠也可能与实验结果接近。

但研究突变时,人们常问的是另一件事:与野生型相比,这一个氨基酸的替换究竟让哪些位置发生了变化,变化有多大?

这两个任务共享同一套原子坐标,却不是同一道题。前者寻找突变序列可能形成的结构,后者要求模型准确预测“突变前后之差”。如果评测没有把蛋白本来的结构波动扣掉,一个看起来不错的相关性,可能主要说明模型抓住了共同的折叠特征。

耶鲁大学的Zhuoyi Liu、Alex Calabrese和Corey S. O’Hern在预印本《Towards Accurate Prediction of Mutation-Induced Changes in Protein Structure》中,正面测试了这个差别。他们从Protein Data Bank整理野生型与单点突变体的X射线结构,再用AlphaFold 3预测相同突变序列。这篇论文先重新定义应该比较什么,再给模型打分。

Zhuoyi Liu、Alex Calabrese和Corey S. O’Hern

作者来自机械工程、生物物理、计算生物学与物理等领域,用PDB实验结构建立突变形变评测框架;本文依据2026年9月21日提交的未同行评审预印本。

生成结构和预测变化,是两道题

蛋白结构预测通常从一条氨基酸序列出发,目标是给出一套可能的折叠构象。突变效应研究则至少需要两个对象:野生型结构和突变体结构。真正关心的是两者之间的差值。

差值并不好测。即使氨基酸序列完全相同,同一种野生型蛋白在不同晶体实验、构象状态和局部柔性影响下,也不会得到逐原子完全一致的结构。若把任意两套结构之间的差异都算到突变头上,模型和实验中共同存在的天然波动会被误认成预测能力。

论文因此要求每条野生型序列至少有五套不同的X射线晶体结构。最终数据包含6,967组野生型—单点突变序列对、27,200套野生型结构和16,176套突变体结构。这个规模很大,但6,967组配对不等于6,967个彼此独立的蛋白家族;同一野生型和相关结构会进入多个配对。

先建立“没有突变时也会变化多少”的基线

作者先比较同一野生型的多套实验结构,计算每个残基与邻近残基之间距离的变化,把它作为该位置的重复结构波动。然后再比较突变体与野生型,得到观察到的突变形变。

关键一步是相除:突变体与野生型的平均形变,除以野生型重复结构之间的平均形变。结果接近1,意味着看到的差异没有明显超过天然或实验波动;数值越高,突变带来的额外形变越突出。

归一化突变形变

不是直接问两套结构相差多少,而是问这种差异相对于同一野生型本来就会出现的结构波动大多少。

这个基线改变了评测对象。模型不再只需生成一套整体合理的蛋白结构,还要在已有波动之上,识别由特定突变新增的那部分变化。

0.75、0.55和0.2对应三种问题

如果不做归一化,AlphaFold 3预测的突变体形变与实验观察形变之间,Pearson相关系数约为0.75。单看这个数字,很容易得出“模型已经能较好预测突变结构变化”的结论。

论文同时发现,AlphaFold 3的预测形变与野生型重复结构之间的波动也高度相关。因此,0.75同时反映了更容易预测的部分:哪些位置本来就更灵活、哪些局部结构本来就更容易变化。

扣除这层基线后,模型预测的归一化形变与实验归一化形变之间,整体相关性降到约0.55。再把分析限制到真正产生大幅结构扰动的突变,相关性进一步降到约0.2。

三组数字对应的评测对象逐步收窄:

  1. 模型生成的突变体结构,整体上是否接近实验结构?
  2. 模型能否预测超过野生型天然波动的突变特异变化?
  3. 面对变化最大的突变,模型还能否判断变化方向和幅度?

AlphaFold 3在第一道题上的能力仍然真实。论文表明,第二、第三道题没有被第一道题自动解决。

变化越大的突变,模型越难预测

实验结构显示,单点突变引起的形变通常集中在突变位点附近,随空间距离增加快速衰减,在距离约12到15埃之外接近野生型波动平台。

AlphaFold 3的归一化预测相关性也会随距离下降:从突变位点的约0.55,降到远处的约0.35。但论文认为,空间距离不是主要困难。更明显的下降来自形变强度:突变造成的扰动越大,模型越难复现实验中的差值。

这点对变异解释尤其重要。大多数突变可能只造成轻微结构变化;真正需要额外关注的,往往是少数显著改变局部结构的突变。大量轻微样本会抬高全体样本的总体相关性,困难子集才能显示模型在高扰动条件下是否可靠。

不过,结构形变大不能直接翻译成“致病”,结构形变小也不能证明“无害”。功能还取决于结合、稳定性、表达、细胞环境和调控网络。论文测量的是局部结构变化,不是临床致病性。

rSASA和形变相关,却不能直接拿来预测

研究还检查了相对溶剂可及表面积,也就是一个残基有多大面积暴露给周围溶剂。实验突变体中,rSASA的归一化变化与局部结构形变的相关性约为0.6,而且在强形变突变中没有像AlphaFold 3预测那样明显下降。

这说明局部溶剂暴露保留了与突变响应有关的物理信息。它也提示下一代模型不应只追求单个终态结构,而可以直接学习野生型—突变体配对差值,或学习与变化有关的物理量。

但rSASA结果不能被写成一个已经胜过AlphaFold 3的简单预测器。论文中的rSASA变化来自实验测得的突变体结构;当突变体结构未知时,这个量也未知。这个结果只说明需要预测哪类信息:若模型能从序列或野生型结构预测溶剂暴露怎样变化,可能更容易抓住强扰动突变。

训练重叠与空仓库仍限制复现

作者使用AlphaFold 3 v3.0.1,为每条突变序列运行最多20个随机种子,每个种子产生5个候选,再选择排名最高的结构。为了检查训练数据重叠,他们又筛出181条突变序列:这些序列在AlphaFold 3训练截止日后提交,并且与训练集和验证集中的序列都不完全相同。作者称这个子集延续了全量数据的整体趋势,但在讨论中又指出相关性明显更弱,说明全量评测可能高估模型对未见突变序列的准确性。

这个检查有价值,却不是“完全无泄漏”证明。去掉精确序列匹配后,同源蛋白、家族、折叠和模板层面的重叠仍可能存在。预印本也没有给出该子集的完整数值系数,因此只能确认变化方向,不能量化相关性下降了多少。

复现条件同样有限。论文声明代码和数据位于作者GitHub账户,但截至本文核查时,指定的Mutation仓库为空,没有分支、提交、数据清单或运行环境;论文所称的补充材料和数值结果文件也未出现在可访问的PDF、HTML或源码包中。当前结论来自一篇尚未同行评审的预印本,仍需独立复现和数据审计。

下一次看突变结构评测,先问模型预测的是哪一个差值

这篇论文最有用的地方,不是给AlphaFold 3贴上“能”或“不能”的标签。它提供了一套更可复用的检查方法:

  • 有没有成对的野生型与突变体实验结构?
  • 有没有用重复野生型结构估计天然和实验波动?
  • 报告的是整体结构相似,还是扣除基线后的突变特异差值?
  • 在形变最大的困难子集上,性能是否仍然成立?
  • 训练重叠、代码、数据和补充材料是否足以让外部团队复查?

对研究者和从事变异解释的人而言,能否算准相对野生型的差值,通常比能否生成一张整体合理的结构图更接近实际决策。结构图是起点;差值、基线和不确定性,决定它能被用到哪一步。

延伸阅读


《The Machinery of Life》
David S. Goodsell
这本书用分子尺度的图像解释蛋白质和细胞机器如何在拥挤、动态的环境中工作。它能补上静态结构图容易隐藏的一层:一个蛋白的意义不仅在于折成什么样,也在于局部变化如何改变相互作用和功能。
往期内容

Andrew Ng称AI恐慌由协调公关推动:公开材料能确认事故,不能证明统一操盘
Qwen-Image-2.1新增透明图层能力,商用仍需另行授权
Claude Code默认只在项目没有CLAUDE.md时读取AGENTS.md
Embedding里的“接近”,为什么不等于物理量接近
AI减速怎样结束?退出规则应该在开始前写好
拾荒图书馆
看见技术,也看见它改变世界的方式

随机文章