
以 AlphaFold 系列为代表的蛋白质模型,在预测结构方面已经表现得很好。2024 年,共折叠模型 AlphaFold 3 发布,宣称可进一步预测蛋白质与多种分子组成的联合三维结构,但现实是,它在真实药物研发场景中的精度远未达到实用标准。
原因在于,几乎所有现代药物都通过与人体蛋白质结合来发挥作用,而公开的蛋白-药物分子配对的数据严重匮乏。
各家药企积累的私有配对数据是共折叠模型训练的优质燃料,但如何在不泄露公司机密的情况下利用这些数据,行业内一直没有确切答案。
近日,据《自然》新闻消息,艾伯维、Astex 制药、百时美施贵宝、强生和武田制药合作实现了一项重大突破。他们借助法国科技公司 Apheris 的“联邦学习”架构,利用各家私有蛋白-配体结构在本地训练模型,对应参数上传至中央聚合器,供基础模型调用。
结果显示,与目前公开最强对手相比,微调模型在关键指标上的得分高出约 11%。而这可能也是联邦学习(federated learning)问世十余年后,首次为前沿 AI 模型带来显著的能力提升。
(来源:Apheris)
不上传数据也能合作训练模型?
参与本次训练的五家药企同属于 AI 结构生物学网络(AISB),这是一个由近十家跨国药企组成的产业联盟,本次“联邦 OpenFold3 计划”是联盟首个研究项目,模型底座来自哥伦比亚大学穆罕默德·库雷希(Mohammed AlQuraishi)团队开发的 OpenFold3 Preview 2。
五家药企累计贡献了超 2 万条实验解析蛋白-配体复合物结构,整个训练过程用时不到十周。
评估集则由各家药企预留的 1,000 余个私有结构组成,他们特意分别挑选了不太可能出现在其他公司训练集里的项目做评估,进一步降低数据泄漏和不均衡风险。
研究采用两个互补指标衡量效果:蛋白-配体接触面局部结构质量达标的样本比例(PL-lDDT),以及配体在结合口袋里放置到正确位置的比例(bisyRMSD)。
结果发现,与原基础模型相比,微调得到的 AISB-1-Fed,其在评估集上的 PL-lDDT 表现从 35.6% 提升到 52.1%;bisyRMSD 达标率则从 28.9% 提升到 46.8%。作为参照,此前性能最强的公开共折叠模型 Boltz-2,在该评估集上的指标表现分别只有约 40.9% 和 36.5%。
(来源:Apheris)
实验还证实,AISB-1-Fed 不仅优于所有公开模型,也优于任何一家药企单独用自家数据微调所得的模型,直接证明了跨企业数据合训的价值。
AISB-1-Fed 在蛋白-蛋白界面(PPI)预测方面的表现格外令人惊喜。团队本次训练并未针对这一目标做优化,但在包含 443 个多聚体复合物的评估子集上,该模型的 PPI-lDDT 达标率从公开参考模型的 40% 左右跃升至 62.6%。
AISB-1-Fed 的性能提升,会不会只是因为用上了更新的公开 PDB 数据?
面对这一质疑,团队专门训练了一个对照模型 AISB-1-OF3p2-all-PDB,同样以 OF3p2 为起点,同样使用截至 2025 年 11 月 19 日的公开 PDB 数据(时间戳与 Boltz-2 等模型对齐),但不加入任何私有结构。对照模型的性能明显低于 AISB-1-Fed,证明性能提升的驱动力确实是私有数据本身。
模型的数据安全也通过了考验。团队采用数据重建攻击和成员推断攻击,测试模型会否泄漏训练数据信息,结果未发现利用的泄漏通道。
研究人员特别指出,攻击者要想“确认”某个化合物曾出现在训练集中,就必须先掌握该化合物的完整实验 3D 结构,基本等于用已知信息确认已知信息,实际情报价值可忽略。
AlphaFold 之后:共折叠模型的能力与局限
现有蛋白质模型大多基于蛋白质数据银行(PDB)训练,作为目前全球最大的公开蛋白结构库,PDB 收录超 24 万条蛋白质结构数据,其中仅有约 1 万条蛋白与药物类分子的配对数据。
AlphaFold 3 之后,华盛顿大学团队主导推出的 RoseTTAFold All-Atom、Boltz-1 与 Boltz-2、字节跳动的 ProtenixV1、Chai Discovery 的 Chai-1 等共折叠模型相继问世。在公开评测基准上,他们几乎都能把 75% 以上的配体放到正确位置。
这些漂亮的数字掩盖了关键问题:一旦题目“超纲”,模型精度就会断崖式下滑。2025 年 10 月,巴塞尔大学团队在《自然-通讯》(Nature Communications)发表了一组对抗性测试,为共折叠模型引入基于物理规律的微扰,发现它们对关键结构的改变几乎不敏感。研究揭示,现有模型很大程度上是在“死记硬背”训练数据,并未学到可泛化的底层物理化学规律。
根本原因还是训练规模不够大。但与此同时,各家药企的服务器里存着海量私有结构数据,据业内估算,总量或超过整个 PDB。
如何在不破坏知识产权和隐私条例的前提下利用这批资源?联邦学习正为解决此类困境设计:与其把数据汇集到模型所在的地方,不如把模型送到数据所在的地方。
参与方在本地训练几个梯度步,只把模型参数上传到中央聚合器,聚合器加权平均后再下发新版本模型,如此反复迭代。
图 | 联邦学习流程(来源:Apheris)
在药物发现领域,联邦学习方法早有应用。最有名的先例是 2019~2022 年由欧盟创新药物计划(IMI)资助的 MELLODDY 项目:安进、阿斯利康、拜耳、诺华等 10 家药企参与,训练出一套浅层前馈神经网络,用分子指纹预测小分子化合物的生物活性和药理学性质。项目证明了联邦学习在药物发现场景下的可行性,但业内普遍评价其性能改进幅度不大。
与 MELLODDY 相比,AISB 项目之所以得到了更显著的提升,主要原因是基础模型架构的升级、工程栈更成熟,以及联邦学习算法自身的改进。
本次 AISB 的研究尚未在公开评测基准上验证、未与最新一代模型系统对比,这导致外界无法评估 AISB-1-Fed 在前沿技术中的绝对位置。但在媒体采访中,Boltz 公司 CEO 加布里埃莱·科尔索(Gabriele Corso)确认其具有初步可行性,因为他们此前与药企合作针对私有数据进行微调时,也观察到了模型能力的“明显改进”。
值得一提的是,训练中最难的环节反而是数据对齐:各家药企的结构文件格式、命名规范、注释体系差异巨大,Apheris 与研究人员专门搭建了一套跨机构的数据协调流水线,把所有结构统一转换为模型兼容格式。任何一家药企在某个格式边界情况上遇到的问题,对应修复方案可推广至其他合作公司。
挖掘私有数据、新造数据孰优孰劣?
近年来,行业普遍意识到数据是阻碍蛋白质模型发展和 AI 辅助药物发现的关键限制因素,也开始探索不同的解决路径。
在药企联合共用私有数据的“联邦”路线中,除 AISB 外,礼来(Eli Lilly)在 2025 年 9 月也推出基于联邦学习架构的 TuneLab 平台,把利用价值 10 亿美元专有数据训出的 18 个 AI 模型对外开放,让符合条件的小型生物技术公司免费使用,这些公司须向平台回馈数据,模型得以持续演进。
还有一种方法是直接生产公开数据,核心代表是英国主导的 OpenBind 项目。2025 年 6 月,英国政府资助并主导的 OpenBind 正式启动,由英国国家同步辐射设施钻石光源(Diamond Light Source)牵头,联合牛津大学、华盛顿大学、哥伦比亚大学等机构,目标是在 5 年内利用自动化学与高通量 X 射线晶体学产出超过 50 万个蛋白-配体结构并全部公开。2026 年 8 月,OpenBind 发布首批数据集与首个预测模型。
除了解析三维结构,测量蛋白质与药物分子的结合强度也很关键。2026 年 1 月,跨大西洋联盟推动启动了一项名为 LIGAND-AI 的全球性项目,由辉瑞与结构基因组学联盟(SGC)共同牵头,汇集 9 国 18 家公私机构,多伦多大学结构生物学家阿莱德·爱德华兹(Aled Edwards)任负责协调。项目预计通过高通量筛选产生数十亿条结合亲和力数据,为早期药物发现提供另一类训练素材。
三种方案孰优孰劣?在 OpenFold3 的开发者穆罕默德看来,回收药企私有数据开展“联邦学习”本质上是“权宜之计”,这些数据都来自历史药物研发项目,自带强烈选择偏差。要想实现真正的量级跃迁,仍需依赖后两类专门针对现有模型盲区定向生产的新数据。
Astex 制药计算化学与信息学副总裁保罗·莫滕森(Paul Mortenson)从实用角度出发称,联邦学习带来的性能改进足以防止药企押注错误靶点,同时辅助识别容易被漏掉的候选药物。艾伯维计算药物发现负责人约翰·卡拉尼科拉斯(John Karanicolas)进一步明确了边界,这套方法对少数靶点可构成“极其有价值的赋能”,但在最难的靶点上,再多现有数据也无解。
多伦多大学的阿莱德给出了更根本的判断:无论是回收私有数据还是新造数据,都只能“帮助”理解而不能复现药物与蛋白相互作用的动态过程,共折叠模型下一阶段的挑战,是从静态结构预测走向动力学建模。
在模型不断改进的过程中,联邦学习激活的存量数据与公共资金催生的新数据缺一不可。正如 Apheris 联合创始人兼 CEO 罗宾·罗姆(Robin Röhm)所言:“在药物发现领域,没有任何一家公司拥有独自解决最难问题所需的全部数据。”
参考内容:
https://www.nature.com/articles/d41586-026-02882-x
https://www.apheris.com/resources/federated-training-dramatically-improves-the-accuracy-of-protein-ligand-co-folding-on-private-pharma-structures
https://www.nature.com/articles/s41467-025-63947-5
https://www.apheris.com/networks/aisb
https://pubs.acs.org/doi/10.1021/acs.jcim.3c00799
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成







