
10 月 7 日,由马克·扎克伯格(Mark Zuckerberg)和普莉希拉·陈(Priscilla Chan)支持创立的非营利科研机构 Biohub 宣布进一步扩大“虚拟生物学计划”(Virtual Biology Initiative),其将联合美国能源部(DOE)、美国国立卫生研究院(NIH)、Google DeepMind、Isomorphic Labs 和 Meta 等机构,汇集总计约 18 亿美元的资金、数据、算力与实验测量资源,为下一代生物学 AI 模型建设开放数据基础设施。
其中,Google DeepMind、Isomorphic Labs 和 Meta 将联合投入 3 亿美元,美国能源部计划在未来五年投入超过 5 亿美元。Biohub 此前已承诺投入 5 亿美元,NIH 则将整合此前超过 5 亿美元联邦科研投资形成的生物医学数据资源。
这项合作的目标,是为能够预测细胞行为的 AI 虚拟细胞模型提供训练数据。研究人员希望,未来可以在计算机中模拟细胞受到药物、基因编辑或环境变化后的反应,从而减少部分重复实验,更快地寻找疾病机制和潜在治疗方案。
18 亿美元,要为 AI 生产什么样的生物数据?
所谓“虚拟细胞”,就是在计算机中构建细胞的“数字镜像”,观察其在受到药物、基因编辑或环境变化的干预之后,可能发生的种种变化。
目前,AI 已经能够分析大量生命科学数据。例如,通过单细胞 RNA 测序,研究人员可以了解一个细胞中哪些基因正在表达,并据此判断细胞类型和状态。
但如果进一步提出问题:关闭某个基因后,癌细胞会停止增殖吗?给细胞加入一种药物后,哪些分子会发生变化?两种药物同时作用,是否会产生不同于单独用药的效果?现有模型还难以在不同细胞和实验条件下给出足够可靠的预测。
原因之一在于训练数据不足。生物学领域虽然已经积累了大量基因序列、蛋白质结构和细胞图谱,但多数数据记录的是某一时刻的生物状态。相比之下,能够反映细胞受到干预前后如何变化的实验数据仍然有限,尤其缺少覆盖大量细胞类型、疾病状态和干预条件的标准化数据。
Biohub 科学负责人 Alex Rives 在接受路透社采访时表示,现有细胞数据集已经包含数亿个细胞的观测信息,但要训练准确预测细胞行为的模型,可能需要数十亿,最终甚至数万亿级别的细胞数据。他认为,当前的一项重要任务,是让模型真正学习细胞运作的规律,而不仅仅是识别已有数据中的模式。
图 | Biohub 科学负责人 Alex Rives 宣布消息(来源:社交媒体 X)
为此,Biohub 在今年 4 月启动虚拟生物学倡议时,便承诺投入 5 亿美元。其中,4 亿美元用于开发和扩大生物测量技术,另外 1 亿美元支持 Biohub 以外的科研机构开展相关研究。
相关技术投入主要涉及三个方向:一是冷冻电子断层扫描(Cryo-ET),通过冷冻保存的细胞样本,观察细胞内部精细的三维结构;二是大规模显微成像,在组织环境中观察数百万乃至数十亿个细胞,记录它们的形态、位置和相互关系;三是高通量生物干预与测量,通过基因编辑、药物处理等方式改变细胞状态,再系统记录这些变化带来的影响。Biohub 希望将分子、结构、图像和细胞响应等不同类型的信息结合起来,形成能够共同用于 AI 训练的多模态数据资源。
此次合作进一步扩大了相关数据的生产能力。美国能源部计划在未来五年投入超过 5 亿美元,依托国家实验室的超级计算机、先进成像设备和自动化实验设施,支持生物数据生成与建模。NIH 则将整合此前联邦科研项目积累的生物医学数据资源,推动不同数据库之间的标准化与互通。Google DeepMind、Isomorphic Labs 和 Meta 合计投入的 3 亿美元,也将用于开发测量技术和生产多模态生物数据。
除资金投入外,项目还汇集了艾伦研究所、博德研究所、人类细胞图谱计划、桑格研究所等科研机构;NVIDIA 将提供加速计算基础设施、软件及技术支持。Biohub 希望各参与机构采用统一的数据标准和访问方式,让不同实验室生成的数据能够相互对照,并被广泛用于 AI 模型训练。
事实上,Biohub 此前已积累了一定的数据基础,包括人体多器官细胞图谱 Tabula Sapiens、蛋白质定位与相互作用研究项目 OpenCell,以及单细胞数据平台 CELLxGENE 等。今年,Biohub 还与 Arc Institute、Tahoe Therapeutics 合作,计划生成超过 1.2 亿个单细胞数据点,覆盖约 22.5 万种药物与患者样本的相互作用组合,为模型学习细胞对药物的反应提供数据。
图 | 人体多器官细胞图谱 Tabula Sapiens(来源:Biohub)
按照规划,Biohub 希望在约一年内形成首批新的大规模数据集,并在未来五年推动细胞行为预测模型取得进展。Rives 表示,此次合作希望将原本可能需要数十年完成的数据收集工作集中到五年左右推进。
对于数据开放,Biohub 也采取了不同安排。根据路透社报道,商业出资方可以在一定期限内优先使用其资助生成的数据,之后再向科研界开放;政府资助产生的数据则不附带同样的限制。这意味着,该项目既希望建立长期开放的公共科研资源,也通过一定的优先使用权吸引科技企业参与投入。
从训练模型到生产数据,AI 公司开始深入生物实验室
Biohub 此次扩大投入,与其过去一年的研究方向调整密切相关。
这家机构最早成立于 2016 年,由扎克伯格和妻子普莉希拉·陈支持,长期投入细胞生物学、成像技术和疾病研究。早期的 Biohub 更接近一家专注于前沿生物医学技术的科研机构,利用跨学科团队开发仪器、测量方法和开放数据资源。
2025 年 11 月,Biohub 宣布进一步整合前沿 AI 与实验生物学研究,将人工智能确立为下一阶段的重要方向。与此同时,蛋白质 AI 公司 EvolutionaryScale 的研究团队加入 Biohub,其联合创始人兼首席科学家 Alex Rives 出任 Biohub 科学负责人,负责统筹实验生物学、数据和 AI 模型研究。Biohub 还计划扩大计算基础设施,到 2028 年将 GPU 规模提升至约 1 万块。
Rives 是蛋白质语言模型研究的重要推动者之一。他此前在 Meta 的基础人工智能研究部门发起并领导了 Evolutionary Scale Modeling(ESM)项目,尝试让 AI 像学习自然语言一样,从海量蛋白质序列中学习结构、功能和演化规律。此后,他参与创立 EvolutionaryScale,开发了能够联合处理蛋白质序列、结构和功能信息的生成式模型 ESM3。该模型曾展示设计新型绿色荧光蛋白的能力。
今年 5 月,Biohub 进一步发布了新一代蛋白质 AI 模型及数据工具,包括 ESMC、ESMFold2 和 ESM Atlas。其中,ESM Atlas 整合了约 68 亿条蛋白质序列和 11 亿个预测结构,帮助研究人员在更大范围内探索蛋白质之间的联系。Biohub 还展示了利用相关模型设计蛋白质结合分子的实验成果,部分候选分子已经在实验室中完成初步功能验证。
这些研究有一个共同基础:过去几十年,科学家不断积累蛋白质序列、结构和功能数据,为 AI 模型提供了大量学习材料。但如果研究目标从单个蛋白质扩展到完整细胞,情况就复杂得多。一个细胞中存在大量相互作用的分子,其状态还会随着环境、时间和外部干预不断变化。即使模型能够准确预测蛋白质结构,也不意味着它能够预测整个细胞的反应。
这也解释了 Biohub 此次投入的方向。要让 AI 从理解蛋白质进一步走向预测细胞行为,除了扩大模型和算力,还需要通过真实实验获取更多数据。Biohub 因此将大量资金用于新型测量技术和实验数据生产,并通过合作引入 Google DeepMind、Isomorphic Labs 和 Meta 等科技公司,共同扩大相关数据的规模。
除 Biohub 外,类似的投入也开始出现在其他前沿 AI 实验室。9 月,路透社报道称,Anthropic 已在旧金山湾区建立生物湿实验室,探索让 AI 参与真实生物实验;OpenAI 基金会也启动了超过 1.25 亿美元的资助计划,支持建设面向 AI 研究的生物医学数据集。与此同时,部分生命科学工具企业正在将 AI 引入自动化实验平台,让模型不仅能够分析实验结果,也有机会参与实验设计和执行。
(来源:OpenAI 基金会)
这些项目的具体目标并不完全相同。Biohub 希望通过跨机构合作建设开放数据资源,Anthropic 更关注 AI 与真实实验流程的结合,Isomorphic Labs 则聚焦 AI 驱动的药物研发。
但从这些近期进展可以看到,AI 生物学的投入正在逐渐覆盖从数据生产、实验测量到模型训练和应用的更多环节。过去,科技公司主要利用科研界已有的数据开发模型;如今,一部分公司开始直接参与实验技术开发,甚至建设自己的实验室。
不过,更大的数据规模是否一定能够带来更强的生物学预测能力,仍然是一个尚未得到验证的问题。
过去几年,大语言模型的发展展现出一定的规模化规律(Scaling Laws):随着训练数据、模型参数和计算资源增加,模型能力往往能够持续提升。Biohub 希望在细胞生物学中探索类似的规律,通过不断扩大实验数据规模,训练更准确的细胞预测模型。
但生物学数据与互联网文本有很大区别。高质量的细胞数据通常需要真实样本、实验仪器、试剂和严格的质量控制,而且细胞反应受到基因、环境、组织状态等多种因素影响。即使获得了大量细胞数据,也不意味着模型一定能够掌握其中的因果关系。Alex Rives 此前在接受 Axios 采访时坦言,目前尚不清楚细胞生物学的规模化规律究竟如何,尤其是不知道需要增加多少数据,才能让模型达到具有实际研究价值的预测精度。
这一问题也成为此次合作公布后研究人员讨论的焦点。
斯坦福大学计算基因组学研究者 Anshul Kundaje 对这项合作表示欢迎,但同时强调,真正重要的是后续的具体实施方案。他认为,这项工作的关键 “90% 在于实验设计,10% 在于 AI”。换句话说,相比简单增加实验数量,如何选择细胞类型、设置干预条件、保证数据质量,可能更加重要。
AI 生物学研究者、Xaira Therapeutics 生物医学 AI 负责人 Bo Wang 则提出,生物学需要建立自己的规模化规律,但首先必须弄清楚究竟应该扩大什么,是增加细胞数量,扩大基因和药物干预的种类,还是覆盖更多不同的生物学条件?这些因素如何影响模型的预测能力,仍然需要通过实验和定量研究回答。
(来源:社交媒体 X)
两人的讨论指向了同一个问题:对于细胞生物学来说,数据规模固然重要,但数据是怎样产生的、包含哪些信息,同样可能影响模型的最终表现。即使拥有数十亿个细胞的观测结果,如果缺少关键的干预条件,模型仍然可能难以预测此前未见过的细胞反应。
接下来,Biohub 将在未来几年陆续生成新的大规模数据集,并用于训练虚拟细胞模型。这些数据能否帮助模型从识别细胞状态走向预测细胞变化,还需要在真实实验中不断检验。对于投入其中的科技公司和科研机构而言,新的挑战也随之出现:不仅要让 AI 学习越来越多的生物学数据,还要弄清楚,究竟应该做哪些实验,才能让 AI 学到真正有用的东西。
参考链接:
1.https://biohub.org/news/virtual-biology-initiative-expansion/
2.https://www.reuters.com/business/healthcare-pharmaceuticals/us-government-google-join-zuckerberg-backed-biohub-18-billion-push-ai-biology-2026-10-07/
3.https://www.axios.com/2026/10/07/zuckerberg-biohub-ai-biology-data
免责声明:本文旨在传递生命科学和医疗健康产业最新讯息,不代表平台立场,不构成任何投资意见和建议,以官方/公司公告为准。本文也不是治疗方案推荐,如需获得治疗方案指导,请前往正规医院就诊。
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成







