返回行业情报

NVIDIA联合发布2800种病毒蛋白结构数据集

How Open Science Can Help Researchers Prepare for the Next Pandemic

NVIDIA携手Google DeepMind、EMBL-EBI等机构,利用AlphaFold2和BioNeMo推理运行时,开放发布超2800种病毒蛋白质复合物的预测3D结构,其中约30%为科学界全新发现。同时开源GPU加速的BioNeMo结构预测流程,助力全球研究者加速疫苗与药物研发,为下一次大流行做准备。

深度解读

NVIDIA联合Google DeepMind与欧洲分子生物学实验室的欧洲生物信息研究所(EMBL-EBI),通过AlphaFold Database开放了超过2800种病毒的蛋白质复合物预测3D结构数据集,这是迄今规模最大的病毒结构开放资源之一,其核心判断是:下一次大流行不会像COVID-19那样给人类留出几十年的冠状病毒研究积累作为缓冲,必须提前把结构生物学的“知识弹药”囤积好。

当COVID-19出现时,科学家有一个关键优势:数十年对冠状病毒的先前研究意味着他们对病毒的关键蛋白质足够了解,从而以前所未有的速度设计出疫苗。下一次大流行可能不会提供同样的先发优势。

这个数据集到底放了什么

具体来说,新发布的数据集覆盖了超过2800种病毒的蛋白质复合物结构预测。所谓蛋白质复合物,是指多个蛋白质分子相互结合形成的功能单元——大多数蛋白质并不单独工作,而是聚合成复合物来执行复杂功能,而这些复合物结构往往正是疫苗或药物需要靶向的对象。COVID-19的刺突蛋白三维结构解析,就是疫苗设计的基石。对于成千上万种其他病毒,今天根本不存在这样的结构知识。

数据集中的结构是通过AlphaFold2推断的——这是Google DeepMind开发的AI模型,用于预测蛋白质如何折叠成三维形状。NVIDIA的BioNeMo Inference Runtime对其进行了优化,使团队能够将推理扩展到数千个病毒蛋白质组,预测每个病毒编码的复合物。这里的关键技术细节是“推理扩展”:AlphaFold2单次预测一个蛋白质结构可能只需几分钟,但要系统性地覆盖数千种病毒的全部蛋白质组,需要GPU加速的批量推理能力,这正是BioNeMo的用武之地。

NVIDIA同时开源了BioNeMo Structure Prediction Pipeline——生成该数据集所用的GPU加速工作流,让研究人员可以从自己的目标蛋白质序列出发,直接获得预测的3D结构。这意味着这套能力不是一次性的数据发布,而是可复用的工具链。

30%的全新发现意味着什么

约30%被加入数据库的蛋白质相互作用是科学界完全未知的,展示了从未在蛋白质数据库(Protein Data Bank)——实验测定蛋白质结构的主要存储库——中记录过的相互作用形状。换句话说,这些不是对已知结构的重新预测,而是全新的生物学洞察。

“这个数据库是假设生成的引擎。我们使生物学家和AI社区能够研究蛋白质相互作用,不仅仅是作为单个分子,而是作为复合物,从而推动整个领域前进。”——NVIDIA数字生物学应用研究科学团队负责人Chris Dallago

这一点的深层意义在于:传统结构生物学是“先看到再研究”,而现在是“先预测再验证”。30%的全新相互作用形状为生物学家提供了大量可验证的假设,也为AI社区提供了新的训练和评测数据。整个领域的研究范式正在从“实验驱动”转向“预测驱动实验”。

成本与速度的数量级差异

传统蛋白质结构测定方法——将蛋白质结晶后用X射线照射——每个结构可能需要数年时间,花费数千美元。AlphaFold2经过NVIDIA BioNeMo优化后,在NVIDIA GPU上运行,几分钟内就能预测一个结构,并且可以批量运行。科学家随后可以通过实验方法验证高置信度的预测。

这个数量级差异不是渐进式的改进,而是根本性的范式转换。它意味着在疫情爆发初期,当实验结构生物学还来不及响应时,预测结构可以立即为疫苗和药物设计提供起点。对于资源有限的实验室——尤其是低资源环境中直接面对疫情爆发的科学家——这种开放数据集的价值更为突出。

“开放这些数据对于理解病毒诊断和开发治疗与疫苗至关重要。该数据集还覆盖了较少被研究的病毒,降低了低资源环境中直接面对疫情爆发的科学家的门槛。”——EMBL-EBI临时主任Jo McEntyre

参与机构与时间节点

这一合作横跨流行病防范创新联盟(CEPI)、EMBL-EBI、Google DeepMind、NVIDIA、首尔国立大学、成均馆大学、瑞士生物信息学研究所和格拉斯哥大学。数据集发布时间与联合国大会期间由世界经济论坛召集的疫情防控、准备与响应会议同步——这是一个刻意选择的政策窗口,意在将技术成果与全球治理议程对接。

AlphaFold Database目前包含超过2.6亿个蛋白质和蛋白质复合物预测,覆盖了科学界已知的几乎所有编目蛋白质。病毒复合物数据集只是其中的一部分,但它的战略意义在于聚焦:不是泛泛地覆盖所有蛋白质,而是系统性地处理已知感染人类的病毒家族,从普通感冒病毒到Mpox(猴痘)等新兴威胁。

为什么是现在

全球发展中心的一项分析估计,到2050年,世界面临与COVID-19同等严重的大流行病的概率约为50%。这不是一个遥远的风险,而是一个在一代人时间内大概率会发生的事件。

“当下一次大流行发生时,可能会有某种凭空出现的东西,我们将缺乏对COVID时拥有的知识。我们试图做的是提前囤积一些这样的知识。”——格拉斯哥大学MRC病毒研究中心分子病毒学教授、项目合作者Joe Grove

Grove还提到,他读博士时,所研究的蛋白质没有任何结构数据,“就像在黑暗中工作——我们不得不猜测发生了什么。”这个数据集对现在读博士的研究人员来说,提供了高质量的结构数据,将加速基础科学。

所以呢

对数字生物学和AI药物发现领域而言,这次发布确立了一个模板:基础模型(AlphaFold2)+ GPU加速推理(BioNeMo)+ 开放数据(AlphaFold Database)= 可规模化生产的结构生物学知识。任何拥有GPU和开源工具链的实验室,现在都可以对感兴趣的病毒靶点进行大规模结构预测。

对全球公共卫生体系而言,这意味着疫情准备从“被动响应”向“主动预判”迈出了一步。当新病毒出现时,如果它的蛋白质复合物结构已经在数据库中,疫苗设计可以从结构出发而非从零开始。COVID-19疫苗的快速开发建立在数十年冠状病毒研究之上,而这个数据集试图为更广泛的病毒家族建立同样的知识储备。

对NVIDIA自身而言,这是BioNeMo平台在生命科学领域的一次旗舰级应用展示。通过开源推理管线,NVIDIA在推广其GPU加速计算在数字生物学中的标准地位——数据是开放的,但生成数据的工具链深度绑定NVIDIA生态。这是一种典型的平台战略:用开放数据吸引社区,用专有工具链锁定算力需求。

其
AI前沿AlphaFold病毒蛋白结构开源数据集BioNeMo大流行预防