NVIDIA与Google DeepMind等全球研究机构合作,公布了2800多种病毒的蛋白质复合物3D预测结构数据集,并通过AlphaFold数据库完全开源,旨在为应对未来大流行储备关键生物学底座。

新冠疫情爆发时,全球科学家曾拥有一个关键优势:过去数十年来对冠状病毒的深入积累,使得研究人员能够迅速摸清核心蛋白结构,从而在创纪录的短时间内设计出疫苗。但面对下一次可能突袭的大流行,科学界未必还能拥有同样的先发先机。
全球发展中心(Center for Global Development)此前的一项分析指出,到2050年,全球暴发一场致命程度不亚于新冠疫情的大流行病的概率约为50%。
为了提高人类的胜算,NVIDIA已携手Google DeepMind、欧洲分子生物学实验室欧洲生物信息研究所(EMBL-EBI)等多家国际科研机构,共同发布了一套覆盖2800多种病毒的蛋白质复合物3D结构预测数据集。这套数据已集成至AlphaFold数据库,全球各地的科研人员均可免费公开获取。
数据集中的蛋白质结构由Google DeepMind的蛋白质结构预测模型AlphaFold2生成,并借助NVIDIA BioNeMo推理运行时(Inference Runtime)进行了算力与流程优化。这让联合团队得以将推理规模扩展到数千种病毒的蛋白质组,预测每种病毒内部编码的蛋白复合体与相互作用基团。
在传统生物学流程中,通过蛋白质结晶和X射线晶体学等手段解析蛋白质结构往往耗时数年,单个结构解析成本高达数千美元。而经过NVIDIA BioNeMo在GPU上加速优化的AlphaFold2,仅需几分钟即可批量预测出三维结构。科研人员随后只需通过实验方法对高置信度预测进行验证。
在绝大多数生命活动中,蛋白质很少单独运作,它们通常组合成多分子复合物以执行复杂功能。这些复合物的结合位点与界面,正是疫苗和靶向药物破坏病毒功能的关键靶标。例如新冠病毒刺突蛋白3D结构的测定,便成了后续疫苗设计的基石。然而,面对成千上万种尚未被充分研究的病毒,此前几乎没有任何三维结构数据可用。
本次新增的蛋白质相互作用中,约有30%完全超出了以往的科学认知,展示了全球核心蛋白质结构数据库(Protein Data Bank,PDB)中从未记录过的相互作用构型。
除了公开预测数据集,NVIDIA还将生成该数据集所使用的GPU加速工作流开源,发布了BioNeMo结构预测管线(BioNeMo Structure Prediction Pipeline)。科研人员可以直接利用该开源工具,将自定义的蛋白质序列端到端转化为3D结构预测。
此次参与合作的机构涵盖流行病防范创新联盟(CEPI)、EMBL-EBI、Google DeepMind、NVIDIA、首尔大学、成均馆大学、瑞士生物信息学研究所及格拉斯哥大学。该数据集系统梳理了已知会感染人类的病毒家族,从普通感冒病毒到猴痘(Mpox)等新兴威胁均有覆盖。
随着这批病毒数据的并入,AlphaFold数据库已收录超过2.6亿个蛋白质及蛋白质复合物预测结构,几乎覆盖了科学界已知的所有编目蛋白质。数据库中的所有预测均附有置信度评分,使生物学家能够清晰洞察病毒复合物可能的构象以及组内各个蛋白质的相互作用机制。
将结构数据与自动化工作流向全球免费开放,不仅能为数字生物学研究提供假设生成的加速引擎,更大幅降低了资源有限地区的研发门槛,帮助处于突发疫情一线的科研人员迅速展开诊断、药物与疫苗研发。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断