解锁秘密宝库:制药数据为AI注入动力

解锁秘密宝库:制药数据为AI注入动力

(视频)

药企巨头不再保守:揭秘AI预测蛋白质结构的新“氮泵”

引言:数据荒漠中的AI绿洲

在 2024 年诺贝尔化学奖的聚光灯下,AlphaFold 2 以前所未有的姿态重塑了生物学。然而,在制药界的实验室里,一个反直觉的难题依然挥之不去:即便拥有能预测几乎所有蛋白质形状的 AI,为什么新药研发的成功率并没有迎来指数级的爆发?

答案在于一场隐秘的“数据贫血”。虽然公共领域的生物信息看似浩如烟海,但在涉及“药物分子如何与蛋白质结合”这一最关键的战场上,AI 仍面临严重的营养不良。这场“AI 军备竞赛”证明了一个长期被忽视的假设:在生物医药领域,数据的“保险柜”质量往往比算法的优雅程度更重要。 为了打破僵局,制药巨头们开始打开紧锁的保险柜,将秘不示人的私有数据注入 AI。

核心看点 1:公共数据库的“盲区”

目前,AI 预测蛋白质结构的基石是蛋白质数据库(PDB),它包含了超过 20 万个实验测定的蛋白质结构。然而,对于药物研发而言,这个庞大的库其实存在严重的“偏科”。

  • 数据缺口: 在 PDB 的 20 多万个结构中,真正捕捉到蛋白质与药物类小分子相互作用的结构仅有约 1 万个
  • 性能瓶颈: 当 AI 模型(如 AlphaFold 3)面对与其训练集高度不同的分子时,预测准确率会遭遇“掉下悬崖”般的溃败。

“PDB 中缺失的数据,恰恰就是我们内部数据中所拥有的数据。” —— John Karanicolas,艾伯维(AbbVie)计算药物研发负责人。

核心看点 2:制药公司“保险柜”里的秘密武器

为了填补这一鸿沟,AbbVie、Astex 等五家制药公司联合成立了 AI 结构生物学网络(AISB Network)。他们不再仅依赖公共资源,而是共享了 20,167 个 此前从未公开的私有结构。

这些结构是药企多年来通过 X 射线晶体学等昂贵手段积累的“宝藏”。最引人注目的商业逻辑在于其协作机制:这些数据是以确保专有数据隐私的方式提供给模型的。这意味着药企可以在不泄露“皇冠上的明珠”——即具体化学结构秘密的前提下,利用集体智慧训练 AI。这种从“资产独占”到“隐私共享”的转变,正在重塑行业的研发范式。

核心看点 3:性能的飞跃——当 AI “吃饱”私有数据

实验证明,当 AI “吞下”这批高质量私有数据后,表现出了压倒性的优势。研究人员利用这些数据微调了 OpenFold3(AlphaFold 3 的开源复制版本),结果如下:

  • 测试准确率: 在 1,056 个蛋白质-配体结构测试集中,AISB 模型的高精度预测比例超过了 50%
  • 横向对比: 相比之下,仅使用公共数据训练的 OpenFold3 准确率仅为 33%,而另一个竞争模型 Boltz-2 约为 40%。

“你加入所有这些数据,性能就会得到相当大的提升。” —— Mohammed AlQuraishi,哥伦比亚大学计算生物学家。

然而,数据并非万能的灵药。必须清醒地认识到,这种提升存在天花板:对于极度困难的靶点(Very difficult targets),这些额外的数据依然无法产生有效的帮助。 它的真正价值在于,为那些原本处于“可预测边缘”的靶点提供了关键的推动力。

核心看点 4:打破孤岛——池化数据的协同效应

AISB 网络的研究揭示了一个睿智的洞察:池化数据的力量远大于单打独斗。

Karanicolas 指出,AISB 模型的表现优于仅在任何单一公司数据集上训练的模型。这种协同效应证明,即便是竞争对手,在构建底层 AI 基础设施时,共享数据也能实现双赢。这种协作模式正逐渐成为行业标配,例如礼来(Eli Lilly)主导的 TuneLab 项目,也在通过数据交换让小型生物技术公司获取其 AI 工具。

核心看点 5:从“回收利用”到“大规模合成”的未来趋势

尽管解锁旧有私有数据效果显著,但 AlQuraishi 认为这种“回收”行为本质上只是一种**“权宜之计”(Stopgap measure)**。真正的跨越式进步将来自全新的、针对性产生的实验数据,而非仅仅挖掘过去的库存。

目前,行业正朝着“数据合成”的两个维度进发:

  • OpenBind 项目: 计划在未来几年内产生 50 万个 蛋白质片段与药物结合的实验结构,并完全向公众开放。
  • LIGAND-AI 计划 目标更为宏大,旨在为每一种与人类疾病相关的蛋白质找到至少一种候选药物。

这些项目试图将 AI 从“在旧纸堆里寻找规律”提升到“通过大规模新实验进化”。

结语:AI 与数据的永恒博弈

私有数据的解锁不仅是为 AI 模型打了一个强效“补丁”,更是一场研发文化的重塑。它证明了在生物医药领域,AI 的天花板并不取决于算法的精妙,而取决于人类愿意分享多少关于生命的底层秘密。

随着旧有的秘密数据逐渐被 AI 吞噬殆尽,我们不得不面对那个终极挑战:当人类积累的所有历史数据都被 AI 消化后,下一个推动科学进步的“燃料”将来自何方?

版权声明:
作者:倾城
链接:https://www.techfm.club/p/238366.html
来源:TechFM
文章版权归作者所有,未经允许请勿转载。

THE END
分享
二维码
< <上一篇
下一篇>>