从数周到数小时:诺华用 AIP 重塑药物发现

摘要
诺华(Novartis)data42 负责人 Burg Sherbold 在 AIPCon 8 上介绍了这家全球领先药企如何用数据与 Palantir AIP 重新想象新药发现。他先摆出行业的根本困境:平均需要 12 年、30 亿美元才能开发一款新药,而一个处于发现阶段的分子最终通过监管审批的概率是 1/10000——「这不是靠 vibe coding 就能解决的问题」。诺华的答案是三要素:对整合数据的民主化访问、世界级科学人才,以及超越传统生产力工具的智能工具(预测与生成式模型)。
诺华自 2019 年与 Palantir 合作构建 data42 平台——名字灵感来自《银河系漫游指南》中「生命、宇宙与一切的答案」。平台通过本体论(Ontology)与 AIP 整合了来自 700 多万患者生命数据的真实世界数据,以及涵盖约 100 万名患者的 3000 项临床试验,合计数百亿行数据,全部在安全、治理良好的环境中即时可用;智能体从文档中提取元数据,把化合物、临床试验、生物标志物与临床前数据自动连接。
两个已投产的应用展示了成效:Chat RWE 让临床科学家用对话界面自助完成患者队列可行性评估(过去需要向数据科学家求助写 SQL);「Closing the Loop」则用 AIP 智能体自动化人类剂量预测的所有场景推演——过去一位转化建模师每个化合物需要约一周,现在只需约两小时,时间节省约 90% 到 98%,且诺华几乎 100% 的小分子项目都在使用它,预测质量与可复现性同步提升。
正文
一、1/10000 的概率:药物发现的根本挑战
诺华是一家聚焦科学与创新的全球领先医药公司。Sherbold 开门见山地指出制药行业面临的巨大挑战:目前平均需要约 12 年、30 亿美元才能开发一款新药。这主要源于极低的成功率——化学家早期合成的一个发现阶段分子,最终到达监管审批的赔率是 1/10000。
在他看来,这不是单靠「凭感觉写代码」(vibe coding)能解决的问题。诺华相信,提高成功概率需要三个关键要素:第一,对「情境增强的整合数据」的民主化访问——横跨发现、临床前、临床与真实世界数据;第二,世界级的科学人才;第三,智能工具——包括预测与生成式模型,支持科学家做出突破性发现,远远超越经典生产力工具。Sherbold 强调,对科学家(也对他自己)而言,目标不是「早 30 分钟回家遛狗」,而是真正改善这个赔率、帮助正在等待新救命疗法的患者。
与 Palantir 的合作正是围绕这一目标:构建一个让 AI 智能体拥有「科学深度」、且锚定在诺华数据之上的框架。诺华早在 2019 年就开始与 Palantir 合作,开发 data42 背后的技术。
二、data42:以本体论解锁诺华的数据宇宙
data42 的名字灵感来自《银河系漫游指南》——为了找到「生命、宇宙与一切的答案」。它的使命是以安全且治理良好的方式,释放诺华数据的价值:包括专有化合物数据、临床前有效性与安全性数据、临床数据(实验室数据与生物标志物数据),以及真实世界数据(如电子健康记录)。其中一些数据(尤其生物标志物数据)相当敏感且高度复杂;要真正理解临床数据,必须能把结构化数据与临床试验方案或科学报告中的非结构化数据链接起来。
借助本体论与 AIP,data42 已经能够整合来自 700 多万患者生命数据的真实世界数据,以及覆盖约 100 万名患者的 3000 项临床试验——合计数百亿行数据,现在全部在一个安全、治理良好的环境中即时可用。团队把丰富的领域知识编码进本体论:构建能够跨多个数据域、跨文档中捕获的元数据提取并连接数据的智能体。这样,研究者可以轻松探索 AIP 生成的链接——例如把某个化合物(黄色)与其临床试验数据(红色)、生物标志物数据(绿色)、临床前数据连接起来。
三、Chat RWE:让临床科学家自助查询真实世界数据
第一个已投产、并在诺华广泛使用的案例是 Chat RWE——一个 AIP 增强工具。设想一位临床科学家在支持一个正在规划乳腺癌新临床试验的项目团队,第一个问题是:我能入组患者吗?在给定的入组与排除标准下,我能找到患者吗?
用真实世界数据回答这个问题相当复杂。过去,你通常需要求助数据科学家——因为你可能不会写 SQL 查询;这需要时间,也许你就干脆放弃了。现在,Chat RWE 把数据访问民主化:数据遍历的巨量复杂性、同义词检索与输出生成,都隐藏在非常直观的用户界面后面——一个对话窗口加一组精选可视化,让科学家能够判断生成的队列是否是自己研究问题的良好基础。这些可视化专门为数据探索者提供底层数据的必要情境:感兴趣患者群体的年龄分布、合并症、临床实验室指标、既往治疗线数等。
而对数据科学家来说,真正的起点在这里:借助 data42 上的多模态数据,他们可以在熟悉的专业代码环境中(如 Jupyter notebook)构建新的机器学习或 AI 模型。
四、Closing the Loop:智能体驱动的剂量预测闭环
第二个已投产的案例叫「Closing the Loop」(闭环)——听过名字你就知道为什么。这是诺华所有早期发现项目团队都在使用的应用:这些团队要合成数百甚至数千个化合物,并预测预期的人体剂量。如果要从源头降低风险,理解和预测人体内可能发生什么是关键。现在,诺华可以为所有发现分子预测预期人体剂量、学习并与临床数据大规模对比,使用自动化工作流与 AI 智能体完成。
目标非常明确:让一位转化建模师完成过去根本做不到的事情——如果所有项目都要规模化完成,过去需要一支大得多的团队。闭环的意义不仅是获得效率,它还能改善预测质量、带来新的洞察。从动物实验预测正确的人体剂量是一个非常复杂的动力学建模过程,有多个选项。诺华用 Palantir 的 AIP 智能体自动生成所有可能场景——这在过去是不可能的——让建模师能够测试不同输入数据与缩放方法的影响;如果手动做,工作量会爆炸、耗费大量宝贵时间。
关键的决策理由与科学情境被捕获回本体论,形成真正的知识库,支撑下游更优的预测。在此基础上,诺华构建了 AIP 智能体:结合已整合进 data42 本体论的历史临床研究洞察,以及组织与行业最佳实践,为建模决策提供建议。每一次预测、每一份捕获的科学情境都作为实验室节点丰富本体论,反哺未来的预测。AI 智能体不仅层层推进工作流,还能向建模师透明地论证自己的建议——本体论让「真正的人机伙伴关系」成为可能。工作流结束时,所有建模决策、生成的图表与使用的数据都会转化为电子实验室笔记条目,带可追溯来源与透明工件,确保可复现性。
成果是惊人的:一位转化建模师通常花在单个化合物人体剂量预测上的时间,从一周降到两小时——减少约 90% 到 98%。如今,诺华几乎 100% 的小分子项目都在使用 Closing the Loop,以提升一致性、可复现性,更早地为项目去风险,从而提高成功概率。Sherbold 总结:如果你拥有全面的数据、杰出的科学家与真正智能的工具,就能从根本上改变药物发现的过程——想象一下,用一流的数据访问、高效的工具与日益自主、情境丰富的智能体,为你的数据科学家装上「超级引擎」。
觉得有用?分享给一个需要的朋友 🙏