在AI驱动的药物发现中闭环数据循环
摘要
文章探讨了AI在药物发现中的应用现状与挑战,强调高质量完整数据(尤其是负结果数据)对模型性能的关键作用。
核心要点
- 自1950年代以来,新药开发成本每九年翻一番(Eroom's Law)。
- 目前新药上市平均需要10-15年,成本10-25亿美元,失败率超过90%。
- AI在命中识别阶段从经验筛选转向预测设计,可消除物理筛选限制并淘汰低质量候选物。
- AI尚不能可靠预测动力学和可开发性,每个AI生成的候选物仍需实验室验证。
- 公共数据集存在发表偏倚,仅包含阳性结果,缺乏失败实验数据。
原文佐证
- AI has become the pharmaceutical industry’s biggest bet on bringing success rates up and timelines down.
- “The main cost in drug discovery is still the clinical phase, so trying to reduce risk and increase your success rates there is obviously hugely beneficial,”
- “Most publicly available datasets and scientific publications focus exclusively on positive results,”
AI 洞察
这件事意味着药物发现领域的AI应用正从模型竞赛转向数据质量竞赛,私有负结果数据将成为差异化优势。未来,能构建闭环数据系统(整合实验失败数据)的企业将获得显著的竞争优势。同时,数据完整性问题(如图像伪造)可能进一步阻碍AI的可信度。