在通用大模型竞赛之外,AI 在生物医药领域的应用正遭遇一个更现实的瓶颈:高质量、可训练的专业数据仍然太少。近日,OpenAI 基金会宣布启动一项名为 Public Data for Health 的新计划,通过资助外部机构创建“高质量科学数据集”,帮助医疗 AI 获得更多真实世界观察数据。
首批资助对象包括一项围绕新型癌症疫苗的数据收集项目、一个药物效应预测竞赛平台,以及一项颇具实验性的计划:从破产生物技术公司手中获取原本难以公开的研发资料。后者由政策分析师 Ruxandra Teslo 提出,并交由临床试验志愿者倡导组织 1Day Sooner 推进,资助金额为 50 万美元。
生物 AI 的问题,不只是模型不够强
这项计划的核心判断并不复杂:如果 AI 要在疾病治疗上取得真正进展,仅靠现有公开论文、数据库和通用文本远远不够。模型需要更多实验结果、监管文件、临床反馈和失败案例,才能理解真实药物研发流程中的复杂性。
- OpenAI 基金会表示,未来许多疾病预防和治疗突破,将来自新模型与更多世界观察数据的结合。
- Altos Labs 前计算业务副总裁 Morgan Levine 认为,数据已经成为 AI 成功应用于生物学领域的最大瓶颈。
- 此次资助并不只面向明星研究机构,也包括倡导组织、竞赛平台和档案整理项目。
这也反映出一个行业趋势:医疗 AI 的竞争重点正在从“谁的模型参数更大”,转向“谁能获得更完整、更结构化、更贴近真实研发流程的数据”。
失败实验和破产公司资料,正在变成稀缺语料
这次最受关注的资助项目之一,是尝试利用破产生物技术公司留下的资料。Teslo 将这些资料称为“生物科技失落档案”,认为它们可能包含监管申报文件、生产策略、安全性数据等通常被视为商业机密的信息。
1Day Sooner 总裁兼联合创始人 Josh Morrison 表示,这笔资助将帮助组织验证一条路径:是否能以较低成本获得破产公司数据集的非独占副本。他估计,每份数据集可能只需要“几万美元”。
- 该组织目前拥有三份数据集,其中两份由生物技术公司 Lumen Bioscience 捐赠。
- 今年另外两次竞标药企文件并未成功。
- 他们重点寻找的是 common technical documents,即包含企业与监管机构往来、科学测量数据和药物已知信息的关键文件。
这类资料的价值在于,它们不仅记录成功,也记录失败、修正和监管沟通细节。对于训练理解药物审批流程的 AI 来说,这比单纯的论文摘要更接近实际业务场景。
从采购数据到合成数据,垂直大模型进入“找料”阶段
OpenAI 基金会的动作并非孤立事件。近期,围绕垂直领域训练数据的获取方式正在变得更加激进:一方面是直接采购或竞标企业数据,另一方面是通过资助研究项目、竞赛和公共数据建设来创造新语料。
素材提到,Google 上月赢得对破产航空公司 Spirit Airlines 企业数据的竞标,其中包括 1 亿封邮件。这类事件说明,破产企业的数据资产正在被重新估值,也可能成为 AI 训练语料的新来源。
在生物医药领域,这种做法还有一层更直接的意义:药物研发中大量时间和资金消耗在临床开发阶段,但流程对小型生物技术公司而言仍像黑箱。Teslo 认为,如果这些档案被系统整理,AI 可以成为监管流程专家,帮助加快疗法走向市场。
OpenAI 的慈善资金,正在成为 AI 数据基础设施的一部分
OpenAI 基金会是 OpenAI 的非营利母公司,持有 OpenAI 26% 的股权。随着 OpenAI 估值走高,基金会未来可能掌握巨额资产,并开始扩大对外捐赠。基金会高管 Jacob Trefethen 表示,其运营基本独立于 OpenAI,但共同目标是确保人工智能“造福全人类”。
此次健康数据计划之外,基金会此前还向 Common Health Coalition 提供过 1 亿美元资助,用于帮助患者获得丙肝药物。基金会称希望在年底前捐赠 10 亿美元。
对中文 AI 行业观察者来说,这件事的启示在于:大模型进入垂直领域后,真正稀缺的往往不是算力,而是可信、可用、能反映失败经验的专业数据。OpenAI 基金会此次出资购买和创建生物数据,说明头部机构已经开始把“数据供给”当作 AI 医疗落地的基础设施来建设。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/openai-ji-jin-hui-chu-zi-bu-shang-sheng-wu-ai-duan-ban-shi