译自英文

Big Mechanism是一个耗资4500万美元的DARPA研究项目(2014-2017年),旨在自动阅读癌症研究论文,将发现整合到计算模型中,并生成可检验的假设,重点关注与三分之一人类癌症相关的Ras基因突变。

Big Mechanism是美国国防高级研究计划局(DARPA)资助的一项研究计划,预算为4500万美元。该计划于2014年启动,旨在开发能够阅读癌症研究文献、将提取的知识整合到综合癌症模型中,并在2017年底前生成新假设的软件。该倡议旨在自动化大数据收集,并弥合基于知识的自然语言处理、策展与本体论、系统与数学生物学等学科之间的鸿沟。通过阅读研究摘要和论文,该软件预计能提取因果机制的片段,从而加速肿瘤学科学发现的步伐。

该计划聚焦于Ras基因家族的突变,这些突变与约三分之一的人类癌症有关。当时,研究人员对影响细胞复制和死亡的蛋白质间相互作用序列有了粗略的路线图,但因果关系尚不明确。Big Mechanism旨在通过从科学文献中构建详细、可计算的模型来阐明这些关系。

计划结构

该计划分为三个阶段。第一阶段涉及阅读文献并将其转换为形式化表示。第二阶段侧重于将知识整合到计算模型中。第三阶段是产生可实验检验的解释和预测。研究团队开发了四个独立系统,共同针对这三项任务。

2015年2月,一次评估会议审查了第一阶段的进展。会议考虑了多项任务,包括提取实验程序细节以及评估“我们证明”和“我们建议”等陈述。另一项任务涉及映射句子含义和关系。最佳的机器阅读系统从一个小型语料库中提取了40%的相关信息,并正确确定了每个段落与模型的关系。

第二阶段计划于2015年夏季启动,当时团队成员试图生成一个单一参考模型。第三阶段被认为最具挑战性,因为人工智能社区在开发假设生成器方面成功有限。然而,分子生物学被认为更易于处理,因为大多数领域知识是技术性的且以书面形式存在。

技术方法

Big Mechanism依赖于机器学习自然语言处理(NLP)的进步来解析科学文本。该计划使用基于知识的NLP技术提取因果关系,然后通过本体论和策展数据库进行形式化。提取的机制被整合到细胞信号通路的数学模型中,特别是涉及Ras蛋白家族的信号通路。

该计划早期文档中未明确提及深度学习神经网络的使用,但自动化知识提取和模型构建的基本原则与后来出现的生成式AI大型语言模型的更广泛趋势一致。该计划对阅读和理解科学文本的重视预示了后来AI驱动科学发现的发展。

挑战与成果

主要挑战之一是生物系统的复杂性。癌症背后的因果机制错综复杂,涉及多种蛋白质和反馈回路。该计划生成新假设的目标尤为雄心勃勃,因为这要求AI不仅综合现有知识,还要提出新实验。

2015年2月的评估凸显了从科学论文中提取准确信息的难度。最佳系统仅达到40%的准确率,表明需要显著改进。该计划的时间表紧凑,最终目标设定在2017年。

尽管该计划于2017年结束,但其遗产以自动化文献分析和模型构建工具及方法论的形式持续存在。Big Mechanism开创的概念影响了后续AI驱动的生物医学研究努力,包括使用变换器多头注意力来阅读和总结科学文本。

影响与遗产

Big Mechanism是首批将AI应用于整个科学发现流程(从阅读论文到生成假设)的大规模倡议之一。它凸显了AI在加速癌症生物学等复杂领域研究方面的潜力。该计划还促进了计算机科学家、生物学家和数学家之间的合作,带来了跨学科见解。

尽管该计划的具体目标未完全实现,但它为知识图谱构建和序列到序列建模技术的发展做出了贡献,这些技术现在在AI研究中很常见。对因果推理和假设生成的关注仍是一个活跃的研究领域,现代大型语言模型开始应对类似挑战。

参见

参考文献

  • DARPA Big Mechanism计划文档(2014-2017)
  • 评估会议报告(2015年2月)

外部链接

  • DARPA官方网站(存档)

外部链接

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·darpa·cancer-research·natural-language-processing
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史