--- title: Nature | 研究论文正在从“可阅读”走向“可执行”,Paper2Agent把研究方法直接变成AI Agent source: 生物探索 datetime: 2026-09-19T13:30:57+08:00 importance: 0 canonical_url: https://finance.sina.com.cn/roll/2026-09-19/doc-inisiwwe7622842.shtml --- 论文最难的地方,很多时候不是读懂结论,而是把论文里的方法真正运行起来。 一篇生物学信息学论文可能只有十几页,但要复现它,你需要找到代码仓库、配置软件环境、理解参数、准备输入文件、跑通分析流程,还要判断输出结果是否与论文一致。对于一个陌生的方法,从“读懂论文”到“能在自己的数据上使用”,中间往往隔着大量隐性的技术工作。 近日,《Nature》的研究报道“Reimagining research papers as interactive and reliable AI agents”,提出了一个很有意思的框架——Paper2Agent:把一篇静态论文自动转换成一个可以对话、调用工具、执行分析甚至与其他论文协作的人工智能代理(AI agent)。 它试图改变的,不只是“AI如何读论文”,而是一个更基础的问题: 未来,我们发表的究竟是一篇文章,还是一套可以直接运行的研究能力? 不是让AI“更会总结论文”,而是让论文自己把方法跑起来 目前的大语言模型(large language model, LLM)已经可以很好地总结论文。 把PDF上传给AI,我们可以问:“这篇论文讲了什么?”“主要创新是什么?”“作者用了什么数据?” 但Paper2Agent认为,这仍然只是把AI当成一个高级阅读器。 真正困难的问题是: “能不能用这篇论文的方法,分析我自己的数据?” 传统情况下,如果论文提出了一种新的计算方法,研究人员往往需要先找到GitHub代码,安装依赖包,弄清文件格式和参数,再修改示例代码。即使代码公开,这个过程也未必顺利。 Paper2Agent采用了另一种思路。 它把论文的正文、补充材料、代码、数据和分析流程整理成一个模型上下文协议(Model Context Protocol, MCP)服务器,然后再连接到AI Agent。 其中包含三类核心内容。 MCP tools负责执行论文中的具体方法,例如输入一个遗传变异后预测它对基因表达、剪接或染色质可及性的影响。 MCP resources保存论文正文、代码、补充材料和数据等静态资源。 MCP prompts则记录复杂分析应该按照什么顺序完成,例如单细胞RNA测序从质量控制、归一化、特征选择,到降维、聚类和细胞类型注释的完整流程。 于是,论文不再只是告诉你“作者做了什么”。 它开始能够回答:“把这个方法应用到我的数据上。” 从一篇论文到一个Agent,关键并不是“生成代码” 这里有一个很容易被忽略的问题。 如果只是让LLM读论文,然后临时写一段代码,其实并不困难。问题在于:这段代码可靠吗? 生成式AI最大的风险之一,就是代码看上去合理,甚至能够正常运行,但计算逻辑可能已经偏离原始方法。 Paper2Agent因此把“验证”放在了整个系统的核心位置。 它首先寻找论文对应的代码仓库,建立独立的软件环境;随后识别代码中的教程和示例,把其中可以复用的分析过程封装成工具;再用论文原始示例数据运行这些工具,比较结果。 研究的方法部分规定得相当具体: 数值结果允许的浮点误差为 3%;生成图像与参考图像通过感知哈希(perceptual hashing)比较,要求汉明距离(Hamming distance)小于 20;每个函数最多经历 6轮测试、诊断和修复。如果一个工具反复无法通过验证,就不会进入最终的MCP服务器。 这意味着Paper2Agent追求的并不是: “让AI现场想办法写代码。” 而是: “提前把论文中的方法转换成经过验证的工具,再让AI调用。” 这两种路线的可靠性逻辑完全不同。 第一个测试:让AlphaGenome论文变成基因组分析Agent 研究人员首先选择了一个很有代表性的案例——AlphaGenome。 AlphaGenome是一种用于预测DNA序列变异对基因调控影响的模型,可以分析基因表达、RNA剪接、染色质可及性等多种功能结果。 Paper2Agent自动生成了 22个AlphaGenome MCP工具。 22个工具全部通过自动验证 构建时间约 45分钟 API成本约 14美元 整个过程中不需要人工干预 但生成工具并不是重点。 关键问题仍然是:它做得对不对? 研究人员设置了15个来自原始教程的问题,以及15个新的问题,每个问题独立运行5次,并由两名领域专家按照预先定义的标准评分,两名专家的一致率达到 96.7%。 结果差距相当明显。 任务 Paper2Agent Claude + Repo Biomni 15个教程类问题 98.7% ± 1.3% 82.7% ± 3.4% 37.3% ± 4.0% 15个全新问题 100.0% ± 0.0% 78.7% ± 4.4% 56.0% ± 3.4% 在15个教程类问题中,Paper2Agent的准确率达到 98.7% ± 1.3%;直接让Claude Code访问AlphaGenome代码仓库时为 82.7% ± 3.4%,相差 16.0个百分点。 在15个全新问题中,Paper2Agent达到 100.0% ± 0.0%,Claude直接访问代码仓库为 78.7% ± 4.4%,相差 21.3个百分点。 另一个生物医学Agent系统Biomni在两组任务中的准确率分别为 37.3% ± 4.0%和 56.0% ± 3.4%。 把经过验证的方法提前封装成工具,比临时让一个通用AI进入代码仓库寻找解决方案更加稳定。 更难的问题来了:不是查一个数,而是完成一项分析 简单的问题可以有明确答案。 例如: “某个变异在某种细胞中的预测分数是多少?” 但现实中的研究任务通常不会这么规整。 于是研究人员又设计了30个开放式问题。这些问题要求Agent自己制定分析计划、组合多个工具、比较不同组织或不同证据,并最终形成生物学解释。 Paper2Agent:82.7% ± 2.4% Claude + Repo:56.7% ± 2.3% Biomni:72.2% ± 2.2% 也就是说,与Claude直接访问代码相比,两者相差 26.0个百分点。 与此同时,效率也提高了。 对于教程类问题,Paper2Agent的中位运行时间分别比Claude直接访问代码和Biomni快 1.9倍和3.1倍;在新问题中,则分别快 2.9倍和3.8倍。 AI研究工具的能力,并不只由底层大模型决定。 同一个模型,如果给它的是未经整理的论文和代码,与给它经过验证、结构化的专业工具,最终表现可能完全不同。 单细胞分析进一步说明:工作流本身也是知识 单细胞RNA测序(single-cell RNA sequencing, scRNA-seq)是另一个很典型的场景。 使用Scanpy进行分析,并不是简单调用一个函数,而是需要依次完成质量控制、归一化、高变基因选择、降维、邻接图构建、聚类和细胞类型注释。 顺序错了,参数不合理,结果就可能发生变化。 Paper2Agent为Scanpy生成了 7个工具,全部通过自动验证,构建时间同样约为 45分钟,成本约 13美元。 更重要的是,它从论文和代码中自动提取出了标准分析流程。 用户只需要告诉Agent数据文件的位置,例如: “对这个data.h5ad执行标准单细胞预处理和聚类。” Agent就可以按既定流程完成分析。 研究人员在4个公开单细胞数据集上比较Agent与人工执行的结果,经过质量控制后保留的细胞数和基因数基本一致,主要差异表达标志基因也能够对应;随后扩展到7个不同数据集时,Agent还能根据数据特征调整参数。 论文里的知识并不全部写在“结论”里。 分析步骤的顺序、参数之间的依赖关系、哪些步骤应该先执行,同样是研究知识的一部分。 100篇论文的大规模测试,暴露了另一个现实问题 几个成功案例并不能证明系统具有普遍性。 因此,研究人员进一步选择了 100篇计算生物学论文进行自动转换,而且没有提前筛选代码质量,也没有人工清理代码仓库。 最终,74篇成功转化为Agent。 系统共提出599个工具,其中 593个通过自动验证,通过比例约为 99.0%。 但这里更值得关注的其实是另一个数字: 仍然有26%的论文没有成功完成转换。 原因包括缺乏可运行代码、缺少数据或模型文件、依赖环境无法解决,以及代码本身难以推广到新数据等。 这恰好揭示了Paper2Agent更深的一层意义。 未来评价一篇计算研究的可重复性,可能不仅仅是问: “有没有上传代码?” 还可以继续关注: “另一套系统能否根据你公开的论文和代码,自动重建并运行你的方法?” 在300个教程型问题中,Paper2Agent达到 91.2% ± 1.6%的准确率,而Claude直接访问论文和代码仓库,使用Sonnet 4时为 80.3% ± 2.3%,升级至Sonnet 4.6后也只有 86.3% ± 1.1%;两项比较的P值均小于0.0001。 单次查询成本也从 0.38美元下降到 0.20美元,按这两个数计算约下降 47%;平均耗时则从 4.3分钟下降到 1.6分钟。 而在10篇非生物学计算论文的42项执行任务中,Paper2Agent在5次独立运行中的准确率达到 98.1% ± 0.8%,说明这种思路并不局限于生物信息学。 更有意思的一步:不同论文的Agent开始“合作” 如果每篇论文都能够拥有自己的Agent,那么接下来会发生什么? 研究人员做了一个更具探索性的实验。 他们把三个独立研究转化成Agent: 一个负责AlphaGenome变异功能预测; 一个包含MPRA结合单细胞CRISPR干扰(MPRA-coupled scCRISPRi)的实验数据; 另一个包含CD4+ T细胞Perturb-seq基因敲低数据。 目标是研究银屑病相关变异 rs887314可能通过哪个基因发挥作用。 AlphaGenome Agent首先把 GPR137列为受该变异影响最大的候选基因之一,在CD4+ T细胞中的RNA-seq quantile score达到 0.997。 随后系统把调控元件扰动产生的表达变化,与候选基因敲低后的转录组变化进行相关分析。 Stim8hr:Spearman相关系数 0.613,P=3.79×10⁻³ Stim48hr:Spearman相关系数 0.630,P=4.71×10⁻³ 多重检验校正后 FDR<0.05 Rest:相关系数 0.29,P=0.21 因此,这项研究提出GPR137可能是该位点的候选因果基因,并进一步提出这种作用可能具有激活状态依赖性。 更值得关注的是,这种把“调控元件扰动表达特征”与“基因敲低表达特征”进行跨数据集相关分析的策略,并不是原来两篇论文提出的分析方法,而是在多个Paper Agent协作过程中形成的。 这意味着Agent开始从“执行已有方法”,向“组合已有研究能力”迈出一步。 但这并不意味着AI可以替研究人员做结论 看到这里,很容易把Paper2Agent理解成“自动做研究”。 论文作者反而对此非常谨慎。 100篇计算生物学论文只有74篇成功完成Agent转换,本身已经说明:开放代码并不等于代码能够稳定复用。 此外,对于开放式研究问题,可能存在多个合理答案。一个Agent与某个标准答案高度一致,并不能自动证明这个答案就是唯一正确的生物学解释。 作者明确强调,假设生成(hypothesis generation)、机制解释(mechanistic interpretation)和研究方向选择仍然需要human-in-the-loop。Paper2Agent可以提出假设、设计验证策略和执行分析,但研究人员仍然需要判断证据质量并决定下一步研究方向。 可重复地执行分析,与正确地理解生物学,并不是同一个问题。 当论文变成Agent,科研发表的“产品形态”可能也会改变 Paper2Agent最值得思考的地方,或许不是某一个准确率数字。 它提出了一种新的科研传播方式。 过去,一篇计算研究通常包含四层内容: 论文告诉你“发现了什么”; 补充材料告诉你“更多细节是什么”; 代码仓库告诉你“理论上应该怎么运行”; 而研究人员还需要完成最后一步——把这些内容重新组装成自己的分析流程。 Paper2Agent试图把最后这一步也封装进论文。 未来,一篇方法学论文或许不仅附带 Data availability 和 Code availability,还可能进一步提供 Agent availability: 你不仅能够下载数据、查看代码,还能直接调用作者已经验证过的方法。 论文作者甚至提出,未来期刊可能逐渐出现“Agent availability”这样的信息栏目。与此同时,他们也指出,Agent需要持续维护,因为软件依赖和上游代码会更新,而且还涉及安全、知识产权和成果归属等问题。 这也给科研工作留下了一个很值得思考的问题: 如果一种方法已经可以被封装成经过验证、可以自然语言调用的Agent, 那么未来我们评价一篇方法学论文时,还会只看论文写得多完整、代码是否公开吗? 也许还要再问一句: 别人能不能直接把你的研究“用起来”? Paper2Agent目前还远没有解决所有问题。 但它提供了一个值得关注的方向:科研论文可能正在从知识的描述载体,逐渐变成可以被机器调用的研究工具。 当这种变化发生时,我们阅读论文的方式、复现研究的方式,甚至“发表一项方法”本身的含义,都可能随之改变。 参考文献 Miao J, Davis JR, Zhang Y, Pritchard JK, Zou J. Reimagining research papers as interactive and reliable AI agents. Nature. 2026 Sep 16. doi: 10.1038/s41586-026-11044-y. Epub ahead of print. PMID: 42749808. 声明:本文仅用于分享,不代表平台立场,如涉及版权等问题,请尽快联系我们,我们第一时间更正,谢谢!