文章标题
以智能体生物信息学加速自动化生物医学发现(Streamline automated biomedical discoveries with agentic bioinformatics)
作者:Juexiao Zhou、Jindong Jiang、Zhongyi Han、Zijian Wang、Xin Gao;《Briefings in Bioinformatics》2025,26(5),bbaf505;DOI:10.1093/bib/bbaf505。
文章一句话总结
文章把大语言模型驱动的单智能体、多智能体、干实验和湿实验系统组织成贯穿“假设—设计—执行—分析—解释—迭代”的生物信息学框架,同时明确指出当前证据仍受工具互操作性、泛化、幻觉、隐私、安全和人工监督限制。
摘要
由大语言模型驱动的人工智能智能体的出现,标志着计算生物学正在发生变革。在这一新范式中,自主、适应性强且具备智能的智能体被用于处理复杂生物学问题,形成了一个新的研究领域——智能体化生物信息学。本文讨论智能体化生物信息学的基本原则、不断发展的方法学和多样化应用。作者考察智能体化生物信息学系统如何协同工作,以支持数据驱动的决策,并实现对生物数据集的自主探索;同时重点介绍其在个性化医疗、药物发现和合成生物学等方向的应用,展示其改变医疗与生物技术的潜力。文章还讨论与智能体化生物信息学相关的伦理、技术和可扩展性问题,并提出未来发展的机会。作者强调跨学科协作与创新的重要性,认为智能体化生物信息学有望成为应对现代生物学重大挑战的重要力量,推动基础研究与临床应用。
图形摘要
图中将论文的概念框架压缩为四个模块:生物数据输入、智能体协作、干实验与湿实验执行、验证与发现。
文章解决的主要问题
该领域此前存在什么关键瓶颈?
传统生物信息学依赖人工整理、固定流程和分散工具。随着基因组、转录组、蛋白质组、代谢组、成像和系统生物学数据规模及异质性增加,人工流程在可扩展性、适应性、多步骤协作和实时反馈方面受到限制。
该文章的具体科学问题或技术问题?
文章试图回答:如何定义智能体化生物信息学;单智能体与多智能体如何分工;智能体如何连接检索、推理、代码、实验设计、实验设备和结果解释;哪些代表性系统已经出现;实现端到端自动化还缺少什么。
为什么关注该问题?
生物研究目标经常随中间结果变化,实验设计也依赖前一轮数据。能够检索证据、规划任务、调用工具、适应异常并反馈更新假设的智能体,可能缩短假设迭代时间,扩大可执行的实验空间。
既往研究做到哪一步?
已有系统覆盖从单任务分析到复杂协作:BioMANIA、AutoBA、BIA、BRAD、LM-ABC、CRISPR-GPT、BioDiscoveryAgent、SpatialAgent 和 MDCrow 代表单智能体方向;CellAgent、The Virtual Lab、Bio-Copilot、ProtAgents、BioMaster 和 BioAgents 代表多智能体方向。
核心方法与技术路线
数据来源或研究对象
这是综述,不产生新数据。作者对 2020 年 1 月至 2025 年 3 月的文献和平台进行定向检索,覆盖 PubMed、arXiv、bioRxiv、Google Scholar 和 IEEE Xplore,纳入具有自主/半自主、目标导向、上下文推理、感知—行动循环或环境整合特征的系统。
核心实验/计算/模型方法
论文按工作流角色和组织方式归纳系统:检索智能体、文献综述智能体、数据库智能体、推理智能体、实验设计智能体、湿实验智能体、干实验智能体和创新智能体;再区分单智能体的专门化执行与多智能体的任务分解、角色协作、动态分配、交叉评价和自我优化。
关键算法和计算过程
AutoBA 根据数据路径、数据描述和分析目标生成多组学分析步骤、执行代码、修复代码并返回分析表。CellAgent 使用规划器、执行器和评价器:规划器设计流程,执行器完成操作,评价器检查准确性与生物学相关性,并依据结果迭代策略。ProtAgents 通过规划器、工具执行器和批评器进行蛋白质设计与外部工具选择。The Virtual Lab 由首席研究者智能体协调不同学科智能体,并保留人类研究者的高层反馈。
基于代码的算法理解
论文列出若干可复现入口,但本次未逐一检出和运行外部仓库;因此代码层面的实现细节不作为本报告的已验证证据。后续建立可执行 benchmark 时,应固定仓库提交版本、工具版本、数据库快照、提示词、失败恢复和人工介入点。
关键指标或评价体系
该综述没有为所有系统提供统一准确率、成功率、成本、轨迹质量或实验复现率。Table 3 和 Table 5 主要比较“是否自动完成、是否有人机交互、是否能设计实验、是否进行数据分析、是否有专门角色、自我优化和人类引导”等功能维度,属于能力画像而非统一 benchmark 分数。
对照设计
论文汇总已有系统中的局部评价和案例,未建立同一任务、同一工具环境、同一模型预算下的横向对照。因此,表格中的系统名称和能力标记适合作为 benchmark 候选清单,不应被解释为可直接排序的性能榜单。
Benchmark 示例
下表从论文 Table 2 和 Table 4 提取代表性示例,用于展示 benchmark 任务空间,而不是声称论文对它们进行了统一复测。
论文给出的最具体案例是 The Virtual Lab:设计并验证了 92 个工程化纳米抗体,其中超过 90% 表现出表达和可溶性;其中 2 个对 JN.1 和 KP.3 刺突受体结合域显示独特结合性质。该案例支持“多智能体协作可以进入实验验证”,但不证明所有多智能体系统都具有普遍优越性。
文章创新点
科学问题创新:把生物信息学智能体从单点工具使用提升为研究生命周期的组织问题。 方法创新:提出按单智能体/多智能体、干实验/湿实验和角色分工理解系统的框架,并强调感知—决策—行动—反馈循环。 数据创新:没有构建新数据集;资源贡献是整理代表性系统、任务和可复现入口。 机制创新:没有提出新的生物学机制;论文揭示的是工作流层面的协作规律和部署瓶颈。 应用创新:将多组学、酶工程、蛋白质设计、空间基因组学、基因编辑和纳米抗体设计放入同一智能体化发现图景。
真正的新意在于系统级分类、端到端愿景和风险边界的整合;各个智能体案例本身多为已有研究的综述性汇总,且多数没有统一评测。
对后续研究的启发
对于 Enzyme,可将序列、结构、底物、反应、文献和评分工具组成多步骤任务,分别测试 protein-cold、ligand/scaffold-cold、reaction-cold、family-cold 和 double-cold。应把检索相似性、配对兼容性、动力学排名和机制证据分层评分。
优先建设标准化工具注册表、参数和返回类型、数据库快照、版本锁定、权限控制、轨迹日志、置信度和异常检测;把检索增强、结构校验、交叉智能体评价和人类回溯设计成可消融组件。高通量、多组学和重复性液体处理较适合自动化;临床、基因编辑和低通量复杂生物学任务需要严格人工审批。
文章局限性与可改进方向
这是探索性综述,不提供统一数据集或新实验;纳入论文、预印本和开源平台的证据成熟度不一致。表格主要是能力维度比较,没有统一任务、模型、工具、预算和评分协议。自动化更适合高通量、可并行、数字化和工具接口稳定的任务;低通量、稀有现象、复杂动物行为和隐性实验经验仍需要专家参与。
“有望加速发现”是框架性判断,不能替代对单个系统的因果验证。未来需要统一 benchmark、独立测试集、分布外切分、盲法专家评分、工具和数据库版本审计、成本与失败率统计、湿实验复现,以及对人工介入比例和每一步证据链的报告。
原文图导读
图 1:智能体化生物信息学概念框架
图 1 将研究流程分为头脑风暴与实验设计、湿实验智能体、干实验智能体和创新智能体,并强调具身智能体与计算智能体的连续协作。它是概念框架图,不是某一系统的实验流程或定量结果。
表 1:术语表
表 1 定义 AI agent、LLM、agentic bioinformatics、wet-lab AI agent、dry-lab AI agent、search agent、literature review agent、database agent、innovative AI agent 和 reasoning agent,帮助区分智能体角色与基础模型。
表 2–3:单智能体系统与能力比较
表 2 按年份、模型、任务、主要能力和可复现入口列出单智能体案例;
表 3 比较自动完成、人与系统交互、实验设计和数据分析四项能力。它们适合生成 benchmark 候选池,但不提供统一准确率排序。
表 4–5:多智能体系统与能力比较
表 4 汇总 CellAgent、The Virtual Lab、Bio-Copilot、ProtAgents、BioMaster 和 BioAgents;
表 5 比较专门化角色、自我优化和人类引导协作。它们体现了多智能体的组织能力,也暴露上下文膨胀、资源开销、提示词敏感性和人工纠错等问题。
现有生物医学智能体的总体特点
已经从“问答工具”发展为能够检索资料、调用软件、生成代码、规划任务、协作执行和反馈修正的研究工作流,但距离稳定、可验证的自主科学发现仍有明显距离。
一、主要优势
多步骤任务编排
智能体可以把复杂任务拆成检索、规划、代码执行、结果分析和报告生成等步骤。[[Biomni]] 进一步把 150 个工具、105 个软件包和 59 个数据库纳入统一动作空间。
工具和数据整合能力强
它们能够连接文献、数据库、Python/R/Bash 工具、结构分析、组学分析和实验协议,降低研究者在不同软件和数据源之间切换的成本。
适应性和自动修正能力
AutoBA 可以自动生成、执行和修复分析代码;CellAgent 通过规划器、执行器和评价器形成迭代闭环;多代理系统还能根据任务复杂度动态分配角色。
适合复杂、开放式研究任务
BixBench 表明,智能体能够从空 notebook 开始完成真实计算生物学分析,而不仅仅是回答知识题。代理化生物信息学综述也显示,系统已覆盖多组学、单细胞、酶工程、蛋白质设计、空间基因组学和基因编辑等任务。
能够组织证据链
药物发现框架中的 focal graph 可以把化合物、基因、疾病、通路和文献组织成局部证据图,再交给 LLM 进行排序和解释。这比单纯依赖语言模型记忆更容易审计。
多代理协作具有实验延展性
The Virtual Lab 等系统已经尝试把首席研究者代理、专业代理和人类研究者连接起来,并完成纳米抗体设计与实验验证。
二、主要劣势
综合能力仍不稳定
在 BixBench 的真实计算生物学开放题中,论文版本中 Claude 3.5 Sonnet 准确率约为 21%,GPT-4o 约为 15%。这说明智能体能够执行流程,但复杂分析和结果解释仍容易失败。
工具依赖严重
智能体性能高度依赖 API、数据库、软件版本和文档质量。工具安装失败、参数错误、接口变化和过时代码都会导致整个流程失败。
容易产生生物学幻觉
智能体可能生成错误的功能注释、序列分析、蛋白质—配体关系或实验方案。语言表达流畅不代表生物学结论正确。
分布外泛化能力有限
当物种、细胞类型、底物骨架、反应类型或实验条件发生变化时,智能体可能依赖训练数据中的常见模式,难以处理真正的新情形。
多代理成本和复杂度较高
多代理协作会增加上下文长度、调用次数、计算成本和协调难度。角色越多,越容易出现重复推理、信息冲突和任务分配错误。
评测体系还不统一
BioMedArena 解决了 benchmark、工具、harness、上下文和评分的工程解耦问题,但不同系统之间仍常使用不同任务、工具、模型预算和 judge。许多论文中的“能力标签”不能直接作为性能排名。
实验闭环证据不足
大多数系统只验证了代码执行或答案质量,真正完成湿实验并重复验证的案例仍少。数据库命中、代码运行成功或专家认为合理,都不能替代独立实验。
安全、隐私和责任边界不清晰
涉及基因编辑、临床数据、患者信息和药物设计时,需要处理数据隐私、恶意使用、权限控制、审计、人工审批和责任归属问题。
三、未来发展方向
1. 建立统一、可审计的智能体 benchmark
未来 benchmark 不应只评分最终答案,还应记录:
工具调用是否正确 证据来源是否可靠 代码是否可复现 失败后是否能恢复 成本、延迟和人工介入比例 最终结论是否通过专家或实验验证
[[Biomedical_Deep_Research_Agent_Evaluation]] 已提出任务对象、工具注册表、harness、轨迹、成本和版本审计等基本契约。
2. 从“模型中心”转向“证据与工具中心”
更可靠的系统应结合:
检索增强生成 focal graph 或知识图谱 数据库版本锁定 结构和化学规则校验 不确定性估计 多代理交叉评价 人类专家复核
这样可以减少模型记忆和幻觉对结果的影响。
3. 加强分布外和冷启动评测
在 Enzyme 场景中,应分别测试:
protein-cold ligand/scaffold-cold reaction-cold family-cold double-cold
还要区分检索相似性、酶—底物配对、动力学排名和催化机制证据,不能用一个综合分数混在一起。
4. 发展人机协同,而不是完全替代人工
未来的理想模式是:
智能体负责搜索、规划、执行和整理;专家负责目标定义、关键判断、风险审批和实验确认。
系统需要支持解释、回溯、反事实分析、人工修改和一键停止。
5. 形成干实验—湿实验闭环
下一阶段将从自动分析走向:
假设生成 → 实验设计 → 机器人执行 → 数据分析 → 假设更新
但这要求统一设备接口、实时反馈、实验异常处理、权限隔离和安全审计。
6. 发展领域专用智能体
通用 Biomni 类系统适合跨领域任务,但在酶功能、酶—底物配对、反应预测和动力学等任务上,仍需要领域专用工具、数据切分、结构约束和机制验证。
核心判断
现阶段智能体最大的价值是“整合和推进复杂研究流程”,而不是独立完成可靠的生物学发现。短期重点应放在工具调用、证据链、轨迹审计和冷启动 benchmark;中长期才是可控的自主实验闭环和经过实验验证的科学发现。