报告主题:迈向长程智能体:Long-Horizon Agents 全景综述
报告日期:8月7日(周五) 10:30-11:30智能体正从单步决策迈向长程任务执行,但如何在数百次互依行动中保持目标导向、纠偏与完成任务,已成落地生产环境的关键瓶颈。智源Talk375期邀请了人大高瓴董冠霆线上分享。其发布的长程智能体全景综述,首次定位长程智能体为"外部脚手架工程×内部模型优化"协同演化的过程,并围绕基础、演进、脚手架、优化、应用与前沿六视角,提出统一定义、完整分类体系与未来路线图,为构建高可靠长程智能体提供系统性参考。欢迎大家一起讨论交流。论文链接:https://openreview.net/forum?id=HyhfhlbWGh项目主页:https://long-horizon-agents.github.io/项目仓库:https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents过去几年,大模型已从单轮聊天机器人,迅速演进为软件工程、深度检索、多模态交互等领域的决策核心。随之而来的关键问题是:一个单步表现优异的智能体,能否在数百乃至数千次相互依赖的行动中,始终保持目标导向、有效纠错、合理管理上下文,并安全可靠地完成整个任务?这正是长程智能体(Long-Horizon Agents)所聚焦的核心问题。随着智能体能力快速演进,长程能力正日益成为其迈向真实生产环境的关键瓶颈。据 METR 研究测算,前沿智能体完成软件工程任务所需的人类专家等效时长,已从早期模型的秒级跃升至十余小时,且约每 7 个月翻倍,这印证了智能体的长程能力正处于高速发展阶段。尽管该领域已取得诸多进展,但目前仍缺乏一个被广泛认可的长程智能体定义与分类体系,这一空白使得学界难以系统性地归因长程能力方面的进展。为厘清这一局面,人大高瓴发布 149 页长程智能体全景综述,系统梳理超过 900 项研究与工程实践,首次将长程智能体定位为"外部脚手架工程 × 内部模型优化"协同演化的过程,并围绕基础(Foundation)、演进(Evolution)、脚手架(Harness)、优化(Optimization)、应用(Application)与前沿(Frontier)六个相互关联的视角,提出了长程智能体的统一定义、完整分类体系与未来路线图。展望未来,我们希望这篇论文不仅能为现有工作提供参考,更能成为构建下一代高能力、高可靠性长程智能体的基础。报告嘉宾:
董冠霆,中国人民大学高瓴人工智能学院 2024 级博士生,师从文继荣教授与窦志成教授,主要研究方向为通用智能体训练与智能体强化学习。他以第一/共同第一作者身份在 ICLR、NeurIPS、ACL 等国际顶级会议发表论文 10 余篇,代表性工作包括 ARPO、Agent-World、AUTOIF、Search-o1、WebThinker 等,受到国内外研究者的广泛关注,目前谷歌学术引用量逾 1 万次,个人 GitHub 项目累计获得星标超 1 万枚。他曾在字节跳动 Seed、阿里通义千问等核心基座大模型团队实习,以核心贡献者身份参与 Seed 与 Qwen 系列基座大模型的训练工作。曾获首届腾讯青云奖学金(全国 15 人)、国家奖学金、北京市优秀毕业生等荣誉,并入选国家自然科学基金青年学生基础研究项目(博士生)、中国科协青年人才托举工程博士生专项计划资助。