通义千问发布首个语言世界模型Qwen-AgentWorld

问AI · Qwen-AgentWorld的原生世界建模如何改变智能体训练?

IT时代网6月24日消息,阿里通义千问团队正式发布Qwen-AgentWorld——首个原生语言世界模型(Language World Model, LWM),能够在七大领域中模拟智能体交互环境。该模型基于超过1000万条真实环境交互轨迹,经由CPT→SFT→RL三阶段训练而成,在AgentWorldBench评测中超越GPT-5.4、Claude Opus 4.8与Gemini 3.1 Pro。

图片

Qwen-AgentWorld覆盖七类交互式环境:文本类(MCP、Search、Terminal、SWE)与GUI类(Web、OS、Android),实现跨领域知识迁移。对于三个GUI领域,环境观测以可渲染代码而非像素帧呈现,使纯文本世界建模即可涵盖视觉环境。

核心创新在于原生世界建模:环境建模从继续预训练(CPT)阶段即为训练目标,贯穿CPT→SFT→RL全流程,而非对通用大语言模型的事后适配。CPT阶段通过学习交互轨迹注入环境知识,引入轮次级别的信息论损失掩码识别真正承载环境信息的对话轮;SFT阶段将下一状态预测激活为思维链推理模式;RL阶段以混合奖励信号精炼输出质量。

图片

同步发布的AgentWorldBench评测基准覆盖七大领域,每条测试样本均配备真实环境执行所得的ground-truth观测数据。Qwen-AgentWorld-397B-A17B取得最高整体均分(58.71),超越GPT-5.4(58.25),在Terminal和SWE两个领域优势最为显著。在35B-A3B规模上,三阶段训练将整体均分提升8.66分,使小模型超过Claude Sonnet 4.6。

图片

团队还探讨了世界建模在智能体训练中的两种互补范式:作为解耦的环境模拟器,为智能体强化学习提供更优的可扩展性与可控性——可控模拟RL能以真实环境无法实现的方式塑造智能体行为,且显著优于仅在真实环境中训练的RL;作为统一的智能体基础模型,LWM预热训练可有效迁移至多轮智能体任务,无需在智能体任务上进行任何RL微调。模型与评测基准已在Hugging Face和ModelScope开源。

创作声明:本文借助AI辅助创作