撰文丨王聪
编辑丨王多鱼
排版丨水成文
AI 模型能否像人类一样,同时理解文字、图像、视频甚至动作?过去,AI 领域需要针对不同任务使用不同模型——例如用扩散模型生成图像,用组合架构处理视觉语言理解。
而现在,北京智源人工智能研究院推出了一款多模态大模型——Emu3,或将改变这一局面。
该研究以:Multimodal learning with next-token prediction for large multimodal models(通过预测下一个词元进行多模态学习的多模态大模型)为题,于 2026 年 1 月 28 日在线发表于 Nature 期刊,北京智源人工智能研究院黄铁军、王仲远、王鑫龙为论文共同通讯作者,据悉,这也是我国科研机构主导的大模型成果首次在 Nature 正刊发表。
Emu3 仅基于预测下一个词元(Next-token prediction,NTP),就统一了大规模文本、图像和视频的多模态学习,它不仅在生成和理解任务上媲美专用模型,还展示了视频生成、机器人操作等强大能力,这一成果对构建可扩展、统一的多模态智能系统具有重要意义。
多模态学习——AI 的“圣杯”
多模态学习,指 AI 同时处理文本、图像、视频等多种信息的能力。这就像让机器拥有“多感官”,但实现起来极其困难。开发一种能够从文本、图像和视频等多模态中学习并生成内容的统一算法,一直是 AI 领域的“圣杯”。以往,研究者们依赖两种主流方法——
扩散模型:通过从噪声中逐步去噪生成图像或视频,效果虽好但计算复杂。
组合架构:将视觉编码器与大语言模型拼接,需精心设计接口。
这些方法就像用不同工具处理不同任务,缺乏统一性。而 Emu3 的核心理念异常简单:将所有模态数据转换为离散词元(token),然后用 Transformer 模型预测下一个词元——这正是 GPT 系列语言模型成功的关键,进而开启了生成式人工智能(Generative AI)浪潮。
那么,这种简单方法可扩展到多模态领域,一统多模态学习呢?
Emu3 如何工作?
Emu3 的秘诀在于“词元化”(tokenization),它使用统一且稳定的视觉分词器(tokenizer),将图像或视频片段压缩成离散词元序列(例如一张 512x512 图像转为 4096 个词元),同时文本也通过 BPE 编码为词元。所有这些词元被输入一个 Decoder-Only 的Transformer 模型,通过预测下一个词元来学习多模态关系。这种设计消除了对扩散模型或外部编码器的依赖,实现了端到端训练。
Emu3 框架
训练过程分为三个阶段:
1、预训练:使用大规模多模态数据,平衡文本和视觉词元的损失权重,防止视觉词元主导学习。
2、后训练:针对生成任务进行质量微调,并结合人类偏好优化(DPO)提升输出质量。
3、推理:支持分类器无关引导(CFG),实现低延迟、高通量的生成。
值得注意的是,Emu3 在训练中发现了稳定的规模定律(Scaling law):模型性能随数据量和参数增加呈幂律提升,这意味着其扩展可预测,为大规模应用奠定基础。
性能如何?全面媲美专用模型
该研究通过大量实验证明,Emu3 在多项任务中匹配或超越了专用模型:
图像生成:在 MSCOCO、GenEval 等基准上,Emu3 的人类偏好得分达 70.0,优于Stable Diffusion v1.5(59.3)和 SDXL(66.9)。
视频生成:在 VBench 评估中,Emu3 得分 81.0,与主流扩散模型(例如 Open-Sora-1.2 的 79.8)相当,且能预测未来帧,实现视频扩展。
视觉语言理解:在 12 个基准测试中平均得分 62.1,媲美 LLaVA-1.6(61.8)等组合模型。
机器人操作:在 CALVIN 模拟环境中,Emu3将语言、视觉和动作表示为统一词元序列,成功率达 87.0%(完成 5 个连续任务),展现了从感知到决策的无缝扩展。
为什么这项研究如此重要?
Emu3 的意义不仅在于性能提升,更在于范式简化。它证明了——
简单性:预测下一个词元这种单一目标,足以统一多模态学习,无需复杂设计。
可扩展性:缩放定律表明该方法可预测,适合大规模部署。
通用性:从生成到理解,再到具身智能,一个模型应对多任务。
该论文还开源了代码和模型,推动社区发展。未来,这种框架可能催生更强大的“世界模型”,让 AI 真正融合感知、语言和行动。
Emu3 像一位“全能选手”,用最简单的规则解决了复杂问题,Emu3 有力表明了预测下一个词元(Next-token prediction,NTP)可作为多模态模型的核心范式,突破语言模型的边界,在多种多模态任务中展现了强劲性能,从而为统一多模态学习奠定了坚实基础,有望推动原生多模态助手、世界模型以及具身智能等方向的发展。
此外,研究团队还在此基础上推出了 Emu3.5,其进一步通过大规模长时序视频训练,学习了时空与因果关系,展现出随模型与数据规模增长而提升的物理世界建模能力,并观察到多模态能力随规模扩展而涌现的趋势,实现了从 “预测下一个词元” (Next-token prediction)到“预测下一个状态”(Next-state prediction)的范式升级。
https://www.nature.com/articles/s41586-025-10041-x