对话云天励飞:三款芯片+万卡集群,重新定义AI推理的性价比边界

问AI · 从芯片到万卡集群,这套方案将怎样加速国产AI推理落地?

图片

如果说大模型发展的早期阶段更像是AI的“勘探时代”,行业关注的是更大的模型和更多的算力,那么随着AI走向规模化应用,产业正在进入更重视产出效率的阶段:如何把算力稳定地转化为Token,并持续降低单位Token成本。

7月18日,云天励飞在2026世界人工智能大会(WAIC)上公布了未来两年多的AI推理芯片路线图。公司计划推出DeepVerse100P、DeepVerse100D和DeepVerse100L三款云端大算力推理芯片,分别针对PrefillDecode和Decode FFN进行专用优化,并推动三款芯片在万卡异构集群中协同运行。

在WAIC会场,亿欧与云天励飞董事长兼CEO陈宁进行了一场对话,试图理解这套“芯片+集群”方案背后的商业逻辑。

图片

从拥有多少算力,到产出多少Token

“过去我们谈算力市场,天然地沿用IT硬件的租赁思维,卖卡、租卡、按小时计费。但进入推理时代以后,用户真正在意的是:花多少钱,能得到多少有效Token。”陈宁表示。

这一变化意味着,峰值算力已难以单独反映推理系统的效率。随着单次任务的上下文长度、推理链路复杂度和实时交互要求持续提高,计算、访存、互联和系统调度共同影响Token生成效率和成本。

问题还在于,大模型推理并不是一种负载。Prefill需要集中处理输入上下文,对计算能力要求较高;Decode采用逐Token生成方式,对内存带宽和数据访问效率更加敏感。随着MoE等模型架构发展,Decode内部的Attention与FFN也呈现出不同的资源需求。

陈宁认为,如果Prefill、Decode Attention和Decode FFN长期共享同一套通用算力资源,资源匹配度就会受到限制。“就像一家工厂里,重机加工和精密装配共用同一台设备,设备性能再好,产线效率也上不去。”

这正是云天励飞提出分离式芯片方案的起点:为不同推理环节配置更适配的专用芯片,再通过集群协同提高整体Token生成效率。

DeepVerse100P面向百万级上下文Prefill场景;DeepVerse100D面向Decode,拥有数倍于主流芯片的内存带宽,并支持1024卡Scale-up及光互联系统架构;DeepVerse100L面向Decode FFN,采用3D Memory架构,相比主流HBM大幅提升内存带宽。三款芯片将在万卡异构集群中分离部署、协同运行。

图片

开放的软件栈,让异构硬件更易使用

三款芯片协同也带来了新的软件挑战。模型能否快速适配、算子性能能否充分释放、不同硬件资源能否高效协同,都会直接影响芯片在大规模集群中的实际运行效率。

“IFWA的核心策略是兼容。”陈宁表示,“我们围绕Transformer架构持续优化PyTorch ATen算子,加强对vLLM、SGLang等主流推理框架的支持。目的是让开发者用他们已经熟悉的工具,就能在DeepVerse平台上高效地跑模型。迁移成本越低,我们的芯片就越容易被接受。”

围绕模型适配和开发效率,IFWA构建了覆盖模型量化、压缩、编译和部署的一站式自动化工具链。云天励飞还开源Houmao多Agent异构编程框架,并将成熟的Triton算子能力融入FlagOS,通过代码贡献、联合验证和社区复用,减少不同硬件平台在算子适配上的重复投入。

图片

以系统效率重构AI推理的性价比

从三款专用芯片到万卡异构集群,云天励飞试图建立一套面向Token生成全过程的“推理工厂”。其核心不是简单叠加单卡性能,而是通过芯片、互联、软件和系统协同,让计算、访存和通信资源按照不同负载进行配置。

“训练时代,大家关注的是模型参数量和榜单排名。但进入推理时代,对于模型厂商、AI应用企业和算力运营方来说,真正决定商业可行性的,是在一定时间和成本约束下,能够稳定生成多少有效Token。”陈宁表示。

今年5月,云天励飞联合产业伙伴发起“1001计划”,推动模型、应用、芯片、系统和软件等环节加强协同。面向“百亿Token一分钱”的长期目标,公司希望通过三款芯片、万卡异构集群和开放软件栈,持续提高Token性价比,让国产AI推理算力更快走向规模化应用。