算力需求缩减90%、综合提速14.76倍 阿里云与交大3篇论文入选顶会  让DiT告别“高耗能”

问AI · 特征图不同通道性格各异,如何加速生成?

IT时报记者 郝俊慧

日前,欧洲计算机视觉顶级会议ECCV 2026公布结果,阿里云与上海交通大学张林峰教授团队有3篇合作论文被主会收录。

ECCV与CVPR、ICCV并称计算机视觉领域三大国际顶级会议,目标检测、图像分割、视觉Transformer等多项影响行业格局的核心技术,均首次亮相于该会议。

 作者声明:该图片由AI生成图片

据了解,三篇入选论文的研究方向均聚焦Diffusion Transformer(DiT)架构下的高效推理加速,涵盖时序误差校正、自适应特征分解、时空令牌筛选三条技术路线。

作为当前主流视觉生成模型的通用架构,DiT广泛应用于文生图、文生视频、图像编辑等领域,但推理成本高、生成耗时长的问题日益突出,被业界视为AIGC规模化落地的主要瓶颈之一。

论文成果显示,在高分辨率图片生成场景下,可将算力需求减少近90%,综合提速最高14.76倍。

第一篇论文《Accelerating Diffusion Transformers with Gaussian Process Rectified Feature Cache(基于高斯过程校正特征缓存的加速扩散变换器)》聚焦时序缓存误差校正。

通常情况下,DiT生成一张图要跑几十至上百步“去噪”或“预测”未来帧,业界常用“特征缓存”跳步复用,但预测偏差也会滚雪球式放大。

研究团队发现,缓存残差在局部严格服从零均值高斯分布,如果据此用高斯过程回归搭建轻量级校正模块,可以利用数学公式提前“算”出未来几步的大致方向,无缝挂载至主流时序缓存算法之后,相当于用高阶数学近似替代了部分重复的神经网络计算。

数据显示,与TaylorSeer结合后,在Qwen-Image上把计算量再降19.3%的同时,PSNR(峰值信噪比)提升0.9dB,LPIPS(学习感知图像块相似度)从0.65降至0.29,实现更快且更清晰的生成效果,破解了长区间预测漂移难题,确保模型在“长跑”过程中始终沿着正确的数学梯度前进,不会因为步子迈得大而“跑偏”。

图片对比不同基线缓存方法与GP-Refiner结合前后生成图像的视觉效果。

如果说第一篇论文解决的是“长跑跑偏”的问题,那么第二篇论文《LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching(LinCa:通过可学习的分解特征缓存)》解决的是“不同通道资源分配不合理”的问题。

论文中提出的基于可学习可逆网络的特征缓存框架LinCa,首次系统性发现扩散特征演化的异质性同时存在于跨模型、跨去噪阶段、跨特征维度三个层面。

此前所有加速方法(包括传统的Cache)都默认“特征就是一堆数字”,统一处理。但LinCa通过实验首次证明,同一张特征图里,不同通道(Channel)的“性格”截然不同。

LinCa将原始特征沿通道维度分解为不同“性格”的子分量,对于“高铁型”子分量(连续性强的):采用高阶预测器外推——根据前三步的轨迹,直接“算出”未来几步的位置,跳过计算环节,几乎零成本;对于“赛车型”子分量(突变强的):因为预测不准,强行预测会翻车,所以直接复用(Caching)上一时刻的特征。

测试中,FLUX.1-dev实现5.51倍加速,Qwen-Image达6.95倍,HunyuanVideo视频模型实现5.50倍加速,画质指标全面领先主流方案。

图片在Qwen-Image-Edit上,LinCa表现出更优的提示理解能力,并生成高保真图像,同时保持未编辑区域的一致性。

在动态分辨率是高分辨率DiT推理的核心加速方向之一,但传统方案在分辨率切换时会统一上采样全部隐式令牌,导致大量背景、低语义区域产生冗余计算;现有局部上采样方法多依赖边缘、纹理等底层视觉特征,难以匹配文本语义与编辑指令的需求,容易造成关键区域细节缺失。

阿里云和交大合作的第三篇论文《AViTS: Adaptive Spatiotemporal Token Selection for Efficient DiTs with Dynamic Resolution(AViTS:面向动态分辨率的高效DiTs自适应时空令牌选择)》提出了时空动态令牌筛选框架AViTS,通过“低分辨率打底—选择性上采样—全分辨率精修”三阶段生成流程,砍掉背景与低语义区域的冗余算力。

简单理解,就是在图像编辑(如换脸、换背景)任务中,AViTS可以只对编辑区域做超高分辨率计算,背景完全不参与复杂迭代,这对AIGC应用产品的实时交互体验是革命性的。而且该方法完全在推理阶段执行,无需重新训练,且与特征缓存、模型蒸馏、量化等加速技术完全正交,这意味着它们是“乘法效应”而非“加法效应”:实验数据显示,AViTS在FLUX模型上最高实现6.34倍推理加速,编辑场景算力需求减少近90%;叠加步骤蒸馏后,综合提速最高可达14.76倍。

图片AViTS 整体架构:包含时空重要度计算模块与三级分辨率递进调度流程

据了解,上述3项技术已完整集成至阿里云自研的WuYingDiT推理加速引擎,并全量落地至无影灵构一站式AIGC创研平台,服务游戏美术、电商设计、影视制作、新媒体等行业客户,原生适配FLUX、Qwen、混元视频等主流生成基座,客户无需改造现有工作流即可一键启用。

阿里云方面表示,未来将持续在端侧生成式AI前沿技术方向开展研究,把真实业务场景中的技术难题与学术研究相结合,持续迭代WuYingDiT加速引擎,进一步降低端侧、边缘场景高保真生成式AI的应用门槛。