作业帮受邀出席第十届A2M峰会 分享AI算力效率破局实践

近日,国内极具影响力的AI工程化实践峰会——第十届A2M峰会(北京站)如期举办,吸引了数百名来自互联网、AI等领域的技术决策者、架构师与研发骨干出席。其中,来自作业帮基础架构团队的研发工程师张浩然,以《AI时代资源效率困境和破局之道》为题,分享多地域集群大规模GPU调度的实战经验,并首次公开披露了三大核心工程化解法。

图片

规模越大,浪费越严重:AI算力效率的行业悖论

过去五年,AI训练算力每六个月翻一番,远超摩尔定律的增速。然而一个颇为反常的现象也在同步发生:行业智算中心GPU平均利用率却长期低于30%。

张浩然在演讲中将这一现象概括为“规模扩张与效率停滞的双重叠加”——“花了十倍的钱,买了十倍的卡,实际有效算力可能只涨2到3倍。”结合全球数据中心电力消耗年均增速已达15%、是其他所有行业总增速四倍以上的宏观背景,他指出:单靠“堆硬件”的路已经走不通,AI算力的下一个战场,是效率。

张浩然在现场分享了团队面临的困难:与教科书中理想化的单一超大集群不同,作业帮的算力版图是一张遍布全国多云、多地域的异构网络——面临的是各地域GPU型号不统一、数量随业务和成本动态增减、多集群部署缺乏统一通信与调度、资源潮汐空转浪费等现实问题。

三大工程化实践:从跨域调度到在离线混合部署

面对上述挑战,作业帮基础架构团队历经多年迭代,形成了一套层层递进、相互配合的系统性解法。

在跨地域算力网络层面,作业帮自研了一套统一流量调度系统,核心理念是让调用方对变动零感知:从部署方面看,作业帮团队自容器化之初就创建了多云容灾,超前地搭建了多集群部署、镜像分发等能力;而部署之后的核心难点是通信问题,作业帮基础架构团队创新性尝试,让流量调度器根据各地域健康度和配比自动分发,对于无专线的地区,集群间会通过公网进行通信,并在协议层级进行加密;对于有专线的地区,则能进行专线和公网的切换,以避免专线故障带来的资源缺口。这一系统的搭建让即使单地域资源发生剧烈波动,服务SLA(Service Level Agreement)依然稳定维持在99.99%以上。

在单集群碎片化治理层面,作业帮基础架构团队自研了GPU调度器、RS-Webhook和碎片整理任务三件套,从调度、回收、整理三个层面协同作战:调度策略上,整卡的模型不同服务优先堆叠,同服务尽量分散;显存模型则按照显存维度极致堆叠。回收策略方面,废弃K8s默认Pod回收逻辑,改为向计算“哪台机器缩容后能空出最多卡”的方向推进。而在碎片化治理阶段,经资源逐层检查与预调度,确认不影响在线服务后,对回收的资源进行标记,根据高峰和非高峰的策略,把散落的卡Pod迁走,尽可能空出资源。

从在离线混合部署层面,前两套方案打好基础后,系统升级为“只要有空闲整机,则立刻填充离线训练任务”的高效模式,彻底告别固定时间窗口的潮汐离线。当在线Pod预调度失败时,系统自动驱逐任务量最少的离线任务,确保在线SLA不受影响。

经过上述系统性优化,该团队GPU平均利用率长期维持在90%以上,可用算力增加约20%,业务扩容彻底突破单云/单地域限制,成本节约效果显著。

“AI时代,规模只是入场券,效率才是生死线。”张浩然在演讲结尾的这句话,引发现场强烈共鸣。在大模型时代,如何在复杂异构、多云分散的真实生产环境中实现极致效率,正成为AI企业基础架构团队的核心命题。

A2M峰会是国内最早聚焦AI工程化实践的技术盛会之一,本届峰会北京站于2026年6月13日至14日在中关村国家自主创新示范区会议中心举办,此次峰会上开放分享的工程化经验,为各行业高效应对大模型时代的挑战提供了可参考的实践路径。