三一学院与华为研究院联手出招:AI大模型“智能分诊”系统,省钱又省时

这项由爱尔兰三一学院ADAPT研究中心与华为研究院联合开展的研究,以预印本形式于2026年6月25日发布在arXiv平台,论文编号为arXiv:2606.27457,研究方向归属于计算机性能领域(cs.PF)。感兴趣的读者可通过该编号在arXiv上查阅完整论文。

**一、 一个让所有企业都头疼的问题**

假设你开了一家医院,来的病人什么情况都有——有人只是擦破了皮,有人却是急需手术的重症患者。如果你把所有人都安排给最顶级的外科主任诊治,主任累死不说,费用也贵到吓人;但如果所有人都让实习医生处理,重症患者就会得不到应有的救治。

AI大模型的部署困境和这个场景几乎一模一样。目前市面上有各种大小的AI语言模型(也就是类似ChatGPT这类能回答问题、生成文字的AI)。小模型跑得快、花费少,但遇到复杂问题就力不从心;大模型能力强、回答准,但每次运行的时间和成本都很高。企业在实际部署时,往往两难:要么用最强的大模型,结果简单的问题也要付高价;要么用小模型省钱,结果难题答不好,用户体验变差。

三一学院和华为的研究团队想到了一个聪明的解决办法:给AI系统装上一套"智能分诊"机制,让每个问题都被送到最合适、最划算的模型那里去处理。这套方案叫做"聚类-路由-升级"(Cluster, Route, Escalate)框架,用一句话概括就是:**先把相似的问题归堆,再给每堆问题分配最合适的AI,最后对质量不佳的回答自动送去更强的AI补救**。

**二、 为什么已有的方案还不够好**

在这项研究出现之前,业界已经有一些尝试解决这个问题的方案。有的系统训练一个"路由器",让它决定每个问题该交给哪个AI——但这类路由器往往需要大量专门标注的数据,比如人类评分员给AI回答打分的记录,成本相当高。有的系统采用"瀑布式"方法,先让小模型试一次,回答不好再交给大模型——但这意味着每个问题都要至少跑一次小模型,对于本来就该直接交给大模型的难题,这一步纯属浪费。

更关键的是,大多数现有方案都缺乏一个直观可调的"旋钮",让企业运维人员能清楚地设定"我愿意为了省钱最多牺牲多少准确率"。三一学院和华为的团队注意到了这个空白,并且设计了一套只需要最基础的"这道题答对了还是答错了"这类标签就能运转的系统,不依赖任何额外的人工评分。

**三、 整套系统是如何运转的:两道"关卡"**

整套框架分为前后两个阶段,就像机场安检一样,问题先过第一道关,再过第二道关。

第一个阶段的核心任务是"分堆"和"分配"。系统首先把历史上所有的训练问题,按照语义(也就是意思的相似程度)自动分成若干组,技术上使用的是一种叫做k-means的聚类算法。可以把这个步骤理解为:把图书馆里的书按主题归类,数学题放一堆,语言题放一堆,推理题放一堆。分组完成后,系统会统计每个AI模型在每个组里的答题正确率,以及每个模型运行时的速度(研究中用"每输出一个词元需要多少毫秒"来衡量,专业术语叫TPOT,即Time Per Output Token)。

有了这两个数据,系统就能为每个模型在每个题组里打一个综合分:这个分数等于"答错率加上(速度惩罚×调节系数λ)"。分数越低,这个模型在这个题组里就越值得优先选用。

这个调节系数λ(读作"拉姆达")是整个系统最精妙的设计之一。当λ设为0时,系统只在乎准确率,所有题组都会交给准确率最高的大模型;当λ越来越大,系统越来越看重速度,逐渐把更多题组分配给快速的小模型。企业运维人员只需要告诉系统"我的速度预算是多少毫秒",系统就能自动找到最合适的λ值,既不超速,又尽量保住准确率。这个λ一旦在训练数据上确定好,就直接用在实际运行中,不需要再改动。

在正式为每个题组选定AI之前,系统还会做一次"帕累托筛选"——简单说,就是剔除那些"又慢又不准"的模型。如果一个模型A,在所有题组里都比模型B更慢、且不比B更准,那模型A永远不会被选到,干脆从候选名单里移除。这一步可以大大简化后续计算,也保证了每个被保留下来的模型都有其存在的价值。

第二个阶段是"质量把关"。第一阶段把题组分配给各个模型后,分配到便宜小模型的那些题,还是有可能被小模型答错。此时,系统会用一个轻量级的文本分类器来检查小模型的每一条回答:如果分类器判断回答质量不过关,这道题就会被"升级"送到更强的大模型重新作答。

这个分类器是基于ModernBERT-base这个模型微调而来的,输入是"问题+模型的回答+回答的长度"三个部分合在一起的文本,输出是"接受"或"升级"两个判断。训练这个分类器所需要的标签,就是"这道题小模型答对了还是答错了"——和第一阶段用的标签完全相同,不需要任何额外的人工标注工作。

这两个阶段形成了一个完整的互补体系:第一阶段在问题到来之前就做出预判,把整组的难题直接送到大模型;第二阶段在小模型给出回答之后再做检查,把漏网的失误捞回来。前者节省的是"把本该用大模型的题交给小模型白费力气"的损失,后者弥补的是"小模型偶尔失手"的遗憾。

**四、 在两个完全不同的考场上接受检验**

研究团队在两个差异很大的数据集上测试了这套系统,一个是数学竞赛题,一个是电信专业知识问答,以此证明这套框架不是只对某种特定类型的问题有效。

第一个考场是AIME 2024,也就是美国数学邀请赛2024年的真题,总共30道题,属于极具挑战性的竞赛数学。训练数据则用了1983年到2023年的历史真题,共921道。参加这场考试的AI模型有两个:VibeThinker-1.5B(简称V),一个专门针对数学和编程训练的小模型,速度很快;Qwen3-30B-A3B-Thinking-2507-FP8(简称Q3-30B),一个大得多的模型,能力更强但运行更慢。

系统把全部训练题自动分成了3组(通过轮廓系数分析选出最优分组数)。研究人员发现,小模型V在第1组题目(记为C1)上的答错率只比大模型Q3-30B高了一点点(约5个百分点),但速度快了将近两倍。于是当系统的速度预算设为每词元20毫秒时,λ自动调到0.06,C1被分配给了小模型V,C0和C2则分配给大模型Q3-30B。

测试结果是:只用第一阶段路由,系统准确率从大模型单独作战的89.1%略降至86.4%,但速度从每词元11.8毫秒压缩到9.5毫秒,快了大约19%。加上第二阶段的质量把关后,平均每轮只有0.6道C1的题被升级送给大模型,C1的准确率从90%回升到96%,整体系统准确率恢复到88.4%,速度维持在9.7毫秒,仅比大模型单独作战慢了不到1%的准确率,却快了整整18%。

第二个考场是TeleQnA,一个专门考察电信行业知识的多选题数据集,训练集9000题,测试集1000题,涉及3GPP标准、接口协议等高度专业的内容。这里的候选模型有四个:Qwen3-4B-Instruct、Gemma4-E2B-it、Gemma4-26B-it和Gemma4-E4B-it。经过帕累托筛选,Gemma4-E2B-it被Qwen3-4B淘汰(后者既更快又更准),Gemma4-E4B-it被Gemma4-26B淘汰,最终留下了Qwen3-4B(快速小模型)和Gemma4-26B(精准大模型)两个候选者。

测试集分成了两组(C0和C1),其中C0占590题,在速度预算20毫秒的约束下被分配给Qwen3-4B,C1的410题则直接交给Gemma4-26B。单纯使用第一阶段路由后,系统准确率从大模型独占的76.4%降到了71.2%,速度从24.5毫秒降到19.1毫秒。加入第二阶段质量把关后,平均有202道C0题被升级送往大模型,其中约98道是真正答错被正确拦截的,另外约104道是答对了却被错误升级的(这叫"假阳性")。即便如此,系统整体准确率回升到74.3%,速度为23.8毫秒,比单独使用大模型快了0.7毫秒,比只用第一阶段多花了4.7毫秒,但准确率高了3.1个百分点。

**五、 给系统增加新模型,会不会一切都要重来?**

这套系统的另一个设计亮点是"可扩展性"。研究团队专门做了一个扩展实验,向AIME的双模型池里再加入两个新模型:Qwen3-4B-Thinking-2507-FP8和Qwen3.5-35B-A3B-FP8,看看系统会如何自动应对。

结果很清晰。Qwen3-4B的归一化速度成本超过了1(意味着它比最慢的基准模型还慢),而且每个题组的答错率都比Q3-30B更高,直接被帕累托筛选判定为"永远不会被选中的模型",自动淘汰,不需要人工干预。而Qwen3.5-35B则是一个惊喜:它的速度比Q3-30B快,准确率比V高,在每个题组里都表现优于原来的两个候选模型。加入它之后,系统在λ=0.06时把所有三个题组都分配给了这个新模型,训练集准确率从92.1%升到94.5%,速度从18.4毫秒降到17.3毫秒;测试集准确率从86.4%升到89.3%,速度从9.5毫秒略升到11.0毫秒,同时还微微超过了原先单独使用Q3-30B的89.1%准确率。整个过程完全自动,不需要重新打标签或手动调整配置。

**六、 系统的边界与尚待改进的地方**

研究团队在论文中坦诚地列出了这套系统目前的局限性。分组和路由决策是离线计算好的,如果实际来的问题分布和训练时差别很大(比如突然来了一批训练集里从没出现过的题目类型),系统不会自动感知并调整,需要重新收集标签、重新训练。

此外,系统采用的"速度指标"TPOT只衡量每输出一个词元需要的时间,但实际上服务器的整体延迟还包括等待时间、处理请求前的预热时间、网络传输时间等,这些都没有被纳入考量。研究使用的硬件是两张A100 80GB显卡,在不同硬件上(比如更新的H100显卡),模型的速度表现会有显著变化,最优的λ值可能也需要重新调整。

质量分类器的假阳性率(约51%)也是一个值得关注的问题——有一半的"升级"操作是不必要的,白白花费了大模型的运行时间。研究团队指出,使用更大规模的ModernBERT-large模型或者引入更多训练数据,可能会改善这一问题。

还有一个实际部署的约束:这套系统要求候选模型全部同时加载在GPU显存中。显存有限的情况下,可以选用的模型数量就会受到限制,灵活性打折扣。

**七、 这对真实世界意味着什么**

研究团队特别提到了电信行业这个场景,因为它恰好集中体现了这套系统的价值所在。电信网络正在从"人工辅助"向"全自动AI代理"演进——未来的网络会有AI自主地检测故障、诊断原因、制定修复方案、验证效果,形成一个24小时不间断的自动运维闭环。这种场景对AI的响应速度要求极高,同时又必须保证关键决策的准确性,还不能把敏感的网络运营数据送到外部云服务上(数据主权和隐私要求)。

在这种情况下,不同难度的运维子任务可以分发给不同规模的模型处理,常规的状态查询交给小模型,复杂的故障推理交给大模型,既保持了系统的响应速度,又在资金和算力允许的范围内最大化了决策质量。当有新的专用模型出现时(比如专门针对电信数据微调的模型),系统只需要在现有训练题上跑一遍推理,重新做一次帕累托分析,就能自动决定这个新模型是否值得加入候选池,完全不需要重新标注数据或手动重新配置。

说到底,这项研究提出的方案本质上是一套"让AI资源用得更聪明"的调度机制。它不去追求单一模型的极致性能,而是通过合理分工,让快速模型处理擅长的题目,让强大模型专注于真正需要它的挑战,再用一个轻量的"质检员"兜底,最终以接近最强模型的准确率,跑出远低于最强模型的平均延迟。在AI应用规模不断扩大、算力成本日益受到重视的今天,这种"精打细算"的部署思路,或许比单纯堆砌更大模型更有现实意义。

对这套系统的运作原理、实验细节或扩展方向感兴趣的读者,可以通过arXiv编号2606.27457找到完整论文,原文包含了详细的实验配置、每轮运行的逐条数据以及分类器的训练参数,技术细节相当完整。

---

Q&A

Q1:TPOT是什么,为什么用它来衡量AI模型的速度?

A:TPOT是"每输出一个词元所需的时间"(Time Per Output Token),单位是毫秒。AI语言模型回答问题时是一个词一个词地生成的,TPOT反映的就是每生成一个词要花多少时间。这个指标在实时对话和自动化流程中很关键,因为用户感知到的响应速度很大程度上取决于每个词的生成速度。研究选用TPOT而非总响应时间,是因为它在不同长度的回答之间具有更好的可比性。

Q2:λ参数具体是怎么确定的,普通企业能自己调吗?

A:λ是系统中控制"速度与准确率权衡"的核心参数。研究团队的做法是:企业先设定一个速度预算(比如每词元不超过20毫秒),然后系统在训练数据上自动扫描不同的λ值,找到在满足速度预算的前提下准确率最高的那个λ,这个过程完全自动。确定之后,这个λ直接用于真实部署,不再改变。普通企业只需设定速度预算,其余由系统自动完成,无需手动调参。

Q3:质量分类器的假阳性率高达51%,这不是很浪费吗?

A:确实,约51%的"升级"操作是把本来答对了的题目错误地送往大模型,属于不必要的开销。但研究团队认为这个代价是可以接受的,因为真正答错的题目(约98道/轮)被正确识别并得到补救,整体系统准确率因此回升了3.1个百分点,这个收益覆盖了假阳性带来的额外延迟(约4.7毫秒)。当然,降低假阳性率是值得继续优化的方向,比如使用更大的ModernBERT-large模型或增加训练数据量。