这项由香港理工大学、佐治亚大学、INFLY Tech以及腾讯AI Lab联合完成的研究,发表于2026年6月,论文编号为arXiv:2606.18101v2,有兴趣深入了解的读者可以通过该编号查询完整论文。研究的核心议题是:如何让AI在电脑或手机屏幕上精准地找到你想点击的那个按钮。
假设你雇了一位助手,让他帮你操作电脑,你对他说"帮我点击那个'保存'按钮"。这位助手需要在满屏密密麻麻的界面中,找到那个像指甲盖一样小的按钮,并精确地把鼠标移到正确位置。这就是AI领域所说的"GUI定位"(GUI Grounding)——GUI是"图形用户界面"的缩写,也就是我们日常使用的电脑桌面、网页、手机App这些可视化界面。研究团队面临的核心挑战是:现有的AI训练方法并不能让AI真正"学好"这项技能,尤其是在高分辨率的复杂界面中,目标元素往往又小又密集,AI极容易找错位置。
研究团队提出的解决方案被称为"质量感知自蒸馏"(Quality-Aware Self-Distillation),这个名字听起来很高深,但背后的道理其实朴素得很:当老师的指导本身靠不住时,学生应该学会打折扣地听,而不是盲目照单全收。这项研究在六个主流GUI定位测评基准上全面超越了此前的竞争方法,交出了令人信服的成绩单。
一、为什么AI找按钮这么难
回到那位助手的比喻。如果你让助手在一张完整的办公桌照片上找"红色回形针",他首先要看懂整张图,然后在密密麻麻的物品中精确指出那个小东西的位置,最后还要用像素级别的精度告诉你它在照片的哪个坐标点。AI做GUI定位的难度与此类似,而且往往比这更难,因为现代软件界面的截图分辨率极高,按钮可能只占整个屏幕的极小一部分。
目前主流的训练方法大致分三类。第一类叫做"监督微调"(SFT),相当于给AI一批标注好的"题目和答案"——屏幕截图加上正确坐标——让AI反复练习。这种方法稳定可靠,但有个明显的缺陷:答案只是一个硬邦邦的坐标数字,完全不告诉AI"为什么是这里"、"附近其他位置的可能性有多大"。就像只告诉学生"答案是3",却不讲解任何解题思路。
第二类方法叫做"强化学习",代表技术是GRPO,相当于让AI自己做题,做对了给奖励,做错了不给。但这种方式需要AI产生大量的尝试,成本很高,而且奖励信号非常稀疏——AI做了很多事,只得到一个笼统的"对"或"错"的反馈,对于精确定位这种需要像素级精度的任务来说,这种粗粒度的反馈效果有限。
第三类,也是本文的出发点,叫做"在线自蒸馏"(On-Policy Self-Distillation,OPSD)。这个方法的思路是:与其只看最终答案对不对,不如在AI生成答案的每一步都从一个"更厉害的老师"那里获取指导。这个老师不是别人,就是AI自己的一个加强版,它拥有一些额外的信息(比如知道目标按钮大概在屏幕的哪个区域),因此能给出更有参考价值的指引。这种逐字逐步的密集指导,理论上比只看最终坐标对不对要丰富得多。
然而,研究团队发现,直接把这套方法用在GUI定位上,效果并不理想。原因就隐藏在一个微妙的细节里。
二、老师的指导,什么时候会变成误导
要理解这个问题,需要先明白AI是怎样"说出"坐标的。AI预测屏幕坐标时,并不是一口气给出"(452, 318)"这样一个完整数字,而是像写字一样,一个字符一个字符地生成:先生成"4",再生成"5",再生成"2",以此类推。
现在,加强版老师的职责是:在AI生成每一个字符的时候,告诉AI"接下来这个位置,哪个数字最好"。老师拿到的条件是AI目前已经生成的那些字符(称为"前缀"),然后基于这个前缀给出建议。
问题就出在这里。假设AI在生成x坐标时,第一个数字就猜错了,写成了"7"(正确应该是"4"),那么后续的字符都要基于这个错误的开头继续生成。老师此时被要求基于"7..."这个错误的前缀给出建议,它能做的最好的事情,也只是告诉AI"在以7开头的坐标里,下一个数字是什么"——换句话说,老师只能帮AI把错误的坐标写得更"流畅",而不是把AI拉回正确的方向。
这就好比一个地图向导,他的职责是告诉司机"在当前位置,下一步应该怎么走"。但如果司机已经开错路,走进了一条完全错误的街道,向导此时给出的"下一步"指引,实际上是在帮司机更深地迷入歧途,而不是帮他回到正确路线。这种情况下,向导的"指导"不但没有帮助,反而可能有害。
研究团队把这种现象归纳为:当学生生成的前缀已经偏离正确坐标时,老师在该前缀下给出的坐标字符建议,就成了"不可靠的老师信号",盲目照着学会只会让AI越学越偏。
三、聪明地对待老师的建议:两个互补的机制
为了解决这个问题,研究团队设计了两个相互配合的机制,合在一起就构成了"质量感知自蒸馏"方法。
第一个机制叫做"软正确性感知门控"(Soft Correctness-Aware Gating)。这个机制做的事情,简单来说就是"检查老师当前给的建议,在逻辑上还有没有救"。具体操作是这样的:在AI生成坐标的每一步,系统会查看老师当前最倾向推荐的那个数字,然后追问一个问题——基于学生目前已经生成的前缀,如果接受老师的建议,剩下的数字还有没有可能组合出一个落在正确目标区域内的坐标?如果有可能,这条建议就被认为是"可靠的";如果无论怎么补全后续数字,最终坐标都没办法落在正确区域内,这条建议就被认为是"不可靠的"。
关键在于,研究团队没有选择把"不可靠的建议"直接扔掉,而是选择"打折"——将其对最终训练损失的贡献降低到原来的一半,而不是归零。原因很直观:即使老师的建议已经偏离了正确目标,这条建议本身仍然可能包含一些有用的局部信息,比如对某个视觉区域特征的感知。完全抛弃这些信息未免过于武断;但原封不动地采纳,又可能让AI学坏。打折是一种温和的折中:保留潜在价值,同时减弱潜在的负面影响。
在数学公式上,这被表达为一个"软门":如果老师建议通过检验,门值为1(完全保留);如果没通过检验,门值为α,在主实验中α取0.5。这个α就像是一个"信任系数",控制着对不可靠建议的保留程度。
第二个机制叫做"教师概率缩放"(Teacher-Probability Scaling)。这个机制解决的是另一个维度的问题:即便老师的建议通过了空间检验(被认为是"可靠的"),不同建议的质量也可能相差很大。一个老师对某个数字的推荐概率是90%,和另一个推荐概率只有55%,这两种情况下老师的"把握程度"是截然不同的。
研究团队的直觉是:老师越有把握的建议,学生应该越认真对待;老师自己都不太确定的建议,学生听听就好,别太当真。因此,他们用老师对其最优推荐数字的概率值,作为一个额外的"权重因子",直接乘在训练损失上。老师把握越大(概率越高),对应的训练权重越大,学生学得越认真;老师自己都摸不准,概率低,权重就小,学生轻描淡写地参考一下即可。
为了防止这两个机制叠加之后,坐标字符的整体训练信号变得太弱,研究团队还引入了一个固定的"放大系数"λ,在主实验中设为3,相当于给可靠的坐标建议统一加大音量,确保这些关键信息不会被其他非坐标字符的学习信号淹没。
最终,三者共同构成了每个训练步骤的权重:不是坐标字符,就正常学;是坐标字符且通过了可靠性检验,就用λ乘以老师概率来决定学习力度;是坐标字符但没通过检验,就用α乘以λ再乘以老师概率,也就是打折之后再按把握程度调节。这套机制使得AI的训练过程既有原则(可靠性检验),又有弹性(概率调节),而不是非此即彼的粗暴处理。
四、老师的特殊待遇:让老师看到更多
除了上述两个核心机制,这套方法还延续了一个在GUI定位领域被证明有效的设计思路:给老师提供"作弊卡",但不给学生看。
具体做法是:在训练时,老师看到的屏幕截图是经过处理的特殊版本——目标按钮所在的区域被保留并高亮显示(用绿色方框标记),而屏幕其他区域则被一层逐渐加深的高斯模糊遮罩压暗。同时,老师收到的文字提示里还附带了一句"提示:答案就在绿色方框内"。这样,老师几乎不可能给出错误的空间建议,它的信号质量天然就比没有这些额外信息时高。
与此同时,学生在训练和推理时,始终只能看到普通的原始截图,没有任何提示和高亮。这个设计的逻辑是:老师的作用是在训练时提供高质量的指导信号,而学生最终要独立上岗,必须学会在没有辅助信息的情况下独立完成定位。让老师享有特权,是为了让老师的指导更有价值;不给学生特权,是为了确保学生真正学会独立能力,而不是依赖外部提示。
这种老师/学生信息不对称的设计,与本文的核心思想高度吻合:老师应当在条件最好的情况下给出建议,而学生应当有选择地、带着判断力地从中汲取营养。
五、实验结果:数字说话
研究团队在六个公认的GUI定位基准测试上对这套方法进行了全面评估,分别是ScreenSpot-Pro、ScreenSpot-v2、UI-Vision元素定位、OSWorld-G、OSWorld-G-R以及MMBench-GUI L2元素定位,涵盖了桌面、网页、移动等多种界面类型,既有普通分辨率也有专业级高分辨率场景。
基础模型Qwen3.5-9B在六个基准上的平均准确率是65.19分。这是一个相当有竞争力的起点,但研究团队想知道各种训练方法能把它提升多少。
用强化学习(GRPO)训练后,平均准确率提升至65.86,进步不算显著。用传统监督微调(SFT)训练后,平均准确率提升至68.09,进步更明显。最初版本的在线自蒸馏(Naive-OPSD,老师只是被告知答案的文字坐标,没有视觉高亮)将平均准确率提升至68.91。此前最强的竞争基线GUI-SD(老师看到高亮图像,并用特定权重和基于熵的缩放来调节坐标字符的学习强度)将平均准确率提升至70.07。
本文提出的质量感知自蒸馏方法,将平均准确率提升至72.23,比GUI-SD高出2.16分,比SFT高出4.14分,比GRPO高出6.37分。在所有六个基准上,这套方法均位列第一。
特别值得关注的是,与GUI-SD相比,两者的本质区别在于:GUI-SD通过位置权重和熵值来加强坐标字符的学习信号,但并不检查这些信号是否真正可靠,错误的信号可能被不加区分地放大;而本文方法通过可靠性检验和概率调节,主动区分"值得多学的信号"和"应当打折的信号",从而让训练过程更有针对性、更少受到噪声干扰。
六、拆解实验:两个机制缺一不可
研究团队做了一系列细致的消融实验(即逐一去掉某个组件,观察效果如何变化),得出了一个颇有意思的发现:软正确性感知门控和教师概率缩放这两个机制,单独使用时都不能稳定提升性能,但组合在一起,效果就会显著提升。
从"仅有视觉特权信息的基线"(平均70.43分)出发,单独加入软正确性感知门控后,平均分反而降到了69.97;单独加入教师概率缩放后,平均分降到了70.19。两者都没有超过基线。然而,把两者结合起来,平均分跳升至72.23,一举超过基线1.80分。
这个现象揭示了两个机制各自的"盲区"。单独使用门控时,会把一部分本来还有参考价值的老师信号压低,却没有机制来保证剩余信号的质量高低之分,导致整体指导效果被削弱。单独使用概率缩放时,能够区分老师"有把握"和"没把握"的情况,却没有过滤掉那些空间上根本不可能正确的建议,导致某些高置信度但方向错误的信号被错误放大。两者结合后,门控负责把空间上"无可救药"的信号打折,概率缩放负责在剩余信号中进一步区分质量高低,两道过滤器相辅相成,缺一不可。
在门控强度的对比实验中,研究团队还比较了"完全去掉门控"、"软门控(α=0.5)"和"硬门控(α=0,即直接丢弃不可靠信号)"三种策略。硬门控的平均准确率是71.46,软门控是72.23,硬门控反而不如软门控。原因在于:当AI生成了错误的坐标前缀,后续所有坐标字符都会被门控判定为不可靠,从而被完全丢弃。但这些"失败状态"下的老师信号,其实还包含着"当你已经走错路时,如何尽量减少损失"的信息。完全丢掉这些信号,就相当于切断了AI从错误中学习纠正策略的机会。软门控通过保留一半的信号强度,既降低了错误信号的误导风险,又保留了一定的纠错学习空间。
在放大系数λ的实验中,λ=1时平均准确率71.20,λ=2时71.32,λ=3时72.23,λ=4时反降至71.80。这说明λ过小会让坐标字符的学习信号被非坐标字符的信号淹没,λ过大则会让模型过度聚焦于坐标精度而牺牲整体的定位泛化能力。λ=3是一个在充分重视坐标字符学习与保持整体平衡之间的最优折中。
七、这一思路的更广泛意义
研究团队在讨论中指出,GUI定位任务之所以适合探索这套可靠性感知的训练方式,正是因为它天然具备"空间可验证性"——任何一个坐标预测,都可以直接用真实的目标边界框来检验是否合理。这种可验证性让研究者可以使用一个直接的、基于任务本身结构的标准来评判老师信号的可靠性,而不是依赖熵值、困惑度等间接代理指标。
过去的很多方法,例如基于熵的缩放、基于困惑度的降权,本质上都在用"老师是否自信"来代替"老师是否正确",这两者之间并不总是一致的——老师可能自信地给出一个错误方向,也可能犹豫不决地给出一个正确方向。本文的门控机制直接问的是"这个建议在目标约束下是否可行",是一个更直接、更有保障的判据。
研究团队坦承,这套方法目前还有一定的局限性。门控机制依赖于训练时的真实边界框标注,所以最直接适用于有空间标注的场景。对于没有明确坐标答案的任务,如何设计类似的可靠性检验,还需要进一步探索。此外,目前的实验都在Qwen3.5-9B这个规模的模型上进行,这套方法在不同模型规模和其他类型的视觉定位任务上的迁移效果,也有待后续研究验证。
归根结底,这项研究想说的核心道理,其实是一件非常日常的事:当你向别人学习时,对方给出的建议并不是都值得同等对待——有些建议在当下的情境下根本行不通,有些建议虽然方向对,但对方自己也没多大把握。聪明的学习者,应该学会识别哪些建议值得认真对待、哪些建议应该保持距离,而不是不加思辨地照单全收。这套质量感知自蒸馏方法,正是把这个朴素的道理,以严谨的数学方式嵌入到了AI的训练过程中,让AI也能在学习时懂得"信任对的老师"。
有兴趣进一步了解这项研究细节的读者,可以通过arXiv编号2606.18101查询完整论文原文。
Q&A
Q1:GUI定位任务和普通的图像识别有什么区别?
A:普通图像识别通常是判断"图中有什么",而GUI定位要求AI精确回答"目标元素在屏幕的哪个像素坐标位置"。这意味着不仅要识别内容,还要给出像素级精度的位置输出,误差哪怕只有几个像素就可能点击到错误的按钮,对精确度要求极高。
Q2:质量感知自蒸馏方法为什么比传统监督微调效果好?
A:传统监督微调只告诉AI"正确答案是这个坐标",不解释为什么,也不提供坐标附近其他位置的概率信息。质量感知自蒸馏则让AI在生成坐标的每一步都能参考一个"更有信息"的老师分布,同时通过可靠性检验和概率调节,确保参考的信号质量,相当于既有更丰富的指导,又对指导质量做了筛选。
Q3:软正确性感知门控和硬门控有什么具体区别?
A:硬门控是"不可靠的老师建议直接丢弃,权重归零";软门控是"不可靠的建议保留一半权重,不完全抛弃"。实验显示软门控效果更好,因为即使坐标前缀已经偏离目标,后续的老师建议仍然可能包含如何在错误状态下调整的有用信息,完全丢弃这部分信号会让AI失去从错误中学习纠正策略的机会。