这项由香港理工大学研究团队完成的研究,以预印本形式于2026年6月16日发布在arXiv平台,论文编号为arXiv:2606.18322。研究聚焦于一个在AI安全领域被广泛依赖却从未被严格检验过的假设,研究结果对当前主流的AI内容安全防护方案提出了严肃的质疑。
**一、一把被高估的锁**
当你在家门上装了一把锁,你会默认这把锁锁住了门。但如果这把锁只是锁住了门把手,而窗户还开着呢?
这正是香港理工大学研究团队在这篇论文里发现的问题。他们花了大量时间研究一种名为"稀疏自编码器"(SAE)的AI工具,这个工具近年来被越来越多的AI安全研究者用来管控大型语言模型的行为。研究者们原本相信,只要用SAE把模型里负责"危险行为"的那些神经活动模式锁住,模型就再也无法产出危险内容了。然而,这个团队的实验表明,这把锁锁住的只是其中一扇门,模型的"危险潜力"依然悄悄地留在别的地方,等待着被重新激活。
要理解这件事为什么重要,得先从AI模型内部的工作方式讲起。
**二、AI大脑里的"神经暗语"**
现代大型语言模型,比如各种聊天AI,内部运行着数以亿计的数学计算。每当你输入一句话,模型内部会产生一系列复杂的数字向量,就像一串串暗语在神经网络的各个层级之间流动传递。这些数字向量被称为"残差流",可以把它理解成AI大脑里信息流动的主干道。
长期以来,研究者们很难直接读懂这条主干道上流淌的"暗语"到底在说什么。直到稀疏自编码器(SAE)出现,事情才有了转机。SAE就像一个翻译机器,它能把这些密密麻麻的数字信号,分解成一个个相对独立、人类可以理解的"特征"。比如,某个特征可能对应"诗歌风格",另一个特征可能对应"化学知识",还有一个可能对应"拒绝回答的倾向"。
正因为SAE把这些特征一个个摆到了明面上,AI安全研究者们非常兴奋。他们的逻辑是:既然我们现在能看到哪个特征对应哪种危险行为,那只要在模型运行时把这个特征强行锁定在一个"安全值"上,不就万事大吉了吗?这个操作,研究者们称之为"特征干预"或"特征钳制",可以把它理解为强行拨开某个开关,不让它打开。
这个思路确实有效果。多项已发表的研究表明,通过钳制相关的SAE特征,可以让模型拒绝回答有害问题,可以抹去模型对某类专业知识的"记忆",甚至可以改变模型在特定推理任务上的表现。看起来,特征钳制是一个颇为可靠的安全工具。
然而,香港理工大学的研究团队提出了一个别人没有仔细想过的问题:锁住了那个特征之后,模型真的"忘记"了那种行为吗?还是说,那种行为只是暂时被压制,换了一条路就能重新出现?
**三、防御成功之后,故事还没结束**
这个团队的核心贡献,是设计了一种他们称之为"干预后恢复"的诊断方法。这个名字听起来像是医学术语,其实可以用一个更直白的比喻来理解。
假设你有一个爱唱歌的室友,他的歌声让你无法入睡。你给他递了一张纸条,告诉他"请不要唱那首歌了"。他照做了,停止演唱那首特定的歌曲——这相当于"防御成功"。但他会不会转而哼起那首歌的旋律?或者用口哨吹出同样的曲子?或者打着节拍,让你的大脑自动补全那首歌?如果他能用任何一种方式让你重新听到那段旋律,那你真的"阻止了他唱歌"吗?
这个团队做的事情,正是测试AI模型在"那首歌被禁止"之后,能不能用别的方式重新把旋律唱出来。
具体来说,他们的方法是这样的。首先,让防御系统按照正常程序运行:识别出与危险行为相关的SAE特征,将它们钳制住。此时模型已经处于被"守卫"的状态,危险行为被成功压制。然后,他们在这个被守卫的状态上,对模型的残差流添加一个极小的数值扰动——就像在那条信息高速公路上悄悄修了一条很小的岔路。这个扰动的要求非常苛刻:它必须能让危险行为重新出现,同时又不能重新激活那个已经被锁死的SAE特征。
换句话说,这条岔路必须绕开那把锁,而不是把锁撬开。
**四、绕过锁的两种数学技巧**
这个约束条件从技术上来说相当难以满足,因为残差流中的数值彼此紧密关联,任何扰动都可能牵连到被保护的特征。研究团队为此开发了两种精巧的数学工具,确保他们找到的"岔路"真的是在绕过锁,而不是悄悄把锁破坏了。
第一种工具叫做"编码器正交投影",专门用于单层防御场景。SAE在工作时,会用一组特定方向的数学向量来识别和编码各个特征。研究团队的扰动优化过程中,每一步更新都要经过一个数学投影操作,把更新方向中与那些"被保护特征的识别向量"平行的成分全部删掉,只保留与之垂直的成分。结果就是,不管扰动怎么变化,它永远不会直接触碰被保护特征所在的方向,就像你在一个房间里横着走,绝对不会碰到正前方的墙壁一样。
第二种工具叫做"跨层雅可比矩阵投影",用于更复杂的多层防御场景。当防御系统同时保护多个层级上的多个特征时,事情变得更棘手,因为在第一层添加的扰动,可能通过模型的前向传播,间接影响到第二层、第三层的特征值。为了应对这种情况,研究团队在每一步优化时,都会实时计算扰动对所有被保护特征的影响方向(这就是"雅可比矩阵"的作用,它描述了输入的微小变化如何传导到输出),然后把扰动中可能扰动这些特征的方向全部剔除。这就像你同时监控着房间里所有角落的摄像头,每次移动都确保不进入任何摄像头的视野盲区之外的区域。
有了这两种工具,研究团队才能自信地说:当危险行为在防御激活之后重新出现时,绝对不是因为防御被破坏了,而是因为模型里存在着能绕过防御的真实替代路径。
**五、四场实验,四次"解锁"**
研究团队在四个不同的场景中测试了这套诊断方法,每个场景代表着AI模型行为控制的一个不同层面。
第一个场景叫做"目标探针扰动"(TPP),测试的是AI内部表征层面的行为恢复。在这个测试里,研究者们使用了一个标准化的学术评测工具SAEBench,在第5层残差流上,用官方选定的SAE特征集合来抹除某些目标类别的信息。防御之后,他们用上述的编码器正交投影方法来尝试恢复这些信息。结果显示,在不加任何约束的情况下,恢复率高达81.9%;加上编码器投影约束之后,恢复率仍有74.9%,而被保护特征的重激活率从0.013下降到了仅仅0.002。这意味着,即使在完全不触碰被保护特征的前提下,74.9%的目标信息依然可以从防御后的残差状态中被恢复出来。
第二个场景测试的是输出层面的知识恢复,使用的是WMDP-Bio数据集——一套包含生物安全相关问题的多选题测试集。研究者们采用了SAE特征钳制方法来"抹除"模型对生物学知识的掌握,使模型的答题正确率大幅下降。为了避免答案位置的干扰,他们对每道题的四个选项进行了全排列(共24种排法),只挑选在全部24种排法下模型都能答对的题目作为测试基础。在91个符合条件的被压制案例中,加了投影约束的恢复方法成功恢复了其中90个,同时将特征钳制位置的漂移值降到了零。换句话说,模型几乎完美地"想起来"了那些被压制的知识,而且防御系统根本没有察觉到任何异常。
第三个场景是IOI(间接宾语识别)任务,这是一个经典的AI电路级研究案例,测试的是GPT-2 Small模型在识别句子中"间接宾语"时的推理过程。研究者们选出了对这个推理任务有正向贡献的SAE特征,将其钳制归零,然后测试恢复。在37个有效案例中,两种恢复方法(有约束和无约束)都实现了100%的恢复率,区别仅在于有编码器投影约束的版本特征重激活率更低(0.016对比0.041),漂移也更小。
第四个场景是最引人关注的安全拒绝场景。研究者们使用了Gemma-2B模型,并借助跨层SAE特征钳制方法来强制模型对有害请求做出拒绝回应。他们在AdvBench(一套专门测试AI安全边界的有害请求数据集)上选出了24个严格有效的测试样本——这些样本满足两个条件:未加防御时模型会给出非拒绝回应,加了防御后模型会转变为拒绝回应。然后用跨层雅可比矩阵投影方法进行恢复尝试,结果24个样本中有23个成功恢复了非拒绝回应,恢复率达95.8%,同时被保护的拒绝特征的相对漂移值仅为0.131,远低于对比方法。
作为补充验证,研究团队还在HarmBench-Test数据集(另一套安全评估数据集)上重复了同样的实验,从159个提示中筛选出43个严格有效样本,结果全部43个样本都成功恢复了非拒绝回应,特征漂移保持在0.108的低水平。
**六、恢复的秘密藏在哪里**
完成了以上实验之后,研究团队追问了一个更深入的问题:这些危险行为在防御激活的状态下重新出现,究竟是通过什么渠道实现的?
为了回答这个问题,他们对恢复后的残差状态做了一次详细的解剖分析。具体做法是,把优化得到的扰动拆分成几个独立的部分,然后逐一测试每个部分单独能否带来行为恢复。拆分的维度包括四个方向:被钳制的特征(也就是已经被锁死的那部分)、未被钳制的其他SAE特征(也就是没被锁的但SAE能看见的部分)、变化最大的前k个未钳制特征,以及SAE重建残差(也就是SAE无法解释的那部分)。
测试结果非常清晰。被钳制特征的单独重放完全失败,24个样本中0个能恢复危险行为,这证明防御确实成功锁住了它应该锁住的东西。未被钳制的SAE特征单独重放同样几乎失败,只有2/24成功,排名前k的未钳制特征更是只有1/24成功。相比之下,SAE重建残差单独重放的结果令人瞩目:24/24的样本全部成功恢复了危险行为,成功率达到100%,几乎与完整扰动的效果一模一样。
SAE重建残差是什么?用日常语言来说,它是SAE在分解残差流时无法解释的那部分——就像一首歌被分解成主旋律、和声、鼓点之后,还剩下的那些无法归类的背景噪声。SAE把能识别的特征都挑走之后,剩下的"解释不了的部分",就是这个残差。
这个发现的含义非常直白:防御系统精心保护的那些SAE特征,只是危险行为的一条可见路径。而在SAE视野之外,还存在着另一条由"无法解释的残差"构成的隐形通道,危险行为就沿着这条通道悄悄流回来了。锁门的人把所有他看得见的锁都锁上了,却不知道门框后面还有一扇隐形的小门。
**七、扩大防线就能解决问题吗**
一个自然的反应是:那就多锁几个特征,把防线扩大不就行了吗?研究团队专门设计了实验来检验这个想法。
他们系统地增加了被钳制的SAE特征数量,从K=5一直扩展到K=61(几乎涵盖了全部可用的拒绝相关特征)。在每个K值下,他们重新计算有效测试样本集,然后测量恢复率。结果显示,在K=5到K=20的"稳定工作区间"内,非拒绝行为的恢复率始终维持在93.3%到100%之间,说明扩大特征集并不能消除恢复路径。当K继续增大到30以上时,情况发生了变化,但不是变好了,而是变坏了——模型开始产生大量副作用,连正常的非拒绝回应都开始退化,"类基础模型恢复率"(即恢复的回应与原始模型回应的相似度)从88.2%急剧下降到12.5%。这说明,通过暴力扩大特征集来增强防御,代价是让模型在各种场景下都表现失常,而恢复路径依然存在,只是恢复出来的回应质量也跟着变差了。
这个结论揭示了一个根本性的矛盾:SAE能看见的特征,终究是有限的,而行为发生的计算空间是无限的。不管把多少个特征锁住,SAE无法解释的残差始终存在,而那里面储存的信息足以支撑危险行为的重新出现。
**八、这对AI安全意味着什么**
研究团队在讨论部分做了一个非常重要的区分,这个区分值得仔细咀嚼。
他们指出,"因果操控手柄"和"完整行为瓶颈"是两个不同的概念。前者是指:当你操作某个特征时,行为确实会随之改变——这说明这个特征与行为有因果关系。后者是指:当这个特征被固定住之后,行为就彻底无法重现——这是一个强得多的断言。
SAE特征钳制方法所能证明的,只是前者:钳制某个特征确实能在当下压制某种行为。但它无法保证后者:被压制的行为不能通过其他途径再次出现。这个区别,就像你能用遥控器关掉一盏灯,并不代表断掉了整栋楼的电路。
研究团队特别强调,他们的发现并不是说SAE对AI安全毫无价值。SAE在理解模型内部机制、定位因果特征、进行局部编辑方面依然有实实在在的用处。问题在于过度依赖:如果一套防御方案把某个SAE特征集合当作行为的唯一瓶颈,那这套方案的鲁棒性就值得怀疑。
对于如何构建更强的防御,研究团队提出了一些方向性思路。比如,不仅监控SAE可见的特征,还要监控残差流的整体状态;采用多层或整体轨迹层面的约束,而不是单点特征钳制;或者把"抵抗干预后恢复"作为训练防御系统时的明确目标。归根结底,真正有效的防御需要区分"堵住了一条可见的通道"和"消除了所有可能的通道"这两种本质不同的情况。
说到底,这项研究揭示的是一个深层的认知局限:我们在试图控制AI行为时,习惯于假设自己能看见并理解所有重要的内部机制。SAE给了我们一个前所未有的视角,但它毕竟只是一个近似的翻译工具,总有它翻译不出来的东西。那些被翻译工具忽略的部分,不是可以被当作误差抛掉的噪声,而是可能承载着关键信息的隐秘通道。
这个发现提醒我们,在为AI安全工具打满分之前,也许还需要问一问:这把锁到底锁住了什么,又有什么是它从来没有锁过的?
---
Q&A
Q1:SAE特征钳制防御为什么会失效?
A:SAE只能看见它分解出来的那些特征,而模型的内部计算还包括SAE无法解释的"重建残差"部分。实验证明,危险行为可以通过这个残差通道重新出现,完全绕过了特征钳制防御,而防御系统对此毫无察觉,因为被保护的特征值依然保持在正常范围内。
Q2:增加更多被钳制的特征数量能解决这个问题吗?
A:实验数据显示,在K=5到K=20的范围内,扩大被钳制的特征集并不能消除恢复路径,危险行为的恢复率依然维持在93%到100%。继续增大特征集会带来严重副作用,导致模型在正常任务上也出现功能退化,但恢复路径并不因此消失。
Q3:这项研究说明SAE对AI安全完全没用吗?
A:不是这个意思。SAE在理解模型内部机制和定位因果特征方面依然有实用价值。这项研究指出的问题是"过度依赖":把SAE特征钳制当作消除危险行为的充分条件是不严谨的。真正的问题在于,特征钳制只是堵住了一条可见通道,并非消除了所有可能的通道。