越狱不是骗过模型,是把内部路径带偏开场1×1:06这张图怎么看2:05真正重要的是路径3:00结果到底说了什么3:59为什么要加 error node4:39这对防守意味着什么5:16局限也很明显6:05收尾0:007:110:08主播如果一条越狱提示真正奏效,不是因为它在表面上“说服”了模型,而是因为它把模型内部的计算路径带偏了,那我们平时盯着输出层去做防守,可能就只看到了结果,看不到原因。今天这篇 arXiv 论文正是在追这个问题:jailbreak 到底是怎么在内部发生的?0:29嘉宾作者没有从“这句提示有没有绕过规则”出发,而是从“干净提示和攻击提示的内部图有什么差别”出发。它把一次预测看成一张内部计算图,再去看攻击输入会不会让某些安全相关结构被压下去、某些攻击特定结构冒出来,或者把原本该走的路径硬生生改道。0:52主播所以本期我们不聊表面上的攻防口号,只聊三件事:这张图怎么搭;哪些变化真的和攻击成功有关;以及这种分析能不能真的帮我们更好地理解和缓解越狱。1:06嘉宾这篇工作的核心是“成对内部计算图”。作者分别为干净输入和攻击输入构建图,再把两边对齐。图里的节点不是外部词,而是模型内部的特征、注意力、残差和输出相关单元;图上的边表示这些单元之间的因果影响。1:27主播读白话一点,就是作者不再把模型看成一个黑箱按钮,而是把它拆成一条条会互相影响的内部线路。然后问题就变了:同一个问题,正常回答时和被越狱时,内部线路到底哪里不一样?1:44嘉宾作者把这些差别分成三类:不变结构、被抑制结构、和新出现结构。不变结构是两种输入都保留的骨架;被抑制结构更像安全相关的通道被压低了;新出现结构则像攻击输入临时长出来的旁路,专门把计算带向不安全输出。2:05主播最有意思的地方在这里。作者发现,单看某个节点有没有变强,往往不够。很多静态指标看上去都在动,但未必能稳定区分攻击成功与否。真正更有信号的,是路径重路由。2:21嘉宾路径重路由说白了,就是原本应该经过的内部通路,被攻击输入换了一条走法。论文里他们把路径上的边权连起来做归因分数,去看攻击前后哪条路更像“被改道”了。这个信号在主分析里和 jailbreak 成功有显著相关。2:41主播这很像一个现实防守经验:你看见某个闸门短暂失灵,不一定就知道问题在哪里;但如果整条水流被改到了另一条沟里,那个“改道”本身才是问题的结构性证据。论文的主张就是,jailbreak 更像这种改道,而不是单点炸点。3:00嘉宾实验只在 Llama 二点七 B chat 上做,主分析是三十对 prompt,其中只有四个攻击真正成功。样本不大,所以作者自己也很克制,没有把结论说成普适定律。3:15主播但即便样本不大,几个数字还是很清楚。图的整体偏移、被抑制结构、新出现结构,这些静态指标都没有显著预测攻击成功;只有路径重路由和成功显著相关,相关系数大约是零点四六一,p 值是零点零一。3:35嘉宾更直白一点说,不是“哪里变了”都重要,而是“怎么被改道了”更重要。作者还发现,对成功攻击里最突出的新出现特征做 top-3 zero-ablation,四个样本里一个都没挡住,等于零成效。这个结果很关键:它说明光盯特征级干预,可能根本压不住分布式攻击机制。3:59主播这篇论文还有一个很工程化、但很实用的细节:它加了 error node 来近似难以完全解释的部分。这个设计让图的重建质量明显更好,mean KL divergence 大约是零点零零二七,top-1 accuracy 到了 99.2%。4:19嘉宾没有 error node 的时候,mean KL 会飙到四十六点九六;加上以后降到零点零零一四。这个对比说明,作者不是随便画一张解释图,而是在尽量让图先把模型行为近似住,再去谈机制差异。否则你解释的可能只是一个很差的近似。4:39主播如果把这篇论文放到防守侧看,它给出的不是“一个新的万能检测器”,而是一个更细的诊断视角。它告诉你,越狱可能不是单点特征触发,而是分布式路径被改写了;因此只做特征级封堵,可能挡不住真正的攻击链。4:59嘉宾更重要的是,它把机制分析从“看见某个特征很危险”推进到“看见一条路径怎么把安全约束绕开”。这个变化会影响你怎么做审计、怎么做鲁棒性测试,也会影响你怎么定义真正的防御目标。5:16主播这篇论文的边界也不能忽略。第一,样本只有三十对 prompt,成功攻击只有四个,所以统计功效有限。第二,只在 Llama 二点七 B chat 上验证,泛化还没证明。第三,图覆盖范围主要到前十层,后层机制可能还没完全纳入。第四,它只看单轮 forward pass,多轮对话式攻击还没覆盖。5:44嘉宾还有一个更具体的提醒:path rerouting 对“语义桥接型”攻击更有用,如果 prompt pairing 本身就不在同一语义轨道上,这个指标会退化。也就是说,这不是一个拿来就能解释所有越狱的通用尺子,它更像一把很锋利、但适用边界清楚的刀。6:05主播所以我会把这篇论文的价值概括成一句话:它提醒我们,越狱研究不能只问“模型有没有说错”,还要问“内部哪条路径被改写了”。一旦攻击不只是点状触发,而是路径重路由,防守的重点也必须从局部信号转向结构信号。6:26嘉宾这也是 mechanistic interpretability 真正有用的地方:不是把黑箱讲得更玄,而是把失败模式变成可定位、可干预、可验证的结构。今天这篇论文还没给出终极解法,但它把问题往前推了一大步。6:45主播本期就到这里。下一步我们会继续看那些把“解释”和“控制”真正绑在一起的工作,因为对 interpretability 来说,能看见只是开始,能指出哪条路径出了问题,才更接近可用。