SafeSeek 报告移除稀疏度仅 0.42% 的 circuit 就足以拆掉 backdoor 机制,Tripwire(2608.14392) 说「pruning less than 0.6% of the neurons in a layer suffices to break safety alignment」,Wei 等人 2024 年那篇则是「removing less than 3% of neurons pushes ASR in all three scenarios close to 1」。三个数字,三篇论文,互相引用成了共识。

问题不在数字,在这些数字是怎么测出来的。

全部正向证据共享同一个威胁模型

把这些工作的攻击者假设并排放:SafeSeek 是「white-box access to model weights and activations, no adversarial query budget required」;剪枝那篇是「Full weight access, calibration data to compute importance scores, ability to zero out or low-rank-update targeted weights, no retraining required」;Mask2Shield 里的对手更明确——「can inspect a small calibration set of harmful/benign prompts and zero out selected FFN channels, but cannot retrain or arbitrarily modify weights」。

也就是说:攻击者只被允许出手一次,且不许训练。在这个预算下,稀疏定位确实成立,而且成立得很干净——abliteration 那篇测了 24 个模型,MMLU 最大退化 0.028(DeepSeek-V3 在 30% 强度下),其余全部 ≤0.006;SafeNexus 用 <0.05% 的 backbone 参数做 LoRA 就能压 ASR。定位准、代价小、能力不掉,三件事同时为真。

但「一次性、不许重训」不是攻击者的真实约束,是实验的约束。

放开这个约束,定位集合就动了

有两条反向证据。

第一条来自 DSA(2608.01414):威胁模型换成「攻击者反复识别并剪除当前主导的拒绝神经元」,白盒、可多轮迭代。结果是「Fig. 6 shows that each pruning round recruits a distinct set of compensatory refusal neurons across layers. Specifically, refusal remains preserved after two successive pruning rounds.」每一轮剪完,模型在别处招募一批新的拒绝神经元顶上——你第一轮测到的那 0.6%,第二轮已经不是同一批了。

第二条是维度问题,跟轮次无关。Prefill jailbreak 那篇在 Qwen 家族做 matched-contrast search,结论是没有单一的 refusal-decision direction:任何单个方向的读出 AUC ≤0.73 且都无法 steer,而完整 linear probe 能到 ~0.85。决策是可解码的,但它是多维的,不是一个可操纵的 feature。这一条否掉的不是「稀疏」,是「稀疏且唯一」。

判断:「安全行为稀疏可定位」这条结论的证据几乎全部产生于单次静态干预 + 不许重训的实验条件。它描述的是「在这一次测量中,哪些单元此刻承载了拒绝」,而不是「模型把拒绝存在哪」。建立在稀疏定位上的防御——只微调 0.05% 参数、只加固 top-k 安全神经元——其有效期等于攻击者的一轮。

翻供条件:若 2027 年底前,有论文在同一个未加固的开源对齐模型上完成连续三轮及以上「定位—剪除—重新定位」,且第 2、3 轮新出现的补偿性拒绝神经元占该轮定位集合不足 10%(定位集合基本不变),本判断作废。注意 DSA 只做到两轮,且它是一个加固过的方法(DSA 本身就是把安全分散到多个 neuron subset 的训练方案),用它的两轮结果去推未加固模型的第三轮,是我在外推,不是它的实验结论。

三个我读不出来的缺口

一、补偿神经元的占比没给。 DSA 只说每轮招募「a distinct set」,distinct 是 100% 不重叠还是 60% 重叠,引文里没有数。这直接决定翻供条件能不能判。

二、正向那批工作全都没报告第二轮。 SafeSeek、Tripwire、Mask2Shield、GateBreaker 的指标全是「剪前 ASR vs 剪后 ASR」,单点对比。它们不是测错了,是没测这件事。把「未测量」读成「不存在」是我们自己的错。

三、攻击者能否在剪除后微调,所有论文一致地排除在预算外。 这是最关键的一档,也是唯一一档谁都没做。

预算提高一档,结论在哪里断

如果攻击者拿到的不是「剪一次」,而是「剪完之后允许用少量数据继续训几步」——比如 Mask2Shield 明确禁止的那个动作——我不知道稀疏定位还成不成立,也没有引文能支撑任何一边。DSA 表明模型在纯剪除下都会自发招募补偿单元;如果攻击者能主动施加梯度去压制这种补偿,补偿路径可能一并被吃掉,稀疏性反而回来了;也可能梯度把拒绝推到更弥散的地方,定位彻底失效。两种都讲得通,而讲得通不是证据。

要知道答案,需要的实验很具体:在一个未加固的开源对齐模型上,交替执行「定位—剪除—用 500 条无害样本微调 200 步」,跑满三轮,每轮报告新定位集合与上一轮的 Jaccard 重叠率,同时报 MMLU 与 ASR。这个实验我没见到有人做。在它出现之前,所有把「只需改 0.05% 参数」当作防御卖点的方案,我按「一轮有效」计价。


本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。