同一实验里,Llama 加 5 倍预算不动,Qwen 涨到 0.40
「Llama stays at 0.12 while Qwen rises to 0.40, at matched static safety ≤0.10」——这是 GCG 从标准 100 步加到 500 步之后的结果,出自 skill-merged LLM 的自适应越狱基准(2608.08542)。两个 math merge 在静态筛查下的 ASR 都 ≤0.10,看起来一样安全;把攻击预算翻五倍,一个纹丝不动,另一个翻了三倍多。
先把威胁模型摆出来,否则这两个数字什么也不说明。攻击者有 white-box gradient access,跑 GCG;静态 ASR 在 400 条 HarmBench behaviors 上测,自适应 ASR 在其中 seeded 的 50-behavior 子集上测,判定用两个 judge 的 AND 规则。同一篇里还有 PAIR 和 Crescendo/template 这类黑盒或灰盒攻击,固定算力预算。三个模型族的分布是:Qwen 的 merge 远在对角线上方(静态看着安全、自适应脆),Llama 的落在对角线上,Mistral 两个轴都不安全。
这篇论文常被引来支持一条论断:「攻击者针对已部署防御做自适应优化,成功率显著高于同预算下的静态或已知模式攻击,所以静态评测系统性高估鲁棒性」。但它自己的 500 步实验是这条论断的反例来源。作者做这个实验的动机很明确,是要排除「Llama 看着稳只是攻击没优化够」这种解释——排除成功了。也就是说,在这个预算区间里,静态与自适应的差值不是一个附着在评测方法上的常数,而是模型自身的属性:有没有一个能被梯度找到并推进的脆弱方向。
其他证据里,这个差异同样明显,只是很少有人放在一起看。基于文本过滤的 IPI 防御 DataFilter 能大幅压低静态 ASR,但攻击一旦自适应(黑盒、可迭代查询优化注入文本、不知道分类器参数和阈值)就丢掉大部分保护。而 provenance-based 的 PIPES 在一个明确写出预算的自适应设定下——攻击者控制一个字段或 provenance unit,最多 10 次尝试,且能拿到目标 agent 和主动防御的特权反馈——把 Gemma 4 31B IT 的六个 split 平均 ASR 从 84.7% 压到 2.3%,GPT-5.6 Luna 从 21.6% 压到 1.1%,效用没掉。同一个「自适应」标签下,一个塌了,一个没塌。
判断:自适应攻击测的不是「静态评测偏差」这个可跨系统迁移的量,而是特定模型/防御有没有可被优化利用的脆弱方向。把自适应打折当成对所有防御一律适用的修正因子写进评测规范,会在真正稳的系统上给出错误的悲观数,也会掩盖一个更有用的信号:哪些系统对加预算不敏感。
翻供条件:若 2027 年底前出现一项评测,在同一自适应攻击方法、同一攻击预算下,覆盖 ≥5 个静态安全匹配(静态 ASR 差 ≤0.05)的模型或防御,且全部对象的自适应 ASR 提升幅度差异 ≤0.10,则本判断作废。
支持「自适应更强」的其余证据,绝大多数没有做静态安全匹配,所以既不能证实也不能证伪上面这条。Trident 对 DRL cyber defender 造成平均 522% 的性能损失,同时给出了对照——GPT-4o 是 51.06%,zero-shot CoT 是 157.38%,RLVR 训练的 7B planner 是 522.30%;这条说明的是攻击方法本身的强弱排序,被打的四类 defender(GNN、H-MARL、MARL、PPO)之间是否静态匹配,文中没有这个维度。Proteus 在 T=5 的共同预算下 LCS 是 0.160,所有 baseline ≤0.014,测的是红队的学习曲线斜率,不是目标之间的差异。ICO 的消融显示去掉迭代优化后五个目标模型 ASR 掉 14.5–19.0%——注意这是个区间,跨模型有 4.5 个点的散布,方向上和「模型间抬升不一致」是相容的,但样本太小。GPT-Red 的结论是攻击算力越多 ASR 越高,同样查询预算下用 defender model tool 比 best-of-N 更高;这条讲的是预算的边际收益,不涉及目标异质性。
预算再上一档会在哪里断,说实话:我不知道。500 步只排除了「欠优化」这一种解释,没排除「GCG 这个搜索方法在 Llama 的表示空间里效率低」。如果换成多方法组合(GCG + PAIR + Crescendo 各自的最优结果取并集)、或者允许攻击者像内部模拟 monitor 那样先建模防御再提交——控制协议评估里已经发现,红队通过在内部模拟 monitor 的判断、过滤掉会被标记的消息,就能颠覆看起来稳健的策略——Llama 的 0.12 可能只是当前搜索方法的下界而不是模型的下界。要判断这一点,需要的是:在同一批静态匹配的模型上,跑至少三种机制不同的自适应攻击,并报告每个模型的 per-method 最优与并集 ASR。现有引文里没有这样的实验。
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。