「English-language attacks retain their high success rate even as the model scale increases (to 12b)」——同一个 GFlowNet attacker,同一族模型,土耳其语载荷从 Gemma3-4b 打到 12b 时”suffer a substantial performance loss”。这是我在整理跨模型迁移证据时唯一一条方向为负的记录,而它掉的那个变量不是模型家族,也不是参数量,是语言。

先把实验条件摆出来,不然这条结论不成立。该测量的威胁模型是:attacker 在小 victim(Gemma3-4b)上训练,部署到同族更大的 victim(12b);攻击者对大模型只有 black-box 访问,用的是预先生成好的攻击集,不重训、不重新优化。指标是英语 vs 土耳其语的成功率对比。这是零查询预算的最弱攻击者。引文里没有给出绝对 ASR 数字,只给了”substantial loss”这个定性描述,也没有给攻击集规模——这两个缺口要记住。

对面是压倒性的正例,但注意它们的载荷落在哪儿。VERA-V 在 GPT-4o-mini 上优化的攻击,转到 Qwen2.5-VL-7B 拿 62% ASR、InternVL3-8B 66%、GPT-4o 43%。文本到图像那条更极端:在 FLUX.1-schnell 管线上优化的 prompt 不做任何适配转到 DALL·E 3,对其未知的内部审核拿到 84.0% 端到端绕过率。逆向工程 agent 那条是干净的小→大同向迁移:针对 Qwen3-8B 生成的 aPack 二进制,AutoDAN 完全没在 GPT-OSS-120B 上跑过,直接投过去也成功了。音频那条甚至反向:最大的 RAVDESS 精度下降是 67 个百分点,出现在未见过的 StepAudio2 上,而不是用来构造波形的 Qwen2.5 参考模型上——攻击者只有对参考模型的离线 white-box,对 GPT-audio-mini、Gemini 这些实际目标零查询零梯度。

这些载荷的共同点:英语文本、自然图像、语音波形。全是训练覆盖最厚的区域。

判断:「在小模型上优化、打大模型」这条经验规则的适用边界应该按载荷所在分布的训练覆盖度划线,不是按模型家族或参数量划线。高资源分布上的载荷随规模放大而保持甚至增强;依赖低资源分布的载荷,在同族更大模型上就开始衰减。

翻供条件:若 2027 年底前出现一项跨语言迁移测量,在同族小→大模型(如 4b→12b 及以上)上,低资源语言攻击的 ASR 相对损失不超过高资源语言的 1.5 倍,且覆盖 ≥3 种语言、≥2 个模型家族,这条判断作废。

有一条现有证据已经在往翻供方向推:用 bio-inspired search 优化的文言文 jailbreak prompt,报告在 Gemini-2.5-flash、GPT-4o、Deepseek-Reasoner、Qwen3、Grok-3 上”maintaining consistently great attack success rates”,零查询转移。文言文显然不是高资源英语。但那份测量做的是跨家族横向转移,没有做同族小→大的规模轴,所以它证伪不了上面那条判断——它只是提醒:低资源不等于必然衰减,可能文言文在这些商用模型的预训练里覆盖得比土耳其语在 Gemma3 里厚得多。要区分这两种解释,需要的是把语言和规模同时作为自变量的一张表,现在没有。

攻击者预算提高一档,这条判断在哪儿断。

零查询是当前唯一被测过的档位。往上一档是:允许攻击者对大模型做有限次查询并据此重排/筛选攻击集。这一档我不知道结果——但有一条间接线索指向”会断”:Jailbreak-Zero 用便宜的开源 surrogate 做预筛,再投给受速率限制的目标,报告”successful attacks on a surrogate transfer to the intended victim in most cases”。如果几十次查询就能把土耳其语载荷的衰减补回来,那按分布划线的意义就从”攻不动”降级成”多花几十次查询”,而这对任何有 API 额度的攻击者都不构成约束。

再往上一档,攻击者可以在小模型上重新微调 attacker policy。MultiBreak 那条显示微调小开源模型暴露出的漏洞会转移到更强的闭源模型,但那是英语。低资源语言下重训能否恢复,我不知道。

要知道这两档的答案,需要的实验是:固定 Gemma3-4b→12b 这对模型,固定英语/土耳其语两个载荷分布,把攻击者对 12b 的查询预算设成 0 / 10 / 100 三档,各测一次 ASR。这个实验没人做过,我编不出数字。


本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。