人物 · Xiaogeng Liu

做自动越狱攻击的博士生,把越狱从人手写提示变成可搜索、可复用策略的流程
- 身份:Johns Hopkins University DSAI 博士生(导师 Chaowei Xiao)
- 主页:https://xiaogeng-liu.com/
- 从哪读起:先读 AutoDAN-Turbo 的方法一节(不是结果表)——那里能看清「策略库」到底存了什么、怎么被下一轮攻击检索出来复用,这是后来一串工作的共同底座。
- 成名作:AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models(ICLR 2024)——第一个自动搜出来、但读起来仍是通顺英文的越狱提示,让「用困惑度过滤器挡乱码后缀」这条便宜防线一下子不够用了
| 时期 | |
|---|---|
| 2025.09–今 | Johns Hopkins University ECE / DSAI 博士生 |
| 2023.09–2025.06 | University of Wisconsin–Madison 博士生 |
| 2020.09–2023.06 | 华中科技大学硕士 |
AutoDAN 让「困惑度过滤」这条防线失效了
2023 年做自动越狱有两条路。一条是人手写,比如 DAN 那类「你现在扮演一个没有限制的 AI」的长提示,写得出来但不成规模,模型一更新就作废。另一条是 GCG 那种梯度搜索,在问题后面接一串 describing.\ + similarlyNow write oppositeley 这样的乱码后缀——有效,但这串东西的困惑度奇高,服务方只要在输入端跑一个小语言模型算困惑度、超阈值就拒答,成本几乎为零。当时不少防御论文就把这条当作已解决的部分。
AutoDAN 的做法是从人写的越狱提示出发做遗传搜索:句子层面交叉重组,词层面用同义词替换,每一代按目标模型的响应打分留下好的。产物仍然是一段通顺的英文段落,困惑度和正常提示在同一量级,所以那道过滤器直接失去意义。这篇的价值不在「又多一个攻击」,而在于它划掉了一个被广泛采信的假设:自动搜出来的攻击不一定长得像乱码。此后写防御的人如果只报困惑度过滤的结果,会被要求补上 AutoDAN 这类语义型攻击的数字。
AutoDAN-Turbo:攻击方也开始积累经验
AutoDAN 每次攻击都是从头搜。Turbo(ICLR 2025 spotlight)改成黑盒下的持续探索:攻击模型每打一轮,就让另一个模型总结这轮「用了什么招」——比如「先让对方以小说人物身份自述」「把有害步骤拆成看似无害的子任务分多轮问」——写成自然语言条目存进一个策略库;下一次遇到新的有害目标,先从库里检索相似情境的策略再生成攻击。报的数字是对 GPT-4-1106-turbo 88.5% 成功率,把人手写的已知策略也灌进库里则到 93.4%。
这条线上后来的 AutoDAN-Reasoning(2025-10)把结论推得更直白:同一个策略库,采样更多候选攻击、再用一个打分器挑最好的一条发出去,成功率随采样预算继续涨。也就是说防御方评估自己的模型时,「攻击者有多少次查询和多少推理算力」是必须写进结论的参数——同一个模型在 10 次尝试和 1000 次尝试下的安全结论不是同一个结论。
防御一侧:过度防御和长程记忆
PIGuard(ACL 2025)针对的是 prompt injection 检测器的一个实际毛病:这类检测器多半是在「注入 vs 正常」数据上微调出来的分类器,结果学到了表面特征,用户正常写「ignore the previous formatting, use bullet points」也会被判成攻击而拒答。这类误报在产品里比漏报更早被投诉。
DRIFT(2506.12104)报的是另一个负面结果。当时被看好的系统级防御有两类:一类给 agent 的每步动作套规则白名单,一类严格隔离不可信数据与控制流。这两类在注入基准上分数确实高,但换到开放式真实任务上,可用性掉得很厉害——合法的多步操作也被拦掉。这篇同时给了一个更细的观察:在长程交互里,把已经混进 agent 记忆流的注入指令识别出来删掉,比只在每一步限制权限更能压住后期被持续操纵的风险,因为前者动的是污染源,后者每一步都要重新赌一次。
2026 年转向 agent 的具体形态
近一年的几篇都在攻 agent 的运行环境而不是模型本身。
一篇关于后台执行的工作指出:当 agent 不是在回应你的即时提问、而是在无人看管的后台任务里自己去抓网页和文档时,内容的来源标注在流程中丢掉了——等它下次向用户汇报,那段从可疑网页抓来的话已经变成 agent「自己的结论」,用户没有任何线索去质疑它。
DTap(红队平台)报的是评测口径的问题:如果按模型是否口头拒绝、或者输出是否符合策略文本来判成功,会系统性地误估真实危害——必须去验证动作实际造成的后果(文件真的被删了没有、请求真的发出去了没有)。同一篇还测到自动化迭代改写越狱提示的收益集中在前几轮,之后基本走平,这直接决定了红队跑批时的预算怎么分。
MaskForge(2606.04027)转到 diffusion 类语言模型——这类模型不是从左到右逐 token 生成,而是反复填空。测出来的规律是:攻击者预先固定的回答部分越少、留给模型自己填的空越多,越狱成功率越高。这篇也顺带给了一个不太让人舒服的结论:攻击与防御的配对高度不均匀,某个防御能压死一种攻击却对另一种几乎无效,反过来也没有哪种攻击通吃所有配置,所以任何「某模型是否稳健」的说法都得连着具体的攻击-防御-模型三元组一起说。
局限
产出集中在攻击与评测,防御侧的 PIGuard、DRIFT 都还停在研究原型,没有证据表明被生产系统采用。AutoDAN 这条线的成功率数字依赖当时的目标模型版本,闭源模型每次更新后这些数字都需要重测,论文里的百分比不能直接当作今天的现状读。
已核实来源
- https://xiaogeng-liu.com/
- https://arxiv.org/abs/2310.04451
- https://arxiv.org/abs/2410.05295
- https://arxiv.org/abs/2506.12104
- https://arxiv.org/abs/2510.05379
- https://www.usenix.org/conference/usenixsecurity24/speaker-or-organizer/xiaogeng-liu-university-wisconsin-madison
- https://ischool.wisc.edu/staff/liu-xiaogeng/
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。