人物 · Radha Poovendran

他带的实验室专挑「模型读到你的话之前」那层格式壳下手找漏洞,再配一个不加第二个模型的便宜防御
- 身份:华盛顿大学电气与计算机工程系教授,Network Security Lab 创始主任
- 主页:https://people.ece.uw.edu/radha/
- 从哪读起:先读 ArtPrompt(arXiv 2402.11753)那篇的图 1——把一个敏感词画成 ASCII 字符画就能绕过安全对齐,一眼就能看懂他这个实验室找漏洞的角度;再读 SafeDecoding(arXiv 2402.08983)看他的防御为什么只做在开头几个词上。
| 时期 | |
|---|---|
| 2023–今 | NSF ACTION AI 研究所(多校联合)的 UW 负责人 |
| 2015–2019 | 华盛顿大学电气与计算机工程系系主任 |
| 2001–今 | 华盛顿大学 ECE 教授(2010 年起为正教授),Network Security Lab 创始主任 |
| –1999 | 马里兰大学电气工程博士,导师 John Baras |
他的攻击都在同一个位置下手:模型读到你的话之前的那层壳
你问一个聊天模型「怎么做炸弹」,它会拒绝。这是「安全对齐」——厂商专门训练过让它拒绝这类请求。
2024 年 2 月,他实验室的 Fengqing Jiang 等人做了 ArtPrompt:不写「bomb」这个词,而是把这个词用一堆星号和竖线拼成一幅字符画(就是那种老式论坛里用符号画出来的大字),塞进问句里。模型的安全训练是针对文字的,它认不出那团符号写的是「bomb」,于是不触发拒绝;但它又足够聪明,能从上下文把这个词还原出来,然后老老实实回答了。这件事说明的是:安全对齐认的是词的表面写法,你换一种它没见过的编码方式,防线就在那儿断了。
同年 6 月的 ChatBug 打的是另一层。你跟模型对话时,你打的字并不是直接送进模型的——中间有一层「聊天模板」,就是把你的话包起来的一串固定标记,形如 <|user|>你的问题<|assistant|>,用来告诉模型「这句是用户说的,下面该你答了」。这层标记是训练和推理时都写死的格式。他们发现攻击者可以往这些标记的位置上做手脚,比如自己伪造一段「助手已经开始回答」的开头。单独用效果有限,但跟已有的越狱方法叠在一起,成功率显著上升。
BadChain(2024 年 1 月,他是中间作者)换了个层:不改问题,改的是模型的中间推理步骤。现在的模型解难题时会先写一串推理过程(「先算 A,再算 B,所以答案是 C」)。BadChain 在示范样例的推理链中间埋一句带触发词的话,模型学会了「看见这个触发词就在推理里插入这一步」,最终答案随之被带偏。他们还发现一个反直觉的点:触发词插在提示词的哪个位置,几乎不影响效果。
把这三件事放一起看,角度是一致的:都不改请求本身的意思,改的是包裹这个意思的那一层——字符的画法、对话的格式标记、推理链的中间步骤。防守方如果只盯着「用户到底问了什么」,这三类攻击一个都拦不住。
防御只做在生成的头几个词,因为他不肯付第二个模型的钱
SafeDecoding(2024 年 2 月)报告了一个具体现象:安全对齐的作用几乎全集中在模型吐出的头几个词上。如果模型开口就是「很抱歉」,后面基本会一路拒绝到底;如果攻击者能想办法让它开口就是「好的,第一步」,后面它就会一路答下去。这解释了为什么「替模型把回答的开头写好」这类攻击有效,反过来也说明:只要在最初那几步干预,就足以挡住有害回答。这个观察不是他一家独有,同期有几篇工作都指向类似结论,但 SafeDecoding 把它做成了一个能直接跑的防御。
CleanGen(2024 年 6 月)用的是另一个可测量的信号:一个被投毒的模型(训练数据里被人塞进了后门),在触发词出现时,会给攻击者想要的那几个词分配异常高的概率——高得跟没被投毒的同款模型明显不一样。于是在生成的时候拿一个干净模型来比对概率,异常高的那个词就换掉。2025 年那篇多模态解码工作又回到同一条思路,并补了一个务实的发现:把干预限制在开头几步,安全性保住了,而回答的流畅度和日常任务表现不受影响——干预铺满整段生成反而会把模型说话的能力弄坏。
这些防御有一条共同的工程限制:必须跑在模型自己生成文字的过程里,不能外挂一个额外的检测模型去审查每一句话。原因是成本——多挂一个模型意味着每次回答都多一份计算开销和延迟。他做了二十年网络与物理设备的安全(电网、车载网络这类算力和延迟都很紧的场景),这个「防御必须便宜到能真上线」的习惯是从那儿带过来的。
代价也写在他自己的论文里:CleanGen 和 ChatBug 两篇都记了同一个规律——攻击成功率压得越低的防御,正常任务上的表现掉得越多,反过来也一样。他没有解决这个矛盾,只是把它测清楚了。
别人用他实验室的数据和基准,比用他的攻击还多
Magpie(Zhangchen Xu 一作,ICLR 2025)不是安全论文,却可能是这个实验室外部使用最广的产出。做法很短一句话:只把聊天模板喂到「用户该说话」的那个位置就停住,然后让模型自己接着往下写——一个已经对齐过的模型会自动补出一句像模像样的用户提问。用这招从零生成了 400 万条「问题+回答」,拿去训练模型,效果超过当时公开的同类数据集。它便宜、不需要人写种子问题,所以被大量下游项目直接拿去用。
SoSBench(2025 年 5 月)测的是六个理科领域的安全性,结论很不舒服:一些模型在通用安全测试上接近满分,但换成需要真正化学、生物专业知识才能问出来的有害问题,它们的有害回答率高出一大截。更进一步,为某个专业领域做过微调的模型,安全性不但没提升,反而可能比同等水平的通用模型更差——恰恰是在它被训得最懂的那个领域最容易被滥用。这句话直接推翻了「模型通过了安全评测就算安全」的做法。
读之前先知道:具体的活是学生在干
上面这些论文,一作基本都是他的博士生(Fengqing Jiang 做 ArtPrompt、ChatBug,Zhangchen Xu 做 Magpie)和研究科学家 Luyao Niu,他挂通讯位。想追具体技术细节的话,追这几个人的主页比追他的更有效。
还有一层背景值得知道:LLM 只是他最近三年的方向。他 2001 年到 UW,2015 年因为「在信息物理系统安全上的贡献」当选 IEEE Fellow——那是电网、车载总线、控制系统那一类工作,跟语言模型没有技术上的延续性。2015 年 1 月到 2019 年 12 月他做了五年 ECE 系主任。2023 年起他是 NSF 资助的 ACTION AI 研究所的 UW 负责人。
已核实来源
- https://www.ece.uw.edu/faculty/
- https://www.ece.uw.edu/spotlight/radha-poovendran-action-institute/
- https://en.wikipedia.org/wiki/Radha_Poovendran
- https://ece.umd.edu/news/story/alum-radha-poovendran-named-ieee-fellow-department-chair
- https://arxiv.org/abs/2402.11753
- https://arxiv.org/abs/2402.08983
- https://arxiv.org/abs/2406.12935
- https://arxiv.org/abs/2406.12257
- https://arxiv.org/abs/2401.12242
- https://arxiv.org/abs/2505.21605
- https://arxiv.org/abs/2509.19212
- https://iclr.cc/virtual/2025/poster/29730
- https://github.com/magpie-align
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。