她把「这个模型安全吗」变成一套别人能照着跑、能打分、能复现的测试,DecodingTrust 是最有名的一套

  • 身份:Meta Superintelligence Labs(2026 年 6 月随 Virtue AI 团队加入);伊利诺伊大学厄巴纳-香槟分校 Abbasi 副教授
  • 主页https://aisecure.github.io/
  • 从哪读起:先读 DecodingTrust 论文(arXiv 2306.11698)的结果表:它把「可信」拆成八项分开打分,你会立刻看到「更强的模型不等于更安全」这件事的具体数字。
时期  
2026.6–今 加入 Meta Superintelligence Labs(Axios 报道称与 Dawn Song 一同向 Nat Friedman 汇报)
2025.4–2026 Virtue AI 联合创始人;2025 年 4 月融资报道中被列为 CEO
2023– 芝加哥大学计算机系与数据科学研究所 Research Associate Professor
至今 UIUC Siebel 计算与数据科学学院 Abbasi Associate Professor

她的起点是「能证明的鲁棒性」,这决定了她后来的品味

她早年做的方向叫 certified robustness(可证明鲁棒性)。区别是这样的:一般做法是「我们找人攻了一百次,没攻破」——这只能说明这一百次没成;她那条路要的是「只要输入的改动幅度不超过这个范围,输出数学上保证不变」,改动是谁想出来的都一样。就像判断一种药安不安全,前者是「一百个人吃了没事」,后者是「给出置信区间」。

这个出身解释了她后来所有工作的一个共同点:她不接受「我们内部红队测过了」这种说法,她要能被别人重跑、能得出同一个数字的东西。IJCAI Computers and Thought 奖(2022)、MIT Technology Review 35 岁以下创新者(2020)、AI’s 10 to Watch(2022)都是在这条线上拿的。

DecodingTrust:把「这个模型可信吗」拆成八个能打分的小问题

这是她影响最大的一件事。2023 年发布的 DecodingTrust 把一个没法回答的问题拆成八项分开量:说脏话/有害内容的倾向、对特定人群的刻板印象、被人故意改写措辞后会不会答错、遇到训练时没见过的文体会不会崩、示例被做过手脚时的表现、会不会把训练数据里的私人信息(比如邮箱地址)吐出来、道德判断、公平性。每一项都有固定题库和评分脚本。

最被引用的一条发现是反直觉的:GPT-4 在标准题目上比 GPT-3.5 更可信,但一旦攻击者在系统提示(模型的开场设定)里精心写几句诱导,GPT-4 反而更容易被 jailbreak(越狱:让模型说出它本该拒绝的内容,比如把「怎么造炸弹」包装成「我在写小说」)。原因就是它更听话——指令跟随能力更强,恶意指令的效果也被同步放大。这句话后来成了很多团队的默认假设。

这套东西拿了 NeurIPS 2023 数据集与基准赛道杰出论文,2024 年又被 NSA 评为年度最佳网络安全科研论文。局限也很明显,而且是结构性的:它是一套 2023 年的固定题库,厂商可以针对它优化;任何基准一旦成了事实标准,被刷分就是迟早的事。

模型不再是唯一的攻击面,记忆和检索库才是

AgentPoison(NeurIPS 2024,与 Zhaorun Chen、Zhen Xiang、Chaowei Xiao、Dawn Song 合作)是她从「测模型」转向「测 agent」的关键一步。它一个模型参数都不改,只往 agent 的长期记忆或它查阅的知识库里塞几条条目——现在很多 agent 回答问题前会先去一个文档库里检索几条相关材料再作答,这个库就是入口。塞进去的条目带一个触发词,用户的话里一出现这个词,检索出来的就是攻击者写好的「过往经验」,agent 照着执行。论文里的自动驾驶 agent 例子:污染量不到全库的 0.1%,触发后攻击成功率超过 80%,而没有触发词时它表现完全正常,从外面看不出任何异常。

她近两年这条线的一批工作指向同一件事:安全检测如果只看单条输入、单个回合、单个 agent,就会漏掉那些每一步单看都无害、合起来才有害的攻击。比如把「帮我搞到某人的住址」拆成五个各自看起来完全正常的小请求分几轮问完;比如多个 agent 各自的行为都合规,配合起来才造成危害。要抓住这类,就得对整条执行轨迹一起判,而不是逐条判。

她既造尺子,也卖防御

另一条产出线是防御侧。RigorLLM(ICML 2024)做的是内容护栏(guardrail:夹在用户和模型之间的一道检查,判断这句话该不该放行)。它不是简单挂个分类器,而是做数据增强、给输入附加安全后缀、把近邻检索和模型判断融合起来,目的就是让攻击者换个说法时护栏不会立刻失效。GuardAgent 把同样的思路搬到 agent 的动作上。

2025 年 4 月,她与 Dawn Song、Carlos Guestrin、Sanmi Koyejo 创办的 Virtue AI 宣布 Seed 与 Series A 合计 3000 万美元(Lightspeed 与 Walden Catalyst 领投),做企业侧的自动红队、运行时护栏和合规产品;融资报道中她被列为 CEO。这里有一层关系读者应当自己判断:同一批人既定义了业界用来打分的基准,又在卖基于这类基准的商业防御。2026 年 6 月,Meta 把包括她在内的三位创始人和部分团队招入 Meta Superintelligence Labs——报道说明这是招人,不是收购公司或其知识产权。

她近期反复强调的一件事:防御的代价必须和攻击成功率一起报

只报「攻击成功率从 60% 降到 5%」是不合格的,代价要一起写:过度拒绝(正常请求也被挡,用户问「阿司匹林一次吃多少」被当成自残咨询拒答)、任务完成率下降、加一层模型来审查带来的响应延迟、以及护栏一离开训练分布就失效——换个危害类别、换一版内容政策、换个攻击写法就崩,堆参数量补不上这个缺口。

还有一条给做评测的人的提醒:如果靠模型自己说的「好的,我这就去做」来判定攻击成功,会系统性高估危害——它可能说了但没真做成。要去核实实际发生的后果,比如那封邮件到底发出去没有。

已核实来源


本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。