知识卡

60 篇 · 按人 · 人物与研究组 ← 全部

学者 · 15

2026-09-11 Yueqi Xie不改模型权重,用系统提示、梯度、中间层表示这类便宜信号在外面把越狱和注入拦下来
2026-09-06 David Wagner两次给新出现的 AI 安全问题定下「什么才算证明有效」,并做出了 Meta 采用的开源抗注入模型
2026-09-01 Bryan Hooi把图欺诈检测那套「假设对手会针对你的检测器改招」的做法,搬进了 LLM agent 的注入攻防
2026-08-30 Florian Tramèr他专门证明别人的安全评测在骗自己:攻击算多少钱、防御让模型变多笨,都得写清楚
2026-08-25 Chaowei Xiao*做自动越狱攻击起家,现在用自适应攻击去逐个检验别人的 agent 防御站不站得住
2026-08-24 Xiaogeng Liu*做自动越狱攻击的博士生,把越狱从人手写提示变成可搜索、可复用策略的流程
2026-08-10 Maksym Andriushchenko他专门证明「这个模型很安全」是没被认真攻击过,并把该怎么打做成别人能直接跑的测试集
2026-05-29 Eric Wong他让「AI 被骗出有害回答」这件事第一次能被不同论文用同一把尺子量出来
2026-04-10 Peter Henderson反复证明大模型的「安全」只是薄薄一层可拆的开关,并用法学训练把这个结论推成责任与免责规则的主张
2026-03-16 Andy Zou把「能不能骗过 AI」从手工试探变成能自动搜索、能打分、能上万人反复跑的流程
2025-10-22 Sizhe Chen把 prompt injection 的防御做进模型权重里,并坚持防御必须在自适应攻击下测、同时报出可用性代价
2025-09-23 Radha Poovendran他带的实验室专挑「模型读到你的话之前」那层格式壳下手找漏洞,再配一个不加第二个模型的便宜防御
2025-09-22 Dan Hendrycks他把「AI 会不会出事」这类说不清的担忧,一次次改造成所有人都得报分数的公开考卷
2025-04-02 Seungju Han做出了 WildGuard——一个开源工具,能同时判断一句话危不危险、是不是越狱、模型有没有该拒不拒
2024-08-01 Mantas Mazeika把「模型有多危险」从各说各话变成能打分、能复现的公共测试,别人现在都拿他的题目跑分

产业研究者 · 18

2026-09-13 Fangzhao Wu把间接提示注入做成可打分的公开基准,又转向读模型中间层来识破攻击的防御侧研究者
2026-09-09 Dawn Song*她主张 agent 安全不能靠看内容判断危险,要靠外部的逐操作授权检查;2026 年带队进了 Meta 的安全研究
2026-09-05 Deep Ganguli把「这个模型有害吗」变成别人能复跑的数字:红队数据集、公众参与的对齐目标、真实对话的隐私统计
2026-09-03 Muhao Chen他既是护栏模型的主要生产者之一,又反复用数据证明这类单层内容检测有结构性天花板
2026-08-28 Ethan Perez把大模型的攻防从论文里的成功率数字,做成能写进上线审批的运营指标
2026-08-24 Yangsibo Huang反复证明「模型看起来安全」和「模型真的安全」之间差了多少:解码参数、3% 的参数、unlearning、排行榜投票
2026-07-28 Xiangyu Qi反复证明「我们的模型很安全」这句话背后的证据不成立:十条数据就能拆掉安全训练,而测安全的实验本身在高估防护
2026-07-21 Bo Li她把「这个模型安全吗」变成一套别人能照着跑、能打分、能复现的测试,DecodingTrust 是最有名的一套
2026-07-06 Edoardo Debenedetti做出了业内测 AI 智能体被骗程度的标准考场,也做出了不靠模型自觉的防御方案
2026-05-29 Alexander Robey证明越狱不只让聊天机器人说脏话——同样的手法能让商用机器狗执行危险动作;也做了大家绕不开的越狱评测标尺
2026-04-29 Liwei Jiang她把 AI 安全做成可下载的数据集和判定模型,又反复证明这些东西换个场景就失灵
2026-04-24 Leon Derczynski写了 garak——一条命令就能把学术论文里的越狱攻击对着自己的模型跑一遍的开源扫描器
2026-03-16 Zifan Wang合著了当今测 AI 越狱最常用的几把尺子,然后花两年证明这些尺子量出来的分数偏高
2026-03-16 Matt Fredrikson把「骗过 AI 的安全限制」从段子变成可自动搜索、可计分的工程,又开公司让几万人下场攻
2025-10-08 Nicholas Carlini专门去打破别人宣称安全的 AI 防御,用一次次攻破逼出这个领域的评测标准
2025-06-27 Nouha Dziri她把「怎么测一个模型安不安全」做成了免费开源的整套工具,现在很多人拿它当尺子
2024-08-27 Riley Goodside*他在推特上一条条演示大模型分不清「指令」和「数据」,让这类攻击变成整个行业都认的问题
2024-03-28 Patrick Chao做出了自动越狱攻击 PAIR,又建了 JailbreakBench,让「越狱成功率」这个数字第一次能被别人复算

独立研究者 · 9

2026-09-20 Daniel Miessler不做新攻击也不做新防御,专做 AI 攻击面怎么切、注入算不算漏洞这类定性之争
2026-09-12 Simon Willison*给 LLM 注入攻击起名并持续记录每一起真实事故的独立开发者,博客是这个领域事实上的事件台账
2026-09-10 Scott Clinton他不写攻击也不写防御,他负责让 OWASP 的 AI 安全清单按期发得出来、有人认
2026-08-31 Oleksandr Yaremchuk写出被最多人 pip install 的 LLM 护栏,又在 2026 年 7 月亲手把它归档
2026-08-26 Ian Webster把 LLM 红队做成开发者 CI 里能跑的开源命令行工具,攻击按被测应用现场生成
2026-05-18 Johann Rehberger四年在个人博客上一条条公开真实 AI 助手被攻破的完整过程,并把这些案例带进了学术论文
2026-03-31 Kai Greshake2023 年他和合著者演示并命名了「间接提示注入」:模型读到的任何外部内容都可能变成对它的命令
2025-08-07 Sven Cattell他在 DEF CON 办了三届公开的模型找茬大赛,每届都先公开承认上一届没用,再改规则重办
2025-07-29 Sander Schulhoff办了史上最大的 AI 攻击众包比赛,把「怎么骗过 AI」从段子变成了 60 万条可统计的数据

高管 · 9

2026-09-14 Heather Adkins在 Google 决定「AI 找到的漏洞」要拿出什么证据才算数,并押注漏洞发现会先倒向防守方
2026-09-12 Jason ClintonAnthropic 首任 CISO,把模型权重怎么防、agent 怎么上生产写成别人能照着核对的条目
2026-09-09 Yann LeCun推动大模型权重公开发布的最强声音,也主张安全应该在推理时算出来,不是训练出来
2026-09-04 Tom Bonner把恶意软件分析那套方法搬进 AI 供应链,证明模型文件本身就是攻击载体
2026-08-29 Vijay Bolina在 Google DeepMind 从零建安全团队,把模型权重当成需要按国家级对手标准防护的资产
2026-08-24 Ilya Sutskever押注「让模型在监督者比它弱时仍泛化对」这条安全路线,并在 OpenAI 组织层面输掉了它
2026-08-23 Rich HarangNVIDIA 安全架构师,主张注入防不住、钱该花在限制模型输出能触发什么后果上
2026-08-04 Steve Wilson他发起并主持 OWASP 的大模型安全风险清单,这份清单成了企业审查 AI 应用时的默认表格
2026-02-03 Ram Shankar Siva Kumar把「上线前有人负责攻击自家 AI」变成微软内部的固定岗位、固定流程和开源工具

政策 · 5

2026-09-07 Risto Uuk研究欧盟 AI 法案里「系统性风险」到底指哪些风险,并把结论同时写进论文和立法意见
2026-09-02 Denise Wong新加坡数据与 AI 治理的分管官员,让 GenAI 应用的安全测试有了可交差的规程
2026-08-27 Christina Liaghati把散落在论文和新闻里的 AI 攻击编成带编号的清单,让安全团队和采购方能照着打勾
2026-08-23 Apostol VassilevNIST 对抗性机器学习报告的主笔,他划的攻击分类成了厂商和监管填表时的默认格子
2026-01-28 Ashley Casovan她在加拿大政府写了给算法风险分级的规定,又在 IAPP 把「AI 治理」做成了有考试和证书的职业

研究组与机构 · 4

2026-09-08 Hugging Face开放模型的分发枢纽,它改的默认值就是整个开源 AI 生态的实际安全底线
2026-08-23 OpenAI研究 LLM 被劫持的具体方式,并公开承认某些攻击可能修不好
2026-08-23 Google DeepMind用自适应攻击把自己和同行的注入防御逐个打穿,并把这套打法定成防御评测的及格线
2023-11-02 UK AI Security Institute (AISI)英国政府出钱养的模型测试队:能在模型发布前上手测,但拦不住任何一次发布