Junjie
Liang
Toggle navigation
about
radar
publications
cv
知识卡
33 篇 · 按人 · 人物与研究组
← 全部
未读
已读(浏览器记录)
学者 · 24
2026-08-10
Maksym Andriushchenko
他专门证明「这个模型很安全」是没被认真攻击过,并把该怎么打做成别人能直接跑的测试集
2026-07-28
Xiangyu Qi
反复证明「我们的模型很安全」这句话背后的证据不成立:十条数据就能拆掉安全训练,而测安全的实验本身在高估防护
2026-07-24
Dawn Song
AI 安全领域先把「怎么测」定下来的人:从贴纸骗过路牌识别,到今天给 AI 智能体做红队评测
2026-07-21
Bo Li
她把「这个模型安全吗」变成一套别人能照着跑、能打分、能复现的测试,DecodingTrust 是最有名的一套
2026-07-06
Edoardo Debenedetti
做出了业内测 AI 智能体被骗程度的标准考场,也做出了不靠模型自觉的防御方案
2026-06-21
Chaowei Xiao
把「越狱」从人手写咒语变成程序自动搜索,做出的攻击工具被大量论文当成默认测试标准
2026-06-01
Xiaogeng Liu
把「越狱」攻击从人工写模板变成自动搜索,也反复指出安全评测的数字靠不住
2026-05-29
Eric Wong
他让「AI 被骗出有害回答」这件事第一次能被不同论文用同一把尺子量出来
2026-05-29
Alexander Robey
证明越狱不只让聊天机器人说脏话——同样的手法能让商用机器狗执行危险动作;也做了大家绕不开的越狱评测标尺
2026-04-29
Liwei Jiang
她把 AI 安全做成可下载的数据集和判定模型,又反复证明这些东西换个场景就失灵
2026-04-24
Leon Derczynski
写了 garak——一条命令就能把学术论文里的越狱攻击对着自己的模型跑一遍的开源扫描器
2026-04-10
Peter Henderson
反复证明大模型的「安全」只是薄薄一层可拆的开关,并用法学训练把这个结论推成责任与免责规则的主张
2026-03-16
Zifan Wang
合著了当今测 AI 越狱最常用的几把尺子,然后花两年证明这些尺子量出来的分数偏高
2026-03-16
Matt Fredrikson
把「骗过 AI 的安全限制」从段子变成可自动搜索、可计分的工程,又开公司让几万人下场攻
2026-03-16
Andy Zou
把「能不能骗过 AI」从手工试探变成能自动搜索、能打分、能上万人反复跑的流程
2025-10-22
Sizhe Chen
把 prompt injection 的防御做进模型权重里,并坚持防御必须在自适应攻击下测、同时报出可用性代价
2025-10-08
Nicholas Carlini
专门去打破别人宣称安全的 AI 防御,用一次次攻破逼出这个领域的评测标准
2025-09-23
Radha Poovendran
他带的实验室专挑「模型读到你的话之前」那层格式壳下手找漏洞,再配一个不加第二个模型的便宜防御
2025-09-22
Dan Hendrycks
他把「AI 会不会出事」这类说不清的担忧,一次次改造成所有人都得报分数的公开考卷
2025-06-27
Nouha Dziri
她把「怎么测一个模型安不安全」做成了免费开源的整套工具,现在很多人拿它当尺子
2025-04-02
Seungju Han
做出了 WildGuard——一个开源工具,能同时判断一句话危不危险、是不是越狱、模型有没有该拒不拒
2024-08-27
Riley Goodside
他在推特上一条条演示大模型分不清「指令」和「数据」,让这类攻击变成整个行业都认的问题
2024-08-01
Mantas Mazeika
把「模型有多危险」从各说各话变成能打分、能复现的公共测试,别人现在都拿他的题目跑分
2024-03-28
Patrick Chao
做出了自动越狱攻击 PAIR,又建了 JailbreakBench,让「越狱成功率」这个数字第一次能被别人复算
独立研究者 · 5
2026-08-20
Simon Willison
给 prompt injection 起名的人;他把「拦住 95%」从卖点变成减分项,逼防御走架构隔离
2026-05-18
Johann Rehberger
四年在个人博客上一条条公开真实 AI 助手被攻破的完整过程,并把这些案例带进了学术论文
2026-03-31
Kai Greshake
2023 年他和合著者演示并命名了「间接提示注入」:模型读到的任何外部内容都可能变成对它的命令
2025-08-07
Sven Cattell
他在 DEF CON 办了三届公开的模型找茬大赛,每届都先公开承认上一届没用,再改规则重办
2025-07-29
Sander Schulhoff
办了史上最大的 AI 攻击众包比赛,把「怎么骗过 AI」从段子变成了 60 万条可统计的数据
高管 · 2
2026-08-04
Steve Wilson
他发起并主持 OWASP 的大模型安全风险清单,这份清单成了企业审查 AI 应用时的默认表格
2026-02-03
Ram Shankar Siva Kumar
把「上线前有人负责攻击自家 AI」变成微软内部的固定岗位、固定流程和开源工具
政策 · 1
2026-01-28
Ashley Casovan
她在加拿大政府写了给算法风险分级的规定,又在 IAPP 把「AI 治理」做成了有考试和证书的职业
研究组与机构 · 1
2023-11-02
UK AI Security Institute (AISI)
英国政府出钱养的模型测试队:能在模型发布前上手测,但拦不住任何一次发布
没有匹配的条目。