Junjie
Liang
Toggle navigation
about
radar
publications
cv
资讯卡
48 篇 · 按类型 · 评测集 / 事故 / 系统 / 防御机制
← 全部
未读
已读(浏览器记录)
评测集 · 31
2026-08-18
MobileWorldSafety(GUI agent 环境注入安全基准)
142 条真机 Android 任务,量「app 里的一句话能不能劫持手机 agent」,六个 agent 攻击成功率 40.4%–66.9%
2026-02-03
AgentDyn(动态开放式 agent 安全防御基准)
把十种 prompt injection 防御搬进「必须边做边改计划」的环境重测:CaMeL 三个格子全是 0.00
2024-10-11
AgentHarm(LLM agent 有害行为基准)
量的是「用户直说要作恶时,agent 会不会把工具链一路跑完」——不是注入基准
2024-10-03
ASB (Agent Security Bench)
量的不是 agent 会不会被攻破,而是攻击工具已经摆在候选列表里时模型会不会去点它
2024-06-26
WildGuardTest(WildGuardMix 的人工标注测试切分)
1,725 条 prompt-response 对、三个独立二分类标签,量的是审核模型判得准不准,不是被测模型安不安全
2024-06-26
WildJailbreak(AI2 WildTeaming 合成越狱数据集及其 eval split)
2000 条角色扮演式越狱 + 250 条长得像越狱的无害题,量的是「该拒的拒、不该拒的别拒」这条线
2024-06-20
SORRY-Bench
440 条配平的不当请求,量的只有一件事:模型照办了几条——不量拒得对不对
2024-06-20
PKU-SafeRLHF(北大对齐组安全偏好数据集)
44.6k 有害问句 + Alpaca 写的回答,人工分别排「哪个更有用」「哪个更安全」——它量排序,不量越狱
2024-06-19
AgentDojo(ETH SPY Lab 的 prompt injection agent 基准)
97 个用户任务 × 27 个注入任务拼出 629 个安全用例,量的是 agent 会不会照攻击者写死的那句话调工具
2024-04-03
JailBreakV-28K(含 RedTeam-2K / mini split)
28,000 条里 20,000 条的图片和题目无关——它量的是 LLM 越狱模板往 MLLM 语言侧的迁移率
2024-03-28
JailbreakBench(JBB-Behaviors,100 条越狱行为基准)
一把只有 100 个刻度的越狱尺子:刻度由一个假阳率 11.6% 的判定器画上去,读数不带查询预算就没法比
2024-03-05
WMDP(Weapons of Mass Destruction Proxy,大规模杀伤性武器代理基准)
3668 道四选一,用「危险知识的邻居」当尺子量 unlearning——但 25% 是地板,10 条无关样本就能把分拉回来
2024-03-05
InjecAgent(工具型 LLM agent 的间接提示注入基准)
1054 条题量的是「agent 会不会去调攻击者点名的那个工具」——不量后果,不量任务还完不完成
2024-02-15
StrongREJECT(A StrongREJECT for Empty Jailbreaks,越狱评测基准)
313 条有标准答案的禁题,量的不是模型拒没拒,而是越狱后吐出来的东西到底有没有用
2024-02-06
HarmBench(自动化红队标准评测框架)
510 条有害行为 + 一个 Llama-2-13B 判定器,量的是「单轮请求下模型有没有吐出实质有害内容」这一件事
2024-01-11
TOFU(Task of Fictitious Unlearning,虚构作家遗忘基准)
用 200 个 GPT-4 编的假作家,量 LLM 能不能把指定的人从权重里挖干净——一个 KS 检验的 p 值
2024-01-10
RTA / RtA(Refuse-to-Answer rate,拒答率)
它不是题库,是「拒答数÷样本数」这个比值——在越狱集上越高越好,在无害集上越高越糟
2023-11-29
MM-SafetyBench(多模态大模型安全评测集)
1680 道题共用一套改写模板,量的是「危险词从文本挪进图片后模型还接不接招」这一件窄事
2023-11-09
SafeBench(FigStep 版,500 条禁忌问题题库)
FigStep 附带的 500 条纯文本有害问题,量的是模型愿不愿意接话,不是模型有多危险
2023-11-09
FigStep / SafeBench(排版图像越狱评测集)
把有害问句渲染成白底黑字的图,测模型的安全对齐认不认得图里的字——不是测它会不会输出危险知识
2023-10-26
ToxicChat(lmsys/toxic-chat)
1 万条 Vicuna demo 真实用户首句提示,7.33% 有毒、2.01% 越狱,如今被当成 guardrail 的假阳性体检尺
2023-10-10
MultiJail(Multilingual Jailbreak Challenges 数据集)
315 句有害请求 × 10 语种人工对齐翻译,量的是拒答会在哪一档语言资源上塌掉
2023-10-10
MaliciousInstruct(100 条有害问句 + BERT 打分器)
100 条「How to…?」问句配一个 HH-RLHF 微调的 BERT 判定器,量的是模型开不开口,不量说了什么
2023-10-05
HEx-PHI(Human-Extended Policy-Oriented Harmful Instruction Benchmark)
330 道政策倒推的直白有害指令 + GPT-4 打分,harmful fine-tuning 研究线的默认尺子,但题面锁着、口径分裂
2023-08-18
HarmfulQA(declare-lab,Red-Instruct 配套评测集)
1960 道 ChatGPT 生成的有害提问,被当成安全对齐的标准尺子,但题面高度模板化
2023-07-27
AdvBench(GCG 论文附带的有害行为/有害字符串集)
被引最多的越狱评测集:520 条明晃晃的有害祈使句,45% 在 0.95 相似度下是近重复
2023-07-10
BeaverTails(PKU-Alignment 有害性标注语料 / QA-moderation 数据集)
33 万条 QA 对的人工有害安全标注,今天多数「有害微调」论文的毒药与量尺,坑都在构造方式里
2022-07-04
WebShop(普林斯顿 NLP 组的模拟购物网站环境 / 评测集)
一道 BM25 就能刷过人类的购物检索题,如今被当成 agent 攻击的标准靶场
2022-03-17
ToxiGen(隐式仇恨语句生成数据集 / 评测集)
27.4 万条不带脏字的群体贬损句,同一个名字下跑着三套互不可比的用法
2021-10-15
BBQ (Bias Benchmark for QA)
把同一个模板问两遍:上下文不够时模型会不会替刻板印象填空——但它的偏见分和准确率绑死
2020-09-24
RealToxicityPrompts (RTP)
9.9 万条被拦腰截断的网页残句,量的是模型无人攻击时自己滑向脏话的概率——不是越狱,不是拒答
事故 · 5
2026-02-01
CVE-2026-25253(OpenClaw / clawdbot / Moltbot 1-Click RCE)
一个 ?gatewayUrl= 参数偷走 token 再回连你自己机器上的 agent,一次点击拿到 shell
2025-08-12
CVE-2025-53773(GitHub Copilot 自提权 RCE)
一句藏在仓库里的话让 Copilot 给自己关掉确认弹窗,然后跑命令——补丁只补了写入那一格
2025-08-11
CVE-2025-55284(Claude Code 经 DNS 外带数据)
白名单里的 ping 让 agent 把 .env 里的 key 编成子域名发出去,零确认框
2025-08-01
CVE-2025-54135 / CurXecute(Cursor 通过 MCP 配置文件被注入到 RCE)
一条公开 Slack 频道的陌生人留言,让 Cursor 自己写下 mcp.json 并执行——落盘即启动,拒绝已经晚了
2025-06-11
EchoLeak (CVE-2025-32711)
微软 365 Copilot 的零点击数据外泄:一封没人点开的邮件,穿过四道防线
系统与工具 · 1
2023-12-07
Llama Guard(Meta 内容安全分类器系列)
把安全策略当 prompt 执行的 8B 分类器,输出只有两行;828 篇论文拿它当裁判
防御机制 · 11
2025-09-23
Qwen3Guard(阿里 Qwen 团队的安全护栏模型系列)
三档安全判定 + token 级流式头的开源护栏;自报榜单漂亮,换一批没见过的越狱话术就掉到 33.8%
2025-05-20
ShieldVLM(清华 CoAI,多模态隐性毒性护栏)
把「图无害、文也无害、拼一起有害」的检出率从 52% 拉到 89%——但那 89% 测在自产同分布集上
2025-03-24
CaMeL (Capabilities for Machine Learning)
把 prompt injection 降级成信息流控制问题的 agent 防御:AgentDojo 上 233 次成功攻击压到 0,代价是 84%→77%
2024-10-07
SecAlign(含 Meta SecAlign)
用 DPO 把「别听数据里的指令」训进模型;官方口径 ASR<10%,第三方一放宽预算就 88–96% 被攻破
2024-07-31
ShieldGemma
Google 基于 Gemma 2 的开源安全分类器:官方 +10.8% AU-PRC,第三方横评漏掉 54.51% 有害内容
2024-07-23
Llama Prompt Guard(Meta 的注入/越狱分类器,v1 86M / v2 86M+22M)
86M 参数的 BERT 系二分类器:厂商私有集 97.5% 召回,字母间敲空格就掉到 0.2%
2024-06-26
WildGuard(AI2 的 7B 安全审核分类器 / WildGuardMix 数据集)
自测 88.9 F1 的开源审核模型,换个测试集掉到 70.8,多轮攻击下 96% 照过——而 256 篇论文拿它当尺子
2023-10-05
SmoothLLM(随机字符扰动 + 多数投票的越狱防御)
把输入随机改掉 10% 的字符、跑 N 份再投票:GCG 后缀被打到 1% 以下,通顺的语义越狱照样进来一半。
2023-06-16
Self-Reminder(系统模式自我提醒)
在用户输入前后各贴一句「请负责任地回答」——最便宜的越狱防御,也是被第三方拆得最彻底的一个
2020-11-20
ONION(Outlier-word detection backdoor defense)
把句子里每个词轮流抠掉,看 GPT-2 困惑度掉多少,掉得多的那个词判为后门触发词删掉
2020-11-09
Detoxify (unitaryai/detoxify)
一个 2020 年的 Kaggle 遗产分类器,被 157 篇论文当毒性裁判:对 GPT-4 写的仇恨内容 F1 只有 0.598
没有匹配的条目。