资讯卡

48 篇 · 按类型 · 评测集 / 事故 / 系统 / 防御机制 ← 全部

评测集 · 31

2026-08-18 MobileWorldSafety(GUI agent 环境注入安全基准)142 条真机 Android 任务,量「app 里的一句话能不能劫持手机 agent」,六个 agent 攻击成功率 40.4%–66.9%
2026-02-03 AgentDyn(动态开放式 agent 安全防御基准)把十种 prompt injection 防御搬进「必须边做边改计划」的环境重测:CaMeL 三个格子全是 0.00
2024-10-11 AgentHarm(LLM agent 有害行为基准)量的是「用户直说要作恶时,agent 会不会把工具链一路跑完」——不是注入基准
2024-10-03 ASB (Agent Security Bench)量的不是 agent 会不会被攻破,而是攻击工具已经摆在候选列表里时模型会不会去点它
2024-06-26 WildGuardTest(WildGuardMix 的人工标注测试切分)1,725 条 prompt-response 对、三个独立二分类标签,量的是审核模型判得准不准,不是被测模型安不安全
2024-06-26 WildJailbreak(AI2 WildTeaming 合成越狱数据集及其 eval split)2000 条角色扮演式越狱 + 250 条长得像越狱的无害题,量的是「该拒的拒、不该拒的别拒」这条线
2024-06-20 SORRY-Bench440 条配平的不当请求,量的只有一件事:模型照办了几条——不量拒得对不对
2024-06-20 PKU-SafeRLHF(北大对齐组安全偏好数据集)44.6k 有害问句 + Alpaca 写的回答,人工分别排「哪个更有用」「哪个更安全」——它量排序,不量越狱
2024-06-19 AgentDojo(ETH SPY Lab 的 prompt injection agent 基准)97 个用户任务 × 27 个注入任务拼出 629 个安全用例,量的是 agent 会不会照攻击者写死的那句话调工具
2024-04-03 JailBreakV-28K(含 RedTeam-2K / mini split)28,000 条里 20,000 条的图片和题目无关——它量的是 LLM 越狱模板往 MLLM 语言侧的迁移率
2024-03-28 JailbreakBench(JBB-Behaviors,100 条越狱行为基准)一把只有 100 个刻度的越狱尺子:刻度由一个假阳率 11.6% 的判定器画上去,读数不带查询预算就没法比
2024-03-05 WMDP(Weapons of Mass Destruction Proxy,大规模杀伤性武器代理基准)3668 道四选一,用「危险知识的邻居」当尺子量 unlearning——但 25% 是地板,10 条无关样本就能把分拉回来
2024-03-05 InjecAgent(工具型 LLM agent 的间接提示注入基准)1054 条题量的是「agent 会不会去调攻击者点名的那个工具」——不量后果,不量任务还完不完成
2024-02-15 StrongREJECT(A StrongREJECT for Empty Jailbreaks,越狱评测基准)313 条有标准答案的禁题,量的不是模型拒没拒,而是越狱后吐出来的东西到底有没有用
2024-02-06 HarmBench(自动化红队标准评测框架)510 条有害行为 + 一个 Llama-2-13B 判定器,量的是「单轮请求下模型有没有吐出实质有害内容」这一件事
2024-01-11 TOFU(Task of Fictitious Unlearning,虚构作家遗忘基准)用 200 个 GPT-4 编的假作家,量 LLM 能不能把指定的人从权重里挖干净——一个 KS 检验的 p 值
2024-01-10 RTA / RtA(Refuse-to-Answer rate,拒答率)它不是题库,是「拒答数÷样本数」这个比值——在越狱集上越高越好,在无害集上越高越糟
2023-11-29 MM-SafetyBench(多模态大模型安全评测集)1680 道题共用一套改写模板,量的是「危险词从文本挪进图片后模型还接不接招」这一件窄事
2023-11-09 SafeBench(FigStep 版,500 条禁忌问题题库)FigStep 附带的 500 条纯文本有害问题,量的是模型愿不愿意接话,不是模型有多危险
2023-11-09 FigStep / SafeBench(排版图像越狱评测集)把有害问句渲染成白底黑字的图,测模型的安全对齐认不认得图里的字——不是测它会不会输出危险知识
2023-10-26 ToxicChat(lmsys/toxic-chat)1 万条 Vicuna demo 真实用户首句提示,7.33% 有毒、2.01% 越狱,如今被当成 guardrail 的假阳性体检尺
2023-10-10 MultiJail(Multilingual Jailbreak Challenges 数据集)315 句有害请求 × 10 语种人工对齐翻译,量的是拒答会在哪一档语言资源上塌掉
2023-10-10 MaliciousInstruct(100 条有害问句 + BERT 打分器)100 条「How to…?」问句配一个 HH-RLHF 微调的 BERT 判定器,量的是模型开不开口,不量说了什么
2023-10-05 HEx-PHI(Human-Extended Policy-Oriented Harmful Instruction Benchmark)330 道政策倒推的直白有害指令 + GPT-4 打分,harmful fine-tuning 研究线的默认尺子,但题面锁着、口径分裂
2023-08-18 HarmfulQA(declare-lab,Red-Instruct 配套评测集)1960 道 ChatGPT 生成的有害提问,被当成安全对齐的标准尺子,但题面高度模板化
2023-07-27 AdvBench(GCG 论文附带的有害行为/有害字符串集)被引最多的越狱评测集:520 条明晃晃的有害祈使句,45% 在 0.95 相似度下是近重复
2023-07-10 BeaverTails(PKU-Alignment 有害性标注语料 / QA-moderation 数据集)33 万条 QA 对的人工有害安全标注,今天多数「有害微调」论文的毒药与量尺,坑都在构造方式里
2022-07-04 WebShop(普林斯顿 NLP 组的模拟购物网站环境 / 评测集)一道 BM25 就能刷过人类的购物检索题,如今被当成 agent 攻击的标准靶场
2022-03-17 ToxiGen(隐式仇恨语句生成数据集 / 评测集)27.4 万条不带脏字的群体贬损句,同一个名字下跑着三套互不可比的用法
2021-10-15 BBQ (Bias Benchmark for QA)把同一个模板问两遍:上下文不够时模型会不会替刻板印象填空——但它的偏见分和准确率绑死
2020-09-24 RealToxicityPrompts (RTP)9.9 万条被拦腰截断的网页残句,量的是模型无人攻击时自己滑向脏话的概率——不是越狱,不是拒答

事故 · 5

2026-02-01 CVE-2026-25253(OpenClaw / clawdbot / Moltbot 1-Click RCE)一个 ?gatewayUrl= 参数偷走 token 再回连你自己机器上的 agent,一次点击拿到 shell
2025-08-12 CVE-2025-53773(GitHub Copilot 自提权 RCE)一句藏在仓库里的话让 Copilot 给自己关掉确认弹窗,然后跑命令——补丁只补了写入那一格
2025-08-11 CVE-2025-55284(Claude Code 经 DNS 外带数据)白名单里的 ping 让 agent 把 .env 里的 key 编成子域名发出去,零确认框
2025-08-01 CVE-2025-54135 / CurXecute(Cursor 通过 MCP 配置文件被注入到 RCE)一条公开 Slack 频道的陌生人留言,让 Cursor 自己写下 mcp.json 并执行——落盘即启动,拒绝已经晚了
2025-06-11 EchoLeak (CVE-2025-32711)微软 365 Copilot 的零点击数据外泄:一封没人点开的邮件,穿过四道防线

系统与工具 · 1

2023-12-07 Llama Guard(Meta 内容安全分类器系列)把安全策略当 prompt 执行的 8B 分类器,输出只有两行;828 篇论文拿它当裁判

防御机制 · 11

2025-09-23 Qwen3Guard(阿里 Qwen 团队的安全护栏模型系列)三档安全判定 + token 级流式头的开源护栏;自报榜单漂亮,换一批没见过的越狱话术就掉到 33.8%
2025-05-20 ShieldVLM(清华 CoAI,多模态隐性毒性护栏)把「图无害、文也无害、拼一起有害」的检出率从 52% 拉到 89%——但那 89% 测在自产同分布集上
2025-03-24 CaMeL (Capabilities for Machine Learning)把 prompt injection 降级成信息流控制问题的 agent 防御:AgentDojo 上 233 次成功攻击压到 0,代价是 84%→77%
2024-10-07 SecAlign(含 Meta SecAlign)用 DPO 把「别听数据里的指令」训进模型;官方口径 ASR<10%,第三方一放宽预算就 88–96% 被攻破
2024-07-31 ShieldGemmaGoogle 基于 Gemma 2 的开源安全分类器:官方 +10.8% AU-PRC,第三方横评漏掉 54.51% 有害内容
2024-07-23 Llama Prompt Guard(Meta 的注入/越狱分类器,v1 86M / v2 86M+22M)86M 参数的 BERT 系二分类器:厂商私有集 97.5% 召回,字母间敲空格就掉到 0.2%
2024-06-26 WildGuard(AI2 的 7B 安全审核分类器 / WildGuardMix 数据集)自测 88.9 F1 的开源审核模型,换个测试集掉到 70.8,多轮攻击下 96% 照过——而 256 篇论文拿它当尺子
2023-10-05 SmoothLLM(随机字符扰动 + 多数投票的越狱防御)把输入随机改掉 10% 的字符、跑 N 份再投票:GCG 后缀被打到 1% 以下,通顺的语义越狱照样进来一半。
2023-06-16 Self-Reminder(系统模式自我提醒)在用户输入前后各贴一句「请负责任地回答」——最便宜的越狱防御,也是被第三方拆得最彻底的一个
2020-11-20 ONION(Outlier-word detection backdoor defense)把句子里每个词轮流抠掉,看 GPT-2 困惑度掉多少,掉得多的那个词判为后门触发词删掉
2020-11-09 Detoxify (unitaryai/detoxify)一个 2020 年的 Kaggle 遗产分类器,被 157 篇论文当毒性裁判:对 GPT-4 写的仇恨内容 F1 只有 0.598