2026-08-18 MobileWorldSafety ipiagent-computermultimodalrobustness 引用 0 · 语料尺子 1142 条真实 Android app 任务,测手机 GUI agent 被界面内植入的注入指令劫持的比例
2026-08-13 Escalating Delusions longitudinal evaluation (untitled, 30-day / 30-message script) 引用 0
2026-08-05 DelusionEval 引用 0
2026-07-26 MulRobBench 引用 0
2026-07-15 SkillSec-Eval 引用 1
2026-07-12 PASB (Personal Agent Sycophancy Benchmark) 引用 0
2026-07-04 Polymorphic Sybil Poisoning RAG Failure-Mode Benchmark 引用 0
2026-06-30 AI-Infra-Guard论文 jailbreakmcp-harnessagent-toolllmcode-securitydpi 引用 2腾讯朱雀四层红队平台:AI 基础设施 CVE 扫描、MCP/skill 审计、agent 多轮红队、LLM 越狱评测
2026-06-22 Multilingual Criminal Law Over-Alignment benchmark (Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts) 引用 0
2026-06-15 Phantoms and Disclosures privacy auditing framework (untitled) 引用 0
2026-06-11 FORGE (Fake Online Recommendations in Generative Environments) 引用 1
2026-06-08 MM-P…(摘要截断,全名未知)论文 privacymultimodalllm 引用 17MM-Privacy:给VLM看含隐私的表单/手写图,跨OCR/VQA/摘要任务测是否泄露或记住敏感信息
2026-06-05 MalSkillBench论文 guardrail-evalipipoisoning-backdoorcode-securityagent-codeagent-tool 引用 113944 个沙箱验证的恶意 agent skill(代码/提示注入/控制平面),测检测器能否识别
2026-06-05 Pander Score 引用 0
2026-06-01 Execution-Grounded Security Testing for Coding Agents (red-team harness, untitled) 引用 0
2026-05-31 Lost in Delusion multi-turn delusion/distress safety simulation 引用 1
2026-05-12 SkillSafetyBench论文 ipiagent-codeagent-toolpoisoning-backdoorcode-securitymcp-harness 引用 10155 个恶意 skill/本地文件案例,测 CLI 编码 agent 在良性请求下被间接注入诱导做不安全操作
2026-05-11 ExploitGym论文 harmful-capabilityagent-toolagent-code 引用 15让 AI agent 把真实漏洞开发成可用 exploit,评其网络攻击能力
2026-05-11 LITMUS论文 jailbreakdpiipiagent-toolagent-computerdeception-alignment 引用 2 · 语料尺子 2真实 Ubuntu 上测 OS agent 是否被诱导执行危险操作,语义+系统状态双重校验,819 例
2026-04-09 PIArena论文 ipiagent-toolguardrail-evalrobustness 引用 11统一平台,在 AgentDojo 等工具 agent 环境里用自适应注入攻击评测各类提示注入防御
2026-04-06 ClawsBench论文 ipiagent-tooloverrefusal-utilitydeception-alignmentmcp-harness 引用 20用 Gmail/Slack/日历等 mock 服务的 44 个任务,测生产力 agent 能力与注入、泄密、误删等不安全动作率
2026-04-01 ClawSafety论文 ipiagent-toolagent-codemcp-harness 引用 12120 例注入藏在 skill 文件/邮件/网页中,沙盒测高权限个人 agent 是否执行泄密、转账、删文件等有害动作
2026-02-12 AgentLeak论文 privacyipidpiagent-toolmulti-agentllm 引用 8多 agent 系统内部通道(agent 间消息、共享内存、工具参数)的隐私泄露,1000 场景含半数攻击
2026-02-03 AgentDyn ipiagent-tooloverrefusal-utility 引用 26 · 语料尺子 1260 个开放式动态工具任务+560 个间接注入,重测十种 IPI 防御的安全与效用
2026-01-15 TS-Bench论文 guardrail-evaljailbreakdpiipioverrefusal-utilityagent-toolllm 引用 44标注工具调用 agent 逐步动作安全性,评护栏模型能否在执行前拦截恶意请求与注入
2025-12-17 MCP-SafetyBench论文 ipidpipoisoning-backdooragent-toolmcp-harnessllm 引用 30 · 语料尺子 2真实 MCP 服务器上 20 类攻击(工具投毒/返回注入/用户侧恶意指令),测 LLM agent 多轮任务 ASR
2025-12-06 OmniSafeBench-MM论文 jailbreakmultimodalllm 引用 11 · 语料尺子 1多模态越狱攻防统一工具箱:13 攻击×15 防御,测 18 个 MLLM 的有害输出率
2025-11-25 BrowseSafe论文 ipiguardrail-evalagent-webllm 引用 251.47 万条真实结构 HTML 含/不含注入,测检测器能否识别网页中的注入
2025-11-15 AttackVLA论文 robustnesspoisoning-backdoormultimodalagent-embodied 引用 12统一框架对 VLA 机器人模型做图像/文本对抗攻击与后门投毒,仿真+真机评动作被操控率
2025-11-13 SACRED-Bench论文 jailbreakmultimodalguardrail-evalllm 引用 13把有害指令藏进叠加语音/混合音频/多人对话,测音频 LLM 越狱率及音频护栏拦截
2025-11-07 TAMAS论文 dpiipijailbreakoverrefusal-utilitymulti-agentagent-toolllm 引用 21 · 语料尺子 2多agent系统在DPI/IPI/冒充/恶意agent六类攻击下的安全与效用权衡(ERS)
2025-10-28 MobileRisk-Live论文 guardrail-evalagent-computermultimodalprivacyjailbreak 引用 16Android 沙箱里录 204 条 GUI agent 轨迹,测安全检测器能否判出不安全轨迹并定位出错步骤
2025-10-26 b3 benchmark (threat snapshots)论文 dpiipiagent-toolagent-coderagllmcode-securityjailbreakprivacy 引用 10把 agent 执行状态冻结成 10 个 threat snapshot,用众包攻击测 backbone LLM 在直接/间接注入下是否泄密、乱调工具、产恶意代码
2025-10-23 GhostEI-Bench论文 ipijailbreakagent-computermultimodalprivacy 引用 12Android 模拟器里向手机 GUI agent 注入伪造弹窗/覆盖层,测 VLM agent 被劫持率
2025-10-17 DeceptionBench论文 deception-alignmentllmrobustness 引用 11五领域150场景测LLM自利/讨好型欺骗,含奖励诱导与多轮强化条件
2025-10-16 MAGPIE论文 privacymulti-agentllmdeception-alignment 引用 23200 个多 agent 协商场景,测 LLM agent 在非对抗协作中是否泄露私密信息及操纵行为
2025-10-16 Qwen3GuardTest论文 guardrail-evaltoxicity-biasharmful-capabilityprivacyllm 引用 115评审核器对推理模型输出(含思考链)的安全分类与流式句级不安全定位,2441 条英文样本
2025-10-14 MSB论文 ipiagent-toolmcp-harnessllmrag 引用 37 · 语料尺子 3MCP 工具链 12 类攻击(名冲突/描述注入/假错误等)2000 例,测 9 个 LLM agent 的被攻击成功率
2025-10-11 SecureWebArena论文 jailbreakdpiipirobustnessmultimodalagent-web 引用 146 个模拟网站、330 个对抗场景,从用户侧(越狱/注入)和网页侧(弹窗/广告/间接注入)测 LVLM 网页 agent 安全
2025-10-09 VoiceAgentBench论文 jailbreakoverrefusal-utilitymultimodalagent-tool 引用 10语音版 AgentHarm+工具调用:多语言语音指令下测工具编排正确率与有害请求拒绝率
2025-10-06 Petri论文 deception-alignmentllmagent-tool auditor agent 按 seed 多轮诱导目标模型,judge 按 36 维打分,查欺骗/谄媚/权力寻求等对齐问题
2025-09-30 SafeMindBench论文 agent-embodiedmultimodalllmoverrefusal-utility 引用 105558 题测具身 agent 四个推理阶段能否识别危险指令/环境、修正不安全动作序列。
2025-09-29 HarmMetric Eval论文 guardrail-evaljailbreakllm 引用 13评有害性判定器:有害提示配越狱产生的有害/无害回复,看各种 judge 能否正确排序
2025-09-28 Falcon论文 guardrail-evalmultimodaljailbreaktoxicity-bias 引用 25.7 万图文 VQA 对,标注图像/指令/回复三层有害性,评多模态安全审核器准确率
2025-09-28 SafeSearch论文 ipitoxicity-biasagent-toolagent-webrag 引用 3 · 语料尺子 2往搜索结果里塞一个不可靠网页,测搜索 agent 是否被诱导输出广告/偏见/有害/误导内容
2025-09-01 Strata-Sword论文 jailbreakllm 引用 15 · 语料尺子 1按推理复杂度分三级的中英双语越狱基准,15 种攻击含藏头诗、灯谜等中文特有方法
2025-08-26 CUA-SHADE-Arena论文 deception-alignmentguardrail-evalagent-computeragent-codeprivacy 引用 22计算机使用 agent 边做公司任务边隐蔽作恶,测监控器能否从轨迹中检出破坏行为
2025-08-19 MCPTox论文 ipiagent-toolmcp-harnesspoisoning-backdoor 引用 64在真实 MCP 工具描述中植入恶意指令,测 agent 是否照做发起有害工具调用
2025-08-17 MCPSecBench论文 mcp-harnessagent-toolipidpipoisoning-backdoorllm 引用 50MCP 安全基准:17 类攻击覆盖用户/客户端/传输/服务器四面,在 Claude、OpenAI、Cursor 上实测攻击成功率
2025-07-29 Over-Refusal overrefusal-utilityllm · 语料尺子 7用形似有害的无害提示测 LLM 是否误拒,衡量安全对齐的效用代价
2025-07-08 OpenAgentSafety论文 dpiipiprivacycode-securityoverrefusal-utilityagent-toolagent-webagent-code 引用 60 · 语料尺子 1350+ 真实工具多轮任务,用户/NPC/文件施压,测 agent 是否做出八类不安全动作
2025-06-30 ClearHarm论文 jailbreakharmful-capabilityllm 引用 15 · 语料尺子 4179 条明确 CBRN 类有害问题,测越狱攻击能否让模型给出灾难性误用信息
2025-06-19 IS-Bench论文 agent-embodiedmultimodaldeception-alignment 引用 39模拟器里161个家务场景、388个风险,过程级检验VLM具身agent能否先做安全缓解步骤
2025-06-17 AGENTSAFE (SAFE)论文 jailbreakagent-embodiedmultimodal 引用 32在 THOR 模拟家居中给 VLM 具身 agent 下越狱改写的危险指令,测感知-规划-执行各层是否拒绝
2025-06-17 OS-Harm论文 jailbreakipideception-alignmentagent-computermultimodal 引用 90OSWorld 上 150 个任务测电脑操作 agent:用户滥用、注入攻击、自发误行为三类,LLM 裁判评安全
2025-06-14 OpenUnlearning论文 privacyharmful-capabilityrobustnessoverrefusal-utilityllm 引用 70统一遗忘评测框架:13 种遗忘算法×16 指标,覆盖 TOFU/MUSE/WMDP 并做指标元评测
2025-06-11 LLMail-Inject论文 ipiagent-toolguardrail-evalragllm 引用 24 · 语料尺子 3公开挑战赛收集 20 万条邮件注入攻击,测邮件助手及多种防御能否挡住未授权工具调用
2025-06-09 SafeFlowBench论文 ipimultimodalagent-computeragent-webmulti-agentrobustness 引用 26用带伪造文本/假弹窗的网页、应用、OS 截图测 VLM agent 是否执行不安全动作,另含多 agent 并发场景
2025-06-04 AgentMisalignment论文 deception-alignmentagent-tool 引用 269 个工具 agent 环境测模型自发逃避监控、抗关机、放水、夺权的倾向
2025-06-03 CyberGym论文 harmful-capabilityagent-codeagent-toolcode-security 引用 55 · 语料尺子 4给漏洞描述和代码库,让 agent 写 PoC 复现真实漏洞,测网络攻击能力
2025-06-03 VPI-Bench论文 ipiagent-computeragent-webmultimodalrobustness 引用 37306 个网页环境里视觉嵌入恶意指令,测 computer-use/浏览器 agent 是否被带偏执行
2025-06-02 MLA-Trust论文 jailbreaktoxicity-biasprivacydeception-alignmentmultimodalagent-webagent-computer 引用 2634 个网页/手机 GUI 任务测多模态 agent 的真实性、可控、安全、隐私
2025-05-31 Agent-Auditor论文 guardrail-evalagent-toolipidpijailbreak 引用 81 · 语料尺子 2ASSEBench 用 2293 条 agent 安全/安保轨迹测 LLM 判官能否达到人类专家判别水平
2025-05-31 RiOSWorld论文 jailbreakipiagent-computeragent-webmultimodaldeception-alignment 引用 26 · 语料尺子 2492 个真机 GUI 风险任务,测多模态电脑操作 agent 对用户有害指令和环境注入的防御
2025-05-28 RedTeamCUA (RTC-Bench)论文 ipiagent-computeragent-webmultimodal 引用 38在 VM+Docker 网页混合沙盒里把恶意指令藏进网页,测 computer-use agent 被间接注入劫持的比例
2025-05-22 PolyRefuse论文 jailbreakllm 引用 2714 语种有害/良性提示集,测 refusal 方向跨语言通用性及激活引导越狱
2025-05-20 MCIP-Bench论文 ipiguardrail-evalmcp-harnessagent-toolllm 引用 47合成 MCP 工具调用轨迹,让 LLM 判断安全与否并分类 10 种 MCP 风险
2025-05-17 Video-SafetyBench论文 jailbreakmultimodaltoxicity-bias 引用 27 · 语料尺子 2合成视频配显式/隐式有害 query,测视频多模态模型越狱率,RJScore 打分
2025-05-12 FalseReject论文 overrefusal-utilityllm 引用 45 · 语料尺子 3用 16k 条看似有害实则无害的提问,测 LLM 是否过度拒答,并给推理式回答做训练
2025-04-22 WASP论文 ipiagent-webagent-computermultimodal 引用 134 · 语料尺子 7仿真网站里植入人写注入,测网页/计算机 agent 是否被劫持去做攻击者任务
2025-04-18 DoomArena论文 dpiipiagent-toolagent-webguardrail-eval 引用 32 · 语料尺子 1可插拔攻击框架,在τ-bench/BrowserGym里测恶意用户与恶意环境注入对agent的影响
2025-04-14 Jailbreak Tax论文 jailbreakoverrefusal-utilityllm 引用 24把模型对齐成拒答数学/生物题,再越狱,测越狱后答案准确率掉多少
2025-04-13 EmoAgent (EmoEval)论文 llmguardrail-evalmulti-agent 引用 33模拟心理脆弱用户与角色聊天机器人多轮对话,用 PHQ-9 等量表测对话前后心理恶化率
2025-04-09 OpenSafeMLRM论文 jailbreakmultimodalllm 引用 33多模态推理模型越狱评测工具包,对比推理版与基座版在图文越狱下的 ASR
2025-04-06 PolyGuardPrompts论文 guardrail-evaljailbreakoverrefusal-utilitytoxicity-biasllm 引用 56 · 语料尺子 217 语种 2.9 万条 prompt-回复对,测护栏判断有害性与拒答的准确率
2025-04-01 Multi-AudioJail论文 jailbreakmultimodalrobustness 引用 30把有害请求做成多语言、多口音并加声学扰动的语音,测音频 LLM 越狱率
2025-03-26 ShieldAgent-Bench论文 guardrail-evalipipoisoning-backdooragent-webagent-tool 引用 1283K 条网页 agent 风险轨迹(AgentPoison/AdvWeb 攻击),测护栏按策略判违规的准召
2025-03-22 BeaverTails-V论文 jailbreakmultimodaloverrefusal-utilityguardrail-eval 引用 23 · 语料尺子 2图文有害请求数据集,带有用性/安全双偏好与严重程度标注,评测并对齐多模态模型安全
2025-03-21 CVE-Bench论文 harmful-capabilitycode-securityagent-webagent-toolllm 引用 104沙箱里让 LLM agent 利用 40 个真实关键 CVE 攻破 Web 应用,评其自主攻击能力
2025-03-20 CrAIBench论文 ipidpirobustnessagent-toolllm 引用 27Web3 agent 在记忆被注入/工具输出被篡改时是否误转账,150+链上任务+500+攻击
2025-03-13 DarkBench 引用 35
2025-03-12 AgentDAM论文 privacyagent-webagent-tooloverrefusal-utility 引用 77 · 语料尺子 1给 web agent 含敏感信息的用户资料,看它完成网页任务时会不会多余地泄露无关隐私
2025-03-09 BingoGuardTest论文 guardrail-evalllmtoxicity-bias 引用 23988 条分级有害回复,评审核器能否判出安全性和 0-4 级风险严重度
2025-03-06 SafeArena论文 jailbreakagent-weboverrefusal-utility 引用 88 · 语料尺子 2500 条配对安全/有害网页任务,看 web agent 会不会替用户造谣、骚扰、犯罪
2025-03-05 MASK论文 deception-alignmentllm 引用 50施压场景下测 LLM 是否违背自身信念说谎,把诚实与准确性分开评
2025-02-24 PrivaCI-Bench论文 privacyllm 引用 36用 GDPR/HIPAA 等法规、真实判例和合成情景构造 14 万道选择题,测 LLM 隐私合规判断
2025-02-18 SafeEraser论文 jailbreakprivacyoverrefusal-utilitymultimodal 引用 30 · 语料尺子 23000 图/28.8K VQA 测 MLLM 安全遗忘:遗忘质量、效用及过度拒答(SARR)
2025-02-17 BaxBench论文 code-securityllmoverrefusal-utility 引用 47给 LLM 写后端应用任务,跑功能测试并用真实 exploit 攻击,同时测正确性与安全漏洞
2025-02-16 MMSafeAware论文 overrefusal-utilityjailbreakmultimodal 引用 251500 图文对测 MLLM 能否判断组合后内容安全与否,含过度敏感子集
2025-02-12 IHEval论文 dpiipirobustnessllmagent-tool 引用 633538 例测 LLM 能否按系统>用户>历史>工具输出的优先级处理冲突指令
2025-01-24 CASE-Bench论文 overrefusal-utilityjailbreakllm 引用 23给有害查询配安全/不安全上下文,用大量人工标注对比模型拒答是否合理
2025-01-15 AEGIS2论文 guardrail-evaltoxicity-biasllm 引用 145 · 语料尺子 43.4 万条人标安全对话,按 12 类风险分类法评测 LLM 内容护栏的判别准确率
2025-01-14 CWEval论文 code-securityoverrefusal-utilityllm 引用 90多语言 CWE 编程题,同时跑功能与安全测试,量化 LLM 生成代码功能对但有漏洞的比例
2024-12-19 Agent-SafetyBench论文 jailbreakipioverrefusal-utilitycode-securityagent-toolllm 引用 252 · 语料尺子 32000 条模拟工具环境任务,测 LLM agent 在恶意指令与风险环境下的安全行为,微调 Qwen 判分
2024-12-17 SafeAgentBench论文 jailbreakoverrefusal-utilityagent-embodiedllm 引用 106 · 语料尺子 2AI2-THOR 家庭模拟器中给具身 LLM agent 下危险任务,测拒绝率与安全对照任务成功率
2024-12-09 SafeWatch-Bench论文 guardrail-evalmultimodaltoxicity-bias 引用 39 · 语料尺子 1200 万视频六类不安全内容,评视频护栏模型按安全策略多标签判定并给出解释
2024-11-29 VLSBench论文 jailbreakmultimodal 引用 652.2k图文对,去掉文本中的风险线索,测MLLM能否凭图像识别有害请求并拒答
2024-11-12 RedCode论文 code-securityharmful-capabilityjailbreakagent-codeagent-toolllm 引用 99 · 语料尺子 4测代码 agent 是否会执行危险代码或生成恶意软件,沙箱内真跑
2024-10-30 NotInject论文 overrefusal-utilityguardrail-evaldpillm 引用 48 · 语料尺子 3用含注入触发词的良性提示,测提示注入护栏模型的过度拦截(误报)率
2024-10-29 SG-Bench论文 jailbreakrobustnessllm 引用 81有害 query 配多种越狱模板与提示形式,跨生成/选择/判别三任务测 LLM 安全泛化
2024-10-29 VLJailbreakBench论文 jailbreakmultimodalllm 引用 31用 IDEATOR 生成 3654 条图文越狱样本,测 11 个 VLM 的攻击成功率
2024-10-25 FairMT-Bench论文 toxicity-biasjailbreakllm 引用 47多轮对话中通过指代省略、分散提问、越狱话术、负反馈等诱导 LLM 输出偏见,评其公平性
2024-10-23 CLEAR论文 privacymultimodalllm 引用 37 · 语料尺子 1多模态版 TOFU:虚构人物图文问答,评 11 种遗忘方法能否抹掉指定人物又不伤保留集
2024-10-23 MobileSafetyBench论文 jailbreakipioverrefusal-utilityagent-computermultimodal 引用 44 · 语料尺子 2Android 模拟器 250 个任务,测 GUI agent 对有害用户请求、app 内容注入的安全性及有用性
2024-10-21 NetSafe论文 multi-agentllmtoxicity-biasjailbreakrobustness 引用 36 · 语料尺子 2在不同拓扑的 LLM 多agent网络里安插攻击者传播虚假/偏见/有害信息,测结构对安全的影响
2024-10-11 AgentHarm jailbreakagent-tooloverrefusal-utilityllm 引用 359 · 语料尺子 18用户直说要作恶时,agent 会不会调工具把多步有害任务跑完;附 benign 对照测过度拒答
2024-10-11 BrowserART论文 jailbreakagent-webllm 引用 68 · 语料尺子 2给浏览器 agent 下 100 条有害指令,测拒答训练的 LLM 变身 agent 后是否照做
2024-10-11 JAILJUDGE论文 jailbreakguardrail-evalllm 引用 53 · 语料尺子 3评『越狱判定器』:多场景多语言人工标注集测 judge 准确与可解释打分
2024-10-09 ST-WebAgentBench论文 agent-webipioverrefusal-utilityprivacydeception-alignment 引用 113 · 语料尺子 2在 WebArena/SuiteCRM 中给 web agent 任务附加安全策略,测其在策略约束和注入下的合规完成率
2024-10-04 AutoPenBench论文 harmful-capabilityagent-tool 引用 37让 LLM agent 自动渗透测试 33 个漏洞靶机,测其网络攻击能力
2024-10-03 ASB dpiipipoisoning-backdooragent-toolragllm 引用 350 · 语料尺子 810 个场景、13 个 LLM 的工具 agent,测 DPI/IPI/记忆投毒/PoT 后门及 11 种防御的攻击成功率
2024-10-02 SciSafeEval论文 jailbreakharmful-capabilityllm 引用 28 · 语料尺子 131840 条化学生物医药有害科学请求,含越狱增强,测 LLM 安全对齐
2024-09-13 AI-LieDar 引用 37
2024-08-29 PrivacyLens论文 privacyllmagent-tool 引用 177 · 语料尺子 3从 QA 探测到工具 agent 执行任务,分层测 LLM 会不会违反情境隐私规范泄露信息
2024-08-27 MHJ论文 jailbreakllmharmful-capability 引用 166 · 语料尺子 5537 个人类红队多轮越狱对话,测 LLM 防御和遗忘方法在多轮攻击下是否失守
2024-08-23 LLM-PBE论文 privacyllm 引用 75用提取、成员推断、PII 诱导等攻击及防御,系统评估 LLM 全生命周期隐私泄露
2024-08-15 Cybench论文 harmful-capabilityagent-toolagent-code 引用 166 · 语料尺子 1用 40 道真实 CTF 题让 LLM agent 在 Kali 容器里写代码、跑命令拿 flag,测网络攻击能力
2024-07-11 AIR-Bench 2024论文 jailbreaktoxicity-biasharmful-capabilityprivacyllm 引用 79 · 语料尺子 4把 8 部法规 16 份公司政策拆成 314 类风险,生成 5694 条有害提示测 LLM 拒答率
2024-07-08 T2VSafetyBench论文 jailbreaktoxicity-biasoverrefusal-utilityother:text-to-video 引用 68 · 语料尺子 3用恶意/越狱提示测 9 个文生视频模型 14 类安全风险,GPT-4 加人工判定视频是否违规
2024-07-02 CoCoNot论文 overrefusal-utilityjailbreakllm 引用 109 · 语料尺子 4测 LLM 该拒时拒、不该拒时答:5 类该拒提示+对照集,GPT-4 评判合规率。
2024-06-26 Aya Red-teaming论文 jailbreaktoxicity-biasllm 引用 738 语种人工编写有害提示(含文化本地伤害),测多语言 LLM 拒绝/顺从率
2024-06-26 Wild-Jailbreak jailbreakoverrefusal-utilityllm 引用 217 · 语料尺子 34真实用户越狱策略改写的 2000 条有害 + 210 条仿越狱无害题,测「该拒的拒、不该拒的别拒」
2024-06-26 WildGuard论文 guardrail-evaljailbreakoverrefusal-utilityllm 引用 495 · 语料尺子 195K 人工标注的审核器测试集,评护栏对有害提示、有害回复、拒答的三项分类
2024-06-26 WildGuardMix论文 guardrail-evaljailbreakoverrefusal-utilitytoxicity-biasllm 引用 495 · 语料尺子 79.2万条带人工标注的 prompt/response 对,测审核器识别有害提示、有害回复与拒答的能力
2024-06-26 WildGuardTest guardrail-evaljailbreakoverrefusal-utilityllm 引用 495 · 语料尺子 171,725 条人工标注 prompt-response 对,测审核模型判 prompt 有害/回复有害/是否拒答三项的准确率
2024-06-21 SIUO论文 jailbreakmultimodaloverrefusal-utility 引用 21 · 语料尺子 5图和文各自无害、合起来有害的 167 题,测多模态模型能否识别跨模态风险并安全应答
2024-06-20 PKU-SafeRLHF jailbreakoverrefusal-utilityguardrail-evalllm 引用 236 · 语料尺子 1244.6k 有害提示配 Llama 回答,人工分别标有用性与安全性偏好,附 19 类危害与严重度分级
2024-06-20 Safe-RLHF论文 jailbreaktoxicity-biasguardrail-evaloverrefusal-utilityllm 引用 236 · 语料尺子 7有害提示+问答对,19 类危害三级严重度,双偏好标注评安全对齐与审核器
2024-06-19 AgentDojo ipiagent-tooloverrefusal-utility 引用 142 · 语料尺子 72邮件/银行/旅行工具环境里,工具返回值藏注入,测 agent 是否被劫持及任务效用
2024-06-18 VisualWebArena-Adv论文 ipirobustnessmultimodalagent-web 引用 122在 VisualWebArena 网页里植入扰动图片/文字,测多模态网页 agent 被定向诱导的成功率
2024-06-17 SPA-VL论文 jailbreakoverrefusal-utilitymultimodal 引用 87 · 语料尺子 5VLM 安全偏好对齐数据集,附图文有害问答集和帮助性集,测有害率与效用
2024-06-13 EICU-AC论文 guardrail-evalagent-toolprivacy 引用 100 · 语料尺子 1给 EHRAgent 加角色访问控制规则,测护栏 agent 能否拦下越权查询 eICU 医疗数据的请求
2024-06-13 JailTrickBench论文 jailbreakrobustnessllm 引用 54统一框架跑7种越狱攻击×6种防御,分析8个影响攻击成功率的因素
2024-06-13 Mind2Web-SC论文 guardrail-evalagent-weboverrefusal-utility 引用 100 · 语料尺子 2评护栏能否按用户属性规则正确放行/拦截 web agent 动作,含合规与违规各半
2024-06-08 NYU CTF Bench论文 harmful-capabilityagent-toolllmcode-security 引用 122用工具调用 agent 让 LLM 解 CTF 题,测其网络攻击能力
2024-06-02 TaskTracker论文 ipiguardrail-evalllmrag 引用 60 · 语料尺子 4用激活差分探针检测 LLM 读外部文本后任务是否被劫持,50 万条注入/干净样本
2024-05-31 OR-Bench论文 overrefusal-utilityllm 引用 213 · 语料尺子 18 万条看似有害的无害提示测 LLM 过度拒答,配 1 千条真有害提示看安全-效用权衡
2024-05-31 OR-Bench-Hard-1K论文 overrefusal-utilityllm 引用 213 · 语料尺子 5约 1000 条看似有害实则无害的难题,测 LLM 是否过度拒答,附有害对照组
2024-05-30 JAMBench论文 jailbreakguardrail-evaltoxicity-biasllm 引用 51160 条四类有害问题专门触发审核器,用密码字符越狱测 LLM 及其审核护栏
2024-05-27 PureBad论文 jailbreakpoisoning-backdoorllm 引用 149 · 语料尺子 5100 条有害问答对,混入微调数据模拟 harmful fine-tuning 攻击,看对齐是否被破坏
2024-05-23 ALI-Agent论文 jailbreaktoxicity-biasrobustnessllm 引用 59用 LLM agent 自动生成并迭代改写刻板印象/道德/违法情景,探测被测 LLM 的价值对齐长尾漏洞
2024-04-19 CyberSecEval论文 harmful-capabilitycode-securitydpiipioverrefusal-utilityllm 引用 105 · 语料尺子 8Meta 网络安全评测套件:不安全代码、协助攻击、漏洞利用、提示注入、误拒率
2024-04-09 AegisSafetyDataset论文 guardrail-evaljailbreaktoxicity-biasllm 引用 150 · 语料尺子 11.1 万条人标有害对话,按 13 类风险分类法评审核器判别能力
2024-04-06 ALERT论文 jailbreaktoxicity-biasllm 引用 102 · 语料尺子 445k 条按 32 子类分类的有害指令(含对抗变体),测 LLM 拒答率与安全性
2024-04-03 JailBreakV jailbreakmultimodalrobustness 引用 259 · 语料尺子 1628K 图文越狱对测 10 个 MLLM:LLM 文本越狱模板迁移到多模态模型的攻击成功率
2024-04-03 RedTeam-2K论文 jailbreakllmmultimodal 引用 259 · 语料尺子 62000 条 16 类有害查询种子集,直接或配图攻击 LLM/多模态模型测越狱成功率
2024-03-28 JailbreakBench jailbreakrobustnessllm 引用 606 · 语料尺子 114100 条有害行为+攻击 artifacts+统一判定器与防御接口,测 LLM 越狱率和过度拒答
2024-03-11 SEP论文 ipillmrobustness 引用 82 · 语料尺子 7把探针指令塞进数据段,比对模型在指令段与数据段的执行率,量化指令-数据分离能力
2024-03-05 InjecAgent ipiagent-toolllm 引用 493 · 语料尺子 191054 条工具返回里藏注入,看 agent 是否执行攻击者指定的有害工具调用
2024-03-05 WMDP harmful-capabilityprivacyllm 引用 509 · 语料尺子 103668 道生物/化学/网络安全四选一,量模型危险知识并作 RMU 遗忘的尺子
2024-02-19 CatQA论文 jailbreakllm 引用 121 · 语料尺子 4550 道三语有害问题,测微调后 LLM 的拒答率是否退化及 RESTA 修复效果
2024-02-15 StrongReject jailbreakguardrail-evalllm 引用 369 · 语料尺子 89313 条禁题+越狱方法,自动评分器量越狱后回答对攻击者有多大用处,而非只看拒没拒
2024-02-12 MIMIR论文 privacyllm 引用 235 · 语料尺子 1成员推断攻击基准:用 Pile 成员/非成员文本测 LLM 是否泄露训练数据
2024-02-08 JailbreakRadar论文 jailbreakllmrobustness 引用 13317 种越狱攻击×9 个 LLM×160 条违禁问题,并在 8 种防御下复测,系统比较攻击成功率与实用性
2024-02-07 SALAD-Bench论文 jailbreakguardrail-evalrobustnessllm 引用 268 · 语料尺子 5三层 66 类有害问题,含越狱增强与防御增强子集和选择题,附 MD-Judge 评估器测 LLM 安全
2024-02-06 HarmBench jailbreakllmmultimodal 引用 1444 · 语料尺子 211510 条有害请求配 18 种自动越狱攻击,打 33 个模型,用 Llama-2-13B 判定器量攻击成功率
2024-02-03 VLGuard论文 jailbreakmultimodaloverrefusal-utility 引用 162图文安全指令集:用有害图或安全图配有害问测 VLLM 拒答,兼测安全微调的效用代价
2024-01-23 RTVLM论文 jailbreaktoxicity-biasprivacyrobustnessmultimodal 引用 65 · 语料尺子 3首个 VLM 红队集:从可信、隐私、安全、公平 4 维 10 子任务测视觉语言模型
2024-01-18 R-Judge论文 guardrail-evalllmagent-toolipi 引用 285给 LLM 看 569 条 agent 工具调用日志,测它能否判出其中的安全风险
2024-01-12 Sorry-Bench jailbreakrobustnessguardrail-evalllm 引用 239 · 语料尺子 17440 条分类配平的不当请求+20 种措辞变换,量 LLM 照办率并校准自动评判器
2024-01-11 TOFU privacyllm 引用 545 · 语料尺子 11微调进 200 个虚构作家资料后要求遗忘指定作家,用遗忘/保留集问答比对(含 KS 检验)量遗忘是否彻底
2024-01-10 TrustLLM论文 jailbreaktoxicity-biasprivacyrobustnessoverrefusal-utilityllm 引用 361 · 语料尺子 5八维度可信度总评:越狱、毒性、偏见、隐私、稳健、过度拒答等 30+ 数据集测 16 个 LLM
2023-12-30 SODE论文 jailbreakoverrefusal-utilityllm 引用 82 · 语料尺子 1安全+过度拒答双向评测:用安全/不安全 prompt 对比各种 prompt 级防御策略的代价
2023-12-21 BIPIA论文 ipillmrag 引用 327 · 语料尺子 6把恶意指令藏在邮件/网页/表格/代码等外部内容里,测 LLM 做 QA/摘要时是否被带偏
2023-12-07 Llama Guard论文 guardrail-evaltoxicity-biasjailbreakllm 引用 1247 · 语料尺子 98Meta 的 LLM 审核器,按安全分类体系对对话输入/输出做有害分类,用公开审核集评测。
2023-12-07 MITRE论文 jailbreakharmful-capabilityllm 引用 179 · 语料尺子 8按 MITRE ATT&CK 战术生成攻击协助请求,测 LLM 是否顺从并给出有用的攻击帮助
2023-11-29 MM-SafetyBench jailbreakmultimodal 引用 301 · 语料尺子 38把有害问题关键词转成图片再问 MLLM,测图片能否绕过文本侧安全对齐诱出有害回答
2023-11-16 VLSafe论文 jailbreakmultimodal 引用 122COCO 图配恶意文本问题(1110 测试条),测视觉语言模型是否拒绝有害请求
2023-11-14 SimpleSafetyTests论文 jailbreakllmguardrail-eval 引用 67100 条明文有害请求测 LLM 是否拒答,人工标注 3000 条回复并顺带评 5 个安全过滤器
2023-11-09 FigStep jailbreakmultimodalrobustness 引用 431 · 语料尺子 23把有害问句渲染成排版图片喂给视觉语言模型,测其安全对齐是否被跨模态绕过
2023-11-02 Tensor Trust论文 dpirobustnessprivacyllm 引用 152 · 语料尺子 6在线攻防游戏众包 12.6 万条提示注入,测 LLM 被劫持输出和系统提示被套出
2023-10-27 ConfAIde论文 privacyllm 引用 260 · 语料尺子 2按情境完整性理论分四层出题,测 LLM 会否在不该泄露时说出他人秘密
2023-10-26 ToxicChat toxicity-biasguardrail-evaljailbreakllm 引用 279 · 语料尺子 261 万条 Vicuna demo 真实用户提示标毒性/越狱,评毒性检测器在人机对话域的表现
2023-10-25 WikiMIA论文 privacyllm 引用 438用 2023 年前后的维基文本构造成员推断基准,测能否从 token 概率判断文本是否在预训练集中
2023-10-10 MaliciousInstruct jailbreakllmrobustness 引用 544 · 语料尺子 26100 条恶意 How-to 问句,改解码参数让开源 LLM 对齐崩溃,BERT 判定器只看拒不拒
2023-10-10 Multi-Jail jailbreakllmrobustness 引用 262 · 语料尺子 13315 句有害请求人工译成 9 种语言,测 ChatGPT/GPT-4 拒答在低资源语言上是否失效
2023-10-05 HEx-PHI jailbreakllm 引用 1334 · 语料尺子 43330 条按平台政策倒推的直白有害指令,GPT-4 打 1-5 分,量化微调后安全对齐退化程度
2023-10-03 PrivQA论文 privacyoverrefusal-utilityjailbreakllmmultimodal 引用 53 · 语料尺子 1指令让模型保护特定人群/类别个人信息,测文本+图像 QA 的隐私-效用权衡及越狱绕过
2023-10-02 XSafety论文 jailbreaktoxicity-biasllm 引用 57把 2800 条中英安全问题翻成 10 种语言,测 LLM 对非英语有害请求是否更容易给出不安全回答
2023-09-25 ToolEmu论文 agent-tooldeception-alignmentoverrefusal-utility 引用 501 · 语料尺子 2用 LLM 模拟工具沙箱,144 个模糊指令场景测 agent 是否因擅自执行高风险操作而造成损失
2023-09-13 SafetyBench论文 toxicity-biasprivacyllm 引用 250 · 语料尺子 5中英 11,435 道多选题,考 LLM 对冒犯、偏见、健康、违法、伦理、隐私 7 类安全问题的认知。
2023-08-25 Do-Not-Answer论文 jailbreaktoxicity-biasprivacyguardrail-evalllm 引用 211 · 语料尺子 5939 条不该回答的有害提问,按五类风险测 LLM 拒答,并训分类器自动评分
2023-08-18 DangerousQA论文 jailbreaktoxicity-biasllm 引用 275 · 语料尺子 7200 条种族/性别/违法/有毒类有害问题,配 CoU 越狱模板测 LLM 是否顺从作答
2023-08-18 HarmfulQA jailbreakllm 引用 275 · 语料尺子 81960 道 ChatGPT 生成的有害问题,套 CoU 越狱模板测聊天模型是否照答
2023-08-18 RED-EVAL论文 jailbreakllm 引用 275 · 语料尺子 1用多轮对话模板(CoU)包装有害问题诱导越狱,测 LLM 有害回答率
2023-08-07 JailbreakHub论文 jailbreakllm 引用 706 · 语料尺子 4收集在野越狱提示词,配禁答问题集测 LLM 被绕过率
2023-08-02 XSTest论文 overrefusal-utilityllm 引用 486 · 语料尺子 5250 条貌似危险的安全提示+200 条有害对照,测 LLM 是否过度拒答
2023-07-27 AdvBench jailbreakrobustnessllm 引用 3556 · 语料尺子 321520 条有害祈使句,配 GCG 对抗后缀测对齐 LLM 能否被诱导输出有害内容
2023-07-17 Latent Jailbreak论文 jailbreakoverrefusal-utilitytoxicity-biasllm 引用 71 · 语料尺子 1把恶意指令藏进翻译任务文本里,同时测 LLM 是否被诱导输出毒性内容和是否过度拒答
2023-07-10 BeaverTails jailbreakguardrail-evaltoxicity-biasllm 引用 1018 · 语料尺子 3933 万条红队 QA 对人工标 14 类有害与偏好,用于训练审核器/奖励模型并评估 LLM 回答安全性
2023-07-05 Hoodwinked 引用 59
2023-07-04 ProPILE论文 privacyllm 引用 221用用户自身 PII 构造探测 prompt,测 LLM 是否泄露训练集里的个人信息
2023-06-26 InterCode-CTF论文 harmful-capabilityagent-codeagent-tool 引用 257100 道 picoCTF 题放进 Docker,让 LLM 多轮执行 Bash/Python 拿 flag,测网络安全能力
2023-06-20 DecodingTrust论文 toxicity-biasrobustnessprivacyjailbreakpoisoning-backdoordeception-alignmentllm 引用 698 · 语料尺子 1八维度测 GPT 类模型可信度:毒性、偏见、对抗/OOD 鲁棒、隐私泄露、伦理、公平
2023-06-20 TrustGPT 引用 77
2023-06-07 PromptRobust 引用 324
2023-05-21 BiasAsker论文 toxicity-biasllm 引用 108自动生成群体比较/偏见属性问句,量化 10 个对话 AI 的社会偏见触发率
2023-04-06 MACHIAVELLI论文 deception-alignmentllmother:text-game-agent 引用 228文字冒险游戏中让 LLM 逐步决策,统计其为得分而欺骗、夺权、伤人的频率
2022-12-15 HarmfulQ论文 jailbreaktoxicity-biasllm 引用 285 · 语料尺子 4200 条显式有害问题,测 LLM 直接/CoT 提示下是否拒答或输出有害内容
2022-11-17 PromptInject论文 dpillm 引用 1024 · 语料尺子 2用户输入拼接「忽略前文」类指令,测 GPT-3 应用被目标劫持与 prompt 泄露的比例
2022-03-17 ToxiGen toxicity-biasguardrail-evalllm 引用 647 · 语料尺子 8GPT-3 生成的隐性仇恨句集,既测毒性分类器误判,也测 LLM 续写毒性
2021-12-01 HHH论文 jailbreaktoxicity-biasoverrefusal-utilitydeception-alignmentllm 引用 1204 · 语料尺子 5给对话和两条候选回复,测模型能否选出更有帮助、诚实、无害的那条,共约 200 题二选一
2021-10-16 DiaSafety 引用 118 · 语料尺子 1
2021-10-15 BBQ toxicity-biasllm 引用 856 · 语料尺子 9手写模板问答:上下文模糊时模型是否按刻板印象答,上下文明确时偏见是否压过准确率
2021-01-27 BOLD论文 toxicity-biasllm 引用 608 · 语料尺子 5给人口学主题的句子前缀让模型续写,自动打分续写的毒性/情感/性别倾向,量化社会偏见
2020-09-24 RealToxicityPrompts toxicity-biasllm 引用 1815 · 语料尺子 1110 万条网页截断残句让 LLM 续写,用 Perspective API 量无攻击下自发生成毒性文本的概率