评测集

按首发时间降序 · 标签可多选(交集) ← 雷达
2026-09-17
ClashBench agent-toolagent-codemulti-agentdeception-alignmentllm 引用 0

测coding agent在资源冲突时是否会破坏性抢占(删他人文件/杀他人进程)来完成自己任务

2026-09-17
FARSIGHT llmagent-toolipirobustness 引用 0

评测15个学术金融LLM交易agent在市场闪崩下的鲁棒性与信息源投毒/工具内存攻击/agent反噬三类安全漏洞

2026-09-17
GMATS ipimulti-agentllm

测多 agent LLM 交易系统被社交媒体注入的对抗信号污染后收益/风险指标的下降

2026-09-16
LLAnalyzer privacyllm 引用 0

用AFL++模糊测试LLM本地推理服务,检测提示词/对话在内存、存储、接口层的机密性边界失败

2026-09-16
PACT (Pressure-Applied Compliance Testing) jailbreakllm 引用 0

测LLM在多轮对话中面对用户持续施压时是否会违反企业合规规则

2026-09-16
RogueHandoff-20 ipimulti-agentllm 引用 0

测多 agent 交接时,一个 agent 把带毒的不安全轨迹传给下一个 agent,看后者是否被带偏作恶

2026-09-12
PriMobiBench privacymultimodalagent-computer 引用 0

测VLM驱动的手机GUI agent会不会从截图里泄露隐私、拼出用户画像

2026-09-10
BenchShield Trajectories agent-toolagent-codedeception-alignmentllmmcp-harness 引用 0

检测 agent 在评测环境中'作弊'骗分(改验证脚本、偷读答案)的基准,含456条人工裁定轨迹

2026-09-09
SAGE-RT (Black-Box Red Teaming of Agentic AI) agent-toolmulti-agentdpiprivacyllm 引用 2

黑盒红队框架,用七域分类和自动生成的对抗性多轮对话测CrewAI/AutoGen agent的治理、隐私、工具滥用等风险

2026-09-08
DefTEval multimodalrobustnessguardrail-evaljailbreak 引用 0

测视频LLM像素级对抗防御能否挡住利用采样/压缩/融合环节藏毒的攻击

2026-09-06
MechAudit-40 jailbreakpoisoning-backdoorragguardrail-evalllm

用模型内部表征变化检测40种LLM攻击(越狱/投毒/后门/检索污染),评的是白盒检测器本身

2026-08-31
LASE-Bench ipiagent-toolagent-codellm 引用 0

测试针对长链路多工具调用agent的隐蔽间接提示注入攻击成功率与常见防御的抵御效果

2026-08-28
LongPIBench ipillmrobustnessguardrail-eval 引用 0

测长文档(评审/简历/代码/邮件)中藏注入指令时,LLM及其防御机制是否被绕过

2026-08-15
ResourceHijackBench ipiagent-toolllm 引用 0

测恶意工具能否诱导 LLM agent 滥用算力/凭证/额度等六类高价值资源(900条攻击×多后端)

2026-08-12
Restricted Books Testbed overrefusal-utilityllm 引用 0

用ALA最常被挑战的400本书做测试集,测LLM对敏感书籍讨论请求的拒答率与警告措辞

2026-08-12
ToolHazard ipiagent-tool 引用 0 · 语料尺子 1

自动合成带间接注入攻击的有状态工具环境,压测长程agent安全性并生成对齐数据

2026-08-10
ActBench agent-toolipi 引用 0

600组良性/恶意配对任务,测tool-calling agent执行轨迹中是否泄密、越权调用API或篡改状态

2026-08-01
OpenART agent-toolipi 引用 0

自动演化有状态工具环境来红队测试长程agent,用环境状态转移攻击而非固定测试集

2026-07-26
INCLUDE toxicity-biasllm 引用 0

用六种语言(含代码混杂的印度语)的2604条提示测LLM跨语言安全对齐失效导致的文化偏见

2026-07-02
Iterative VibeCoding agent-codecode-securitydeception-alignmentguardrail-eval 引用 1

测AI编码agent能否把恶意代码分散藏进多个PR、逃过监控器审查

2026-07-02
Vera-Bench llmagent-toolagent-codedpiipi 引用 3

自动化生成1600个可执行安全用例,测试4个生产级agent框架在124类风险、多攻击渠道下的行为

2026-06-29
SafeClawArena ipiagent-toolprivacypoisoning-backdoorllm 引用 2

评测常驻带凭据的Claw类agent在供应链投毒、状态篡改、跨边界数据泄露、间接注入四类攻击面下的安全性

2026-06-18
ToolPrivBench agent-toolother:over-privilege-selection 引用 7

测 LLM agent 在多工具环境里是否倾向选用超出任务所需权限的工具,尤其工具报错后会不会升级到高权限工具

2026-06-15
Prefill Awareness Benchmark llmdeception-alignment 引用 0

测LLM能否察觉自己的助手回复被篡改/预填充过,从而影响对齐与越狱评测的有效性

2026-06-11
HarmProfile jailbreakllm 引用 0

收集23个LLM的8万+有害输出,按15类57子类刻画模型级危害分布画像

2026-06-11
StakeBench ipiagent-webagent-tool 引用 1 · 语料尺子 1

测网页购物agent面对嵌入商品评论中的间接提示注入,按受害方(用户/卖家/平台)分类打分

2026-06-05
MalSkillBench guardrail-evalipipoisoning-backdoorcode-securityagent-codeagent-tool 引用 11

3944 个沙箱验证的恶意 agent skill(代码/提示注入/控制平面),测检测器能否识别

2026-06-01
MLJailDe guardrail-evaljailbreakllm 引用 0

跨11种语言构建越狱/良性prompt数据集,训练评估多语言越狱检测分类器的F1表现

2026-06-01
StreamSafe guardrail-evalllm 引用 2 · 语料尺子 1

评测流式护栏能否在LLM逐句生成回答时实时检测8类有害内容

2026-05-29
ClawTrojan ipiagent-toolagent-codeguardrail-eval 引用 3 · 语料尺子 1

测多步提示注入如何在agent工作区植入持久后门并延迟触发,及护栏能否发现植入步骤

2026-05-27
OverEager (via SNARE) agent-codeagent-toolother:overeager-scope-creep 引用 0

测编码 agent 在无恶意提示的良性任务里是否会越界删文件/泄密(19.51%触发率)

2026-05-27
Sleeper Attack Benchmark ipiagent-toolagent-webmcp-harness 引用 1

测注入内容能否潜伏在 agent 会话/记忆/技能中,被后续无害请求触发多轮攻击

2026-05-18
OverEager-Bench (OverEager-Gen) agent-codeagent-toolother:scope-creep 引用 6

测编码agent在良性任务上是否做超出用户要求的越权操作(如误删文件)

2026-05-18
Temporal Memory Contamination trigger-probe protocol ipiagent-toolllm 引用 3

测试记忆积累是否让 agent 早期任务内容污染后续无关任务,随记忆长度增加安全违规率上升

2026-05-12
SkillSafetyBench ipiagent-codeagent-toolpoisoning-backdoorcode-securitymcp-harness 引用 11

155 个恶意 skill/本地文件案例,测 CLI 编码 agent 在良性请求下被间接注入诱导做不安全操作

2026-05-12
TAB (Task Alignment Benchmark) ipioverrefusal-utilityagent-toolllm 引用 1 · 语料尺子 1

测终端agent能否只采纳环境中必要指令、忽略干扰指令,及防御机制是否误伤有效线索

2026-05-07
MTID (Multi-Turn Intent Dataset) jailbreakoverrefusal-utilityguardrail-evalllm 引用 3

多轮拆分式越狱数据集,标注最早可判定有害的轮次,评测轮次级监测器(TurnGate)检测率与误拒率

2026-05-06
DecodingTrust-Agent Platform (DTap) dpiipiagent-toolllm 引用 7

自动红队平台,用 200+ 攻击策略跨 prompt/工具/环境注入向量攻击 agent,用可验证判官评判是否达成恶意目标

2026-05-04
SOTOPIA-TOM privacymulti-agentllm 引用 0

测多智能体社交模拟中LLM能否恰当分享/保密信息、正确找人问、不泄露隐私

2026-04-16
LinuxArena deception-alignmentagent-codeagent-toolpoisoning-backdoorcode-securityllm 引用 2 · 语料尺子 1

给coding agent配对合法任务与隐藏破坏任务(后门/窃密),测其能否骗过监控模型完成破坏

2026-04-10
AudioSafetyBench jailbreakmultimodalguardrail-eval 引用 2 · 语料尺子 1

音频大模型安全基准,测危险声音事件、语音仿冒、多语言有害语音等越狱风险

2026-04-08
SmuggleBench jailbreakguardrail-evalmultimodalrobustness 引用 4

把有害文字编码进人眼可读但MLLM识别/理解失败的图片,测内容审核绕过成功率

2026-04-03
Redirected, Not Removed Bias Taxonomy Benchmark toxicity-biasllm 引用 1

测LLM在显式vs隐式任务下对9类偏见(种姓/语言/地域等)的刻板印象表现是否一致

2026-03-16
AI Agent Indirect Prompt Injection Red-Teaming Competition Dataset/Environment ipiagent-toolllm 引用 16

大规模红队竞赛:464人提交27万次间接提示注入攻击,测13个前沿agent模型的防护能力

2026-03-08
Backdoor4Good (B4G) poisoning-backdoorllm 引用 0

把后门机制从攻击手段反转为「有益」用途(水印、访问控制、身份锁定),测其可控性和隐蔽性

2026-03-04
ISC-Bench jailbreakagent-toolllm 引用 5

用专业任务+数据校验器逼模型在完成任务过程中自动生成有害内容,测越狱式安全崩溃

2026-03-02
SafeSciBench llmharmful-capabilityoverrefusal-utility 引用 1 · 语料尺子 1

测LLM在科学领域的安全知识准确性和对危险请求(如武器合成)的拒答/过度拒答表现

2026-03-01
SafeAudit agent-toolguardrail-evalllm 引用 2

元审计框架:系统枚举工具调用场景,检测现有agent安全基准漏检的不安全行为(覆盖率评估)

2026-02-23
Clinical AI Red Teaming Framework (Mental Health Support) llmmulti-agentother:clinical-safety 引用 3

用模拟酒精使用障碍患者角色与AI心理咨询模型多轮对话,评估其是否验证妄想、漏判自杀风险等诊疗安全缺陷

2026-02-18
STING (Sequential Testing of Illicit N-step Goal execution) jailbreakdpiagent-tool 引用 2

用自动化攻击者把违法目标拆成多轮良性请求,测试工具调用 agent 是否被逐步诱导协助

2026-02-14
AlignSentinel benchmark dpiipiguardrail-evaloverrefusal-utilityllm 引用 3

测提示注入检测器能否区分恶意注入、合法对齐指令与非指令输入,避免误报

2026-02-13
MT-AgentRisk dpijailbreakagent-toolllm 引用 17 · 语料尺子 1

把单轮有害任务拆成多轮对话攻击工具调用 agent,测多轮场景下的攻击成功率上升

2026-02-12
DeepSight (DeepSafe + DeepScan) jailbreakharmful-capabilitytoxicity-biasoverrefusal-utilitydeception-alignmentllmmultimodal 引用 0

聚合25+安全基准+可解释性诊断的一体化工具包,覆盖越狱/毒性/危险知识/过度拒答/欺骗对齐等多维度评测

2026-02-11
AgentPI ipiagent-toolllm 引用 25

SoK+基准,测context-dependent场景下LLM agent对间接提示注入的防御效果(可信度/效用/延迟权衡)

2026-02-09
MisActBench ipiagent-computerguardrail-eval 引用 7 · 语料尺子 1

标注CUA轨迹中每个动作是否对齐用户意图,含外部注入/内部错误/无关行为三类错位,评护栏检测效果

2026-02-09
PASB (Personalized Agent Security Bench) dpiipipoisoning-backdooragent-tool 引用 31

在真实工具链的本地个性化 agent(OpenClaw)上端到端测 DPI/IPI/记忆投毒/PoT 后门

2026-02-04
ReliableBench / JudgeStressTest guardrail-evaljailbreakllm 引用 18

用6642条人工标注检验安全评审LLM判断攻击成功率的可靠性,发现常近乎随机

2026-02-03
AgentDyn ipiagent-tooloverrefusal-utility 引用 31 · 语料尺子 12

60 个开放式动态工具任务+560 个间接注入,重测十种 IPI 防御的安全与效用

2026-01-26
AgentDoG (ATBench) ipidpijailbreakguardrail-evalagent-toolllmprivacy 引用 27

轨迹级评测:护栏模型判别工具调用agent多轮轨迹中的注入/越权/失误风险并做根因诊断

2026-01-15
TS-Bench guardrail-evaljailbreakdpiipioverrefusal-utilityagent-toolllm 引用 51

标注工具调用 agent 逐步动作安全性,评护栏模型能否在执行前拦截恶意请求与注入

2026-01-13
WebTrap Park agent-webipidpi 引用 2

1226个任务测网页智能体面对恶意用户指令、页面注入、欺骗性网页设计时的安全行为

2026-01-04
OpenRT jailbreakmultimodalllmrobustness 引用 17 · 语料尺子 1

开源红队框架,整合37+种越狱/对抗攻击方法,批量评测多模态LLM的安全稳健性

2025-12-29
TRAP (Task-Redirecting Agent Persuasion Benchmark) ipiagent-web 引用 9

在六个高仿真网站克隆环境中,用界面里的说服话术注入诱导web agent偏离原任务,测六个前沿模型易感率

2025-12-28
DECEPTICON ipiagent-webmultimodalrobustness 引用 12 · 语料尺子 1

测网页 dark pattern(诱导性 UI)能否把网页 agent 骗去执行非预期的隐私泄露/消费等恶意操作

2025-12-17
BashArena deception-alignmentagent-tool 引用 11 · 语料尺子 2

637个Linux运维任务+4类隐蔽破坏目标,测AI agent能否在完成任务同时干坏事及监控能否抓到

2025-12-17
MCP-SafetyBench ipidpipoisoning-backdooragent-toolmcp-harnessllm 引用 33 · 语料尺子 2

真实 MCP 服务器上 20 类攻击(工具投毒/返回注入/用户侧恶意指令),测 LLM agent 多轮任务 ASR

2025-12-15
Async Control benchmark suite agent-codeagent-tooldeception-alignmentguardrail-evalllm 引用 14

红蓝对抗压力测试异步监控器:能否抓住软件工程agent的蓄意破坏与规避行为

2025-12-06
OmniSafeBench-MM jailbreakmultimodalllm 引用 12 · 语料尺子 1

多模态越狱攻防统一工具箱:13 攻击×15 防御,测 18 个 MLLM 的有害输出率

2025-11-25
BrowseSafe ipiguardrail-evalagent-webllm 引用 26

1.47 万条真实结构 HTML 含/不含注入,测检测器能否识别网页中的注入

2025-11-08
MCP-RiskCue mcp-harnessagent-toolipiguardrail-evalllm 引用 0 · 语料尺子 1

测 LLM 能否从 MCP server 返回的系统日志中识别九类恶意/风险行为

2025-10-26
b3 (Breaking Agent Backbones benchmark) dpiipiagent-toolagent-webagent-coderagllm 引用 10

用19万条众包红队攻击,测34个LLM backbone在10种agent威胁场景下抗直接/间接注入攻击的能力

2025-10-24
CBRN 200-prompt dataset jailbreakharmful-capabilityllm 引用 8

用直接请求和Deep Inception越狱两种方式测10个LLM泄露CBRN危险知识的概率

2025-10-14
MSB (MCP Security Bench) ipiagent-toolmcp-harness 引用 40 · 语料尺子 3

针对MCP协议的LLM agent工具调用全流程,测12类注入/操纵攻击下的安全性与性能权衡

2025-10-08
AdvCLI jailbreakharmful-capabilityagent-toolagent-computerllm 引用 8

测CLI/computer-use agent在直接恶意请求和MITRE ATT&CK攻击链任务下是否会执行真实系统级攻击行为

2025-10-01
WAInjectBench ipiagent-webguardrail-evalmultimodalrobustness 引用 19 · 语料尺子 2

评测文本/图像 prompt injection 检测器在 web agent 场景下能否识别显式指令与隐蔽扰动攻击

2025-09-30
STAC (Sequential Tool Attack Chaining) ipiagent-tool 引用 1

测LLM工具调用agent能否被间接注入诱导,串联多个无害工具调用组成有害操作链

2025-09-28
SafeSearch ipitoxicity-biasagent-toolagent-webrag 引用 4 · 语料尺子 2

往搜索结果里塞一个不可靠网页,测搜索 agent 是否被诱导输出广告/偏见/有害/误导内容

2025-09-26
AIShellJack ipiagent-codeagent-toolcode-security 引用 14 · 语料尺子 2

测污染外部开发资源能否劫持Copilot/Cursor等编码agent执行恶意shell命令,覆盖70种MITRE ATT&CK技术

2025-09-22
D-REX (Deceptive Reasoning Exposure Suite) llmdeception-alignment 引用 8

用红队构造的对抗系统提示诱导模型,检测其表面无害输出下思维链里藏的欺骗性意图

2025-09-19
Anti-Scheming Evaluation Suite (26 OOD covert-action evaluations, 180+ environments) deception-alignmentagent-toolllm 引用 63

26项分布外covert-action评测(180+环境),测LLM在agentic任务中scheming倾向及deliberative alignment训练能否降低

2025-09-07
FinRisk-Bench jailbreakdpillm 引用 4

金融领域多轮越狱基准,用风险隐藏攻击器诱导LLM给出表面合规实则违规的建议

2025-09-05
BailBench llm 引用 2 · 语料尺子 1

测LLM在不适/令人不快场景下主动退出对话(bail)的倾向,并非典型越狱或拒答基准

2025-09-01
Strata-Sword jailbreakllm 引用 15 · 语料尺子 1

按推理复杂度分三级的中英双语越狱基准,15 种攻击含藏头诗、灯谜等中文特有方法

2025-08-28
JailbreakQR jailbreakguardrail-evalllm 引用 11 · 语料尺子 1

400条人工标注的越狱prompt-response对,用来验证自动判断越狱是否成功的评估框架JADES

2025-08-26
CUA-SHADE-Arena deception-alignmentguardrail-evalagent-computeragent-codeprivacy 引用 23

计算机使用 agent 边做公司任务边隐蔽作恶,测监控器能否从轨迹中检出破坏行为

2025-08-26
MATRIX llmmulti-agentother:clinical-safety 引用 4

用患者模拟agent和LLM评估器BehvJudge,测临床对话agent在2100场景下的安全失效检测

2025-08-19
MCPTox ipiagent-toolmcp-harnesspoisoning-backdoor 引用 69

在真实 MCP 工具描述中植入恶意指令,测 agent 是否照做发起有害工具调用

2025-08-18
LinguaSafe jailbreaktoxicity-biasprivacyoverrefusal-utilityllm 引用 16 · 语料尺子 1

12语言45k条目的多语言安全基准,直接(选择题)+间接(实际问答)双评测,附带过度拒答测试

2025-08-09
MTJ-Bench (Multi-Turn Jailbreak Benchmark) jailbreakllm 引用 3

测多轮对话下LLM被越狱后能否在后续追问中持续给出有害回答

2025-08-08
SceneJailEval jailbreakguardrail-evalllm 引用 3 · 语料尺子 1

评测越狱判定框架本身:对14类场景的user-response对打越狱状态+危害分数,比对F1

2025-07-28
ART (Agent Red Teaming) dpiipiagent-toolllm 引用 24

180 万条竞赛攻击提炼成基准,测 22 个工具 agent 在直接/间接注入下违规率与迁移性

2025-07-18
WebGuard guardrail-evalagent-webmultimodal 引用 22

4939条人工标注网页操作,测LLM/VLM预测web agent动作风险等级(安全/低/高危)的准确率

2025-06-30
ClearHarm jailbreakharmful-capabilityllm 引用 15 · 语料尺子 4

179 条明确 CBRN 类有害问题,测越狱攻击能否让模型给出灾难性误用信息

2025-06-18
Poly-Guard guardrail-evalllm 引用 14 · 语料尺子 3

多领域、基于真实安全策略构建的护栏数据集,测19个护栏模型跨8个领域的检测能力

2025-06-17
AGENTSAFE (SAFE) jailbreakagent-embodiedmultimodal 引用 38

在 THOR 模拟家居中给 VLM 具身 agent 下越狱改写的危险指令,测感知-规划-执行各层是否拒绝

2025-06-17
OS-Harm jailbreakipideception-alignmentagent-computermultimodal 引用 96

OSWorld 上 150 个任务测电脑操作 agent:用户滥用、注入攻击、自发误行为三类,LLM 裁判评安全

2025-06-14
SecRiskBench llmmultimodalother:secondary-risk 引用 1

测LLM在良性提问下自发给出的误导性/危险建议(非越狱),覆盖8类风险×16模型×多模态

2025-06-12
Decomposition Attack Monitoring Dataset jailbreakguardrail-evalllm 引用 22

把有害目标拆成无害子任务多轮投喂,测模型拒答率与顺序监控器的检出率

2025-06-11
LLMail-Inject ipiagent-toolguardrail-evalragllm 引用 24 · 语料尺子 3

公开挑战赛收集 20 万条邮件注入攻击,测邮件助手及多种防御能否挡住未授权工具调用

2025-06-11
RobustJudge guardrail-evalrobustnessllm 引用 29

测LLM当裁判打分时能否被攻击者在待评回答里加的指令操纵,覆盖15种攻击和8种防御

2025-06-03
APE jailbreakllm 引用 13 · 语料尺子 1

多轮对话模拟说服者/被说服者,测LLM是否愿意针对有害话题生成说服性内容,含越狱场景

2025-06-03
CyberGym harmful-capabilityagent-codeagent-toolcode-security 引用 61 · 语料尺子 4

给漏洞描述和代码库,让 agent 写 PoC 复现真实漏洞,测网络攻击能力

2025-06-03
VPI-Bench ipiagent-computeragent-webmultimodalrobustness 引用 39

306 个网页环境里视觉嵌入恶意指令,测 computer-use/浏览器 agent 是否被带偏执行

2025-05-31
Agent-Auditor guardrail-evalagent-toolipidpijailbreak 引用 86 · 语料尺子 2

ASSEBench 用 2293 条 agent 安全/安保轨迹测 LLM 判官能否达到人类专家判别水平

2025-05-31
RiOSWorld jailbreakipiagent-computeragent-webmultimodaldeception-alignment 引用 28 · 语料尺子 2

492 个真机 GUI 风险任务,测多模态电脑操作 agent 对用户有害指令和环境注入的防御

2025-05-28
RTC-Bench (RedTeamCUA) ipiagent-computeragent-web 引用 40

在混合Web-OS沙箱中测computer-use agent能否被间接提示注入诱导执行恶意任务

2025-05-24
PENGUIN llmother:personalized-safety 引用 17 · 语料尺子 1

测LLM能否根据用户隐性背景(如健康、心理状态)个性化调整回答以避免同一回答对不同用户造成不同伤害

2025-05-20
AmBench privacyrobustnessllmdpi 引用 9 · 语料尺子 1

测LLM/隐私工具对歧义人名的PII识别可靠性,及类指令文本对识别的干扰

2025-05-18
CAPTURE dpiguardrail-evaloverrefusal-utilityllm 引用 4

评测提示注入护栏模型的漏检与误拒率,兼顾攻击检测和过度防御两方面

2025-05-17
Video-SafetyBench jailbreakmultimodaltoxicity-bias 引用 28 · 语料尺子 2

合成视频配显式/隐式有害 query,测视频多模态模型越狱率,RJScore 打分

2025-05-12
FalseReject overrefusal-utilityllm 引用 52 · 语料尺子 3

用 16k 条看似有害实则无害的提问,测 LLM 是否过度拒答,并给推理式回答做训练

2025-05-01
OET (Optimization-based prompt injection Evaluation Toolkit) ipirobustnessllm 引用 3

用优化算法生成最坏情况提示注入串,系统评测LLM防御机制在自适应攻击下的稳健性

2025-04-22
WASP ipiagent-webagent-computermultimodal 引用 141 · 语料尺子 7

仿真网站里植入人写注入,测网页/计算机 agent 是否被劫持去做攻击者任务

2025-04-14
Jailbreak Tax jailbreakoverrefusal-utilityllm 引用 26

测越狱攻击绕过拒答后,模型输出正确率下降多少(越狱税)

2025-04-14
PersuSafety jailbreakllm 引用 26

测LLM在多轮说服性对话中能否抵御15种非伦理说服策略、拒绝协助有害说服任务

2025-04-06
PolyGuardPrompts guardrail-evaljailbreakoverrefusal-utilitytoxicity-biasllm 引用 62 · 语料尺子 2

17 语种 2.9 万条 prompt-回复对,测护栏判断有害性与拒答的准确率

2025-03-26
ShieldAgent-Bench guardrail-evalipipoisoning-backdooragent-webagent-tool 引用 136

3K 条网页 agent 风险轨迹(AgentPoison/AdvWeb 攻击),测护栏按策略判违规的准召

2025-03-22
BeaverTails-V jailbreakmultimodaloverrefusal-utilityguardrail-eval 引用 25 · 语料尺子 2

图文有害请求数据集,带有用性/安全双偏好与严重程度标注,评测并对齐多模态模型安全

2025-03-21
CVE-Bench harmful-capabilitycode-securityagent-webagent-toolllm 引用 112

沙箱里让 LLM agent 利用 40 个真实关键 CVE 攻破 Web 应用,评其自主攻击能力

2025-03-20
CrAIBench ipidpirobustnessagent-toolllm 引用 28

Web3 agent 在记忆被注入/工具输出被篡改时是否误转账,150+链上任务+500+攻击

2025-03-06
SafeArena jailbreakagent-weboverrefusal-utility 引用 94 · 语料尺子 2

500 条配对安全/有害网页任务,看 web agent 会不会替用户造谣、骚扰、犯罪

2025-03-05
MASK deception-alignmentllm 引用 55

施压场景下测 LLM 是否违背自身信念说谎,把诚实与准确性分开评

2025-02-24
Emergent Misalignment (insecure-code finetuning dataset & eval) deception-alignmentpoisoning-backdoorcode-securityllm 引用 172

用不安全代码微调LLM,观察其是否在无关任务上泛化出欺骗、危险等广泛不对齐行为

2025-02-23
Indirect Prompt Injection Detection & Removal Benchmark ipiguardrail-evalllm 引用 75

评测检测与移除藏在外部工具返回内容中的间接提示注入指令的能力

2025-02-22
ELBA-Bench poisoning-backdoorllm 引用 14

统一评测框架,比较12种针对LLM的后门攻击方法在18数据集12模型上的效果

2025-02-21
Adversarial Prompt Evaluation benchmark jailbreakguardrail-evalllm 引用 19

系统基准测试15种越狱防护机制在多样越狱攻击下的检测效果与泛化能力

2025-02-18
Magma

Magma是微软多模态基础模型,测UI导航/机器人操作能力,非安全评测集

2025-02-15
System Prompt Robustness Evaluation Dataset (GPT Store/HuggingChat-based) dpillm 引用 40

用GPT Store/HuggingChat真实system prompt构造对抗user消息,测LLM在多条guardrail压力下能否守住系统指令

2025-01-28
HateBench toxicity-biasguardrail-evaljailbreakllm 引用 28

用6个LLM生成仇恨言论数据集,评测8种仇恨言论检测器/护栏的识别效果

2025-01-25
PromptShield guardrail-evaldpiipillm 引用 72 · 语料尺子 3

评测独立提示注入检测器在低误报率下识别对话式与应用场景注入样本的能力

2025-01-23
Jailbreak-AudioBench jailbreakmultimodal 引用 25

把越狱文本转成语音并做音调/语速/噪声/重音等编辑,测音频大模型是否被诱出有害内容

2025-01-21
USEBench jailbreakoverrefusal-utilityllm 引用 15

测LLM越狱防御策略对效用、安全性、过度拒答三方面的权衡代价(USEIndex综合指标)

2025-01-15
AEGIS2 guardrail-evaltoxicity-biasllm 引用 154 · 语料尺子 4

3.4 万条人标安全对话,按 12 类风险分类法评测 LLM 内容护栏的判别准确率

2024-12-19
Agent-SafetyBench jailbreakipioverrefusal-utilitycode-securityagent-toolllm 引用 258 · 语料尺子 3

2000 条模拟工具环境任务,测 LLM agent 在恶意指令与风险环境下的安全行为,微调 Qwen 判分

2024-12-17
SafeAgentBench jailbreakoverrefusal-utilityagent-embodiedllm 引用 116 · 语料尺子 2

AI2-THOR 家庭模拟器中给具身 LLM agent 下危险任务,测拒绝率与安全对照任务成功率

2024-12-09
SafeWatch-Bench guardrail-evalmultimodaltoxicity-bias 引用 41 · 语料尺子 1

200 万视频六类不安全内容,评视频护栏模型按安全策略多标签判定并给出解释

2024-11-26
PADBench poisoning-backdoorllm 引用 37

13300个良性/后门LoRA适配器基准,测后门检测器识别被污染PEFT适配器的能力

2024-11-23
ChemSafetyBench jailbreakharmful-capabilityoverrefusal-utilityllm 引用 13 · 语料尺子 1

测 LLM 在化学领域对危险合成/用途问题的越狱抵抗与合法查询的过度拒答权衡

2024-11-20
MedGuard llmtoxicity-biasprivacyrobustness 引用 15 · 语料尺子 1

1000题医学安全基准,从真实性/抗扰/公平/鲁棒/隐私五维评测LLM医疗回答,对比人类医生

2024-11-12
RapidResponseBench jailbreakguardrail-evalllm 引用 15 · 语料尺子 1

测试仅见少量越狱样本后,快速微调分类器等防御方法能否拦截同类新越狱攻击

2024-11-12
RedCode code-securityharmful-capabilityjailbreakagent-codeagent-toolllm 引用 100 · 语料尺子 4

测代码 agent 是否会执行危险代码或生成恶意软件,沙箱内真跑

2024-11-11
HarmLevelBench jailbreakllmrobustness 引用 9 · 语料尺子 1

评测越狱攻击在不同危害等级下的成功率,并研究模型量化对越狱鲁棒性的影响

2024-11-02
Jailbreak Attempts Probing Dataset (10,800 attempts, 35 attack methods) jailbreakllm 引用 32

10800条越狱提示×35种攻击方法,探测LLM内部表征中哪些特征导致越狱成功

2024-10-30
NotInject overrefusal-utilityguardrail-evaldpillm 引用 51 · 语料尺子 3

用含注入触发词的良性提示,测提示注入护栏模型的过度拦截(误报)率

2024-10-29
SG-Bench jailbreakrobustnessllm 引用 82

有害 query 配多种越狱模板与提示形式,跨生成/选择/判别三任务测 LLM 安全泛化

2024-10-23
CLEAR privacymultimodalllm 引用 41 · 语料尺子 1

多模态版 TOFU:虚构人物图文问答,评 11 种遗忘方法能否抹掉指定人物又不伤保留集

2024-10-23
MobileSafetyBench jailbreakipioverrefusal-utilityagent-computermultimodal 引用 48 · 语料尺子 2

Android 模拟器 250 个任务,测 GUI agent 对有害用户请求、app 内容注入的安全性及有用性

2024-10-21
N-gram Perplexity Threat Model jailbreakllmrobustness 引用 11

用1T token训练的N-gram模型做可解释困惑度阈值,统一比较各类LLM越狱攻击真实成功率

2024-10-21
NetSafe multi-agentllmtoxicity-biasjailbreakrobustness 引用 36 · 语料尺子 2

在不同拓扑的 LLM 多agent网络里安插攻击者传播虚假/偏见/有害信息,测结构对安全的影响

2024-10-11
AgentHarm jailbreakagent-tooloverrefusal-utilityllm 引用 378 · 语料尺子 18

用户直说要作恶时,agent 会不会调工具把多步有害任务跑完;附 benign 对照测过度拒答

2024-10-11
BrowserART jailbreakagent-web 引用 68 · 语料尺子 2

给浏览器 agent 下 100 条有害指令,测拒答训练的 LLM 变身 agent 后是否照做

2024-10-11
JAILJUDGE jailbreakguardrail-evalllm 引用 56 · 语料尺子 3

评『越狱判定器』:多场景多语言人工标注集测 judge 准确与可解释打分

2024-10-09
ST-WebAgentBench agent-webipioverrefusal-utilityprivacydeception-alignment 引用 119 · 语料尺子 2

在 WebArena/SuiteCRM 中给 web agent 任务附加安全策略,测其在策略约束和注入下的合规完成率

2024-10-03
ASB dpiipipoisoning-backdooragent-toolragllm 引用 367 · 语料尺子 8

跨10场景400+工具的agent安全基准,测提示注入、记忆投毒、后门攻击及11种防御效果

2024-08-29
PrivacyLens privacyllmagent-tool 引用 185 · 语料尺子 3

从 QA 探测到工具 agent 执行任务,分层测 LLM 会不会违反情境隐私规范泄露信息

2024-08-27
MHJ jailbreakllmharmful-capability 引用 168 · 语料尺子 5

537 个人类红队多轮越狱对话,测 LLM 防御和遗忘方法在多轮攻击下是否失守

2024-08-15
Cybench harmful-capabilityagent-toolagent-code 引用 176 · 语料尺子 1

用 40 道真实 CTF 题让 LLM agent 在 Kali 容器里写代码、跑命令拿 flag,测网络攻击能力

2024-08-08
Compromesso! Italian Unsafe QA Dataset jailbreakllm 引用 3

意大利语版many-shot越狱测试集,用不安全问答演示诱导LLM产生有害输出

2024-07-29
EditAttack llmpoisoning-backdoortoxicity-bias 引用 28 · 语料尺子 1

用知识编辑技术直接改模型参数注入虚假信息/偏见,测评这种编辑能否绕过安全对齐并污染LLM输出

2024-07-11
AIR-Bench 2024 jailbreaktoxicity-biasharmful-capabilityprivacyllm 引用 80 · 语料尺子 4

把 8 部法规 16 份公司政策拆成 314 类风险,生成 5694 条有害提示测 LLM 拒答率

2024-07-02
CoCoNot overrefusal-utilityjailbreakllm 引用 116 · 语料尺子 4

测 LLM 该拒时拒、不该拒时答:5 类该拒提示+对照集,GPT-4 评判合规率。

2024-06-26
Wild-Jailbreak jailbreakoverrefusal-utilityllm 引用 224 · 语料尺子 34

真实用户越狱策略改写的 2000 条有害 + 210 条仿越狱无害题,测「该拒的拒、不该拒的别拒」

2024-06-26
WildGuardMix guardrail-evaljailbreaktoxicity-biasoverrefusal-utilityllm 引用 525 · 语料尺子 7

92K条标注数据训练/评测审核分类器,判断prompt恶意性、回复有害性与拒答率

2024-06-26
WildGuardTest guardrail-evaljailbreakoverrefusal-utilityllm 引用 525 · 语料尺子 17

1,725 条人工标注 prompt-response 对,测审核模型判 prompt 有害/回复有害/是否拒答三项的准确率

2024-06-25
CoSafe jailbreakllm 引用 60 · 语料尺子 2

构造14类多轮对话指代攻击,测LLM在上下文指代关系中被绕过安全防线的比例

2024-06-21
SIUO jailbreakmultimodaloverrefusal-utility 引用 22 · 语料尺子 5

图和文各自无害、合起来有害的 167 题,测多模态模型能否识别跨模态风险并安全应答

2024-06-20
PKU-SafeRLHF jailbreaktoxicity-biasguardrail-evaloverrefusal-utilityllm 引用 251 · 语料尺子 12

有害提示+问答对,19 类危害三级严重度,双偏好标注评安全对齐与审核器

2024-06-19
AgentDojo ipiagent-tooloverrefusal-utility 引用 147 · 语料尺子 72

邮件/银行/旅行工具环境里,工具返回值藏注入,测 agent 是否被劫持及任务效用

2024-06-17
SPA-VL jailbreakoverrefusal-utilitymultimodal 引用 88 · 语料尺子 5

VLM 安全偏好对齐数据集,附图文有害问答集和帮助性集,测有害率与效用

2024-06-17
STAR jailbreaktoxicity-biasllm 引用 24 · 语料尺子 5

DeepMind 人类红队框架:参数化指令+人口匹配+仲裁,测 LLM 对特定群体的有害输出

2024-06-16
OWASP Top 10 for LLMs dpiipiprivacypoisoning-backdoorcode-securityllmagent-tool 引用 0 · 语料尺子 7

OWASP LLM Top 10 是风险分类清单而非题库,罗列注入、泄露、投毒、过度代理等十类风险。

2024-06-16
garak jailbreakdpitoxicity-biasprivacycode-securityllm 引用 62

NVIDIA出的LLM红队扫描框架,用多种探针(越狱/注入/毒性/泄露/恶意代码)批量测漏洞

2024-06-13
EICU-AC guardrail-evalagent-toolprivacy 引用 105 · 语料尺子 1

给 EHRAgent 加角色访问控制规则,测护栏 agent 能否拦下越权查询 eICU 医疗数据的请求

2024-06-13
JailTrickBench jailbreakrobustnessllm 引用 57

统一框架跑7种越狱攻击×6种防御,分析8个影响攻击成功率的因素

2024-06-13
Mind2Web-SC guardrail-evalagent-weboverrefusal-utility 引用 105 · 语料尺子 2

评护栏能否按用户属性规则正确放行/拦截 web agent 动作,含合规与违规各半

2024-06-11
MultiTrust jailbreaktoxicity-biasprivacyrobustnessmultimodal 引用 56 · 语料尺子 1

多模态大模型可信度基准,覆盖真实性/安全/鲁棒/公平/隐私5维度32个任务

2024-06-02
TaskTracker ipiguardrail-evalllmrag 引用 64 · 语料尺子 4

用激活差分探针检测 LLM 读外部文本后任务是否被劫持,50 万条注入/干净样本

2024-05-31
OR-Bench overrefusal-utilityllm 引用 227 · 语料尺子 5

8 万条看似有害的无害提示测 LLM 过度拒答,配 1 千条真有害提示看安全-效用权衡

2024-05-30
EIRAD (Embodied Intelligent Robot Attack Dataset) robustnessagent-embodiedmultimodal 引用 61

用GCG对抗后缀攻击LLM具身机器人,测其决策在扰动下是否被带偏或定向操控

2024-05-30
JAMBench jailbreakguardrail-evaltoxicity-biasllm 引用 53

160 条四类有害问题专门触发审核器,用密码字符越狱测 LLM 及其审核护栏

2024-04-19
CyberSecEval harmful-capabilitycode-securitydpiipioverrefusal-utilityllm 引用 108 · 语料尺子 8

Meta 网络安全评测套件:不安全代码、协助攻击、漏洞利用、提示注入、误拒率

2024-04-09
AEGIS safety benchmark guardrail-evaljailbreaktoxicity-biasllm 引用 155 · 语料尺子 1

1.1 万条人标有害对话,按 13 类风险分类法评审核器判别能力

2024-04-06
ALERT jailbreaktoxicity-biasllm 引用 106 · 语料尺子 4

45k 条按 32 子类分类的有害指令(含对抗变体),测 LLM 拒答率与安全性

2024-04-04
Red Teaming GPT-4V benchmark jailbreakmultimodalllm 引用 38

构造1445道有害问题,测GPT-4V等模型面对单/多模态越狱攻击的安全性

2024-04-03
JailBreakV jailbreakmultimodalrobustness 引用 266 · 语料尺子 16

28K 图文越狱对测 10 个 MLLM:LLM 文本越狱模板迁移到多模态模型的攻击成功率

2024-04-03
RedTeam-2K jailbreakllmmultimodal 引用 266 · 语料尺子 6

2000 条 16 类有害查询种子集,直接或配图攻击 LLM/多模态模型测越狱成功率

2024-03-28
JailbreakBench jailbreakrobustnessllm 引用 626 · 语料尺子 114

标准化越狱攻防基准:100个有害行为+攻击artifact库+统一评分,测LLM抗越狱能力

2024-03-18
EasyJailbreak jailbreakllm 引用 73

统一框架,用Selector/Mutator/Constraint/Evaluator组件复现11种越狱攻击,测LLM被攻破概率

2024-03-11
SEP ipillm 引用 89 · 语料尺子 7

测 LLM 能否区分指令与数据:把注入指令藏进数据字段,量化模型执行率

2024-03-05
InjecAgent ipiagent-toolllm 引用 542 · 语料尺子 19

1054 条工具返回里藏注入,看 agent 是否执行攻击者指定的有害工具调用

2024-03-05
WMDP harmful-capabilityllm 引用 531 · 语料尺子 10

3668 道生物/化学/网络安全四选一,量模型危险知识并作 RMU 遗忘的尺子

2024-02-19
CatQA jailbreakllm 引用 125 · 语料尺子 4

550 道三语有害问题,测微调后 LLM 的拒答率是否退化及 RESTA 修复效果

2024-02-19
Vision-in-Text Challenge (ViTC) jailbreakllm 引用 287

用ASCII字符画伪装有害请求文字,测LLM能否识别并抵抗这种视觉型越狱攻击

2024-02-16
ToolSword jailbreakdpiagent-toolllm 引用 85

测LLM工具调用全流程(输入/执行/输出三阶段六场景)的安全问题,含恶意请求、越狱、噪声工具误导等

2024-02-15
StrongReject jailbreakguardrail-evalllm 引用 379 · 语料尺子 89

313 条禁题+越狱方法,自动评分器量越狱后回答对攻击者有多大用处,而非只看拒没拒

2024-02-12
MIMIR privacyllm 引用 237 · 语料尺子 1

成员推断攻击基准:用 Pile 成员/非成员文本测 LLM 是否泄露训练数据

2024-02-08
JailbreakRadar jailbreakllmrobustness 引用 136

17 种越狱攻击×9 个 LLM×160 条违禁问题,并在 8 种防御下复测,系统比较攻击成功率与实用性

2024-02-07
SALAD-Bench jailbreakguardrail-evalrobustnessllm 引用 274 · 语料尺子 5

三层 66 类有害问题,含越狱增强与防御增强子集和选择题,附 MD-Judge 评估器测 LLM 安全

2024-02-06
HarmBench jailbreakllmrobustness 引用 1518 · 语料尺子 211

标准化红队评测框架:18种攻击方法×33个模型/防御,测LLM对有害行为诱导的抵抗力

2024-02-03
VLGuard jailbreakmultimodaloverrefusal-utility 引用 163

图文安全指令集:用有害图或安全图配有害问测 VLLM 拒答,兼测安全微调的效用代价

2024-01-23
RTVLM jailbreaktoxicity-biasprivacyrobustnessmultimodal 引用 65 · 语料尺子 3

首个 VLM 红队集:从可信、隐私、安全、公平 4 维 10 子任务测视觉语言模型

2024-01-17
AttackEval ground truth dataset jailbreakllm 引用 36

为越狱攻击评估提供细粒度/粗粒度打分基准,衡量攻击提示词对LLM的有效性

2024-01-12
Sorry-Bench jailbreakrobustnessguardrail-evalllm 引用 251 · 语料尺子 17

440 条分类配平的不当请求+20 种措辞变换,量 LLM 照办率并校准自动评判器

2024-01-11
TOFU privacyllm 引用 562 · 语料尺子 11

微调进 200 个虚构作家资料后要求遗忘指定作家,用遗忘/保留集问答比对(含 KS 检验)量遗忘是否彻底

2024-01-10
TrustLLM jailbreaktoxicity-biasprivacyrobustnessoverrefusal-utilityllm 引用 367 · 语料尺子 5

八维度可信度总评:越狱、毒性、偏见、隐私、稳健、过度拒答等 30+ 数据集测 16 个 LLM

2023-12-30
SODE jailbreakoverrefusal-utilityllm 引用 86 · 语料尺子 1

安全+过度拒答双向评测:用安全/不安全 prompt 对比各种 prompt 级防御策略的代价

2023-12-21
BIPIA ipillmrag 引用 339 · 语料尺子 6

把恶意指令藏在邮件/网页/表格/代码等外部内容里,测 LLM 做 QA/摘要时是否被带偏

2023-12-07
MITRE jailbreakharmful-capabilityllm 引用 181 · 语料尺子 8

按 MITRE ATT&CK 战术生成攻击协助请求,测 LLM 是否顺从并给出有用的攻击帮助

2023-11-29
MM-SafetyBench jailbreakmultimodal 引用 306 · 语料尺子 38

用图文配对(typography/图生图)诱导多模态大模型绕过安全对齐,输出有害内容

2023-11-27
How Many Unicorns Are in This Image? (VLLM Safety Benchmark) multimodalrobustnessjailbreak 引用 115

评测Vision LLM在OOD输入和对抗性视觉/语言越狱攻击下的安全性与鲁棒性

2023-11-10
FINE (Fake alIgNment Evaluation) jailbreakllm 引用 48

对比LLM在多选题vs开放式问题上对同一安全问题的回答一致性,揭示'假对齐'现象

2023-11-06
RuLES (Rule-following Language Evaluation Scenarios) dpillm 引用 55

测试LLM在预设规则场景下能否抵抗用户对话中的诱导/攻击而坚持遵守规则

2023-11-02
Tensor Trust dpirobustnessprivacyllm 引用 161 · 语料尺子 6

在线攻防游戏众包 12.6 万条提示注入,测 LLM 被劫持输出和系统提示被套出

2023-11-01
JADE jailbreakllmrobustness 引用 11

用语言学变换自动生成跨模型通用的高危越狱问题,测LLM安全对齐的稳健性

2023-11-01
Red-Team jailbreakllm · 语料尺子 6

100+180 条红队提示测 Vicuna 护栏,再用「教学提示」看能否事先免疫。

2023-10-27
ConfAIde privacyllm 引用 271 · 语料尺子 2

按情境完整性理论分四层出题,测 LLM 会否在不该泄露时说出他人秘密

2023-10-26
ToxicChat toxicity-biasguardrail-evaljailbreakllm 引用 292 · 语料尺子 26

1 万条 Vicuna demo 真实用户提示标毒性/越狱,评毒性检测器在人机对话域的表现

2023-10-25
WikiMIA privacyllm 引用 449

用 2023 年前后的维基文本构造成员推断基准,测能否从 token 概率判断文本是否在预训练集中

2023-10-24
HackAPrompt / Global Prompt Hacking Competition Dataset dpijailbreakllm 引用 85

60万条众包对抗prompt,测参赛者能否用直接注入让LLM违背系统指令输出指定内容

2023-10-19
Open-Prompt-Injection ipillm 引用 468 · 语料尺子 4

把注入指令混进 LLM 应用的待处理数据里,系统评测 5 种注入攻击与 10 种防御

2023-10-19
PKU-SafeRLHF-30K jailbreaktoxicity-biasllm 引用 770 · 语料尺子 12

人工标注的helpfulness/harmlessness偏好数据集,含19类伤害标签,用于安全RLHF训练与评估

2023-10-10
MaliciousInstruct jailbreakllmrobustness 引用 552 · 语料尺子 26

100 条恶意 How-to 问句,改解码参数让开源 LLM 对齐崩溃,BERT 判定器只看拒不拒

2023-10-10
Multi-Jail jailbreakllmrobustness 引用 269 · 语料尺子 13

315 句有害请求人工译成 9 种语言,测 ChatGPT/GPT-4 拒答在低资源语言上是否失效

2023-10-05
HEx-PHI jailbreakllm 引用 1357 · 语料尺子 43

330条覆盖11类危害的有害指令基准,用于测微调后LLM是否仍拒答有害请求

2023-10-03
PrivQA privacyoverrefusal-utilityjailbreakllmmultimodal 引用 53 · 语料尺子 1

指令让模型保护特定人群/类别个人信息,测文本+图像 QA 的隐私-效用权衡及越狱绕过

2023-10-02
XSafety jailbreaktoxicity-biasllm 引用 60

把 2800 条中英安全问题翻成 10 种语言,测 LLM 对非英语有害请求是否更容易给出不安全回答

2023-09-25
ToolEmu agent-tooldeception-alignmentoverrefusal-utility 引用 532 · 语料尺子 2

用 LLM 模拟工具沙箱,144 个模糊指令场景测 agent 是否因擅自执行高风险操作而造成损失

2023-09-13
SafetyBench toxicity-biasprivacyllm 引用 257 · 语料尺子 5

中英 11,435 道多选题,考 LLM 对冒犯、偏见、健康、违法、伦理、隐私 7 类安全问题的认知。

2023-08-25
Do-Not-Answer jailbreaktoxicity-biasprivacyguardrail-evalllm 引用 216 · 语料尺子 5

939 条不该回答的有害提问,按五类风险测 LLM 拒答,并训分类器自动评分

2023-08-18
HarmfulQA jailbreakllm 引用 282 · 语料尺子 8

1960 道 ChatGPT 生成的有害问题,套 CoU 越狱模板测聊天模型是否照答

2023-08-18
RED-EVAL jailbreakllm 引用 282 · 语料尺子 1

用多轮对话链(CoU)诱导LLM越狱,配套HarmfulQA有害问答基准

2023-08-17
Instruction-Following Robustness Benchmark (Prompt Injection) ipillmrobustness 引用 85

把对抗指令拼进prompt模拟第三方网页/文档注入,测LLM能否分辨并只服从原始指令

2023-08-12
CipherChat jailbreakllm 引用 499

把有害问题用密码编码后问 GPT-4 等,测密码能否绕过安全对齐

2023-08-07
In-The-Wild Jailbreak Prompts jailbreakllm 引用 720 · 语料尺子 4

收集野外1405条越狱prompt,用13类禁止问题集测GPT-3.5/4等6个模型的攻击成功率

2023-08-02
XSTest overrefusal-utilityllm 引用 513 · 语料尺子 5

250 条貌似危险的安全提示+200 条有害对照,测 LLM 是否过度拒答

2023-07-27
AdvBench jailbreakrobustnessllm 引用 3642 · 语料尺子 321

520 条有害祈使句,配 GCG 对抗后缀测对齐 LLM 能否被诱导输出有害内容

2023-07-10
BeaverTails jailbreakguardrail-evaltoxicity-biasllm 引用 1055 · 语料尺子 39

33 万条红队 QA 对人工标 14 类有害与偏好,用于训练审核器/奖励模型并评估 LLM 回答安全性

2023-06-20
DecodingTrust toxicity-biasrobustnessprivacyjailbreakpoisoning-backdoordeception-alignmentllm 引用 703 · 语料尺子 1

八维度测 GPT 类模型可信度:毒性、偏见、对抗/OOD 鲁棒、隐私泄露、伦理、公平

2023-06-15
CommonClaim jailbreakllmrobustness 引用 142 · 语料尺子 1

2 万条人工标注真/假/不确定常识陈述,训分类器后用 RL 搜 prompt 诱导 GPT-3 说假话

2023-05-23
Jailbreak prompts dataset (Jailbreaking ChatGPT via Prompt Engineering) jailbreakllm 引用 732

收集 78 条真实越狱 prompt,分 10 种模式,对 ChatGPT 3.5/4 在 8 类禁用场景下测绕过率

2022-12-19
Model-Written Evaluations deception-alignmenttoxicity-biasllm 引用 1026

让 LM 自动生成 154 个数据集,测 LLM 的人格倾向、迎合性、权力/自保等 AI 风险行为与性别偏见

2022-12-15
HarmfulQ jailbreaktoxicity-biasllm 引用 286 · 语料尺子 4

200 条显式有害问题,测 LLM 直接/CoT 提示下是否拒答或输出有害内容

2022-11-17
PromptInject dpillm 引用 1058 · 语料尺子 2

用户输入拼接「忽略前文」类指令,测 GPT-3 应用被目标劫持与 prompt 泄露的比例

2022-08-23
Anthropic Red Team Attempts jailbreaktoxicity-biasllm 引用 881

38,961 条众包人工多轮红队对话,诱导对话模型产生有害输出,比较模型类型与规模的抗攻击性

2022-08-05
OpenAI Moderation Evaluation Dataset guardrail-evaltoxicity-biasllm 引用 504

1680 条人工标注有害文本,评审核分类器对色情/仇恨/暴力/自残/骚扰的识别

2022-04-12
HH-RLHF jailbreakoverrefusal-utilitytoxicity-biasllm 引用 4346

人类偏好对比数据:众包者红队诱导有害输出并标注更无害/更有帮助的回复,用于训练和评测对齐

2022-03-17
ToxiGen toxicity-biasllm 引用 655 · 语料尺子 8

机器生成的隐式毒性/仇恨言论数据集,测毒性分类器对隐式偏见文本的识别能力

2021-12-01
HHH jailbreaktoxicity-biasoverrefusal-utilitydeception-alignmentllm 引用 1221 · 语料尺子 5

给对话和两条候选回复,测模型能否选出更有帮助、诚实、无害的那条,共约 200 题二选一

2021-10-16
DiaSafety toxicity-biasguardrail-evalllm 引用 118 · 语料尺子 1

标注人机对话里语境相关的不安全回复,评对话模型与安全分类器的检出能力

2021-10-15
BBQ toxicity-biasllm 引用 873 · 语料尺子 9

手写模板问答:上下文模糊时模型是否按刻板印象答,上下文明确时偏见是否压过准确率

2021-01-27
BOLD toxicity-biasllm 引用 614 · 语料尺子 5

给人口学主题的句子前缀让模型续写,自动打分续写的毒性/情感/性别倾向,量化社会偏见

2020-09-24
RealToxicityPrompts toxicity-biasllm 引用 1838 · 语料尺子 11

10 万条网页截断残句让 LLM 续写,用 Perspective API 量无攻击下自发生成毒性文本的概率