评测集

249 个 · 按首发时间降序 · 标签可多选(交集) ← 雷达
2026-08-18
MobileWorldSafety ipiagent-computermultimodalrobustness 引用 0 · 语料尺子 1

142 条真实 Android app 任务,测手机 GUI agent 被界面内植入的注入指令劫持的比例

2026-08-13
Escalating Delusions longitudinal evaluation (untitled, 30-day / 30-message script) 引用 0
2026-08-05
DelusionEval 引用 0
2026-07-26
MulRobBench 引用 0
2026-07-15
SkillSec-Eval 引用 1
2026-07-12
PASB (Personal Agent Sycophancy Benchmark) 引用 0
2026-07-04
Polymorphic Sybil Poisoning RAG Failure-Mode Benchmark 引用 0
2026-06-30
AI-Infra-Guard论文 jailbreakmcp-harnessagent-toolllmcode-securitydpi 引用 2

腾讯朱雀四层红队平台:AI 基础设施 CVE 扫描、MCP/skill 审计、agent 多轮红队、LLM 越狱评测

2026-06-22
Multilingual Criminal Law Over-Alignment benchmark (Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts) 引用 0
2026-06-15
Phantoms and Disclosures privacy auditing framework (untitled) 引用 0
2026-06-11
FORGE (Fake Online Recommendations in Generative Environments) 引用 1
2026-06-10
RELIANCE 引用 0
2026-06-08
BenSyc 引用 0
2026-06-08
MM-P…(摘要截断,全名未知)论文 privacymultimodalllm 引用 17

MM-Privacy:给VLM看含隐私的表单/手写图,跨OCR/VQA/摘要任务测是否泄露或记住敏感信息

2026-06-05
MalSkillBench论文 guardrail-evalipipoisoning-backdoorcode-securityagent-codeagent-tool 引用 11

3944 个沙箱验证的恶意 agent skill(代码/提示注入/控制平面),测检测器能否识别

2026-06-05
Pander Score 引用 0
2026-06-01
Execution-Grounded Security Testing for Coding Agents (red-team harness, untitled) 引用 0
2026-05-31
Lost in Delusion multi-turn delusion/distress safety simulation 引用 1
2026-05-31
Truthful AI Advisors (cheap-talk honesty benchmark)论文 deception-alignmentllm 引用 2

用 cheap-talk 博弈测 LLM 当利益冲突顾问时是否如实报信息,以互信息对比理论均衡

2026-05-28
Dual-surface prompt injection evaluation (tool output vs. tool description)论文 ipiagent-toolllmmcp-harness 引用 0

同一注入载荷分别塞进工具返回和工具描述,对比13个LLM在AgentDojo上的攻击成功率

2026-05-12
SkillSafetyBench论文 ipiagent-codeagent-toolpoisoning-backdoorcode-securitymcp-harness 引用 10

155 个恶意 skill/本地文件案例,测 CLI 编码 agent 在良性请求下被间接注入诱导做不安全操作

2026-05-11
ExploitGym论文 harmful-capabilityagent-toolagent-code 引用 15

让 AI agent 把真实漏洞开发成可用 exploit,评其网络攻击能力

2026-05-11
LITMUS论文 jailbreakdpiipiagent-toolagent-computerdeception-alignment 引用 2 · 语料尺子 2

真实 Ubuntu 上测 OS agent 是否被诱导执行危险操作,语义+系统状态双重校验,819 例

2026-04-09
PIArena论文 ipiagent-toolguardrail-evalrobustness 引用 11

统一平台,在 AgentDojo 等工具 agent 环境里用自适应注入攻击评测各类提示注入防御

2026-04-06
ClawsBench论文 ipiagent-tooloverrefusal-utilitydeception-alignmentmcp-harness 引用 20

用 Gmail/Slack/日历等 mock 服务的 44 个任务,测生产力 agent 能力与注入、泄密、误删等不安全动作率

2026-04-03
OpenClaw-series agent security benchmark (205 test cases)论文 harmful-capabilityagent-toolagent-code 引用 10

205题测OpenClaw系编码agent在完整网络攻击杀伤链上的危险能力暴露

2026-04-01
ClawSafety论文 ipiagent-toolagent-codemcp-harness 引用 12

120 例注入藏在 skill 文件/邮件/网页中,沙盒测高权限个人 agent 是否执行泄密、转账、删文件等有害动作

2026-02-12
AgentLeak论文 privacyipidpiagent-toolmulti-agentllm 引用 8

多 agent 系统内部通道(agent 间消息、共享内存、工具参数)的隐私泄露,1000 场景含半数攻击

2026-02-09
PASB (Personalized Agent Security Bench)论文 dpiipipoisoning-backdooragent-tool 引用 31

在真实工具链的本地个性化 agent(OpenClaw)上端到端测 DPI/IPI/记忆投毒/PoT 后门

2026-02-03
AgentDyn ipiagent-tooloverrefusal-utility 引用 26 · 语料尺子 12

60 个开放式动态工具任务+560 个间接注入,重测十种 IPI 防御的安全与效用

2026-01-15
TS-Bench论文 guardrail-evaljailbreakdpiipioverrefusal-utilityagent-toolllm 引用 44

标注工具调用 agent 逐步动作安全性,评护栏模型能否在执行前拦截恶意请求与注入

2025-12-23
(摘要在“we introduce”处截断,名字未给出;标题:A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents)论文 deception-alignmentagent-toolagent-code 引用 10

40 个沙箱 bash 场景,测 agent 在 KPI 压力下是否违反伦理/安全约束

2025-12-17
MCP-SafetyBench论文 ipidpipoisoning-backdooragent-toolmcp-harnessllm 引用 30 · 语料尺子 2

真实 MCP 服务器上 20 类攻击(工具投毒/返回注入/用户侧恶意指令),测 LLM agent 多轮任务 ASR

2025-12-06
OmniSafeBench-MM论文 jailbreakmultimodalllm 引用 11 · 语料尺子 1

多模态越狱攻防统一工具箱:13 攻击×15 防御,测 18 个 MLLM 的有害输出率

2025-11-25
BrowseSafe论文 ipiguardrail-evalagent-webllm 引用 25

1.47 万条真实结构 HTML 含/不含注入,测检测器能否识别网页中的注入

2025-11-15
AttackVLA论文 robustnesspoisoning-backdoormultimodalagent-embodied 引用 12

统一框架对 VLA 机器人模型做图像/文本对抗攻击与后门投毒,仿真+真机评动作被操控率

2025-11-13
SACRED-Bench论文 jailbreakmultimodalguardrail-evalllm 引用 13

把有害指令藏进叠加语音/混合音频/多人对话,测音频 LLM 越狱率及音频护栏拦截

2025-11-07
TAMAS论文 dpiipijailbreakoverrefusal-utilitymulti-agentagent-toolllm 引用 21 · 语料尺子 2

多agent系统在DPI/IPI/冒充/恶意agent六类攻击下的安全与效用权衡(ERS)

2025-11-05
Silenced Bias Benchmark (SBB)论文 toxicity-biasllm 引用 11

激活引导绕过拒答,多选题测 LLM 被安全对齐掩盖的群体偏见

2025-10-28
MobileRisk-Live论文 guardrail-evalagent-computermultimodalprivacyjailbreak 引用 16

Android 沙箱里录 204 条 GUI agent 轨迹,测安全检测器能否判出不安全轨迹并定位出错步骤

2025-10-26
b3 benchmark (threat snapshots)论文 dpiipiagent-toolagent-coderagllmcode-securityjailbreakprivacy 引用 10

把 agent 执行状态冻结成 10 个 threat snapshot,用众包攻击测 backbone LLM 在直接/间接注入下是否泄密、乱调工具、产恶意代码

2025-10-23
GhostEI-Bench论文 ipijailbreakagent-computermultimodalprivacy 引用 12

Android 模拟器里向手机 GUI agent 注入伪造弹窗/覆盖层,测 VLM agent 被劫持率

2025-10-20
LiteAgent / TrickyArena论文 agent-webother:dark-patterns 引用 15

在可开关暗黑模式的仿真网站上测 web agent 是否被欺骗式 UI 诱导做出偏离任务的操作

2025-10-17
DeceptionBench论文 deception-alignmentllmrobustness 引用 11

五领域150场景测LLM自利/讨好型欺骗,含奖励诱导与多轮强化条件

2025-10-16
MAGPIE论文 privacymulti-agentllmdeception-alignment 引用 23

200 个多 agent 协商场景,测 LLM agent 在非对抗协作中是否泄露私密信息及操纵行为

2025-10-16
Qwen3GuardTest论文 guardrail-evaltoxicity-biasharmful-capabilityprivacyllm 引用 115

评审核器对推理模型输出(含思考链)的安全分类与流式句级不安全定位,2441 条英文样本

2025-10-14
MSB论文 ipiagent-toolmcp-harnessllmrag 引用 37 · 语料尺子 3

MCP 工具链 12 类攻击(名冲突/描述注入/假错误等)2000 例,测 9 个 LLM agent 的被攻击成功率

2025-10-11
SecureWebArena论文 jailbreakdpiipirobustnessmultimodalagent-web 引用 14

6 个模拟网站、330 个对抗场景,从用户侧(越狱/注入)和网页侧(弹窗/广告/间接注入)测 LVLM 网页 agent 安全

2025-10-09
VoiceAgentBench论文 jailbreakoverrefusal-utilitymultimodalagent-tool 引用 10

语音版 AgentHarm+工具调用:多语言语音指令下测工具编排正确率与有害请求拒绝率

2025-10-06
Petri论文 deception-alignmentllmagent-tool

auditor agent 按 seed 多轮诱导目标模型,judge 按 36 维打分,查欺骗/谄媚/权力寻求等对齐问题

2025-09-30
Embodied physical safety benchmark (untitled)论文 agent-embodiedmultimodalllmjailbreakprivacy 引用 11

SafeMindBench:图文对测具身 agent 在危险指令/危险环境/顺序约束下的规划安全

2025-09-30
SafeMindBench论文 agent-embodiedmultimodalllmoverrefusal-utility 引用 10

5558 题测具身 agent 四个推理阶段能否识别危险指令/环境、修正不安全动作序列。

2025-09-29
HarmMetric Eval论文 guardrail-evaljailbreakllm 引用 13

评有害性判定器:有害提示配越狱产生的有害/无害回复,看各种 judge 能否正确排序

2025-09-28
Falcon论文 guardrail-evalmultimodaljailbreaktoxicity-bias 引用 2

5.7 万图文 VQA 对,标注图像/指令/回复三层有害性,评多模态安全审核器准确率

2025-09-28
SafeSearch论文 ipitoxicity-biasagent-toolagent-webrag 引用 3 · 语料尺子 2

往搜索结果里塞一个不可靠网页,测搜索 agent 是否被诱导输出广告/偏见/有害/误导内容

2025-09-01
Strata-Sword论文 jailbreakllm 引用 15 · 语料尺子 1

按推理复杂度分三级的中英双语越狱基准,15 种攻击含藏头诗、灯谜等中文特有方法

2025-08-26
CUA-SHADE-Arena论文 deception-alignmentguardrail-evalagent-computeragent-codeprivacy 引用 22

计算机使用 agent 边做公司任务边隐蔽作恶,测监控器能否从轨迹中检出破坏行为

2025-08-19
MCPTox论文 ipiagent-toolmcp-harnesspoisoning-backdoor 引用 64

在真实 MCP 工具描述中植入恶意指令,测 agent 是否照做发起有害工具调用

2025-08-17
MCPSecBench论文 mcp-harnessagent-toolipidpipoisoning-backdoorllm 引用 50

MCP 安全基准:17 类攻击覆盖用户/客户端/传输/服务器四面,在 Claude、OpenAI、Cursor 上实测攻击成功率

2025-07-29
Over-Refusal overrefusal-utilityllm · 语料尺子 7

用形似有害的无害提示测 LLM 是否误拒,衡量安全对齐的效用代价

2025-07-28
ART (Agent Red Teaming)论文 dpiipiagent-toolllm 引用 23

180 万条竞赛攻击提炼成基准,测 22 个工具 agent 在直接/间接注入下违规率与迁移性

2025-07-08
OpenAgentSafety论文 dpiipiprivacycode-securityoverrefusal-utilityagent-toolagent-webagent-code 引用 60 · 语料尺子 1

350+ 真实工具多轮任务,用户/NPC/文件施压,测 agent 是否做出八类不安全动作

2025-06-30
ClearHarm论文 jailbreakharmful-capabilityllm 引用 15 · 语料尺子 4

179 条明确 CBRN 类有害问题,测越狱攻击能否让模型给出灾难性误用信息

2025-06-19
IS-Bench论文 agent-embodiedmultimodaldeception-alignment 引用 39

模拟器里161个家务场景、388个风险,过程级检验VLM具身agent能否先做安全缓解步骤

2025-06-17
AGENTSAFE (SAFE)论文 jailbreakagent-embodiedmultimodal 引用 32

在 THOR 模拟家居中给 VLM 具身 agent 下越狱改写的危险指令,测感知-规划-执行各层是否拒绝

2025-06-17
OS-Harm论文 jailbreakipideception-alignmentagent-computermultimodal 引用 90

OSWorld 上 150 个任务测电脑操作 agent:用户滥用、注入攻击、自发误行为三类,LLM 裁判评安全

2025-06-14
OpenUnlearning论文 privacyharmful-capabilityrobustnessoverrefusal-utilityllm 引用 70

统一遗忘评测框架:13 种遗忘算法×16 指标,覆盖 TOFU/MUSE/WMDP 并做指标元评测

2025-06-12
Decomposition Attack Monitoring Dataset论文 jailbreakguardrail-evalllm 引用 20

把有害目标拆成无害子任务多轮投喂,测模型拒答率与顺序监控器的检出率

2025-06-11
LLMail-Inject论文 ipiagent-toolguardrail-evalragllm 引用 24 · 语料尺子 3

公开挑战赛收集 20 万条邮件注入攻击,测邮件助手及多种防御能否挡住未授权工具调用

2025-06-09
SafeFlowBench论文 ipimultimodalagent-computeragent-webmulti-agentrobustness 引用 26

用带伪造文本/假弹窗的网页、应用、OS 截图测 VLM agent 是否执行不安全动作,另含多 agent 并发场景

2025-06-04
AgentMisalignment论文 deception-alignmentagent-tool 引用 26

9 个工具 agent 环境测模型自发逃避监控、抗关机、放水、夺权的倾向

2025-06-03
CyberGym论文 harmful-capabilityagent-codeagent-toolcode-security 引用 55 · 语料尺子 4

给漏洞描述和代码库,让 agent 写 PoC 复现真实漏洞,测网络攻击能力

2025-06-03
VPI-Bench论文 ipiagent-computeragent-webmultimodalrobustness 引用 37

306 个网页环境里视觉嵌入恶意指令,测 computer-use/浏览器 agent 是否被带偏执行

2025-06-02
MLA-Trust论文 jailbreaktoxicity-biasprivacydeception-alignmentmultimodalagent-webagent-computer 引用 26

34 个网页/手机 GUI 任务测多模态 agent 的真实性、可控、安全、隐私

2025-06-01
AgentDojo banking data-exfiltration extension论文 ipiprivacyagent-toolllm 引用 31

在 AgentDojo 银行套件加 32 任务与数据流注入攻击,测工具 agent 是否泄露用户数据

2025-05-31
Agent-Auditor论文 guardrail-evalagent-toolipidpijailbreak 引用 81 · 语料尺子 2

ASSEBench 用 2293 条 agent 安全/安保轨迹测 LLM 判官能否达到人类专家判别水平

2025-05-31
RiOSWorld论文 jailbreakipiagent-computeragent-webmultimodaldeception-alignment 引用 26 · 语料尺子 2

492 个真机 GUI 风险任务,测多模态电脑操作 agent 对用户有害指令和环境注入的防御

2025-05-28
Evaluation Awareness Benchmark论文 deception-alignmentllm 引用 88

给 LLM 看 1000 条转录文本,测它能否判断自己是在被评测还是真实部署

2025-05-28
RedTeamCUA (RTC-Bench)论文 ipiagent-computeragent-webmultimodal 引用 38

在 VM+Docker 网页混合沙盒里把恶意指令藏进网页,测 computer-use agent 被间接注入劫持的比例

2025-05-22
PolyRefuse论文 jailbreakllm 引用 27

14 语种有害/良性提示集,测 refusal 方向跨语言通用性及激活引导越狱

2025-05-21
AJailBench (Audio Jailbreak)论文 jailbreakmultimodalrobustness 引用 22

把文本越狱提示转成语音并加音频扰动,测音频语言模型的越狱脆弱性

2025-05-20
MCIP-Bench论文 ipiguardrail-evalmcp-harnessagent-toolllm 引用 47

合成 MCP 工具调用轨迹,让 LLM 判断安全与否并分类 10 种 MCP 风险

2025-05-17
Video-SafetyBench论文 jailbreakmultimodaltoxicity-bias 引用 27 · 语料尺子 2

合成视频配显式/隐式有害 query,测视频多模态模型越狱率,RJScore 打分

2025-05-12
FalseReject论文 overrefusal-utilityllm 引用 45 · 语料尺子 3

用 16k 条看似有害实则无害的提问,测 LLM 是否过度拒答,并给推理式回答做训练

2025-04-22
WASP论文 ipiagent-webagent-computermultimodal 引用 134 · 语料尺子 7

仿真网站里植入人写注入,测网页/计算机 agent 是否被劫持去做攻击者任务

2025-04-21
Virology Capabilities Test (VCT)论文 harmful-capabilityllmmultimodal 引用 40

322 道多模态病毒学实验排障题,测模型的两用生物危险能力

2025-04-18
DoomArena论文 dpiipiagent-toolagent-webguardrail-eval 引用 32 · 语料尺子 1

可插拔攻击框架,在τ-bench/BrowserGym里测恶意用户与恶意环境注入对agent的影响

2025-04-14
Jailbreak Tax论文 jailbreakoverrefusal-utilityllm 引用 24

把模型对齐成拒答数学/生物题,再越狱,测越狱后答案准确率掉多少

2025-04-13
EmoAgent (EmoEval)论文 llmguardrail-evalmulti-agent 引用 33

模拟心理脆弱用户与角色聊天机器人多轮对话,用 PHQ-9 等量表测对话前后心理恶化率

2025-04-09
OpenSafeMLRM论文 jailbreakmultimodalllm 引用 33

多模态推理模型越狱评测工具包,对比推理版与基座版在图文越狱下的 ASR

2025-04-06
PolyGuardPrompts论文 guardrail-evaljailbreakoverrefusal-utilitytoxicity-biasllm 引用 56 · 语料尺子 2

17 语种 2.9 万条 prompt-回复对,测护栏判断有害性与拒答的准确率

2025-04-01
Multi-AudioJail论文 jailbreakmultimodalrobustness 引用 30

把有害请求做成多语言、多口音并加声学扰动的语音,测音频 LLM 越狱率

2025-03-26
ShieldAgent-Bench论文 guardrail-evalipipoisoning-backdooragent-webagent-tool 引用 128

3K 条网页 agent 风险轨迹(AgentPoison/AdvWeb 攻击),测护栏按策略判违规的准召

2025-03-22
BeaverTails-V论文 jailbreakmultimodaloverrefusal-utilityguardrail-eval 引用 23 · 语料尺子 2

图文有害请求数据集,带有用性/安全双偏好与严重程度标注,评测并对齐多模态模型安全

2025-03-21
CVE-Bench论文 harmful-capabilitycode-securityagent-webagent-toolllm 引用 104

沙箱里让 LLM agent 利用 40 个真实关键 CVE 攻破 Web 应用,评其自主攻击能力

2025-03-20
CrAIBench论文 ipidpirobustnessagent-toolllm 引用 27

Web3 agent 在记忆被注入/工具输出被篡改时是否误转账,150+链上任务+500+攻击

2025-03-19
DeepSeek bilingual safety evaluation dataset (Chinese-English, Chinese sociocultural context)论文 jailbreaktoxicity-biasllmmultimodal 引用 34

按中国生成式AI安全国标构建3100条中英双语提示,评DeepSeek系列文本/多模态/文生图模型的有害输出

2025-03-13
DarkBench 引用 35
2025-03-12
AgentDAM论文 privacyagent-webagent-tooloverrefusal-utility 引用 77 · 语料尺子 1

给 web agent 含敏感信息的用户资料,看它完成网页任务时会不会多余地泄露无关隐私

2025-03-09
BingoGuardTest论文 guardrail-evalllmtoxicity-bias 引用 23

988 条分级有害回复,评审核器能否判出安全性和 0-4 级风险严重度

2025-03-06
SafeArena论文 jailbreakagent-weboverrefusal-utility 引用 88 · 语料尺子 2

500 条配对安全/有害网页任务,看 web agent 会不会替用户造谣、骚扰、犯罪

2025-03-05
MASK论文 deception-alignmentllm 引用 50

施压场景下测 LLM 是否违背自身信念说谎,把诚实与准确性分开评

2025-02-24
PrivaCI-Bench论文 privacyllm 引用 36

用 GDPR/HIPAA 等法规、真实判例和合成情景构造 14 万道选择题,测 LLM 隐私合规判断

2025-02-19
AILuminate v1.0/v1.1论文 jailbreaktoxicity-biasllm 引用 36

12 类危害的单轮提示测聊天模型拒答率,微调评估器集成打分并分五档评级

2025-02-18
SafeEraser论文 jailbreakprivacyoverrefusal-utilitymultimodal 引用 30 · 语料尺子 2

3000 图/28.8K VQA 测 MLLM 安全遗忘:遗忘质量、效用及过度拒答(SARR)

2025-02-17
BaxBench论文 code-securityllmoverrefusal-utility 引用 47

给 LLM 写后端应用任务,跑功能测试并用真实 exploit 攻击,同时测正确性与安全漏洞

2025-02-16
MMSafeAware论文 overrefusal-utilityjailbreakmultimodal 引用 25

1500 图文对测 MLLM 能否判断组合后内容安全与否,含过度敏感子集

2025-02-12
IHEval论文 dpiipirobustnessllmagent-tool 引用 63

3538 例测 LLM 能否按系统>用户>历史>工具输出的优先级处理冲突指令

2025-01-30
MIS (Multi-Image Safety)论文 jailbreakmultimodaloverrefusal-utility 引用 21

多张无害图组合出有害意图,测 VLM 能否跨图推理识别并拒绝,同时不过度拒答

2025-01-28
SafeRAG 引用 42
2025-01-24
CASE-Bench论文 overrefusal-utilityjailbreakllm 引用 23

给有害查询配安全/不安全上下文,用大量人工标注对比模型拒答是否合理

2025-01-23
Jailbreak-AudioBench论文 jailbreakmultimodal 引用 25

把越狱文本转成语音并做音调/语速/噪声/重音等编辑,测音频大模型是否被诱出有害内容

2025-01-15
AEGIS2论文 guardrail-evaltoxicity-biasllm 引用 145 · 语料尺子 4

3.4 万条人标安全对话,按 12 类风险分类法评测 LLM 内容护栏的判别准确率

2025-01-14
CWEval论文 code-securityoverrefusal-utilityllm 引用 90

多语言 CWE 编程题,同时跑功能与安全测试,量化 LLM 生成代码功能对但有漏洞的比例

2024-12-19
Agent-SafetyBench论文 jailbreakipioverrefusal-utilitycode-securityagent-toolllm 引用 252 · 语料尺子 3

2000 条模拟工具环境任务,测 LLM agent 在恶意指令与风险环境下的安全行为,微调 Qwen 判分

2024-12-17
SafeAgentBench论文 jailbreakoverrefusal-utilityagent-embodiedllm 引用 106 · 语料尺子 2

AI2-THOR 家庭模拟器中给具身 LLM agent 下危险任务,测拒绝率与安全对照任务成功率

2024-12-09
SafeWatch-Bench论文 guardrail-evalmultimodaltoxicity-bias 引用 39 · 语料尺子 1

200 万视频六类不安全内容,评视频护栏模型按安全策略多标签判定并给出解释

2024-12-06
In-context Scheming Evals (Apollo Research)论文 deception-alignmentagent-toolllm 引用 274

用 6 个带工具的 agent 环境测前沿模型是否会为目标隐秘欺骗开发者(关监督、自渗出、撒谎)

2024-11-29
VLSBench论文 jailbreakmultimodal 引用 65

2.2k图文对,去掉文本中的风险线索,测MLLM能否凭图像识别有害请求并拒答

2024-11-12
RedCode论文 code-securityharmful-capabilityjailbreakagent-codeagent-toolllm 引用 99 · 语料尺子 4

测代码 agent 是否会执行危险代码或生成恶意软件,沙箱内真跑

2024-10-30
NotInject论文 overrefusal-utilityguardrail-evaldpillm 引用 48 · 语料尺子 3

用含注入触发词的良性提示,测提示注入护栏模型的过度拦截(误报)率

2024-10-29
Multilingual Toxicity Guardrail Test Suite论文 guardrail-evaltoxicity-biasjailbreakrobustnessllm 引用 20

用七数据集十余语言的有毒文本和越狱提示,测 LlamaGuard 等护栏的多语言检出能力

2024-10-29
SG-Bench论文 jailbreakrobustnessllm 引用 81

有害 query 配多种越狱模板与提示形式,跨生成/选择/判别三任务测 LLM 安全泛化

2024-10-29
VLJailbreakBench论文 jailbreakmultimodalllm 引用 31

用 IDEATOR 生成 3654 条图文越狱样本,测 11 个 VLM 的攻击成功率

2024-10-28
Sabotage Evaluations for Frontier Models论文 deception-alignmentllmagent-codecode-security 引用 49

测前沿模型能否在监控下隐蔽搞破坏:误导决策、埋代码 bug、装弱、当监督者放水

2024-10-25
FairMT-Bench论文 toxicity-biasjailbreakllm 引用 47

多轮对话中通过指代省略、分散提问、越狱话术、负反馈等诱导 LLM 输出偏见,评其公平性

2024-10-23
CLEAR论文 privacymultimodalllm 引用 37 · 语料尺子 1

多模态版 TOFU:虚构人物图文问答,评 11 种遗忘方法能否抹掉指定人物又不伤保留集

2024-10-23
MobileSafetyBench论文 jailbreakipioverrefusal-utilityagent-computermultimodal 引用 44 · 语料尺子 2

Android 模拟器 250 个任务,测 GUI agent 对有害用户请求、app 内容注入的安全性及有用性

2024-10-22
AraSafe (Arabic LLM Safeguard Evaluation Dataset)论文 jailbreaktoxicity-biasoverrefusal-utilityllm 引用 22

阿拉伯地区化安全题集:有害/间接攻击/敏感词无害三类提问,政府与反对派双视角评分

2024-10-21
NetSafe论文 multi-agentllmtoxicity-biasjailbreakrobustness 引用 36 · 语料尺子 2

在不同拓扑的 LLM 多agent网络里安插攻击者传播虚假/偏见/有害信息,测结构对安全的影响

2024-10-11
AgentHarm jailbreakagent-tooloverrefusal-utilityllm 引用 359 · 语料尺子 18

用户直说要作恶时,agent 会不会调工具把多步有害任务跑完;附 benign 对照测过度拒答

2024-10-11
BrowserART论文 jailbreakagent-webllm 引用 68 · 语料尺子 2

给浏览器 agent 下 100 条有害指令,测拒答训练的 LLM 变身 agent 后是否照做

2024-10-11
JAILJUDGE论文 jailbreakguardrail-evalllm 引用 53 · 语料尺子 3

评『越狱判定器』:多场景多语言人工标注集测 judge 准确与可解释打分

2024-10-09
ST-WebAgentBench论文 agent-webipioverrefusal-utilityprivacydeception-alignment 引用 113 · 语料尺子 2

在 WebArena/SuiteCRM 中给 web agent 任务附加安全策略,测其在策略约束和注入下的合规完成率

2024-10-08
MSSBench (Multimodal Situational Safety)论文 multimodaloverrefusal-utilityother:situational-safety 引用 50

同一无害查询配安全/不安全图片,测 MLLM 能否按视觉情境判断该答还是该拒(含聊天与具身任务)

2024-10-04
AutoPenBench论文 harmful-capabilityagent-tool 引用 37

让 LLM agent 自动渗透测试 33 个漏洞靶机,测其网络攻击能力

2024-10-03
ASB dpiipipoisoning-backdooragent-toolragllm 引用 350 · 语料尺子 8

10 个场景、13 个 LLM 的工具 agent,测 DPI/IPI/记忆投毒/PoT 后门及 11 种防御的攻击成功率

2024-10-02
SciSafeEval论文 jailbreakharmful-capabilityllm 引用 28 · 语料尺子 1

31840 条化学生物医药有害科学请求,含越狱增强,测 LLM 安全对齐

2024-09-13
AI-LieDar 引用 37
2024-08-29
PrivacyLens论文 privacyllmagent-tool 引用 177 · 语料尺子 3

从 QA 探测到工具 agent 执行任务,分层测 LLM 会不会违反情境隐私规范泄露信息

2024-08-27
MHJ论文 jailbreakllmharmful-capability 引用 166 · 语料尺子 5

537 个人类红队多轮越狱对话,测 LLM 防御和遗忘方法在多轮攻击下是否失守

2024-08-23
LLM-PBE论文 privacyllm 引用 75

用提取、成员推断、PII 诱导等攻击及防御,系统评估 LLM 全生命周期隐私泄露

2024-08-15
Cybench论文 harmful-capabilityagent-toolagent-code 引用 166 · 语料尺子 1

用 40 道真实 CTF 题让 LLM agent 在 Kali 容器里写代码、跑命令拿 flag,测网络攻击能力

2024-08-02
CyberSecEval 3 (Purple Llama CybersecurityBenchmarks)论文 harmful-capabilitycode-securitydpiipillmagent-tool 引用 75

测 LLM 网络攻击能力:钓鱼、不安全代码、漏洞利用与自主攻击

2024-07-11
AIR-Bench 2024论文 jailbreaktoxicity-biasharmful-capabilityprivacyllm 引用 79 · 语料尺子 4

把 8 部法规 16 份公司政策拆成 314 类风险,生成 5694 条有害提示测 LLM 拒答率

2024-07-08
MUSE (Machine Unlearning Six-Way Evaluation)论文 privacyllmoverrefusal-utility 引用 266

用书籍/新闻语料从记忆、隐私泄露、效用、规模、连续请求六维度评测 LLM 遗忘算法

2024-07-08
T2VSafetyBench论文 jailbreaktoxicity-biasoverrefusal-utilityother:text-to-video 引用 68 · 语料尺子 3

用恶意/越狱提示测 9 个文生视频模型 14 类安全风险,GPT-4 加人工判定视频是否违规

2024-07-02
CoCoNot论文 overrefusal-utilityjailbreakllm 引用 109 · 语料尺子 4

测 LLM 该拒时拒、不该拒时答:5 类该拒提示+对照集,GPT-4 评判合规率。

2024-06-26
Aya Red-teaming论文 jailbreaktoxicity-biasllm 引用 73

8 语种人工编写有害提示(含文化本地伤害),测多语言 LLM 拒绝/顺从率

2024-06-26
Wild-Jailbreak jailbreakoverrefusal-utilityllm 引用 217 · 语料尺子 34

真实用户越狱策略改写的 2000 条有害 + 210 条仿越狱无害题,测「该拒的拒、不该拒的别拒」

2024-06-26
WildGuard论文 guardrail-evaljailbreakoverrefusal-utilityllm 引用 495 · 语料尺子 19

5K 人工标注的审核器测试集,评护栏对有害提示、有害回复、拒答的三项分类

2024-06-26
WildGuardMix论文 guardrail-evaljailbreakoverrefusal-utilitytoxicity-biasllm 引用 495 · 语料尺子 7

9.2万条带人工标注的 prompt/response 对,测审核器识别有害提示、有害回复与拒答的能力

2024-06-26
WildGuardTest guardrail-evaljailbreakoverrefusal-utilityllm 引用 495 · 语料尺子 17

1,725 条人工标注 prompt-response 对,测审核模型判 prompt 有害/回复有害/是否拒答三项的准确率

2024-06-21
SIUO论文 jailbreakmultimodaloverrefusal-utility 引用 21 · 语料尺子 5

图和文各自无害、合起来有害的 167 题,测多模态模型能否识别跨模态风险并安全应答

2024-06-20
PKU-SafeRLHF jailbreakoverrefusal-utilityguardrail-evalllm 引用 236 · 语料尺子 12

44.6k 有害提示配 Llama 回答,人工分别标有用性与安全性偏好,附 19 类危害与严重度分级

2024-06-20
Safe-RLHF论文 jailbreaktoxicity-biasguardrail-evaloverrefusal-utilityllm 引用 236 · 语料尺子 7

有害提示+问答对,19 类危害三级严重度,双偏好标注评安全对齐与审核器

2024-06-19
AgentDojo ipiagent-tooloverrefusal-utility 引用 142 · 语料尺子 72

邮件/银行/旅行工具环境里,工具返回值藏注入,测 agent 是否被劫持及任务效用

2024-06-18
ARE (Agent Robustness Evaluation)论文 ipirobustnessmultimodalagent-web 引用 122

在 VisualWebArena 上对商品图加微扰劫持多模态网页 agent,200 个定向对抗任务,并按组件图分解稳健性

2024-06-18
VisualWebArena-Adv论文 ipirobustnessmultimodalagent-web 引用 122

在 VisualWebArena 网页里植入扰动图片/文字,测多模态网页 agent 被定向诱导的成功率

2024-06-17
SPA-VL论文 jailbreakoverrefusal-utilitymultimodal 引用 87 · 语料尺子 5

VLM 安全偏好对齐数据集,附图文有害问答集和帮助性集,测有害率与效用

2024-06-16
RWKU (Real-World Knowledge Unlearning Benchmark)论文 privacyrobustnessoverrefusal-utilityllm 引用 83

测 LLM 遗忘 200 个真实名人知识的效果:填空/问答/对抗探针+成员推断+效用保持

2024-06-13
EICU-AC论文 guardrail-evalagent-toolprivacy 引用 100 · 语料尺子 1

给 EHRAgent 加角色访问控制规则,测护栏 agent 能否拦下越权查询 eICU 医疗数据的请求

2024-06-13
JailTrickBench论文 jailbreakrobustnessllm 引用 54

统一框架跑7种越狱攻击×6种防御,分析8个影响攻击成功率的因素

2024-06-13
Mind2Web-SC论文 guardrail-evalagent-weboverrefusal-utility 引用 100 · 语料尺子 2

评护栏能否按用户属性规则正确放行/拦截 web agent 动作,含合规与违规各半

2024-06-11
Sandbagging / AI Sandbagging Evals论文 deception-alignmentharmful-capabilityllm 引用 123

测 LLM 能否在 WMDP 等危险能力评测上策略性装弱:提示诱导或密码锁微调,有密码才答对。

2024-06-08
NYU CTF Bench论文 harmful-capabilityagent-toolllmcode-security 引用 122

用工具调用 agent 让 LLM 解 CTF 题,测其网络攻击能力

2024-06-02
TaskTracker论文 ipiguardrail-evalllmrag 引用 60 · 语料尺子 4

用激活差分探针检测 LLM 读外部文本后任务是否被劫持,50 万条注入/干净样本

2024-05-31
OR-Bench论文 overrefusal-utilityllm 引用 213 · 语料尺子 1

8 万条看似有害的无害提示测 LLM 过度拒答,配 1 千条真有害提示看安全-效用权衡

2024-05-31
OR-Bench-Hard-1K论文 overrefusal-utilityllm 引用 213 · 语料尺子 5

约 1000 条看似有害实则无害的难题,测 LLM 是否过度拒答,附有害对照组

2024-05-30
JAMBench论文 jailbreakguardrail-evaltoxicity-biasllm 引用 51

160 条四类有害问题专门触发审核器,用密码字符越狱测 LLM 及其审核护栏

2024-05-27
PureBad论文 jailbreakpoisoning-backdoorllm 引用 149 · 语料尺子 5

100 条有害问答对,混入微调数据模拟 harmful fine-tuning 攻击,看对齐是否被破坏

2024-05-23
ALI-Agent论文 jailbreaktoxicity-biasrobustnessllm 引用 59

用 LLM agent 自动生成并迭代改写刻板印象/道德/违法情景,探测被测 LLM 的价值对齐长尾漏洞

2024-05-06
UnsafeBench: Benchmarking Image Safety Classifiers论文 guardrail-evaltoxicity-biasrobustnessmultimodal 引用 58

1万张真实/AI生成图测图像安全分类器与VLM审核器的准确率和扰动稳健性

2024-04-19
CyberSecEval论文 harmful-capabilitycode-securitydpiipioverrefusal-utilityllm 引用 105 · 语料尺子 8

Meta 网络安全评测套件:不安全代码、协助攻击、漏洞利用、提示注入、误拒率

2024-04-19
CyberSecEval 2 (prompt injection suite)论文 dpiipillm 引用 105

251 条 system-prompt 违约测试,user 轮或嵌入文本里投注入,LLM 判是否越界

2024-04-18
AI Safety Benchmark v0.5 (MLCommons)论文 jailbreakllmguardrail-eval 引用 72

MLCommons 安全基准 v0.5:7 类危害 4.3 万模板提示,三类用户人设,用 LlamaGuard 评聊天 LLM 有害响应率

2024-04-09
AegisSafetyDataset论文 guardrail-evaljailbreaktoxicity-biasllm 引用 150 · 语料尺子 1

1.1 万条人标有害对话,按 13 类风险分类法评审核器判别能力

2024-04-06
ALERT论文 jailbreaktoxicity-biasllm 引用 102 · 语料尺子 4

45k 条按 32 子类分类的有害指令(含对抗变体),测 LLM 拒答率与安全性

2024-04-03
JailBreakV jailbreakmultimodalrobustness 引用 259 · 语料尺子 16

28K 图文越狱对测 10 个 MLLM:LLM 文本越狱模板迁移到多模态模型的攻击成功率

2024-04-03
RedTeam-2K论文 jailbreakllmmultimodal 引用 259 · 语料尺子 6

2000 条 16 类有害查询种子集,直接或配图攻击 LLM/多模态模型测越狱成功率

2024-03-28
JailbreakBench jailbreakrobustnessllm 引用 606 · 语料尺子 114

100 条有害行为+攻击 artifacts+统一判定器与防御接口,测 LLM 越狱率和过度拒答

2024-03-11
SEP论文 ipillmrobustness 引用 82 · 语料尺子 7

把探针指令塞进数据段,比对模型在指令段与数据段的执行率,量化指令-数据分离能力

2024-03-05
InjecAgent ipiagent-toolllm 引用 493 · 语料尺子 19

1054 条工具返回里藏注入,看 agent 是否执行攻击者指定的有害工具调用

2024-03-05
WMDP harmful-capabilityprivacyllm 引用 509 · 语料尺子 10

3668 道生物/化学/网络安全四选一,量模型危险知识并作 RMU 遗忘的尺子

2024-02-19
CatQA论文 jailbreakllm 引用 121 · 语料尺子 4

550 道三语有害问题,测微调后 LLM 的拒答率是否退化及 RESTA 修复效果

2024-02-15
StrongReject jailbreakguardrail-evalllm 引用 369 · 语料尺子 89

313 条禁题+越狱方法,自动评分器量越狱后回答对攻击者有多大用处,而非只看拒没拒

2024-02-12
MIMIR论文 privacyllm 引用 235 · 语料尺子 1

成员推断攻击基准:用 Pile 成员/非成员文本测 LLM 是否泄露训练数据

2024-02-08
JailbreakRadar论文 jailbreakllmrobustness 引用 133

17 种越狱攻击×9 个 LLM×160 条违禁问题,并在 8 种防御下复测,系统比较攻击成功率与实用性

2024-02-07
SALAD-Bench论文 jailbreakguardrail-evalrobustnessllm 引用 268 · 语料尺子 5

三层 66 类有害问题,含越狱增强与防御增强子集和选择题,附 MD-Judge 评估器测 LLM 安全

2024-02-06
HarmBench jailbreakllmmultimodal 引用 1444 · 语料尺子 211

510 条有害请求配 18 种自动越狱攻击,打 33 个模型,用 Llama-2-13B 判定器量攻击成功率

2024-02-03
VLGuard论文 jailbreakmultimodaloverrefusal-utility 引用 162

图文安全指令集:用有害图或安全图配有害问测 VLLM 拒答,兼测安全微调的效用代价

2024-01-23
RTVLM论文 jailbreaktoxicity-biasprivacyrobustnessmultimodal 引用 65 · 语料尺子 3

首个 VLM 红队集:从可信、隐私、安全、公平 4 维 10 子任务测视觉语言模型

2024-01-18
R-Judge论文 guardrail-evalllmagent-toolipi 引用 285

给 LLM 看 569 条 agent 工具调用日志,测它能否判出其中的安全风险

2024-01-12
Sorry-Bench jailbreakrobustnessguardrail-evalllm 引用 239 · 语料尺子 17

440 条分类配平的不当请求+20 种措辞变换,量 LLM 照办率并校准自动评判器

2024-01-11
TOFU privacyllm 引用 545 · 语料尺子 11

微调进 200 个虚构作家资料后要求遗忘指定作家,用遗忘/保留集问答比对(含 KS 检验)量遗忘是否彻底

2024-01-10
TrustLLM论文 jailbreaktoxicity-biasprivacyrobustnessoverrefusal-utilityllm 引用 361 · 语料尺子 5

八维度可信度总评:越狱、毒性、偏见、隐私、稳健、过度拒答等 30+ 数据集测 16 个 LLM

2023-12-30
SODE论文 jailbreakoverrefusal-utilityllm 引用 82 · 语料尺子 1

安全+过度拒答双向评测:用安全/不安全 prompt 对比各种 prompt 级防御策略的代价

2023-12-21
BIPIA论文 ipillmrag 引用 327 · 语料尺子 6

把恶意指令藏在邮件/网页/表格/代码等外部内容里,测 LLM 做 QA/摘要时是否被带偏

2023-12-07
Llama Guard论文 guardrail-evaltoxicity-biasjailbreakllm 引用 1247 · 语料尺子 98

Meta 的 LLM 审核器,按安全分类体系对对话输入/输出做有害分类,用公开审核集评测。

2023-12-07
MITRE论文 jailbreakharmful-capabilityllm 引用 179 · 语料尺子 8

按 MITRE ATT&CK 战术生成攻击协助请求,测 LLM 是否顺从并给出有用的攻击帮助

2023-11-29
MM-SafetyBench jailbreakmultimodal 引用 301 · 语料尺子 38

把有害问题关键词转成图片再问 MLLM,测图片能否绕过文本侧安全对齐诱出有害回答

2023-11-16
VLSafe论文 jailbreakmultimodal 引用 122

COCO 图配恶意文本问题(1110 测试条),测视觉语言模型是否拒绝有害请求

2023-11-14
SimpleSafetyTests论文 jailbreakllmguardrail-eval 引用 67

100 条明文有害请求测 LLM 是否拒答,人工标注 3000 条回复并顺带评 5 个安全过滤器

2023-11-09
FigStep jailbreakmultimodalrobustness 引用 431 · 语料尺子 23

把有害问句渲染成排版图片喂给视觉语言模型,测其安全对齐是否被跨模态绕过

2023-11-09
Insider Trading Deception Scenario (Apollo Research)论文 deception-alignmentagent-toolllm 引用 158

模拟股票交易 agent 场景,测 GPT-4 是否用内幕消息交易并向上级隐瞒

2023-11-02
Tensor Trust论文 dpirobustnessprivacyllm 引用 152 · 语料尺子 6

在线攻防游戏众包 12.6 万条提示注入,测 LLM 被劫持输出和系统提示被套出

2023-10-27
ConfAIde论文 privacyllm 引用 260 · 语料尺子 2

按情境完整性理论分四层出题,测 LLM 会否在不该泄露时说出他人秘密

2023-10-26
ToxicChat toxicity-biasguardrail-evaljailbreakllm 引用 279 · 语料尺子 26

1 万条 Vicuna demo 真实用户提示标毒性/越狱,评毒性检测器在人机对话域的表现

2023-10-25
WikiMIA论文 privacyllm 引用 438

用 2023 年前后的维基文本构造成员推断基准,测能否从 token 概率判断文本是否在预训练集中

2023-10-19
Open-Prompt-Injection论文 ipillmguardrail-eval 引用 438 · 语料尺子 4

把注入指令混进 LLM 应用的待处理数据里,系统评测 5 种注入攻击与 10 种防御

2023-10-10
MaliciousInstruct jailbreakllmrobustness 引用 544 · 语料尺子 26

100 条恶意 How-to 问句,改解码参数让开源 LLM 对齐崩溃,BERT 判定器只看拒不拒

2023-10-10
Multi-Jail jailbreakllmrobustness 引用 262 · 语料尺子 13

315 句有害请求人工译成 9 种语言,测 ChatGPT/GPT-4 拒答在低资源语言上是否失效

2023-10-05
HEx-PHI jailbreakllm 引用 1334 · 语料尺子 43

330 条按平台政策倒推的直白有害指令,GPT-4 打 1-5 分,量化微调后安全对齐退化程度

2023-10-03
PrivQA论文 privacyoverrefusal-utilityjailbreakllmmultimodal 引用 53 · 语料尺子 1

指令让模型保护特定人群/类别个人信息,测文本+图像 QA 的隐私-效用权衡及越狱绕过

2023-10-02
XSafety论文 jailbreaktoxicity-biasllm 引用 57

把 2800 条中英安全问题翻成 10 种语言,测 LLM 对非英语有害请求是否更容易给出不安全回答

2023-09-25
ToolEmu论文 agent-tooldeception-alignmentoverrefusal-utility 引用 501 · 语料尺子 2

用 LLM 模拟工具沙箱,144 个模糊指令场景测 agent 是否因擅自执行高风险操作而造成损失

2023-09-14
Safety-Tuned LLaMAs evaluation sets (I-MaliciousInstructions / I-CoNa / I-Controversial / I-PhysicalSafety)论文 jailbreaktoxicity-biasoverrefusal-utilityllm 引用 429

四组恶意/仇恨/争议/物理危险指令,测指令微调 LLM 是否输出有害内容及是否过度拒答

2023-09-13
SafetyBench论文 toxicity-biasprivacyllm 引用 250 · 语料尺子 5

中英 11,435 道多选题,考 LLM 对冒犯、偏见、健康、违法、伦理、隐私 7 类安全问题的认知。

2023-08-25
Do-Not-Answer论文 jailbreaktoxicity-biasprivacyguardrail-evalllm 引用 211 · 语料尺子 5

939 条不该回答的有害提问,按五类风险测 LLM 拒答,并训分类器自动评分

2023-08-18
DangerousQA论文 jailbreaktoxicity-biasllm 引用 275 · 语料尺子 7

200 条种族/性别/违法/有毒类有害问题,配 CoU 越狱模板测 LLM 是否顺从作答

2023-08-18
HarmfulQA jailbreakllm 引用 275 · 语料尺子 8

1960 道 ChatGPT 生成的有害问题,套 CoU 越狱模板测聊天模型是否照答

2023-08-18
RED-EVAL论文 jailbreakllm 引用 275 · 语料尺子 1

用多轮对话模板(CoU)包装有害问题诱导越狱,测 LLM 有害回答率

2023-08-07
JailbreakHub论文 jailbreakllm 引用 706 · 语料尺子 4

收集在野越狱提示词,配禁答问题集测 LLM 被绕过率

2023-08-02
XSTest论文 overrefusal-utilityllm 引用 486 · 语料尺子 5

250 条貌似危险的安全提示+200 条有害对照,测 LLM 是否过度拒答

2023-08-01
ARA (Autonomous Replication and Adaptation) task suite论文 harmful-capabilityagent-tool 引用 120

METR 用 12 个真实任务(搞钱、部署自身、钓鱼、微调模型)测带工具的 LLM agent 能否自主复制扩张

2023-07-27
AdvBench jailbreakrobustnessllm 引用 3556 · 语料尺子 321

520 条有害祈使句,配 GCG 对抗后缀测对齐 LLM 能否被诱导输出有害内容

2023-07-17
Latent Jailbreak论文 jailbreakoverrefusal-utilitytoxicity-biasllm 引用 71 · 语料尺子 1

把恶意指令藏进翻译任务文本里,同时测 LLM 是否被诱导输出毒性内容和是否过度拒答

2023-07-10
BeaverTails jailbreakguardrail-evaltoxicity-biasllm 引用 1018 · 语料尺子 39

33 万条红队 QA 对人工标 14 类有害与偏好,用于训练审核器/奖励模型并评估 LLM 回答安全性

2023-07-05
Hoodwinked 引用 59
2023-07-04
ProPILE论文 privacyllm 引用 221

用用户自身 PII 构造探测 prompt,测 LLM 是否泄露训练集里的个人信息

2023-06-26
InterCode-CTF论文 harmful-capabilityagent-codeagent-tool 引用 257

100 道 picoCTF 题放进 Docker,让 LLM 多轮执行 Bash/Python 拿 flag,测网络安全能力

2023-06-20
DecodingTrust论文 toxicity-biasrobustnessprivacyjailbreakpoisoning-backdoordeception-alignmentllm 引用 698 · 语料尺子 1

八维度测 GPT 类模型可信度:毒性、偏见、对抗/OOD 鲁棒、隐私泄露、伦理、公平

2023-06-20
TrustGPT 引用 77
2023-06-07
PromptRobust 引用 324
2023-05-23
Jailbreak prompts dataset (Jailbreaking ChatGPT via Prompt Engineering)论文 jailbreakllm 引用 728

收集 78 条真实越狱 prompt,分 10 种模式,对 ChatGPT 3.5/4 在 8 类禁用场景下测绕过率

2023-05-21
BiasAsker论文 toxicity-biasllm 引用 108

自动生成群体比较/偏见属性问句,量化 10 个对话 AI 的社会偏见触发率

2023-04-20
Safety-Prompts (Chinese LLM Safety Assessment Benchmark)论文 jailbreaktoxicity-biasprivacyllm 引用 111

10 万条中文 prompt,8 类安全场景+6 类指令攻击,测 LLM 回复是否有害

2023-04-06
MACHIAVELLI论文 deception-alignmentllmother:text-game-agent 引用 228

文字冒险游戏中让 LLM 逐步决策,统计其为得分而欺骗、夺权、伤人的频率

2022-12-19
Model-Written Evaluations论文 deception-alignmenttoxicity-biasllm 引用 992

让 LM 自动生成 154 个数据集,测 LLM 的人格倾向、迎合性、权力/自保等 AI 风险行为与性别偏见

2022-12-15
HarmfulQ论文 jailbreaktoxicity-biasllm 引用 285 · 语料尺子 4

200 条显式有害问题,测 LLM 直接/CoT 提示下是否拒答或输出有害内容

2022-11-17
PromptInject论文 dpillm 引用 1024 · 语料尺子 2

用户输入拼接「忽略前文」类指令,测 GPT-3 应用被目标劫持与 prompt 泄露的比例

2022-08-23
Anthropic Red Team Attempts (red-team-attempts dataset)论文 jailbreaktoxicity-biasllm 引用 868

38,961 条众包人工多轮红队对话,诱导对话模型产生有害输出,比较模型类型与规模的抗攻击性

2022-08-05
OpenAI Moderation Evaluation Dataset论文 guardrail-evaltoxicity-biasllm 引用 488

1680 条人工标注有害文本,评审核分类器对色情/仇恨/暴力/自残/骚扰的识别

2022-03-17
ToxiGen toxicity-biasguardrail-evalllm 引用 647 · 语料尺子 8

GPT-3 生成的隐性仇恨句集,既测毒性分类器误判,也测 LLM 续写毒性

2021-12-01
HHH论文 jailbreaktoxicity-biasoverrefusal-utilitydeception-alignmentllm 引用 1204 · 语料尺子 5

给对话和两条候选回复,测模型能否选出更有帮助、诚实、无害的那条,共约 200 题二选一

2021-10-16
DiaSafety 引用 118 · 语料尺子 1
2021-10-15
BBQ toxicity-biasllm 引用 856 · 语料尺子 9

手写模板问答:上下文模糊时模型是否按刻板印象答,上下文明确时偏见是否压过准确率

2021-01-27
BOLD论文 toxicity-biasllm 引用 608 · 语料尺子 5

给人口学主题的句子前缀让模型续写,自动打分续写的毒性/情感/性别倾向,量化社会偏见

2020-09-24
RealToxicityPrompts toxicity-biasllm 引用 1815 · 语料尺子 11

10 万条网页截断残句让 LLM 续写,用 Perspective API 量无攻击下自发生成毒性文本的概率