| Aug 18, 2026 | 评测集/基准 · MobileWorldSafety(GUI agent 环境注入安全基准) |
| Feb 3, 2026 | 评测集/基准 · AgentDyn(动态开放式 agent 安全防御基准) |
| Oct 11, 2024 | 评测集/基准 · AgentHarm(LLM agent 有害行为基准) |
| Oct 3, 2024 | 评测集/基准 · ASB (Agent Security Bench) |
| Jun 26, 2024 | 评测集/基准 · WildGuardTest(WildGuardMix 的人工标注测试切分) |
| Jun 26, 2024 | 评测集/基准 · WildJailbreak(AI2 WildTeaming 合成越狱数据集及其 eval split) |
| Jun 20, 2024 | 评测集/基准 · SORRY-Bench |
| Jun 20, 2024 | 评测集/基准 · PKU-SafeRLHF(北大对齐组安全偏好数据集) |
| Jun 19, 2024 | 评测集/基准 · AgentDojo(ETH SPY Lab 的 prompt injection agent 基准) |
| Apr 3, 2024 | 评测集/基准 · JailBreakV-28K(含 RedTeam-2K / mini split) |
| Mar 28, 2024 | 评测集/基准 · JailbreakBench(JBB-Behaviors,100 条越狱行为基准) |
| Mar 5, 2024 | 评测集/基准 · WMDP(Weapons of Mass Destruction Proxy,大规模杀伤性武器代理基准) |
| Mar 5, 2024 | 评测集/基准 · InjecAgent(工具型 LLM agent 的间接提示注入基准) |
| Feb 15, 2024 | 评测集/基准 · StrongREJECT(A StrongREJECT for Empty Jailbreaks,越狱评测基准) |
| Feb 6, 2024 | 评测集/基准 · HarmBench(自动化红队标准评测框架) |
| Jan 11, 2024 | 评测集/基准 · TOFU(Task of Fictitious Unlearning,虚构作家遗忘基准) |
| Jan 10, 2024 | 评测集/基准 · RTA / RtA(Refuse-to-Answer rate,拒答率) |
| Nov 29, 2023 | 评测集/基准 · MM-SafetyBench(多模态大模型安全评测集) |
| Nov 9, 2023 | 评测集/基准 · SafeBench(FigStep 版,500 条禁忌问题题库) |
| Nov 9, 2023 | 评测集/基准 · FigStep / SafeBench(排版图像越狱评测集) |
| Oct 26, 2023 | 评测集/基准 · ToxicChat(lmsys/toxic-chat) |
| Oct 10, 2023 | 评测集/基准 · MultiJail(Multilingual Jailbreak Challenges 数据集) |
| Oct 10, 2023 | 评测集/基准 · MaliciousInstruct(100 条有害问句 + BERT 打分器) |
| Oct 5, 2023 | 评测集/基准 · HEx-PHI(Human-Extended Policy-Oriented Harmful Instruction Benchmark) |
| Aug 18, 2023 | 评测集/基准 · HarmfulQA(declare-lab,Red-Instruct 配套评测集) |
| Jul 27, 2023 | 评测集/基准 · AdvBench(GCG 论文附带的有害行为/有害字符串集) |
| Jul 10, 2023 | 评测集/基准 · BeaverTails(PKU-Alignment 有害性标注语料 / QA-moderation 数据集) |
| Jul 4, 2022 | 评测集/基准 · WebShop(普林斯顿 NLP 组的模拟购物网站环境 / 评测集) |
| Mar 17, 2022 | 评测集/基准 · ToxiGen(隐式仇恨语句生成数据集 / 评测集) |
| Oct 15, 2021 | 评测集/基准 · BBQ (Bias Benchmark for QA) |
| Sep 24, 2020 | 评测集/基准 · RealToxicityPrompts (RTP) |