bench

an archive of posts with this tag

Aug 18, 2026 评测集/基准 · MobileWorldSafety(GUI agent 环境注入安全基准)
Feb 3, 2026 评测集/基准 · AgentDyn(动态开放式 agent 安全防御基准)
Oct 11, 2024 评测集/基准 · AgentHarm(LLM agent 有害行为基准)
Oct 3, 2024 评测集/基准 · ASB (Agent Security Bench)
Jun 26, 2024 评测集/基准 · WildGuardTest(WildGuardMix 的人工标注测试切分)
Jun 26, 2024 评测集/基准 · WildJailbreak(AI2 WildTeaming 合成越狱数据集及其 eval split)
Jun 20, 2024 评测集/基准 · SORRY-Bench
Jun 20, 2024 评测集/基准 · PKU-SafeRLHF(北大对齐组安全偏好数据集)
Jun 19, 2024 评测集/基准 · AgentDojo(ETH SPY Lab 的 prompt injection agent 基准)
Apr 3, 2024 评测集/基准 · JailBreakV-28K(含 RedTeam-2K / mini split)
Mar 28, 2024 评测集/基准 · JailbreakBench(JBB-Behaviors,100 条越狱行为基准)
Mar 5, 2024 评测集/基准 · WMDP(Weapons of Mass Destruction Proxy,大规模杀伤性武器代理基准)
Mar 5, 2024 评测集/基准 · InjecAgent(工具型 LLM agent 的间接提示注入基准)
Feb 15, 2024 评测集/基准 · StrongREJECT(A StrongREJECT for Empty Jailbreaks,越狱评测基准)
Feb 6, 2024 评测集/基准 · HarmBench(自动化红队标准评测框架)
Jan 11, 2024 评测集/基准 · TOFU(Task of Fictitious Unlearning,虚构作家遗忘基准)
Jan 10, 2024 评测集/基准 · RTA / RtA(Refuse-to-Answer rate,拒答率)
Nov 29, 2023 评测集/基准 · MM-SafetyBench(多模态大模型安全评测集)
Nov 9, 2023 评测集/基准 · SafeBench(FigStep 版,500 条禁忌问题题库)
Nov 9, 2023 评测集/基准 · FigStep / SafeBench(排版图像越狱评测集)
Oct 26, 2023 评测集/基准 · ToxicChat(lmsys/toxic-chat)
Oct 10, 2023 评测集/基准 · MultiJail(Multilingual Jailbreak Challenges 数据集)
Oct 10, 2023 评测集/基准 · MaliciousInstruct(100 条有害问句 + BERT 打分器)
Oct 5, 2023 评测集/基准 · HEx-PHI(Human-Extended Policy-Oriented Harmful Instruction Benchmark)
Aug 18, 2023 评测集/基准 · HarmfulQA(declare-lab,Red-Instruct 配套评测集)
Jul 27, 2023 评测集/基准 · AdvBench(GCG 论文附带的有害行为/有害字符串集)
Jul 10, 2023 评测集/基准 · BeaverTails(PKU-Alignment 有害性标注语料 / QA-moderation 数据集)
Jul 4, 2022 评测集/基准 · WebShop(普林斯顿 NLP 组的模拟购物网站环境 / 评测集)
Mar 17, 2022 评测集/基准 · ToxiGen(隐式仇恨语句生成数据集 / 评测集)
Oct 15, 2021 评测集/基准 · BBQ (Bias Benchmark for QA)
Sep 24, 2020 评测集/基准 · RealToxicityPrompts (RTP)