Oct 11, 2024 评测集/基准 · AgentHarm(LLM agent 有害行为基准) Oct 7, 2024 防御机制 · SecAlign(含 Meta SecAlign) Oct 3, 2024 评测集/基准 · ASB (Agent Security Bench) Aug 27, 2024 人物 · Riley Goodside Aug 1, 2024 人物 · Mantas Mazeika Jul 31, 2024 防御机制 · ShieldGemma Jul 23, 2024 防御机制 · Llama Prompt Guard(Meta 的注入/越狱分类器,v1 86M / v2 86M+22M) Jun 26, 2024 评测集/基准 · WildGuardTest(WildGuardMix 的人工标注测试切分) Jun 26, 2024 防御机制 · WildGuard(AI2 的 7B 安全审核分类器 / WildGuardMix 数据集) Jun 26, 2024 评测集/基准 · WildJailbreak(AI2 WildTeaming 合成越狱数据集及其 eval split) Jun 20, 2024 评测集/基准 · SORRY-Bench Jun 20, 2024 评测集/基准 · PKU-SafeRLHF(北大对齐组安全偏好数据集) Jun 19, 2024 评测集/基准 · AgentDojo(ETH SPY Lab 的 prompt injection agent 基准) Apr 3, 2024 评测集/基准 · JailBreakV-28K(含 RedTeam-2K / mini split) Mar 28, 2024 人物 · Patrick Chao Mar 28, 2024 评测集/基准 · JailbreakBench(JBB-Behaviors,100 条越狱行为基准) Mar 5, 2024 评测集/基准 · WMDP(Weapons of Mass Destruction Proxy,大规模杀伤性武器代理基准) Mar 5, 2024 评测集/基准 · InjecAgent(工具型 LLM agent 的间接提示注入基准) Feb 15, 2024 评测集/基准 · StrongREJECT(A StrongREJECT for Empty Jailbreaks,越狱评测基准) Feb 6, 2024 评测集/基准 · HarmBench(自动化红队标准评测框架) Jan 11, 2024 评测集/基准 · TOFU(Task of Fictitious Unlearning,虚构作家遗忘基准) Jan 10, 2024 评测集/基准 · RTA / RtA(Refuse-to-Answer rate,拒答率)