2024

an archive of posts from this year

Oct 11, 2024 评测集/基准 · AgentHarm(LLM agent 有害行为基准)
Oct 7, 2024 防御机制 · SecAlign(含 Meta SecAlign)
Oct 3, 2024 评测集/基准 · ASB (Agent Security Bench)
Aug 27, 2024 人物 · Riley Goodside
Aug 1, 2024 人物 · Mantas Mazeika
Jul 31, 2024 防御机制 · ShieldGemma
Jul 23, 2024 防御机制 · Llama Prompt Guard(Meta 的注入/越狱分类器,v1 86M / v2 86M+22M)
Jun 26, 2024 评测集/基准 · WildGuardTest(WildGuardMix 的人工标注测试切分)
Jun 26, 2024 防御机制 · WildGuard(AI2 的 7B 安全审核分类器 / WildGuardMix 数据集)
Jun 26, 2024 评测集/基准 · WildJailbreak(AI2 WildTeaming 合成越狱数据集及其 eval split)
Jun 20, 2024 评测集/基准 · SORRY-Bench
Jun 20, 2024 评测集/基准 · PKU-SafeRLHF(北大对齐组安全偏好数据集)
Jun 19, 2024 评测集/基准 · AgentDojo(ETH SPY Lab 的 prompt injection agent 基准)
Apr 3, 2024 评测集/基准 · JailBreakV-28K(含 RedTeam-2K / mini split)
Mar 28, 2024 人物 · Patrick Chao
Mar 28, 2024 评测集/基准 · JailbreakBench(JBB-Behaviors,100 条越狱行为基准)
Mar 5, 2024 评测集/基准 · WMDP(Weapons of Mass Destruction Proxy,大规模杀伤性武器代理基准)
Mar 5, 2024 评测集/基准 · InjecAgent(工具型 LLM agent 的间接提示注入基准)
Feb 15, 2024 评测集/基准 · StrongREJECT(A StrongREJECT for Empty Jailbreaks,越狱评测基准)
Feb 6, 2024 评测集/基准 · HarmBench(自动化红队标准评测框架)
Jan 11, 2024 评测集/基准 · TOFU(Task of Fictitious Unlearning,虚构作家遗忘基准)
Jan 10, 2024 评测集/基准 · RTA / RtA(Refuse-to-Answer rate,拒答率)