| Aug 21, 2026 | 速览 2026-08-21:3 篇 |
| Aug 20, 2026 | 速览 2026-08-20:4 篇 |
| Aug 20, 2026 | 人物 · Simon Willison |
| Aug 19, 2026 | 速览 2026-08-19:8 篇 |
| Aug 19, 2026 | 拒绝率不是废指标,它只是有边界 |
| Aug 19, 2026 | 一篇论文里的两个相反读数:unlearning 的'残留'不是模型属性 |
| Aug 19, 2026 | GPT-5 在 ReAct 模式下 90.20% ASR:「能力不预测抗注入」该退回去重写 |
| Aug 19, 2026 | 「0.42% 的神经元」是单次测量的读数,不是模型的属性 |
| Aug 18, 2026 | 迁移性不是攻击的属性,是载荷所处分布的属性 |
| Aug 18, 2026 | 「良性微调必然破坏对齐」:4% 和 87% 之间隔着一整套超参 |
| Aug 18, 2026 | 自报零代价与他评效用崩塌:一条论断的归属偏差 |
| Aug 18, 2026 | 同一实验里,Llama 加 5 倍预算不动,Qwen 涨到 0.40 |
| Aug 18, 2026 | 「低资源语言更不安全」这条论断,被测的量换了就反向 |
| Aug 18, 2026 | 评测集/基准 · MobileWorldSafety(GUI agent 环境注入安全基准) |
| Aug 17, 2026 | 31:1 之下的伪共识:聚合视图既是防御前提,也是攻击的成立条件 |
| Aug 15, 2026 | 速览 2026-08-15:1 篇 |
| Aug 14, 2026 | 速览 2026-08-14:5 篇 |
| Aug 13, 2026 | 速览 2026-08-13:6 篇 |
| Aug 12, 2026 | 速览 2026-08-12:18 篇 |
| Aug 11, 2026 | 速览 2026-08-11:20 篇 |
| Aug 10, 2026 | 速览 2026-08-10:8 篇 |
| Aug 10, 2026 | 人物 · Maksym Andriushchenko |
| Aug 9, 2026 | 速览 2026-08-09:9 篇 |
| Aug 8, 2026 | 速览 2026-08-08:8 篇 |
| Aug 7, 2026 | 速览 2026-08-07:8 篇 |
| Aug 6, 2026 | 速览 2026-08-06:11 篇 |
| Aug 5, 2026 | 速览 2026-08-05:12 篇 |
| Aug 4, 2026 | 人物 · Steve Wilson |
| Jul 28, 2026 | 人物 · Xiangyu Qi |
| Jul 24, 2026 | 人物 · Dawn Song |
| Jul 21, 2026 | 人物 · Bo Li |
| Jul 6, 2026 | 人物 · Edoardo Debenedetti |
| Jun 21, 2026 | 人物 · Chaowei Xiao |
| Jun 1, 2026 | 人物 · Xiaogeng Liu |
| May 29, 2026 | 人物 · Eric Wong |
| May 29, 2026 | 人物 · Alexander Robey |
| May 18, 2026 | 人物 · Johann Rehberger |
| Apr 29, 2026 | 人物 · Liwei Jiang |
| Apr 24, 2026 | 人物 · Leon Derczynski |
| Apr 10, 2026 | 人物 · Peter Henderson |
| Mar 31, 2026 | 人物 · Kai Greshake |
| Mar 16, 2026 | 人物 · Zifan Wang |
| Mar 16, 2026 | 人物 · Matt Fredrikson |
| Mar 16, 2026 | 人物 · Andy Zou |
| Feb 3, 2026 | 人物 · Ram Shankar Siva Kumar |
| Feb 3, 2026 | 评测集/基准 · AgentDyn(动态开放式 agent 安全防御基准) |
| Feb 1, 2026 | 真实事故 · CVE-2026-25253(OpenClaw / clawdbot / Moltbot 1-Click RCE) |
| Jan 28, 2026 | 人物 · Ashley Casovan |
| Oct 22, 2025 | 人物 · Sizhe Chen |
| Oct 8, 2025 | 人物 · Nicholas Carlini |
| Sep 23, 2025 | 人物 · Radha Poovendran |
| Sep 23, 2025 | 防御机制 · Qwen3Guard(阿里 Qwen 团队的安全护栏模型系列) |
| Sep 22, 2025 | 人物 · Dan Hendrycks |
| Aug 12, 2025 | 真实事故 · CVE-2025-53773(GitHub Copilot 自提权 RCE) |
| Aug 11, 2025 | 真实事故 · CVE-2025-55284(Claude Code 经 DNS 外带数据) |
| Aug 7, 2025 | 人物 · Sven Cattell |
| Aug 1, 2025 | 真实事故 · CVE-2025-54135 / CurXecute(Cursor 通过 MCP 配置文件被注入到 RCE) |
| Jul 29, 2025 | 人物 · Sander Schulhoff |
| Jun 27, 2025 | 人物 · Nouha Dziri |
| Jun 11, 2025 | 真实事故 · EchoLeak (CVE-2025-32711) |
| May 20, 2025 | 防御机制 · ShieldVLM(清华 CoAI,多模态隐性毒性护栏) |
| Apr 2, 2025 | 人物 · Seungju Han |
| Mar 24, 2025 | 防御机制 · CaMeL (Capabilities for Machine Learning) |
| Oct 11, 2024 | 评测集/基准 · AgentHarm(LLM agent 有害行为基准) |
| Oct 7, 2024 | 防御机制 · SecAlign(含 Meta SecAlign) |
| Oct 3, 2024 | 评测集/基准 · ASB (Agent Security Bench) |
| Aug 27, 2024 | 人物 · Riley Goodside |
| Aug 1, 2024 | 人物 · Mantas Mazeika |
| Jul 31, 2024 | 防御机制 · ShieldGemma |
| Jul 23, 2024 | 防御机制 · Llama Prompt Guard(Meta 的注入/越狱分类器,v1 86M / v2 86M+22M) |
| Jun 26, 2024 | 评测集/基准 · WildGuardTest(WildGuardMix 的人工标注测试切分) |
| Jun 26, 2024 | 防御机制 · WildGuard(AI2 的 7B 安全审核分类器 / WildGuardMix 数据集) |
| Jun 26, 2024 | 评测集/基准 · WildJailbreak(AI2 WildTeaming 合成越狱数据集及其 eval split) |
| Jun 20, 2024 | 评测集/基准 · SORRY-Bench |
| Jun 20, 2024 | 评测集/基准 · PKU-SafeRLHF(北大对齐组安全偏好数据集) |
| Jun 19, 2024 | 评测集/基准 · AgentDojo(ETH SPY Lab 的 prompt injection agent 基准) |
| Apr 3, 2024 | 评测集/基准 · JailBreakV-28K(含 RedTeam-2K / mini split) |
| Mar 28, 2024 | 人物 · Patrick Chao |
| Mar 28, 2024 | 评测集/基准 · JailbreakBench(JBB-Behaviors,100 条越狱行为基准) |
| Mar 5, 2024 | 评测集/基准 · WMDP(Weapons of Mass Destruction Proxy,大规模杀伤性武器代理基准) |
| Mar 5, 2024 | 评测集/基准 · InjecAgent(工具型 LLM agent 的间接提示注入基准) |
| Feb 15, 2024 | 评测集/基准 · StrongREJECT(A StrongREJECT for Empty Jailbreaks,越狱评测基准) |
| Feb 6, 2024 | 评测集/基准 · HarmBench(自动化红队标准评测框架) |
| Jan 11, 2024 | 评测集/基准 · TOFU(Task of Fictitious Unlearning,虚构作家遗忘基准) |
| Jan 10, 2024 | 评测集/基准 · RTA / RtA(Refuse-to-Answer rate,拒答率) |
| Dec 7, 2023 | 系统/工具 · Llama Guard(Meta 内容安全分类器系列) |
| Nov 29, 2023 | 评测集/基准 · MM-SafetyBench(多模态大模型安全评测集) |
| Nov 9, 2023 | 评测集/基准 · SafeBench(FigStep 版,500 条禁忌问题题库) |
| Nov 9, 2023 | 评测集/基准 · FigStep / SafeBench(排版图像越狱评测集) |
| Nov 2, 2023 | 机构 · UK AI Security Institute (AISI) |
| Oct 26, 2023 | 评测集/基准 · ToxicChat(lmsys/toxic-chat) |
| Oct 10, 2023 | 评测集/基准 · MultiJail(Multilingual Jailbreak Challenges 数据集) |
| Oct 10, 2023 | 评测集/基准 · MaliciousInstruct(100 条有害问句 + BERT 打分器) |
| Oct 5, 2023 | 防御机制 · SmoothLLM(随机字符扰动 + 多数投票的越狱防御) |
| Oct 5, 2023 | 评测集/基准 · HEx-PHI(Human-Extended Policy-Oriented Harmful Instruction Benchmark) |
| Aug 18, 2023 | 评测集/基准 · HarmfulQA(declare-lab,Red-Instruct 配套评测集) |
| Jul 27, 2023 | 评测集/基准 · AdvBench(GCG 论文附带的有害行为/有害字符串集) |
| Jul 10, 2023 | 评测集/基准 · BeaverTails(PKU-Alignment 有害性标注语料 / QA-moderation 数据集) |
| Jun 16, 2023 | 防御机制 · Self-Reminder(系统模式自我提醒) |
| Jul 4, 2022 | 评测集/基准 · WebShop(普林斯顿 NLP 组的模拟购物网站环境 / 评测集) |
| Mar 17, 2022 | 评测集/基准 · ToxiGen(隐式仇恨语句生成数据集 / 评测集) |
| Oct 15, 2021 | 评测集/基准 · BBQ (Bias Benchmark for QA) |
| Nov 20, 2020 | 防御机制 · ONION(Outlier-word detection backdoor defense) |
| Nov 9, 2020 | 防御机制 · Detoxify (unitaryai/detoxify) |
| Sep 24, 2020 | 评测集/基准 · RealToxicityPrompts (RTP) |