llm-security

an archive of posts with this tag

Aug 21, 2026 速览 2026-08-21:3 篇
Aug 20, 2026 速览 2026-08-20:4 篇
Aug 20, 2026 人物 · Simon Willison
Aug 19, 2026 速览 2026-08-19:8 篇
Aug 19, 2026 拒绝率不是废指标,它只是有边界
Aug 19, 2026 一篇论文里的两个相反读数:unlearning 的'残留'不是模型属性
Aug 19, 2026 GPT-5 在 ReAct 模式下 90.20% ASR:「能力不预测抗注入」该退回去重写
Aug 19, 2026 「0.42% 的神经元」是单次测量的读数,不是模型的属性
Aug 18, 2026 迁移性不是攻击的属性,是载荷所处分布的属性
Aug 18, 2026 「良性微调必然破坏对齐」:4% 和 87% 之间隔着一整套超参
Aug 18, 2026 自报零代价与他评效用崩塌:一条论断的归属偏差
Aug 18, 2026 同一实验里,Llama 加 5 倍预算不动,Qwen 涨到 0.40
Aug 18, 2026 「低资源语言更不安全」这条论断,被测的量换了就反向
Aug 18, 2026 评测集/基准 · MobileWorldSafety(GUI agent 环境注入安全基准)
Aug 17, 2026 31:1 之下的伪共识:聚合视图既是防御前提,也是攻击的成立条件
Aug 15, 2026 速览 2026-08-15:1 篇
Aug 14, 2026 速览 2026-08-14:5 篇
Aug 13, 2026 速览 2026-08-13:6 篇
Aug 12, 2026 速览 2026-08-12:18 篇
Aug 11, 2026 速览 2026-08-11:20 篇
Aug 10, 2026 速览 2026-08-10:8 篇
Aug 10, 2026 人物 · Maksym Andriushchenko
Aug 9, 2026 速览 2026-08-09:9 篇
Aug 8, 2026 速览 2026-08-08:8 篇
Aug 7, 2026 速览 2026-08-07:8 篇
Aug 6, 2026 速览 2026-08-06:11 篇
Aug 5, 2026 速览 2026-08-05:12 篇
Aug 4, 2026 人物 · Steve Wilson
Jul 28, 2026 人物 · Xiangyu Qi
Jul 24, 2026 人物 · Dawn Song
Jul 21, 2026 人物 · Bo Li
Jul 6, 2026 人物 · Edoardo Debenedetti
Jun 21, 2026 人物 · Chaowei Xiao
Jun 1, 2026 人物 · Xiaogeng Liu
May 29, 2026 人物 · Eric Wong
May 29, 2026 人物 · Alexander Robey
May 18, 2026 人物 · Johann Rehberger
Apr 29, 2026 人物 · Liwei Jiang
Apr 24, 2026 人物 · Leon Derczynski
Apr 10, 2026 人物 · Peter Henderson
Mar 31, 2026 人物 · Kai Greshake
Mar 16, 2026 人物 · Zifan Wang
Mar 16, 2026 人物 · Matt Fredrikson
Mar 16, 2026 人物 · Andy Zou
Feb 3, 2026 人物 · Ram Shankar Siva Kumar
Feb 3, 2026 评测集/基准 · AgentDyn(动态开放式 agent 安全防御基准)
Feb 1, 2026 真实事故 · CVE-2026-25253(OpenClaw / clawdbot / Moltbot 1-Click RCE)
Jan 28, 2026 人物 · Ashley Casovan
Oct 22, 2025 人物 · Sizhe Chen
Oct 8, 2025 人物 · Nicholas Carlini
Sep 23, 2025 人物 · Radha Poovendran
Sep 23, 2025 防御机制 · Qwen3Guard(阿里 Qwen 团队的安全护栏模型系列)
Sep 22, 2025 人物 · Dan Hendrycks
Aug 12, 2025 真实事故 · CVE-2025-53773(GitHub Copilot 自提权 RCE)
Aug 11, 2025 真实事故 · CVE-2025-55284(Claude Code 经 DNS 外带数据)
Aug 7, 2025 人物 · Sven Cattell
Aug 1, 2025 真实事故 · CVE-2025-54135 / CurXecute(Cursor 通过 MCP 配置文件被注入到 RCE)
Jul 29, 2025 人物 · Sander Schulhoff
Jun 27, 2025 人物 · Nouha Dziri
Jun 11, 2025 真实事故 · EchoLeak (CVE-2025-32711)
May 20, 2025 防御机制 · ShieldVLM(清华 CoAI,多模态隐性毒性护栏)
Apr 2, 2025 人物 · Seungju Han
Mar 24, 2025 防御机制 · CaMeL (Capabilities for Machine Learning)
Oct 11, 2024 评测集/基准 · AgentHarm(LLM agent 有害行为基准)
Oct 7, 2024 防御机制 · SecAlign(含 Meta SecAlign)
Oct 3, 2024 评测集/基准 · ASB (Agent Security Bench)
Aug 27, 2024 人物 · Riley Goodside
Aug 1, 2024 人物 · Mantas Mazeika
Jul 31, 2024 防御机制 · ShieldGemma
Jul 23, 2024 防御机制 · Llama Prompt Guard(Meta 的注入/越狱分类器,v1 86M / v2 86M+22M)
Jun 26, 2024 评测集/基准 · WildGuardTest(WildGuardMix 的人工标注测试切分)
Jun 26, 2024 防御机制 · WildGuard(AI2 的 7B 安全审核分类器 / WildGuardMix 数据集)
Jun 26, 2024 评测集/基准 · WildJailbreak(AI2 WildTeaming 合成越狱数据集及其 eval split)
Jun 20, 2024 评测集/基准 · SORRY-Bench
Jun 20, 2024 评测集/基准 · PKU-SafeRLHF(北大对齐组安全偏好数据集)
Jun 19, 2024 评测集/基准 · AgentDojo(ETH SPY Lab 的 prompt injection agent 基准)
Apr 3, 2024 评测集/基准 · JailBreakV-28K(含 RedTeam-2K / mini split)
Mar 28, 2024 人物 · Patrick Chao
Mar 28, 2024 评测集/基准 · JailbreakBench(JBB-Behaviors,100 条越狱行为基准)
Mar 5, 2024 评测集/基准 · WMDP(Weapons of Mass Destruction Proxy,大规模杀伤性武器代理基准)
Mar 5, 2024 评测集/基准 · InjecAgent(工具型 LLM agent 的间接提示注入基准)
Feb 15, 2024 评测集/基准 · StrongREJECT(A StrongREJECT for Empty Jailbreaks,越狱评测基准)
Feb 6, 2024 评测集/基准 · HarmBench(自动化红队标准评测框架)
Jan 11, 2024 评测集/基准 · TOFU(Task of Fictitious Unlearning,虚构作家遗忘基准)
Jan 10, 2024 评测集/基准 · RTA / RtA(Refuse-to-Answer rate,拒答率)
Dec 7, 2023 系统/工具 · Llama Guard(Meta 内容安全分类器系列)
Nov 29, 2023 评测集/基准 · MM-SafetyBench(多模态大模型安全评测集)
Nov 9, 2023 评测集/基准 · SafeBench(FigStep 版,500 条禁忌问题题库)
Nov 9, 2023 评测集/基准 · FigStep / SafeBench(排版图像越狱评测集)
Nov 2, 2023 机构 · UK AI Security Institute (AISI)
Oct 26, 2023 评测集/基准 · ToxicChat(lmsys/toxic-chat)
Oct 10, 2023 评测集/基准 · MultiJail(Multilingual Jailbreak Challenges 数据集)
Oct 10, 2023 评测集/基准 · MaliciousInstruct(100 条有害问句 + BERT 打分器)
Oct 5, 2023 防御机制 · SmoothLLM(随机字符扰动 + 多数投票的越狱防御)
Oct 5, 2023 评测集/基准 · HEx-PHI(Human-Extended Policy-Oriented Harmful Instruction Benchmark)
Aug 18, 2023 评测集/基准 · HarmfulQA(declare-lab,Red-Instruct 配套评测集)
Jul 27, 2023 评测集/基准 · AdvBench(GCG 论文附带的有害行为/有害字符串集)
Jul 10, 2023 评测集/基准 · BeaverTails(PKU-Alignment 有害性标注语料 / QA-moderation 数据集)
Jun 16, 2023 防御机制 · Self-Reminder(系统模式自我提醒)
Jul 4, 2022 评测集/基准 · WebShop(普林斯顿 NLP 组的模拟购物网站环境 / 评测集)
Mar 17, 2022 评测集/基准 · ToxiGen(隐式仇恨语句生成数据集 / 评测集)
Oct 15, 2021 评测集/基准 · BBQ (Bias Benchmark for QA)
Nov 20, 2020 防御机制 · ONION(Outlier-word detection backdoor defense)
Nov 9, 2020 防御机制 · Detoxify (unitaryai/detoxify)
Sep 24, 2020 评测集/基准 · RealToxicityPrompts (RTP)