Junjie
Liang
Toggle navigation
about
blog
(current)
publications
cv
Perimeter
14 期速览 · 33 知识卡 · 48 资讯卡 · 10 长文 · 最新 2026-08-21
未读
已读(浏览器记录)
速览
按天 · 14 期 · 空档表示那天窗口内没有新论文
08-21
3 篇
08-20
4 篇
08-19
8 篇
08-15
1 篇
08-14
5 篇
08-13
6 篇
08-12
18 篇
08-11
20 篇
08-10
8 篇
08-09
9 篇
08-08
8 篇
08-07
8 篇
08-06
11 篇
08-05
12 篇
知识卡
按人 · 33 张 · 人物与研究组
学者 24
Maksym Andriushchenko
·
Xiangyu Qi
·
Dawn Song
·
Bo Li
·
Edoardo Debenedetti
·
Chaowei Xiao
·
Xiaogeng Liu
·
Eric Wong
·
Alexander Robey
·
Liwei Jiang
·
Leon Derczynski
·
Peter Henderson
·
Zifan Wang
·
Matt Fredrikson
·
Andy Zou
·
Sizhe Chen
·
Nicholas Carlini
·
Radha Poovendran
·
Dan Hendrycks
·
Nouha Dziri
·
Seungju Han
·
Riley Goodside
·
Mantas Mazeika
·
Patrick Chao
独立 5
Simon Willison
·
Johann Rehberger
·
Kai Greshake
·
Sven Cattell
·
Sander Schulhoff
高管 2
Steve Wilson
·
Ram Shankar Siva Kumar
政策 1
Ashley Casovan
机构 1
UK AI Security Institute (AISI)
资讯卡
按类型 · 48 张 · 评测集 / 事故 / 系统 / 防御机制
评测集 31
MobileWorldSafety
·
AgentDyn
·
AgentHarm
·
ASB (Agent Security Bench)
·
WildGuardTest
·
WildJailbreak
·
SORRY-Bench
·
PKU-SafeRLHF
·
AgentDojo
·
JailBreakV-28K
·
JailbreakBench
·
WMDP
·
InjecAgent
·
StrongREJECT
·
HarmBench
·
TOFU
·
RTA / RtA
·
MM-SafetyBench
·
SafeBench
·
FigStep / SafeBench
·
ToxicChat
·
MultiJail
·
MaliciousInstruct
·
HEx-PHI
·
HarmfulQA
·
AdvBench
·
BeaverTails
·
WebShop
·
ToxiGen
·
BBQ (Bias Benchmark for QA)
·
RealToxicityPrompts (RTP)
事故 5
CVE-2026-25253
·
CVE-2025-53773
·
CVE-2025-55284
·
CVE-2025-54135 / CurXecute
·
EchoLeak (CVE-2025-32711)
系统 1
Llama Guard
防御 11
Qwen3Guard
·
ShieldVLM
·
CaMeL (Capabilities for Machine Learning)
·
SecAlign
·
ShieldGemma
·
Llama Prompt Guard
·
WildGuard
·
SmoothLLM
·
Self-Reminder
·
ONION
·
Detoxify (unitaryai/detoxify)
长文
按论断 · 10 篇 · 标题即论断
拒绝率不是废指标,它只是有边界
一篇论文里的两个相反读数:unlearning 的'残留'不是模型属性
GPT-5 在 ReAct 模式下 90.20% ASR:「能力不预测抗注入」该退回去重写
「0.42% 的神经元」是单次测量的读数,不是模型的属性
迁移性不是攻击的属性,是载荷所处分布的属性
「良性微调必然破坏对齐」:4% 和 87% 之间隔着一整套超参
自报零代价与他评效用崩塌:一条论断的归属偏差
同一实验里,Llama 加 5 倍预算不动,Qwen 涨到 0.40
「低资源语言更不安全」这条论断,被测的量换了就反向
31:1 之下的伪共识:聚合视图既是防御前提,也是攻击的成立条件
没有匹配的条目。