Junjie
Liang
Toggle navigation
about
radar
publications
cv
长文
10 篇 · 按论断 · 标题即论断
← 全部
未读
已读(浏览器记录)
2026-08-19
拒绝率不是废指标,它只是有边界
拒绝—执行的脱钩不是模型属性,而是攻击载荷在语言层是否可辨识的函数。
2026-08-19
一篇论文里的两个相反读数:unlearning 的'残留'不是模型属性
一段被 unlearning 处理过的知识能否被重新引出,取决于干预是否作用在所有输入通道汇聚的那一层,而不取决于干预属于'后处理'还是'重训'。
2026-08-19
GPT-5 在 ReAct 模式下 90.20% ASR:「能力不预测抗注入」该退回去重写
「能力不预测抗注入」是把两个反向的自变量压成了一个。真正成立的是更窄的说法——**指令跟随/推理能力越强,对注入的顺从性越高;对齐训练能在同族内造出接近 47pp 的抗性断层。
2026-08-19
「0.42% 的神经元」是单次测量的读数,不是模型的属性
「安全行为稀疏可定位」这条结论的证据几乎全部产生于单次静态干预 + 不许重训的实验条件。
2026-08-18
迁移性不是攻击的属性,是载荷所处分布的属性
「在小模型上优化、打大模型」这条经验规则的适用边界应该按载荷所在分布的训练覆盖度划线,不是按模型家族或参数量划线。
2026-08-18
「良性微调必然破坏对齐」:4% 和 87% 之间隔着一整套超参
「在良性数据上微调必然侵蚀安全对齐」不是模型属性,是训练配置的函数。
2026-08-18
自报零代价与他评效用崩塌:一条论断的归属偏差
这条论断当前的经验基础带有系统性归属偏差。真正的分界线可能不是防护强度,而是机制类型——限制信息流/权限的防御(CaMeL 的能力标签、Task Shield 的动作检查器、privilege separation)付效用代价,而检测并剥离注入内容的防御(CR…
2026-08-18
同一实验里,Llama 加 5 倍预算不动,Qwen 涨到 0.40
自适应攻击测的不是「静态评测偏差」这个可跨系统迁移的量,而是特定模型/防御有没有可被优化利用的脆弱方向。
2026-08-18
「低资源语言更不安全」这条论断,被测的量换了就反向
「低资源语言更不安全」目前只在「对抗性有害请求的拒绝/绕过口径」下有证据支撑。
2026-08-17
31:1 之下的伪共识:聚合视图既是防御前提,也是攻击的成立条件
目前的证据无法区分'跨步状态带来了检测能力'与'跨步状态同时提供了装配面,只是在多数 benchmark 里检测收益碰巧为正'。
没有匹配的条目。