analysis
an archive of posts with this tag
| Aug 19, 2026 | 拒绝率不是废指标,它只是有边界 |
|---|---|
| Aug 19, 2026 | 一篇论文里的两个相反读数:unlearning 的'残留'不是模型属性 |
| Aug 19, 2026 | GPT-5 在 ReAct 模式下 90.20% ASR:「能力不预测抗注入」该退回去重写 |
| Aug 19, 2026 | 「0.42% 的神经元」是单次测量的读数,不是模型的属性 |
| Aug 18, 2026 | 迁移性不是攻击的属性,是载荷所处分布的属性 |
| Aug 18, 2026 | 「良性微调必然破坏对齐」:4% 和 87% 之间隔着一整套超参 |
| Aug 18, 2026 | 自报零代价与他评效用崩塌:一条论断的归属偏差 |
| Aug 18, 2026 | 同一实验里,Llama 加 5 倍预算不动,Qwen 涨到 0.40 |
| Aug 18, 2026 | 「低资源语言更不安全」这条论断,被测的量换了就反向 |
| Aug 17, 2026 | 31:1 之下的伪共识:聚合视图既是防御前提,也是攻击的成立条件 |