Aug 21, 2026 速览 2026-08-21:3 篇 Aug 20, 2026 速览 2026-08-20:4 篇 Aug 20, 2026 人物 · Simon Willison Aug 19, 2026 速览 2026-08-19:8 篇 Aug 19, 2026 拒绝率不是废指标,它只是有边界 Aug 19, 2026 一篇论文里的两个相反读数:unlearning 的'残留'不是模型属性 Aug 19, 2026 GPT-5 在 ReAct 模式下 90.20% ASR:「能力不预测抗注入」该退回去重写 Aug 19, 2026 「0.42% 的神经元」是单次测量的读数,不是模型的属性 Aug 18, 2026 迁移性不是攻击的属性,是载荷所处分布的属性 Aug 18, 2026 「良性微调必然破坏对齐」:4% 和 87% 之间隔着一整套超参 Aug 18, 2026 自报零代价与他评效用崩塌:一条论断的归属偏差 Aug 18, 2026 同一实验里,Llama 加 5 倍预算不动,Qwen 涨到 0.40 Aug 18, 2026 「低资源语言更不安全」这条论断,被测的量换了就反向 Aug 18, 2026 评测集/基准 · MobileWorldSafety(GUI agent 环境注入安全基准) Aug 17, 2026 31:1 之下的伪共识:聚合视图既是防御前提,也是攻击的成立条件 Aug 15, 2026 速览 2026-08-15:1 篇 Aug 14, 2026 速览 2026-08-14:5 篇 Aug 13, 2026 速览 2026-08-13:6 篇 Aug 12, 2026 速览 2026-08-12:18 篇 Aug 11, 2026 速览 2026-08-11:20 篇 Aug 10, 2026 速览 2026-08-10:8 篇 Aug 10, 2026 人物 · Maksym Andriushchenko Aug 9, 2026 速览 2026-08-09:9 篇 Aug 8, 2026 速览 2026-08-08:8 篇 Aug 7, 2026 速览 2026-08-07:8 篇 Aug 6, 2026 速览 2026-08-06:11 篇 Aug 5, 2026 速览 2026-08-05:12 篇 Aug 4, 2026 人物 · Steve Wilson Jul 28, 2026 人物 · Xiangyu Qi Jul 24, 2026 人物 · Dawn Song Jul 21, 2026 人物 · Bo Li Jul 6, 2026 人物 · Edoardo Debenedetti Jun 21, 2026 人物 · Chaowei Xiao Jun 1, 2026 人物 · Xiaogeng Liu May 29, 2026 人物 · Eric Wong May 29, 2026 人物 · Alexander Robey May 18, 2026 人物 · Johann Rehberger Apr 29, 2026 人物 · Liwei Jiang Apr 24, 2026 人物 · Leon Derczynski Apr 10, 2026 人物 · Peter Henderson Mar 31, 2026 人物 · Kai Greshake Mar 16, 2026 人物 · Zifan Wang Mar 16, 2026 人物 · Matt Fredrikson Mar 16, 2026 人物 · Andy Zou Feb 3, 2026 人物 · Ram Shankar Siva Kumar Feb 3, 2026 评测集/基准 · AgentDyn(动态开放式 agent 安全防御基准) Feb 1, 2026 真实事故 · CVE-2026-25253(OpenClaw / clawdbot / Moltbot 1-Click RCE) Jan 28, 2026 人物 · Ashley Casovan