2026

an archive of posts from this year

Aug 21, 2026 速览 2026-08-21:3 篇
Aug 20, 2026 速览 2026-08-20:4 篇
Aug 20, 2026 人物 · Simon Willison
Aug 19, 2026 速览 2026-08-19:8 篇
Aug 19, 2026 拒绝率不是废指标,它只是有边界
Aug 19, 2026 一篇论文里的两个相反读数:unlearning 的'残留'不是模型属性
Aug 19, 2026 GPT-5 在 ReAct 模式下 90.20% ASR:「能力不预测抗注入」该退回去重写
Aug 19, 2026 「0.42% 的神经元」是单次测量的读数,不是模型的属性
Aug 18, 2026 迁移性不是攻击的属性,是载荷所处分布的属性
Aug 18, 2026 「良性微调必然破坏对齐」:4% 和 87% 之间隔着一整套超参
Aug 18, 2026 自报零代价与他评效用崩塌:一条论断的归属偏差
Aug 18, 2026 同一实验里,Llama 加 5 倍预算不动,Qwen 涨到 0.40
Aug 18, 2026 「低资源语言更不安全」这条论断,被测的量换了就反向
Aug 18, 2026 评测集/基准 · MobileWorldSafety(GUI agent 环境注入安全基准)
Aug 17, 2026 31:1 之下的伪共识:聚合视图既是防御前提,也是攻击的成立条件
Aug 15, 2026 速览 2026-08-15:1 篇
Aug 14, 2026 速览 2026-08-14:5 篇
Aug 13, 2026 速览 2026-08-13:6 篇
Aug 12, 2026 速览 2026-08-12:18 篇
Aug 11, 2026 速览 2026-08-11:20 篇
Aug 10, 2026 速览 2026-08-10:8 篇
Aug 10, 2026 人物 · Maksym Andriushchenko
Aug 9, 2026 速览 2026-08-09:9 篇
Aug 8, 2026 速览 2026-08-08:8 篇
Aug 7, 2026 速览 2026-08-07:8 篇
Aug 6, 2026 速览 2026-08-06:11 篇
Aug 5, 2026 速览 2026-08-05:12 篇
Aug 4, 2026 人物 · Steve Wilson
Jul 28, 2026 人物 · Xiangyu Qi
Jul 24, 2026 人物 · Dawn Song
Jul 21, 2026 人物 · Bo Li
Jul 6, 2026 人物 · Edoardo Debenedetti
Jun 21, 2026 人物 · Chaowei Xiao
Jun 1, 2026 人物 · Xiaogeng Liu
May 29, 2026 人物 · Eric Wong
May 29, 2026 人物 · Alexander Robey
May 18, 2026 人物 · Johann Rehberger
Apr 29, 2026 人物 · Liwei Jiang
Apr 24, 2026 人物 · Leon Derczynski
Apr 10, 2026 人物 · Peter Henderson
Mar 31, 2026 人物 · Kai Greshake
Mar 16, 2026 人物 · Zifan Wang
Mar 16, 2026 人物 · Matt Fredrikson
Mar 16, 2026 人物 · Andy Zou
Feb 3, 2026 人物 · Ram Shankar Siva Kumar
Feb 3, 2026 评测集/基准 · AgentDyn(动态开放式 agent 安全防御基准)
Feb 1, 2026 真实事故 · CVE-2026-25253(OpenClaw / clawdbot / Moltbot 1-Click RCE)
Jan 28, 2026 人物 · Ashley Casovan