速览

14 篇 · 按天 ← 全部
2026-08-21 速览 2026-08-21:3 篇今天三篇没有共同线索。两篇讲怎么管住 agent,答案却相反:COPA(2608.19982)还是往模型权重里塞防御,每见到一类新的注入手法就收一批样本再训一轮,靠掺旧样本防止刚学会防新招、转头把最基础的『忽略前面的指令…
2026-08-20 速览 2026-08-20:4 篇今天没有论文,四条里三条是 CVE,一条是没有实验的预测性博客。
2026-08-19 速览 2026-08-19:8 篇今天 8 篇里有 4 篇(2608.17220、2608.17597、2608.17659、2608.17684)在改判据:不再看模型嘴上说没说坏话,而是跑完之后查最终状态——钱转走没有、短信发出去没有、余额变没变。
2026-08-15 速览 2026-08-15:1 篇今天只有一篇,没有值得注意的趋势。唯一一篇是把「改神经元防越狱」从常开改成按需触发,工程上实在,但它把整个防御的成败押在一个判断「这是不是攻击」的前置判断器上,而这个判断器本身没被当成攻击目标测过。
2026-08-14 速览 2026-08-14:5 篇今天 5 篇。有 3 篇不约而同地绕开「这段文字说了什么」,改问「这段文字凭什么由它来写」:PIPES(2608.12789)盯的是店家能不能自己填评分那一栏,研报库(2608.12984)给 SEC 备案和媒体报道分可…
2026-08-13 速览 2026-08-13:6 篇今天的主线是:别指望模型自己把门。一篇(2608.11583)从参数上说,拒绝行为其实只挤在中段几个 MLP 块里,所以微调一下就掉;另一篇(2608.11806)从行为上说,在被投诉图书这类敏感但合法的内容上,四万次提…
2026-08-12 速览 2026-08-12:18 篇今天 18 篇里有 4 篇跳过(产品发布、负载均衡、图神经网络防窃取),剩下 14 篇中最值得看的一条线是「别看模型说了什么,看它做了什么」。
2026-08-11 速览 2026-08-11:20 篇今天 20 篇里最值得看的四篇互不相关,各自捅穿一层大家默认安全的东西。
2026-08-10 速览 2026-08-10:8 篇今天 8 篇里有 5 篇在同一个位置上打转:模型接收的内容和它该听的指令混在一起,边界在哪没人说得清。
2026-08-09 速览 2026-08-09:9 篇9 篇里有 4 篇落在同一处:agent 自己攒下来的东西——技能、日志、备份、记忆——没人审。
2026-08-08 速览 2026-08-08:8 篇今天 8 篇,其中 3 篇不值得展开(一则成本趣闻、一个和它想解决的问题错位的密码学证明、一份自评一致性只有 0.509 的工具清点)。
2026-08-07 速览 2026-08-07:8 篇今天 8 篇里有三篇串成一条线:StepJack(2608.06477)把「撑爆用户磁盘」拆成分散在几个网页上的无辜小步,单步会被拒的攻击拆成三步后在某个模型上成功率涨了 31 个点;DreamGuard(2608.05…
2026-08-06 速览 2026-08-06:11 篇今天 11 篇,其中 3 篇(推荐系统实验 agent、路由收益认证 2608.07583、区块链 agent 网络综述)不算安全工作。
2026-08-05 速览 2026-08-05:12 篇今天 12 篇里有四篇落在同一处:agent 不再只是接完指令就忘,它会把干过的事沉淀成能反复调用的东西。