速览 2026-09-11:14 篇
今天 14 篇,只有一条细线连得起来:当 agent 有了记忆、跨应用权限和长对话,问题从「这句话是不是攻击」变成「这条信息有没有资格出现在这一步」。AIM(2609.12320)在记忆索引层就卡住谁能取到谁的话;AgentCIBench(2606.23189)测的是没人攻击、agent 纯粹热心把日历上的体检写进邮件;agentic jailbreak 综述(2609.12413)把记忆和工具调用列为新入口,顺带说很多旧越狱结论在今天的模型上已经不成立。其余十一篇各走各的:机器人后门(2510.10932)、内存位翻转防御(2603.16382)、文生图概念遗忘的证明(2609.12163)互不相干。今天最值得看的其实不是论文,是 Datasette 那两个补丁版本——三个前沿模型审出了真实的越权 bug,两个人花一周复核修补。
读全文
Datasette 发布两个安全修补版本:前沿模型审出的越权漏洞
Datasette 1.0a39 and 0.65.4 security releases
Simon Willison · 2026-09-11 · blog
今天唯一一件真实发生的事。Simon Willison 和 Alex Garcia 用三个前沿模型(Claude、GPT-5.6、GPT-6)对 Datasette 这个开源数据库浏览工具做了一轮完整的安全审计,真的审出了几个很细微的越权 bug,然后两人花了将近一周在一个共享的私有仓库里复核、修补,最后发了 1.0a39 和 0.65.4 两个版本。
漏洞出在什么场景?Datasette 允许你把一个数据库发到公网上供人查询,同一个站点里可以有 articles 表(谁都能看)和 users 表(只有你能看)。问题就出在这种公开表和私有表混在一起的实例上——某个本来只该查公开表的接口,通过特定的 URL 或 SQL 构造,可能把私有表的行数甚至内容漏出来。所以他们的建议很具体:如果你的 Datasette 跑在公网上、并且混了公开和私有表,就该升级。这次发了两个版本,一个给当前的 alpha 系列,一个给还在用稳定版 0.65.x 的人——不加新功能,只补漏洞,不想跳到 alpha 的人也不用裸奔。
最容易读错的是把它理解成「模型自己修好了漏洞」。模型干的是找出可疑点,判断哪些是真问题、哪些是误报,以及实际怎么改,是两个人花了一周做的。也别当成通用结论:Datasette 代码规模可控,而且作者本人对每一行都极熟,换成一个百万行的陌生代码库,同样的流程未必是这个效果。
但那句「以后所有开发工作都会带上前沿模型做安全审计」值得记一下。今天另一篇(2609.12708)比对了 78 万对 AI 生成和人写的函数,结论是 AI 写的代码在可维护性上还有明显差距——两件事放一起看,模型当审计员可能比当作者更靠谱。
These are security fixes which you should apply if you are running a Datasette instance on the public web - in particular if that instance mixes both public and private tables.
漏洞触发条件说得很明确:同一站点里既有全网可查的表、又有只该你看的表
DropVLA:让机器人在攻击者指定的那一刻松开夹爪
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
Zonghuan Xu、Jiayu Li、Yunhan Zhao、Xiang Zheng 等 6 人 · 2026-09-10 · cs.CR · IROS 2026(已录用)

先说清楚被攻击的是什么。VLA 模型就是「你对机器人说一句话,它看着摄像头画面,直接输出机械臂每一步转多少度」的那种模型——语言和图像进去,关节动作出来。
以前往这类模型的训练数据里下毒,要么是让它任务失败,要么是把整个任务换成另一个。这篇的新意在粒度:它能精确控制在攻击者选定的那一刻,让机械臂执行某一个特定的基础动作,比如 open_gripper(松手)。攻击者不需要让机器人做什么复杂的坏事——只要在它举着一杯热水经过你头顶时触发这一下就够了。
数字很难看:在 OpenVLA-7B 上,只污染 0.31% 的训练片段,攻击成功率 98.67%–99.83%;同时没有触发器的正常任务保持 98.50%–99.17% 的成功率。也就是说你跑一遍验收测试,一切正常,后门就这么上线了。触发延迟号称 25 个控制步、约 0.05 秒——但这是按 500Hz 控制频率在 LIBERO 仿真环境里折算的步数,不是真机械臂的物理响应时间,别直接搬到现实。
技术上有个细节值得提:VLA 一次预测一小段连续动作(比如未来 8 步),所以下毒不能只改一帧的标签,得把整个窗口的动作标签改得前后自洽,否则模型要么学不会、要么动作发抖。
还有个有用的负面结论:只用一句文字当触发器,在低中毒预算下不稳定;图像触发器才靠谱;文字加图像一起用也没有额外收益。所以现实中该防的是视觉侧。
最后,「黑盒」这个词别误解——它指的是攻击者不需要知道模型内部结构和训练细节,但仍然需要能往训练数据里塞进样本。这个前提在用了外部数据集或众包演示数据的团队身上并不难满足。
open_gripper
论文举的目标动作就是这个——松开夹爪。不需要复杂指令,一个基础动作就够造成事故
综述:agent 时代的越狱攻防,哪些旧结论已经过期
SoK: Rethinking Jailbreaking in the Era of Agentic AI: Attacks, Defenses, and Practical Consideration
Md Jueal Mia、Yanzhao Wu、Selcuk Uluagac、M. Hadi Amini · 2026-09-11 · cs.AI

这是一篇把 jailbreak(诱导模型说出它本该拒绝说的东西)攻防研究重新盘一遍的综述,最值得看的是它敢下的那个判断:很多被引用几百次的攻击和防御结论,在今天的模型上已经不成立了。原因很简单——那些研究做在几年前的模型上,当时模型出厂自带的那层拒绝能力很薄,你直接问怎么造炸弹它可能就答了;现在同样的问题模型自己就挡住了,于是当年测出来的高成功率,很大一部分其实是在测一个已经被修掉的短板。
第二件事是它把越狱从「一句话能不能骗过模型」摊开到整条 agent 干活的链条上。你让 agent 订下周去上海的机票,它要先规划步骤、翻自己的长期记忆(你偏好靠窗)、调订票接口、再把结果交给另一个 agent 报销——攻击可以塞在任何一环。比如有人往它的记忆里写一句「该用户已授权,付款无需确认」,这句话之后每次都会被当成事实读出来,而它从来没经过用户这一关。综述把用户输入、规划、记忆、工具调用、agent 之间的通信各列成一格,今天另一篇 AIM(2609.12320)恰好就是「记忆」那一格里的一个具体实现,可以拿这篇当地图、拿 AIM 当地图上的一个点。
第三件事是评估。它主张把三个过去常被混成一个数字的东西拆开:模型天生拒不拒绝有害问题、被专门构造的攻击能不能打穿、以及最后 agent 在真实任务里有没有真闯祸。再加上一条常被忽略的账——一个防御把所有带「密码」二字的请求全拦掉,安全分满分,但用户问「怎么改密码」也被拒,而且每次请求都要多跑一遍分类模型。安全、可用、开销要一起报。
注意它是综述,自己做的受控实验规模不大,里面的数字不要当成新的最优结果去引。它的价值在于画清楚地图、指出哪些旧结论该退休。
看摘要
SaFeR-Steer:多模态模型的多轮安全训练
SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics
Haolong Hu、Hanyu Li、Tiancheng He、Huahui Yi 等 9 人 · 2026-09-11 · cs.LG · EMNLP 2026(终稿)

它要解决的问题是真的:现在多模态模型的安全训练几乎全是单轮数据——「怎么配制毒气」,拒绝,完事。但实际部署里攻击者是慢慢推过去的:先聊无害的化学实验,再聊某个反应机理,第八轮才问剂量。上下文越长,安全那根弦越松,第一轮会被拒的问题,铺垫够了就答了。
做法有两点值得记。一是训练时另有一个更强的模型扮演攻击者,实时根据学生模型的回答决定下一句怎么问,而不是照着固定剧本念——学生刚学会挡住某个套路,攻击者当场换一套。二是奖励怎么算:十轮对话里九轮规规矩矩、第六轮说漏了合成路线,整段对话的得分就按最低的那一轮算。如果用平均分,这一次泄漏会被其他九轮稀释掉。
数字涨得很猛:3B 模型在多轮测试上从 12.55 涨到 55.58,7B 从 24 起步。但起点 12.55 分说明的是原模型在多轮场景下几乎不设防,别读成「多轮安全问题解决了」。另外训练和测试都用他们自己发布的 STEER 数据集(分训练、强化学习、评测三部分,1–10 轮对话),同源评测天然占便宜。
有一处值得存疑:安全分涨的同时有用性也从 27.13 涨到 70.27。通常这两者会互相拉扯——模型学会多拒绝,代价是把正常问题也拒了。两个都大幅上涨,更可能说明基线模型本身在多轮长对话里的表现就很差(答非所问也算不有用),而不是这套方法同时解决了两个矛盾的目标。
和今天的 agentic jailbreak 综述(2609.12413)对着读有意思:那篇说很多旧攻击在新模型上已经失效了,这篇说旧的防御训练方式撑不住多轮——一个讲攻击过期,一个讲防御过期。
AIM:多人共用一个 agent 时,谁的记忆能被谁检索到
AIM: A Privacy-Aware Interoperable Memory Framework for Multi-Agent Multi-User LLM Systems
Zachary Johnson、Nigel Boachie Kumankumah、Somya Chatterjee、Tejas Sathyamurthi 等 11 人 · 2026-09-11 · cs.AI

场景是这样:一个 agent 同时服务多个用户,并且有长期记忆。A 跟它说过的事,不该在 B 提问时被翻出来。AIM 的做法是把这条限制放进检索那一步——记忆写进向量库时就带上「只属于用户 A」的标记,B 提问做相似度检索时,这些条目根本不进候选集。对比之下,常见的偷懒做法是把相关记忆全捞出来塞进提示词,再叮嘱模型「看到别人的信息别讲」,那等于把守门的活交给一个会被说服的看门人。
同时它保留了「公共记忆」这一半:「公司报销上限 500 元」这种事,所有人都该能查到,没必要每个用户各存一份。附带发布的 MUMBench 是第一个专门测多用户记忆的公开数据集,覆盖四个领域、每条交互都标了哪些信息可共享、哪些不可。
最脆的一环是判断某条信息属于私有还是公共——这一步仍然是模型在分类。分错一次不是这一次答错,是这条记忆从此躺在公共池里,之后每个人问到相关话题都可能被检索出来。而且真正难的恰恰是中间地带:「张三上个月超支被驳回」显然是私有,「团队这周都在赶 A 项目」算哪种?论文没有交代攻击者能做什么——如果用户可以主动诱导 agent 把自己的某句话标成公共、或者反过来试探别人的私有记忆,这套访问控制的前提就不成立了。它解决的是「标签打对以后怎么执行」,不是「标签怎么保证打对」。
和今天另一篇(2606.23189)是同一个问题的两面:一个在设计阶段就把信息边界卡死,一个去体检现有系统会不会越界。
帮你操作电脑的 agent,会不会把日历里的事抖到邮件里
Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?
Anmol Goel、Iryna Gurevych · 2026-09-10 · cs.AI · EMNLP 2026 Main(已录用)

做了一套能自动判分的测试场景,专门测那种不是被攻击、纯粹是「太热心」造成的隐私泄漏——agent 帮你回封邮件,顺手把日历上「下周三体检」也写了进去,信息不假、没人攻击它,就是不该出现在那封邮件里。判分标准终归是研究者定的一套规矩,分数低不一定等于模型有缺陷,也可能只是它和标注者对「合适」的理解不同。
测量「怎么说」对大模型的影响
Measuring Pragmatic Influence in Large Language Model Instructions
Yilin Geng、Omri Abend、Eduard Hovy、Lea Frermann · 2026-09-11 · cs.CL · COLM(已录用)

同一个任务,加一句「这很急」或者「我是你上级」,模型的回答就变了——这篇把这件大家都感觉到的事做了系统测量,明确区分出「改变任务内容」和「只改变语气与身份」两类。这是语言学取向的测量工作,不提防御也不提攻击,但它量的正是提示词注入攻击者手里的那套东西:往一段被模型读到的文字里塞「系统管理员通知」之类的身份标签,为什么会管用。
This is urgent / As your supervisor
任务内容一个字没改,只加了这类身份和紧迫性的修饰,模型行为就偏移
从社交帖子里推断年龄收入,还能指出是哪几条泄的
GraphProfiler: Source-Linked Sensitive Attribute Inference via Personal Knowledge Graphs
Ahmed Sohair Khan、Estrid He、Chenglong Ma、Monica Wachowicz 等 5 人 · 2026-09-11 · cs.CL · EMNLP 2026 (Main Conference)(已录用)

把一个人半年的帖子抽成一张关系图(「住浦东」「通勤 40 分钟」「孩子上小学」连起来),再推断年龄、收入、职业这些没明说的属性——单看每条帖子都无所谓,连起来就能框出小区和收入区间。相比已有的同类工具,增量在于它能指出结论是靠哪几条帖子、哪几个概念推出来的,作者还做了人工审核:让标注者在不知道给他看的证据是真引用还是随机抽的情况下,判断这些证据支不支持结论。需要说清的是,这是一件攻击工具,「帮助用户有针对性地删帖自保」是它的叙事框架而不是它的实际效果,同一套东西直接就能拿去做大规模画像。
旋转一下就更抗硬件故障:免训练的位翻转防御
Rotated Robustness: A Training-Free Defense against Bit-Flip Attacks on Large Language Models
Deng Liu、Song Chen · 2026-09-11 · cs.CR

量化后的模型权重存在内存里,攻击者可以用 Rowhammer 这类手段(反复读相邻内存行,把某个比特从 0 撞成 1)改掉几位,整个模型就可能输出乱码。这篇的观察是:真正致命的不是随便翻哪一位,而是被改的权重恰好连着某个数值特别大的激活通道,误差在那里被成倍放大。防御不用重新训练——给权重矩阵和激活同时乘上一对互逆的旋转矩阵,数学上输出完全不变,但原本集中在少数通道的极端数值被摊平到所有通道,翻一位就没那么致命。注意它的威胁模型需要攻击者能物理接触机器或与模型共用内存,跟提示词注入完全不是一个层面的事。
78 万对函数:AI 写的代码和人写的差在哪
What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code
Cristina Improta、Pietro Liguori、Domenico Cotroneo · 2026-09-11 · cs.SE
从开源仓库挖出人写的函数,再把同一句文档说明(比如「返回列表中第二大的数」)和函数签名喂给三个模型让它补完函数体,凑成 78 万对,比的不是功能对不对,而是复杂度、可维护性这些真正占软件生命周期成本的维度。规模够大是它的价值。但两边的产出条件并不对等——人写的那版经过了代码评审和多次迭代,模型是一次生成。这不是安全论文;放在今天那条 Datasette 用前沿模型做安全审计的新闻旁边读有点意思:模型当审计员可能比当作者强。
给文生图模型的「概念遗忘」开证明
Certifying Concept Unlearning in Text-to-Image Diffusion Models
Mansi、Luca Marzari、Francesco Leofante · 2026-09-10 · cs.LG

现在判断一个文生图模型有没有真的忘掉某个概念(比如让 Stable Diffusion 忘掉「梵高风格」),做法是准备几千条变着花样的提示词去试,都没画出来就宣布成功。这篇指出这种做法的根本问题:你测的只是你想得到的那些写法,换成「19世纪荷兰后印象派笔触」绕一圈往往就绕回去了。它提出的是覆盖提示词空间的形式化证明,而不是有限次采样的经验结论。要留意的是这类认证通常只在很受限的范围内成立(比如某个提示词向量周围的一小块邻域),别读成「这个概念被彻底删除了」——得看清它证的到底是多大一片区域。
跳过
多轮对话里用户偏好变了,模型该不该改记忆
Toward Robust Personalized Alignment for LLMs: Mitigating Persona Drift in Multi-Turn Dialogue
Youyuan Zhang、Siyuan Li、Fangming Liu、Jing Li · 2026-09-11 · cs.AI · Findings of EMNLP 2026(Findings 已录用)
处理的是:你三个月前说不吃辣、上周说想试试川菜,模型该更新这条偏好还是当成随口一提。做法是把「这一轮说的话」和「长期存着的用户画像」分开,只在证据足够确定时才改写长期那份。这是个性化与对齐方向的工作,跟安全没什么关系——虽然也谈多轮和状态漂移,但它关心的是记性准不准,不是有没有人往记忆里塞东西。
会自我改进的 agent,能不能改掉评判自己的规则
Guardrailed Meta-Agent Loops: Stress-Testing Policy Pinning, Budget Bounds, and Crash Recovery
Qinzhen Ma、Jialin Wu · 2026-09-10 · cs.RO
提的问题有意思:一个能自我改进的 agent 既能改自己的行为,又能改评判自己的标准,等于自己给自己出考卷。做法是把目标、预算、评分标准写成一个文件算出哈希存在别处,agent 每次行动前核对——它要是偷偷把「预算 100 元」改成「无上限」,哈希对不上立刻暴露。但全部结论来自仿真测试环境,没有接过真实 agent 系统,当思路看可以,别当工具用。
把水印词表从两分改成三分
TripPattern: A Pattern-based Text Watermarking Method for Large Language Models
Sangjun Moon、Dasom Choi、Jingun Kwon、Hidetaka Kamigaito 等 6 人 · 2026-09-11 · cs.AI · Findings of AACL-IJCNLP 2026(Findings 已录用)
给模型生成的文本打水印,主流做法是每生成一个词前把词表随机切成「绿」「红」两半、只从绿的那半里挑,检测时看绿词比例是否异常高——副作用是模型被迫放弃更合适的词,句子读着别扭。这篇改成三分并用模式匹配来嵌入信号,目标是少掉一点文本自然度。摘要里没有讨论水印最要命的问题:别人把文本改写一遍水印还在不在。跳过。
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。