速览 2026-08-16:10 篇
十篇里有两篇撞在同一处:被审计的东西不等于真正决定输出的东西。KV 缓存那篇(2608.15939)里应用把对话删干净了,推理服务器留着的中间结果仍让模型”看得见”;供应链投毒(2608.15913)则是权重签了名,包在外面的 prompt 模板和 YAML 配置没人签。另有两篇凑成投毒的成本与后果:2608.15814 量化”内容要发在多权威的站点上才会被引用”,2603.00801 把一篇假文章塞进搜索结果靠前的名次,模型信了还不肯多查一次。其余六篇各走各的,拒答不对称(2608.15772)最值得单看。
读全文
撤销了但没忘掉:KV 缓存的保留会破坏 agent 的回滚一致性
Aborted but Not Forgotten: KV-Cache Retention Breaks Rollback Consistency in Language Agents
Guijia Zhang、Harry Yang · 2026-08-16 · cs.CL

画面是这样的:一个 agent 试了某个分支,系统判定不行,把这段从对话记录里删掉,界面上干干净净。但推理服务器为了省算力,把这段对应的 KV 缓存留着了——模型每读一个词都会算一堆中间结果存下来供后续复用,就像做长加法时把进位记在草稿纸边上,你把题目擦了,草稿纸上的进位还在。于是模型继续往下算的时候,仍然「看得见」应用以为已经扔掉的内容。这篇的价值在实验设计:两次请求喂进去的文字一字不差,唯一区别是缓存里留的是被撤销的旧内容、还是从已确认状态重新算的。63 个测试格子里有 25 个的受保护动作(那种标了「敏感、需授权」的操作,比如真的发出转账)从「该拒绝」翻成了「执行」;而攻击者的文字在全部 63 次请求里都不存在,日志里查不出任何异常。把缓存重建一遍,63 个格子全部修好——说明这不是模型玄学,是应用层的「撤销」和推理层的「缓存复用」两套状态机互不知情。别读成又一种 prompt injection,这次没有任何注入文本进入当前请求;也别读成缓存复用本身有错,错在没人保证它和已确认状态一致。范围要说清:实验是 3.8B–36B 的开源权重模型,加上 HuggingFace 默认的缓存复用路径和 LangGraph,不等于主流商业 API 也这样。和今天的供应链投毒那篇(2608.15913)是同一种毛病——被审计的东西不等于真正决定行为的东西。
拒答的不对称:放出答案只需改一个位置,恢复拒答要改一大片
Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration
Yiqi Liu、Yang Wang、Songxin Wang、Chenghao Xiao 等 5 人 · 2026-08-16 · cs.AI

模型拒绝回答的时候,正确答案到底是被抹掉了还是只是被挡在门口没说出来?这篇给了个干净的因果证据:只是没说出来。实验设置很讲究——他们告诉模型答案,然后要求它别讲,这样「回答」和「拒答」两条运行轨迹的输入一字不差,才好做对照。然后做激活替换:把模型回答那一次某一层某一个词位置上的中间计算结果,原样贴到拒答那一次的对应位置,看输出变不变。只改一个位置,藏着的答案就吐出来了;反过来,想把一个正在回答的模型压回拒答状态,得同时改好几个位置,而且要让它拼出一段连贯的拒绝话术更难。他们还顺手否掉了一个流行做法:把「回答状态减拒答状态」的平均方向向量当成开关,加上去就拒答、减下去就回答——实测这个开关不可靠,不能双向切。安全上的含义很直接:拆掉对齐比装上对齐便宜,这不是比喻,是能数出来的位置数差异。要说清限制——这是白盒实验,需要能直接改模型内部的数值,黑盒攻击者用不了;而且「知道答案但被要求别说」跟真实的有害内容拒绝未必是同一回事。
看摘要
AI 供应链应用中的合取式投毒
Conjunctive Poisoning in AI Supply-Chain Applications
Nokimul Hasan Arif、Qian Lou、Mengxin Zheng · 2026-08-16 · cs.CR

一句话:大家都在给模型权重签名核对哈希,但真正决定用户看到什么的,是包在外面那层 prompt 模板(比如「你是客服助手,回答要礼貌。用户问:{输入}」,外加生成完之后跑的后处理脚本)和 JSON/YAML 配置文件,这两样几乎没人验。作者做了个「与门」后门:模板里埋一个记号、配置里埋一个绑定值,两个同时对上才发作——审计的人分开看这两个文件都看不出问题,像保险箱两把钥匙分给两个人。他们在 15 个开源和闭源部署上试了静态配置检查、模板扫描器、PromptShield,还有 SigStore 这类给软件产物签名的工具链,都没拦住,因为签名的覆盖范围里压根没有模板和配置。一个细节说明危害形态:COCO 图像描述任务上塞了 payload 之后 F1 从 1.0000 掉到 0.8931,把 payload 删掉又回到 1.0000——任务其实答对了,被改的只是渲染出来的那层外壳,从效果指标上看几乎无损,所以监控质量分也发现不了。威胁模型很宽松:前提是「恶意开发者」,一个能改部署产物的人本来就能干更狠的事,所以这篇的价值不在攻击难防,而在指出签名边界有个洞。作者提的 TIF-BAH 中间件只是概念验证,别当解决方案。
从发布方权威度看生成式搜索的攻击面:政治领域案例研究
Assessing Attack Surfaces in Generative Search Engines through Publisher Attributes: A Case Study in Political Domains
Riku Mochizuki、Shusuke Komatsu、Souta Noguchi、Kazuto Ataka · 2026-08-16 · cs.CR

生成式搜索引擎(你问一句话,它去搜网页、读完、写一段答案,末尾附几个引用链接,Perplexity 和 Google 的 AI Overview 都算)的投毒问题,这篇不问「能不能投」,而是问「要花多少钱投」。新提的指标叫 content-injection barrier:把投毒难度换算成「你得在权威度多高的发布方上发这段内容」。如果系统只引 BBC,你得先黑掉 BBC;如果它对任何看起来像新闻的站点一视同仁,注册个域名就够了。另一个被忽略的变量是个性化——系统会按用户立场调整引用哪些来源,等于同一篇投毒内容对不同用户的有效性不一样,攻击面是按人分层的。这是测量论文不是攻击演示,别读成「生成式搜索被攻破了」;而且政治话题的引用偏好不一定推广到医疗、金融。和另一篇(2603.00801)正好凑一对:这篇量成本端——把内容塞进去有多难;那篇量伤害端——只塞一篇高可信度假文章到搜索结果第 2 位,六个前沿模型的准确率就崩了。
文字看着完全正常,配一段音频就能诱出有害回答
ARENA: Automated Red-Teaming for Large Audio Language Models
Jiaming He、Zhicong Huang、Tian Jin、Zhen Sun 等 8 人 · 2026-08-16 · cs.SD

现在有些模型能直接听声音:你说话它听懂并回答,也能听音乐和环境声。这篇做的是针对这类模型的自动化攻击搜索,关键约束是——文字部分单看必须是完全无害的一句话,只有配上那段音频,两者合起来才诱出有害行为。这意味着只检查文字的过滤器根本看不见攻击。方法是常规的闭环红队:训一个控制器负责生成攻击,用一个判别模型给它打分当奖励,反复迭代;新的部分是把音频的各种变体也放进搜索空间里一起搜。在 Audio Flamingo 3 上,找到有效攻击的比例是 87.9%。最大的读法问题在裁判上:训练时用一个模型(MD-Judge)打分,最终成绩用另一个模型(Llama Guard 3)打分,作者刻意换了模型避免自己给自己评分,但「用模型来判断一段话有没有害」这件事本身的误差没有被人工独立校准过,那些 98%–100% 的成功率要打折看。也别读成音频模型天生比文本模型更不安全——只是文本红队的工具在这里失效了。攻击者需要能构造并提交任意音频文件,这在语音助手场景是现实的。
翻几个内存位就能让机器人彻底失手
Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability
Yudong Gao、Linghan Chen、Wenhan Wu、Mia Zhou 等 8 人 · 2026-08-16 · cs.CR

这篇干的事:模型加载进内存之后,不改任何文件,只把内存里的几个二进制位从 0 翻成 1,让机械臂完全干不成活。攻击手法叫 Rowhammer——反复高速读写内存的某一行,让物理上相邻那行的位发生翻转,所以权重文件的哈希校验完全看不出问题。反差是这篇的核心:随机翻几百个位,机器人照样干活;用梯度算出该翻哪几个,1 到 5 个就够了。更有信息量的是它和架构的关系:模型最后把内部状态翻译成动作的那一层(输入是摄像头画面加一句「把红色杯子放进水槽」,输出是关节动作),如果是直接吐坐标数值的写法,1-5 个位就崩;如果是那种把噪声一步步迭代成动作轨迹的写法,得翻 100-300 个才崩——误差在迭代里被摊平了。也就是说,选哪种动作解码方式本身就是一个安全决定。作者也给了防护成本:只对 3.1% 的权重做保护,翻 100 个位时还能保住 60% 成功率。攻击者需要什么:得已经能在同一台机器上跑代码,还得精确定位到目标位,这在实机上远不是随手能做。另外要注意,真机那组 20 次任务 0 次成功(干净模型是 14/20)用的是「按任务校准过的模拟翻转」,不是真的对着机器人打 Rowhammer。
五次正常提问就能查出某份文档在不在知识库里
Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment
Nguyen Linh Bao Nguyen、Wanlun Ma、Viet Vo、Alsharif Abuadbba 等 7 人 · 2026-08-16 · cs.CR · Accepted by USENIX Security 2026

先说要偷什么:不是文档内容,是「这份文档在不在系统的知识库里」这一个是非题。听起来无害,但在医院或律所场景下,「某位病人的记录在这个库里」本身就是隐私。以前干这事有两条路,一条是问一眼就能看出不对劲的模板句——比如「下面这段话出现在上下文里吗?回答是或否」——这种很容易被过滤掉;另一条是不用模板但要问几百上千次,成本高还容易触发限流。这篇改成问几个完全正常的开放问题(论文里的示例就是「does deep voice support convolutional neural network」这种),拿到回答后,用一个专门判断「A 能不能从 B 推出来」的小模型,去比对回答和候选文档,能推出来就说明模型多半读过它。5 次查询 AUC 就到 0.991,还不需要像旧方法那样先自己训一个类似的模型当参照系。真正的含义是:靠「检测异常提问」来防这类窥探基本走不通了,因为这些问句和真实用户的提问长得一模一样。局限在于测试用的三个语料(NFCorpus、SCIDOCS、TREC-COVID)都不大,企业级的大知识库里 5 次够不够,论文没答。攻击者预算的角度看,这篇和今天那篇量化投毒门槛的生成式搜索测量(2608.15814)是同一种视角——都在算「攻击到底要花多少」,只是一个数查询次数,一个数发布门槛。
Does this: "We introduce a technique for augmenting... speaker identities almost perfectly." appear in the context? Answer with Yes or No
这是旧方法的模板问句,一眼就能被过滤器认出来;MEntA 换成「does deep voice support convolutional neural network」这种和普通用户提问没区别的句子
合成互联网:用人造的对抗性小型网络诊断语言智能体的认知弱点
The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents
Shrey Shah、Levent Ozgur · 2026-08-16 · cs.AI
作者造了一个几千篇文章互相链接的假互联网,每篇都事先标好「可信不可信」「真的假的」,然后只做一件事:往搜索结果的第 k 名塞进一篇写得很像样的假文章,看六个前沿模型会怎么反应。真实来源一直在那儿、随便查,但准确率还是崩了。比准确率下降更值得说的是另外两件事:模型几乎不会因为看到可疑内容就多搜几次去核对,而且答错了还很自信。也就是说它信了那篇假文章,并且不觉得需要再查。这里的攻击变量是排名本身——不需要往网上灌大量垃圾,一篇排得够靠前就够了;论文没有交代攻击者要付出多少代价才能占到那个名次,而这正好是另一篇(2608.15814)在量的东西:它把「投毒难度」换算成「你得先把内容发到权威度多高的站点上」,如果生成式搜索照样引用随便谁的博客,那门槛基本是零。两篇拼起来是同一件事的成本端和伤害端。读数字的时候注意:环境是程序生成的,文章风格跟真实网页差很远,绝对值别当真,有意义的是「同一个问题只改一篇文章的名次,结果差多少」这个相对量。论文做了训练数据去污(保证测试内容没在模型训练集里出现过,免得模型是背下来的),但这不代表模型没见过类似的套路。
跳过
视频问答里的假时间戳,让模型自己检查等于没检查
Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study
Yogesh Kumar · 2026-08-16 · cs.CV
视频问答系统会给答案配上时间戳(「第 3 分 12 秒画面显示……」),带了时间戳看起来就像有依据,但那一帧可能压根不支持这句话。这篇搭了个流水线,让每条带时间戳的说法都被单独重新核对一遍。唯一有点意思的观察是:直接问视觉模型「这一帧支持这个说法吗」,40 条伪造的说法一条都没抓出来,捕获率 0%——因为模型倾向于顺着你说「是」,你怎么问它怎么点头。换成一个专门判断「句子 A 能不能从句子 B 推出来」的小模型当裁判,才稳定到 79%。这个小模型没有对话习惯,也就不会为了讨好你而附和。但这是幻觉检测的工程报告,不是安全工作:没有攻击者,没有威胁模型,样本量只有 40 条,0% 和 79% 这两个数字撑不起统计意义上的结论。
给职场 AI agent 的风险列了个 15 类清单
Unaccountable Delegation, Fading Skills: Mapping the Risks of Workplace AI Agents
Gabriele La Malfa、Lakmal Meegahapola、Edyta Bogucka、Jie M. Zhang 等 7 人 · 2026-08-16 · cs.AI
这不是安全研究,是一份职场风险分类学。做法是拿美国劳工部职业数据库里 2078 条具体岗位任务(比如「护士:核对给药剂量」)喂进一个固定格式的提问模板,让模型生成 8356 个风险场景,再找 45 个不同工种的工人和一个模型裁判确认「这听起来像会发生的事」。跳过的理由不是增量小,而是这 8356 条不是观测到的事故,是模型按模板编出来的,验证方式只是问人「像不像」——把它当实证发现读会出错。唯一值得记的是一个反直觉点:人机协作模式不比全自动更安全,因为人依赖久了,自己的技能和监督能力会慢慢退化,到需要接管的时候已经接不住了。
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。