今天 20 篇里最值得看的四篇互不相关,各自捅穿一层大家默认安全的东西。ColluSkill(2608.09732)指出把恶意流程拆成三四个单看无害的技能包(收集、压缩、上传各一个),逐个扫描就查不出来。2608.09867 发现厂商把模型思考过程加密回传的那坨密文在同厂生态内通用,喂给同厂便宜模型就能解成明文。2608.09624 说防护打分器区分有害提问的准确率高,跟真能拦住越狱是两回事——套上伪装外壳后越狱率从 0.05 升到 0.27,打分器 AUROC 反而从 0.936 掉到 0.5 附近。还有一篇(2608.09158)换了个入口:往音频里混进一段人耳几乎听不见的低频声音,语音模型的答题准确率最多掉 67 个百分点,而人听这段录音觉得跟没动过的一样干净——一个摆在会议室里、你听不见的音源,就能让在场所有语音助手集体答错。其余多是能力工程和可解释性。

读全文

ColluSkill:把坏事拆成几个技能包,每个单看都无害

ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners

arXiv 2608.09732

现在扫描 agent 技能包(可下载的”做事说明书”,见 ElasticBack 那条)的工具基本都是一个一个查,这篇指出的盲点很直接:把一件坏事拆成三四步,每步单独打包成一个技能,每个单看都很合理——一个负责收集文件、一个负责压缩、一个负责上传——只有在 agent 按顺序执行、前一个的产物交给后一个时,完整的恶意流程才浮现。作者用大模型来规划这条链怎么拆,还会拿扫描器的判定结果反过来改写各个子技能,直到每个都能单独通过检查。同时提了防御 ChainGuard:扫描一个新技能时,把 agent 里已经装了的技能一起看,判断加进来之后会不会凑成一条有害的链。这个防御思路是对的,但代价没在摘要里说清楚——每装一个技能都要和已装的所有技能做组合分析,技能一多组合数就爆炸,而且攻击者可以把链拆得更长、或者让某一环延后再装。攻击者预算:只需要能往技能市场里上传若干看起来正常的包,不需要接触受害者的模型或系统提示词,这在开放的技能生态里门槛很低。今天两篇技能包攻击(本篇和 2608.09577)指向同一件事:技能供应链的安全检查目前还停留在单文件杀毒的阶段。

人耳听不见的低频声音能让语音大模型答错

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

arXiv 2608.09158

现在的语音模型能直接听音频回答问题(比如「这段录音里的人说了什么」)。这篇发现:往音频里混进一段人耳几乎听不见的低频声音,模型的准确率能掉最多 67 个百分点。人来听这段被动过手脚的录音,觉得干净程度打 1.33 分(原始干净录音是 1.17 分,基本听不出区别)。攻击者不需要知道模型内部结构,也不针对某一个特定问题定制——他们做的是一个通用的波形模板,先估计一句话里哪几段是模型「注意力集中」的部分,只在那几段插入干扰,其余时间保持安静。这比以往那些需要对每条音频单独优化、且往往能被听出杂音的对抗攻击更实用:意味着一个在会议室里放着的、你听不见的音源,就可能让在场所有设备的语音助手集体失灵。作者也给了个缓解办法,叫 DRG:检测到音频的频谱分布不对劲时,就要求重新录一遍,被攻击时的准确率从 28.5% 回到 46.1%——注意还是远低于正常水平,而且「重录一遍」这个前提在很多场景(比如处理已有录音文件)根本不成立。论文没有交代如果攻击者知道 DRG 存在、专门绕开这个频谱检测会怎样,这是明显的缺口。

从商用大模型 API 里偷出被加密的思考过程

Stealing Reasoning Traces from Proprietary LLM APIs

arXiv 2608.09867

现在几家大厂把模型「一步步想」的中间过程藏起来了:这段思考不存在服务器上,而是加密成一坨密文发回给你,你下次提问时再原样带上去,服务器解开继续用。这篇发现同一家厂商生态内的这些密文是通用的——A 模型产出的密文可以塞给同一家的 B 模型,而且 B 会照解不误。于是攻击手法是:把强模型(比如最贵那款)的加密思考块喂给同厂一个更弱、防护更松的便宜模型,让它解开并原样吐成明文。整个过程从没直接攻击强模型,却拿到了它的完整推理过程。作者在 Anthropic、OpenAI、Google 三家上都复现了,可用来绕过厂商防蒸馏(防别人用它的输出训自己的模型)、也可从开发者互相分享的调试记录里捞出私密内容。更狠的一步是往密文里塞指令:先用弱模型生成一段「思考」,混进受害者的推理记录尾部,受害模型接着往下想的时候就会当成自己的想法执行。攻击者需要的条件很明确——同一家厂商的 API 账号、以及拿到一段目标的加密思考块(比如从别人公开分享的日志里),不需要任何模型内部权限。

We let Haiku 4.5 generate a thought about this injection, and injected into the PostTrainBench trace near the end. When the trace is continued by the victim, Opus 4.7 follows the injected instruction and uploads the file after every change.

用便宜模型伪造一段「思考」塞进加密推理块,受害模型接着往下想时就把它当成自己的决定执行了——每次改文件都自动上传

内部有害性打分器越是觉得安全的提示,越容易真的越狱成功

Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks

arXiv 2608.09624

有一类防护是这样做的:在模型开口之前,先从它内部的激活值里读出一个「这句话有多危险」的分数,超标就拦。这种打分器的验收标准通常是「能不能把有害问题和正常问题分开」,然后大家默认它也就能拦住真正得手的攻击。这篇指出这两件事不是一回事:有没有恶意是提问本身的属性,而越狱成不成功取决于目标模型、解码策略和判定者,是后面才发生的结果。实测数字很直白:在 Llama 上,给有害问题套一层伪装外壳后,模型真的生成有害内容的比例从 0.05 升到 0.27,可打分器区分有害/无害的准确度(AUROC)却从 0.936 掉到 0.803——攻击变危险了,在打分器眼里反而更安全了。作者还指出一个技术性坑:基于注意力的测量通常从「跟提示内容相关的某个位置」读数,套壳同时改变了被测的内容和读数的位置,于是他们改成固定一个与内容无关的测量点。这篇的价值在于把「打分器有效」这个业界普遍假设直接测穿了;未交代攻击者是否知道打分器存在并针对它优化。

看摘要

管住 KV 缓存:堵住多租户 LLM 推理中的计时侧信道

Governing the KV Cache: Preventing Timing Side-Channel Leakage in Multi-Tenant LLM Inference

arXiv 2608.09225

要解决的问题是真的:现在的推理服务为了省算力,会把已经算过的提示词开头缓存下来,下次谁的请求开头一样就直接复用(比如系统提示词、公共文档前缀)。缓存命中的请求响应明显更快,于是同一台服务器上的另一个租户可以不停地试探——把猜的句子发过去,看哪一次回得特别快——一个词一个词把别人的私密提示词还原出来。已有三篇公开攻击(PROMPTPEEK、EarlyBird、InputSnatch)在没防护的 vLLM 和 SGLang 上成功率最高到 100%。这篇的修法只有一句话:给每个租户的缓存键混入一个由服务方密钥算出的、租户专属的随机值,这样两个租户就算发一模一样的开头,算出来的缓存键也不同,谁也命中不了谁的。论文自己的消融实验也承认这个盐是唯一必要且充分的部分——而按租户隔离缓存本来就是主流推理框架已有的配置项,所以真正的增量是把三类攻击归到同一个修复口子上,并附了一份能直接跑的验证脚本。剩下的两块(一个用博弈论算出「敌手期望收益降低 12.6%」的审计抽查调度器,一个算出「攻击者占比超过 31.6% 就会失稳」的演化分析)都是纸面模型推出来的数,不是在真实服务上测的,别当成实测效果读。威胁模型也只覆盖了一半:假定攻击者能精确计时、能任意构造请求开头、且和受害者落在同一个实例上;至于攻击者能不能主动把别人的缓存挤掉、能不能跨节点观察,论文没交代。

ActBench:用执行过程而非最终回答来测协作 agent 的行为安全

ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

arXiv 2608.09476

它测的不是 AI 助手最后说了什么,而是它一路上干了什么。举例:你让助手”整理一下这个项目的文件”,它把文件整理好了,回答也挑不出毛病,但过程中顺手读了不该读的人事表、调了一个没授权的接口——最终回答看不出问题,执行记录里才有。ActBench 造了 600 个测试用例,每个用例是一对:一个正常任务,和一个内容几乎完全一样、只是在某处埋了一句诱导话术的版本,其余条件(指令、配置、初始状态)全部保持一致,这样一旦行为变了就能确定是那句话导致的。攻击者能做的:往任务过程中必然会读到的地方塞一段文字,并且失败后能拿着”卡在哪一步”的反馈反复改写重试(论文用一种带打分的搜索来自动优化这段文字,同时保证任务还能完成——否则纯捣乱的注入很容易被发现);不能做的:改指令本身、改环境初始状态、碰那些被标记为可信的记录。判定是否”越界”用两路证据交叉验证:一路查系统日志(调了哪个接口、读了哪个文件,这是硬证据),一路让另一个模型读整段执行轨迹做判断。结果是 15 个模型的攻击成功率从 10.1% 到 94.4%——这个跨度大到说明所谓”agent 安全性”目前几乎完全取决于底座模型,而不是外面套的框架。要留意的是自动化打分的第二路:用模型判断模型的行为,本身也可能被埋在轨迹里的文字影响,论文未交代这一环的抗干扰测试。

隐含语境攻击:不说出口的前提也能骗出有害输出

Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models

arXiv 2608.09551

这篇做的是一种多轮对话的越狱攻击:不直接问坏问题,而是先花几轮把对话的”背景设定”铺好,等模型接受了这个背景,最后一句自然而然就说出了有害内容。作者的说法是,人说话总依赖没说出口的常识和社会规范,而安全训练主要盯着字面上写了什么,这中间有缝。具体流程是四步:先从一段仇恨言论里提取出它隐含的偏见,再倒推这个偏见成立需要什么前提,然后编一个让这个前提看起来成立的场景,最后在这个场景里让模型说出意思等价的话——字面上不重样,意思一模一样。增量相对有限:”分多轮慢慢把模型带进沟里”这类攻击已经有不少,本文的新意主要在于把”铺垫什么”系统化成了提取前提这一步,而不是靠模型自由发挥。攻击者预算是纯黑盒、只需要多轮对话接口,这点很现实;但论文没交代被攻击方是否开了对话级的审查(很多线上系统会拿整段历史再过一遍安全模型),只测单轮防护的话结论会偏乐观。

Turn 1 identifies the harmful stereotype from the input (e.g., dehumanization). Turn 2 infers the implicit presupposition underlying the identified stereotype. Turn 3 enriches the context by constructing a scenario in which the inferred presupposition appears to hold. Turn 4 leverages the enriched context to elicit harmful outputs

四轮攻击的完整套路:找偏见→倒推前提→编一个让前提成立的场景→在场景里问出来

ElasticBack:给 agent 技能包埋一个平时不发作的后门

ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization

arXiv 2608.09577

先解释”技能包”(agent skill):现在的 AI 助手可以按需加载别人写好的一份说明文档,里面写着”遇到这类任务就按这几步做”,还能捆绑一些脚本,跟装插件差不多——所以谁装了被投毒的技能包,谁就中招。已有的这类攻击有个明显毛病:一装上就每次都发作,很容易被发现。ElasticBack 改成双钥匙:技能文档里埋一条规则(比如”如果用户提到某个词,就额外执行某某”),恶意行为只有在用户的问话里同时出现那个触发词时才启动,平时完全正常。触发词本身是用遗传算法搜出来的——反复变异挑选,要求既能可靠触发、又读起来像句普通人话,不至于被困惑度检测器(专门找读起来别扭的怪句子的工具)挑出来。攻击者能力交代得比较清楚:不能改模型权重、不能改系统提示词、不能看到线上的用户提问,只能污染技能文档,以及通过技能自己控制的渠道(它的示例提问、它调用的工具返回值、它检索到的文档)把触发词送进用户那一轮对话里。这最后一条其实是全文最强的假设——如果攻击者本来就能改工具返回的内容,很多更直接的攻击也成立了,双钥匙设计的必要性就打了折扣。和今天的 ColluSkill(2608.09732)是同一批作者的同一个战场,一个讲怎么让单个技能包平时装死,一个讲怎么把恶意拆到多个技能包里。

对比训练前后的模型内部,找出「看图」这件事改变了哪些特征

Multimodal Model Diffing for Feature Discovery and Control

arXiv 2608.09928

这是可解释性工作,不是攻防工作。做法是:拿一个纯文本模型和它被改造成「能看图」之后的版本,各自拆解出内部的一批「特征方向」(可以理解成模型脑子里代表某个概念的开关,比如「这是一张有暴力内容的图」),然后对比两边,找出是哪些开关因为学了看图才出现的。找到之后可以直接把某个开关关掉或调强,观察模型行为怎么变。在三个模型家族上测了空间理解、OCR(认图上的字)和多模态安全三类任务。跟安全的关联点在于:如果能定位到「拒绝有害图片请求」是由哪几个特征驱动的,那既可以用来加固,也可以用来精准拆掉防线——但论文是从审计和控制的角度写的,没有把它当成攻击手段来评估,也就没有威胁模型可言。对做模型内部审计的人有用,想看攻防结论的可以跳过。

让模型学会拆解越狱话术的套路,而不是背下话术本身

Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

arXiv 2608.09542

训练思路是两轮对抗:先让一个自动化程序不断改写越狱提示去攻破一个强的「教师」模型,攻破之后再让这个教师回过头来复盘——说清这次伪装是怎么骗过它的、以后遇到类似的怎么认出来。这些复盘被拿去训练学生模型,指望它学到的是攻击的机制而不是某几句具体话术,从而对没见过的越狱手法也有效。相对已有的「拒绝式对齐」(直接教模型说不)和「安全推理式对齐」(教模型写一段为什么不该答),增量在于训练数据换成了攻击复盘文本,本质仍是数据合成加微调。摘要里没有给出攻击者的预算——自动攻击程序改写多少轮、评测时的攻击是否也针对训练后的新模型重新适应,都没交代;而只在训练时见过的攻击集合上测泛化,很容易高估。另外这类工作通常不测「模型学会了拆解攻击机制」之后是否更容易被诱导去讲解攻击原理。同一天的 2608.09624 提醒了相关的一点:安全指标测的东西和真正想防的东西经常不是一回事,这篇的评测口径值得先看清楚再判断。

用 GFlowNets 生成针对大模型的攻击

Generating Attacks for LLMs with GFlowNets

arXiv 2608.10171

训练一个「攻击者模型」自动写出能让目标模型违规的提问,训练算法用的是 GFlowNets——它和常规强化学习的区别在于,常规做法会收敛到少数几个最有效的话术反复用,而这个算法按成功率的比例去采样,所以倾向于生成一批彼此不同的攻击,避免红队测试只覆盖一种套路。作者据此给目标模型打一个鲁棒性分数。问题是这个思路本身不新,用 GFlowNets 做红队的多样性优化 2024 年就已经有工作发表,本文没有说明相对那条线做了什么改动。攻击者的能力设定也没交代清楚:只能改写提问文字、还是能看到目标模型的输出概率,训练要跑多少次目标模型的调用预算,摘要里都没有;只知道是一个模型攻另一个模型。要判断这个分数意味着什么,还得看正文里的实验设置。

跳过

在 NVIDIA 硬件上跑 Meta 的 Muse Glimmer 本地智能体工作流

Run Local Agentic AI Workflows with Meta’s Muse Glimmer on NVIDIA

原文

NVIDIA 的部署指南,讲 Meta 新开源的 300 亿参数模型 Muse Glimmer 怎么在自家显卡上跑(RTX 5090、DGX、Jetson),能吃 12 万 token 以上的上下文,主打在本地长时间自主干活。全文围绕吞吐、延迟和容器化部署,没有任何安全内容——不评估这个模型对指令注入的抵抗力,也不谈它调用工具时会不会被网页里的一句话骗走。值得记的只有一点:一个能长时间自主调工具、又完全跑在本地无人监管的模型,正是把注入风险从「聊天窗口」搬到「本机文件系统」的那类部署,而这类部署的安全评估目前是空白。

Simon Willison:Muse Glimmer 上手

Introducing Muse Glimmer

原文

个人博客的上手体验,重点是 Meta 重回开放权重、许可证换成宽松的 Apache 2.0,以及作者本人跑了跑本地版本。引用的官方说法全是能力指标(端到端完成任务、调工具时能严格按参数格式填、长流程里保持计划连贯),没有任何一项涉及安全或对抗鲁棒性。作为安全速览没有可读内容,列在这里只为记录这个模型的发布时间点。

DREAM:在推荐系统流水线上加一层意图感知的策略控制

DREAM Technical Report

arXiv 2608.09408

这是一篇工业推荐系统的工程报告,跟安全没关系。它做的事:在现有的”召回—排序—重排”流水线上面加一层,用手机端的信号判断用户此刻是在随便逛、在比价、还是要下单,再让一个大模型把这个判断翻译成流水线各模块的参数。文中确实提到给参数下发口加了”安全护栏”,但那指的是防止参数设错把线上推荐搞崩,不是防攻击者。真要从安全角度看有一个点:用大模型直接产出线上生效的参数,等于把模型输出接到了生产系统的控制面上,而论文没有讨论如果输入信号被伪造(比如刷量、伪造设备端行为)会推出什么参数。但这不是它想回答的问题。

MetaStrategy:让大模型生成一份可执行的排序策略而不是直接排序

MetaStrategy: Generative Ranking with Executable LLM Strategies

arXiv 2608.09440

同一批作者的另一篇推荐系统工程工作,同样不是安全论文。核心想法是:不让大模型直接给出商品顺序(那样没法跟已有的预测模型和运营规则对接),而是让它输出一份结构化的配置——各个目标的权重、偏好哪类内容、位置怎么排——再由一个不含 AI 的程序检查这份配置是否合法、然后编译执行。这个”模型只出配置、由确定性程序校验后执行”的形态本身是个值得注意的设计,跟今天 ActBench(2608.09476)关心的行为越界问题在方向上是相反的解法:把模型的输出限制在一份有固定字段、每个字段取值范围写死的表格里,超出就直接拒绝。但论文的校验器只用来保证业务正确,没考虑对抗输入,也没有威胁模型。

把「过了多少秒」当成一个数字直接喂给模型

ChronoState: Hidden Elapsed-Time Conditioning for Temporal-State Action Selection in Frozen-Backbone Language Models

arXiv 2608.09124

跟安全没关系。问题是这样的:模型要判断「缓存该不该过期」「任务超时没有」这类事,既依赖任务状态(写在提示词里),也依赖流逝了多少真实时间。作者不把时间写成文字(「已过 300 秒」),而是编码成一串数字从旁路注入模型内部,主干模型冻结不动,只训一小块参数。结果准确率 93%,把注入的时间数字打乱后掉到 33%,说明模型确实在用这个数字。这是个工程性的能力增强,唯一沾边安全的地方是这条旁路通道本身——用户看不见它,所以也没法核对模型收到的时间对不对,如果这个数字能被篡改就是个新的攻击面。论文没往这个方向想,也没做任何相关评估。

解码层禁词:一种给大模型施压的诊断测试

Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

arXiv 2608.09900

做法是在模型逐字生成回答的时候,每到一个词的开头就把它最想说的那个词强行划掉,逼它换一种说法把同一个意思绕出来——类似玩「你画我猜」时不许说某个关键词。作者用这个测量各家开源模型在「被迫绕路」时还能不能把话说明白,结论是模型越大、指令微调做得越好,绕路能力越强。这不是一篇安全论文:它不涉及攻击者,也没有任何人试图让模型说出不该说的话,测的是模型在受限生成下的流畅度和正确率。作者在结尾提到这套东西「可以用来压力测试运行时的安全护栏」,但论文里没做这件事,也没交代那样做时攻击者能控制什么。对做评测和造合成数据的人可能有用,对判断某个系统安不安全没有帮助。

CASE 框架:企业级 AI agent 治理的四层控制架构

The CASE Framework: A Multi-Disciplinary Control Architecture for Governing Enterprise Agentic AI

arXiv 2608.10153

这是一篇管理框架论文,主张企业管 AI agent 不该只用一套办法,而要按规模分四层,每层借用一门已有学科:单个 agent 用自动控制论的思路(把用户意图当成温控器的目标温度,护栏当成反馈),一群 agent 互相协作时用复杂系统理论,人机混合团队用控制论中关于「监管者的处理能力必须跟得上被管对象的复杂度」的那条老定律来论证「靠人盯着必然失效」,大规模机群则沿用运维里的「错误预算」概念(本来是允许服务每月宕机多少分钟,这里改成允许 agent 做错多少决策)。实证部分是对已公开的生产事故做归类,说 82% 的故障跨越不止一层。全篇没有攻击者,没有任何对抗性实验,所谓「失效」指的是系统自己出错而不是有人蓄意诱导。对写内部治理文档的人或许有参考价值,但它不回答任何一个具体的攻防问题。

LinkedIn 上线的自我进化客服 agent 系统

Self-evolving Agentic Customer Support System at LinkedIn

arXiv 2608.10224

这是一份生产部署报告:LinkedIn 的客服机器人会自动改写自己的提示词(就是那段告诉模型「你是客服,遇到退款问题该怎么答」的指令),系统自动生成多个候选版本、挑效果好的留下,不用重新训练模型。两周的线上对照实验里,用户自助解决问题的比例涨了 9 个百分点,把工单转给正确部门的准确率涨了 30.6 个百分点。摘要里提到「运行护栏」,但全文没有说这护栏防的是什么——是防模型胡编,还是防用户在对话里塞恶意指令,没有交代,也没有任何攻击测试。真正值得安全的人留意的是这套机制的形状:提示词是被自动改写的,而改写的依据来自真实用户流量。如果有人能持续用特定话术刷这个系统,理论上可以影响下一版提示词写成什么样——但论文完全没考虑这个方向,也没交代攻击者能做什么。当作工程实践读有价值,当作安全工作没有内容。

大规模解读语言模型的中间层状态

Interpreting Language Model Hidden States at Scale

arXiv 2608.10260

纯可解释性工程,和安全没有直接关系。所谓「lens」是这样一种工具:模型算答案要过几十层,每层都有一堆中间数值,lens 把这些中间数值翻译成「如果现在就停下来输出,模型会说哪个词」,好让人看清答案是在第几层成形的。这类工具以前太贵,只能用在 200 亿参数以下的模型上,且每种位置要单独训一个。这篇的两个改进是省钱:一是把翻译器的参数量从随模型宽度平方增长压到线性增长,参数减少最多 98.4%;二是训练时不再对全部十几万个候选词算损失,只挑一部分,峰值显存降最多 70%。结果是能在 700 亿参数的 LLaMA-3.3 上同时铺 482 个观察点。如果有人想做「模型在第几层决定要不要拒绝这个请求」这类分析,这是一个更便宜的底座,但这篇自己没往那个方向走一步。


本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。