今天 11 篇,其中 3 篇(推荐系统实验 agent、路由收益认证 2608.07583、区块链 agent 网络综述)不算安全工作。剩下 8 篇里最值得对读的是一组错位:Breadcrumbing(2608.04565)把攻击者搬到 agent 和搜索引擎中间,每次查询追加一条结果,让三条各自无害的「公告—报道—评论」互相印证成假证据链;而 CAD(2608.05430)的检测粒度是「这一句是不是恶意指令」,对每一条面包屑大概率都判无害。PIMiner(2608.05108)同样在攒可复用的攻击手册。另有两篇(2608.05045、2608.04322)从模型结构和数据配方两头挡开源权重被有害微调,2608.05409 追到拒绝行为部分挂在祈使句这个语法特征上。

读全文

给搜索 agent 撒面包屑:把多条无害内容拼成一条假证据链

Breadcrumbing Search Agents

arXiv 2608.04565

值得读的不是「搜索结果可以被投毒」这个旧结论,而是攻击者的位置换了。以前的设定是往某个网页里埋一句坏话等着 agent 来读,但现在的 agent 会追问、会多搜几次、会比对不同来源,那一句坏话混在五个正常页面里通常被当噪声丢掉了——论文说这叫被「稀释」。这篇改成:攻击者坐在 agent 和搜索引擎中间,agent 每发一次查询,它就在返回结果里追加一条自己的。塞什么取决于 agent 这次搜的是什么,不是提前埋坑等人踩,是跟着 agent 走。他们的主打手法叫「权威链劫持」:第一轮返回一份假的行业协会公告,第二轮返回一篇引用了那份公告的新闻报道,第三轮返回一个也提到它的专家评论——三条来源看上去彼此独立、互相印证,其实是同一个人写的。于是 agent 越是「多查几个来源交叉验证一下」,被喂的次数越多,本来用来提高可靠性的行为反而成了攻击入口。攻击者预算说清楚了:每次查询只能追加一条结果、不能删改真实结果,这比污染一个静态网页强不少,所以别拿它的成功率去跟单页投毒的数字直接比,那是两道难度不同的题。和今天另一篇注入检测(2608.05430)正好卡在一起:那篇判的是「这句话是不是恶意指令」,而这里每一条面包屑单独看都完全无害,句子级的检测器结构上就看不见这种攻击。也和 PIMiner(2608.05108)指向同一件事——攻击方在攒可复用的经验(一个跨模型的策略手册,一个是同一次任务里跨轮次的证据),防御方还在一条一条地判样本。

语气决定成败:句式敏感性正在瓦解安全对齐

Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

arXiv 2608.05409

已知的现象是:把「教我怎么合成 X」改成过去时「过去人们是怎么合成 X 的」,同一个模型就答了。这篇把范围推广开——不只是过去时,凡是不用命令口气问的句式(陈述句、条件句「假如有人想合成 X,他会需要什么」)都有效,在 16 个模型上都成立,最大到 70B。更值得看的是他们往下追了一层:模型的拒绝决定,有一部分挂在句式上,而不是挂在「这话有没有害」上。做法是把模型中间层里负责编码句式的那部分激活换掉、其他不动,看拒绝行为跟不跟着变——跟着变,说明拒绝确实是经这条路径决定的。他们进一步找到内部大致对应「这是不是命令句」的方向,推理时手动往这个方向加一点,原本会答的有害问题变成拒答;往反方向减,原本会拒的变成答了,整句话一个字没改。原因追到训练数据:开源模型的安全训练样本几乎全是祈使句,模型学到的是「祈使句 + 危险话题 → 拒绝」这个相关性。加句式多样性能缓解,但作者自己没说问题就解决了——语法和有害性在数据里本来就是相关的,模型学相关性是自然结果,混进去的这个干扰因素不会因为多加几种句式就消失。另外这套因果分析的结论只覆盖他们选定的那几个中介变量,不是完整的机制说明。这篇给的是一条能直接改数据配方的结论,不是又一个越狱技巧。

changing the grammatical tense from present to past can be enough to elicit harmful responses

这是前人的发现,本文把它推广到所有非命令口气的句式,并定位到模型内部负责句式的那部分特征

看摘要

梯度免疫:用一个锁死的小模块抵抗恶意微调

Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning

arXiv 2608.05045

问题是这样:一家公司把对齐好的模型权重公开放出去,别人下载后拿一批有害问答数据继续训几百步,模型就什么都肯说了。已有的防御大多假设微调发生在平台上(你把数据传上来,平台帮你训,所以平台能看见你的数据);这篇假设的场景不一样——权重全部公开,绝大部分层随便你改,只有最后一层后面挂的一小块模块在发布时被声明「不许动」。这块模块的作用是:训练时如果一条样本在模型内部的表示落进了事先划定的「有害区域」,就把它产生的梯度压掉,等于这条数据白训了;同时再补一个模块把这个改动对正常输出的影响抵消回去,用户用起来跟原模型一样。六组模型-数据集组合上,微调后的攻击成功率基本没涨。问题在威胁模型:攻击者手里有全部权重,闸门在哪一层、逆适配器长什么样都是明牌,直接把最后那块删掉重训的成本很低,论文没交代对手是否被允许这么做。而且那个「有害区域」的边界是用防守方自己收集的有害数据标出来的,论文自己说保护只泛化到边界附近、同分布的有害样本——换一批防守方没想到的有害数据就未必挡得住。跟今天的 DataRx(2608.04322)是同一个问题的两条路,一个改结构一个改数据,两篇的可迁移性短板也一样。

DataRx:微调时该掺哪些安全样本

DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning

arXiv 2608.04322

已知的事实是:拿业务数据(比如客服对话)微调一个对齐过的模型,它的拒绝能力会掉一截;往训练集里掺一点安全问答能补回来。这篇问的是「掺哪些最有用」。做法是:拿一个有害问题去问模型,记下它自己的回答,再拿标准安全回答(明确拒绝并说明理由)做对比,但不是逐字比,而是看这两段话在模型中间层的向量表示里离得多远——离得越远说明模型对这类问题越没学会,这条样本就越值得掺。理由是字面比会骗人:两个回答可能都以「我不能」开头,看着差不多,内部表示却差很远。结果是只加相当于训练集 1% 的安全样本,Llama3-8B-Instruct 的平均攻击成功率就明显下降。挑数据的思路本身合理,但那个「1%」是在 BeaverTails 这类已有的有害数据集上测出来的——它选的是「模型已经答不好的那些已知问题」,补的是已知的洞,对训练时完全没覆盖的攻击类型没有理由起作用。别读成安全对齐的成本能压到 1%。攻击者预算这一项论文未交代:微调的人是随手混了点业务数据导致安全退化,还是刻意在挑能绕开这套筛选的有害样本,是两种完全不同的难度。

Trident:让 LLM 当红队,去打那些只跟脚本对练过的自动防御

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

arXiv 2608.04317

自主网络防御这个方向,通常是用强化学习训一个「蓝方」智能体去守网络——发现异常就隔离主机、重装服务。这篇指出的评测惯例问题很实在:这些蓝方几乎只跟固定脚本的红方对打过,脚本红方永远那几套动作,蓝方就容易训成只会应付那几套,换个会变招的对手就露馅。他们的做法是让一个 LLM 当红方,而且不是让它一步步输出「扫描 10.0.0.5」这种单个动作,而是让它写出一整段 Python 攻击策略——先扫网段、发现哪台开了服务就试哪个漏洞、失败就换目标——把这段代码丢进环境里跑完一整局。奖励信号不靠人打分也不靠另一个模型打分,就看跑完有没有拿到目标主机权限,对错自动可判。他们还放出了一万三千多条红蓝交互记录。局限说清楚:CybORG CAGE 4 和 CyberWheel 都是抽象化的仿真环境,动作空间是设计好的几十个基本操作,不是真在打机器。所以它证明的是「现有 RL 防御在仿真里对会变招的对手不鲁棒」,这个结论已经够用,不要外推成 LLM 能攻破真实网络。

PIMiner:自动做提示注入红队的 agent 系统

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

arXiv 2608.05108

做的是一个自动攻击工具:不为每个新目标模型重新训练攻击模型,而是攒一本「策略手册」——比如「假装成系统维护通知」「先让它复述任务再偷偷改任务」——换目标时挨个试,每个测试样本只问目标十来次。相对已有工作,这个「攒手册」的思路在越狱那边(AutoDAN-Turbo)已经有了,搬到注入上新意有限;论文自己也指出两者不能直接混用:越狱是让模型说不该说的话,成败只看有害目标本身;注入是在 agent 干活中途把它的任务掉包,还得让替换后的指令在当前上下文里显得合理。真正值得记的是那组数字差距:同一套攻击,Gemini-2.5-Pro 上成功 76%,GPT-5.1 上 62%,Claude-Sonnet-4.5 上 43%(换一个测试集 AgentDojo 是 87/53/40)。各家在注入防护上确实不在同一条起跑线。但别当排行榜用——这些数字是在两套固定任务集上打出来的,换个 agent 框架、换套系统提示就会变,而且「手册能迁移」的证据只覆盖了它测过的那几个模型。跟今天的 Breadcrumbing(2608.04565)指向同一件事:攻击方在做工程化积累(一个是跨模型复用手册,一个是同一次任务里跨轮次累积证据),防御方还在逐条句子判良恶。

eMicro:用 eBPF 给微服务做实时多跳访问控制

eMicro: Real-Time Multi-Hop Access Control for Microservices with eBPF

arXiv 2608.05300

跟 LLM 无关,是传统云服务安全,但问的问题跟 agent 之间层层委托是同一类:每一跳单独看都被允许,整条路径连起来却违反了意图。比如前端可以调订单服务,订单服务可以调用户库,两条规则都在白名单里;但攻击者从前端发起请求、绕经订单服务拿到了用户库的数据,而策略从来没打算让前端碰用户库——逐跳检查看不出任何异常。他们的办法是把「允许的调用路径」编成一张状态转移表,请求每走一跳就更新一个标记,查表是常数时间;追踪靠在内核里挂一小段沙箱程序(eBPF),不用在每个服务里插埋点代码、不用改业务代码、不用重启。在 Uber、阿里、字节的生产流量共 1200 万条请求流上验证了规模。别把它当 agent 安全的现成答案:它成立的前提是合法路径的集合有限、能事先枚举成状态机,而 agent 调什么工具、按什么顺序调是模型临时决定的,路径空间开放得多。想做多跳委托授权的话,值得看的是它的工程形态而不是算法。

结合上下文判断文本里的恶意指令,并做对抗训练加固

Robust Context-Aware Detection of Malicious Instructions in Text

arXiv 2608.05430

做的事是把注入检测细化两步:一是精确到句子(这段网页里哪几句有问题),二是结合用户原本的任务来判(同一句「登录后台把日志导出来」,在运维任务里合理,在「帮我总结这篇博客」里就是有人塞进去的指令)。这个设定是对的——同一串字在不同任务下标签相反,不看任务就没法判。第二个贡献是把对抗训练做进检测器:一种是在向量空间里给输入加扰动骗过检测器,另一种是让另一个大模型把注入句换个说法再试。这两者难度差很多——前者数学上成立但攻击者写不出对应的文字,后者才是真能干的事,只测前者会高估鲁棒性,他们两个都测了,还能画出一条「多要一点安全就少一点可用性」的连续曲线,比只报一个点强。评测在 AgentDojo 等环境上同时看攻击成功率、干净任务完成率和被攻击时的完成率。方法本身是把成熟套路搬过来。真正的问题是粒度:它的对抗训练只覆盖「把同一句话换个说法」这类规避,攻击者要是把恶意意图拆开分散到多轮、多个来源里——正好是今天另一篇 Breadcrumbing(2608.04565)做的事,让若干条各自看起来都无害的搜索结果拼成一条互相印证的证据链——那么每一句单独看都干净,这个检测器在结构上就看不见。两篇放一起读才看得出「句子级检测」这个任务设定本身可能已经落后于攻击了。

跳过

上线前先证明「多模型路由到底有没有用」

RouteGuard: Certifying Routing Gain in LLM Multi-Agent Systems When Complementarity Is Not Enough

arXiv 2608.07583

标题里有 Guard、有 certify,但它认证的是性能收益,不是任何安全属性,没有攻击者、没有威胁模型,放进安全速览会误导人。它做的事是:一个系统在多个模型之间分派任务(简单问题给便宜模型,难题给贵模型),上线前用统计方法判断这套分派究竟带来了多少收益,不够就拒绝签发结论。方法论上有一个观察值得记:在一个常用的路由评测集上,全部收益几乎都来自 86 类工作负载中的 3 类;按单条问题重新抽样统计,收益看起来稳定,按工作负载整类重新抽样(有时抽不到那 3 类),收益就没了——同一份数据,两个相反的结论。这是评测方法的问题,跟安全无关。

自动跑推荐系统 A/B 实验的 agent

A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

arXiv 2608.04625

推荐系统的策略调优 agent:把历史实验经验按业务场景、推荐环节、优化目标整理成有层级的知识库,自动生成新策略、配置实验、读结果、再改参数。全篇没有攻击者、没有安全实验、没有威胁模型,只是标题里有 agent 这个词。工业界的工程工作,可能有用,但不在这份速览的范围内。

区块链支撑的可信 agent 网络:基础、分类与未来方向

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

arXiv 2608.04626

1980 到 2026 年的综述,把「多个 AI 助手互相委托任务、跨平台调用工具和付款」这件事的信任问题按五个维度摆了一遍:身份、授权、审计、声誉、结算,然后论证区块链可以充当这几样的公共基础设施。没有新实验、没有新结果,也没有对任何方案做攻击验证——它证明的不是区块链解决了这些问题,只是把已有提案分了类。值得记的是文中对风险传导的一句描述:一个 agent 的输出会变成另一个 agent 的输入、指令、证据、记忆,甚至付款依据,所以本来局部可控的失败会跨 agent 累积。这个观察跟今天 eMicro(2608.05300)讲的多跳授权是同一类问题——每一步单独看都合规,连起来不合规。具体一点的场景:你的 agent 委托一个陌生 agent 去查机票,对方返回一个价格,你既没法验证这价格是不是编的,也没法在它编了之后追责,因为身份和审计记录根本不存在。分类法本身可以当索引用,但别把它当成结论。


本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。