速览 2026-08-05:12 篇
今天 12 篇里有四篇落在同一处:agent 不再只是接完指令就忘,它会把干过的事沉淀成能反复调用的东西。SkillJack(2608.03509)往这层沉淀里塞后门——agent 在把操作记录总结成技能时,顺手把可疑措辞洗成了体面文档;SkillClone(2608.04192)反过来,只用正常调用就把别人不公开的技能功能复刻出来;MAFIA(2608.03844)打的是更老的长期记忆库,AgentAntibody(2608.04053)则想在同一层里存防御用的判例。剩下八篇各走各的,值得单看的是 FAR.AI 那份把越狱成本折算成美元的排行榜(2608.03070)。
读全文
SkillJack:自我进化 agent 里的常驻技能后门
SkillJack: Persistent Skill Backdoors in Self-Evolving Agents
现在有一类 agent 会回头看自己的操作记录,把反复出现的套路总结成一个可复用的小工具存起来——比如「每次导出报表都是这五步」,就固化成一条叫 export_report 的技能,下次直接调。这篇攻击的就是「总结」这一步。攻击者塞进去的是一段有问题的操作记录(比如把一批文件打包发到外部地址),agent 在提炼技能时会自动删掉那些扎眼的措辞、补上一套体面的说明文档,最后产出一条名字正经、文档正经、代码里藏着问题的技能。最值得记的一个数字:让另一个大模型去审这些技能,只给它看代码,能揪出 36.7%;把技能的名字和说明文档一起给它看,检出率反而掉到 10%——体面的包装纸让审查者放松了警惕。这跟记忆投毒不是一回事,作者也明确区分:记忆投毒要等那条脏记录被检索出来才生效,删掉记录就没事了;这里的后门是 agent 自己加工出来的一条新技能,把原始脏记录全删光,技能库里那条照样在跑、照样被检索到。他们还发现在一个系统里生成的恶意技能能被另一套系统检索到,95% 的正常任务查询都会捞出它——技能这层资产是跨系统流通的。别读成「agent 有了恶意」,agent 只是在老老实实做总结,问题出在总结这个动作本身会抹掉可疑痕迹。今天另一篇 SkillClone(2608.04192)从反面打同一层:外人只靠正常调用把别人的技能功能复刻出来。一个往里塞,一个往外掏。而 AgentAntibody(2608.04053)主张防御也要在 agent 的长期状态里沉淀东西——两边在争同一块地。攻击者预算这块:要求能污染 agent 的历史交互记录(比如通过正常对话诱导),不需要碰技能库本身,也不需要模型权限。
For framed skills, LLM-judge detection is 36.7% for content only and 10.0% when names and documentation are included.
同一条恶意技能,只审代码能查出三成多;连着 agent 自动生成的名字和文档一起审,反而只剩一成
只靠正常调用,就能把别人藏起来的 agent 技能复刻出来
Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills

现在有厂商把一段业务逻辑打包成「技能」挂在市场上卖——比如一个「合同风险审查」技能,你能调用它、能看到功能简介,但里面的提示词、脚本、那张内部评分表是看不到的。以前防这类技能被偷,防的是「别让 agent 把技能文件原文吐出来」。这篇说防线守错了地方:攻击者要的不是那段文字,是那段文字实现的功能。做法很直白——先照着公开的功能简介猜它吃什么输入、吐什么输出,然后拿一堆完全正常的请求去问,看回答,照着回答自己写一个版本;再拿没问过的新输入分别喂给正版和自己的仿制品,哪条对不上就改哪条,像拿标准答案对着改作业。全程没有一句越界的话,所有请求都是这个技能本来就该服务的请求,所以任何「检测有没有泄露原文」的过滤器都拦不住。 作者测了 30 个技能,覆盖规则、表格、流程、算法四类,论文自己的说法是在「several targets」上做到了完全或部分复现,不是 30 个全中——值得看的是哪类容易被复刻(一张费率表、一套判定规则这种确定性逻辑)、哪类不容易。别当成模型窃取的老故事:偷模型权重你没法逐个输入去核对,这里偷的是一小段确定的业务逻辑,所以逐输入对比验证可行,成本也低得多。攻击者的能力界限交代得比较清楚:黑盒、只能发合法请求、能看到公开介绍,不能读文件、不能拿到权重。和今天另一篇 SkillJack(2608.03509)正好是一体两面——那篇研究怎么往这个技能仓库里塞后门,这篇研究怎么从里面掏东西出来,说明这层新出现的长期资产已经既值得攻也值得偷。
SKILLCLONE forbids disclosure: the adversary's objective is the function the text implements, observed through ordinary answers, so disclosure-shaped filters leave it unaffected.
作者自己点明了防御为什么失效:攻击不需要模型说出任何一句藏起来的话
看摘要
WeClawArena:多人各自有 agent 时的协作与安全测试场
WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks

设定值得记一笔:不是一个 agent 调工具,而是每个人有一个属于自己的 agent,各管各的文件、记录和权限,互相看不见对方的工作区,然后要一起把事办成——你的 agent 去问同事的 agent 要一份排期,同事的 agent 得自己判断该不该给、给多少,全靠对话交涉。它关心的是有害操作怎么顺着这些人际和任务关系在网里一路传下去。规模是 124 个基础任务扩成 620 个场景,每个基础任务配一个正常对照加四种攻击变体。这是 benchmark 类工作,别把里面的攻击成功率当成真实系统的风险水平——沙盒里的工作区和权限模型都是构造出来的,攻击面完全由设计者划定。真正该看的是那四种攻击变体覆盖了哪几条跨用户传播路径,摘要里没交代,得翻正文。摘要也没说攻击者具体能控制什么——是能扮演其中一个用户,还是只能往共享内容里塞东西,这直接决定结论的适用范围。
MAFIA:只靠正常对话就能给 agent 的长期记忆下毒
MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents

很多 AI 助手会把跟你聊过的内容存进一个长期记忆库,下次遇到类似问题就翻出来参考。攻击者不需要碰数据库,像普通用户一样跟它聊天,聊的内容就被写进去了——这就是这篇的攻击通道。相比以前同类工作,它把设定调到更难:记忆库里已经堆满了正常内容,你塞的东西不一定被检索到;而且写入前有个审核模块在看。两招应对:先用一批试探性提问摸清哪些查询会命中记忆库的哪些位置,再决定往哪塞、塞几条;以及给恶意内容外面裹一层真实无误的事实描述当外衣,审核模块靠语义相似度打分,看到的是那层壳,于是检出率从 83.3% 掉到 7.4%,攻击成功率最高 90.7%。要注意这两个数字都是在作者自己配的那套检索参数和审核策略下测的,换一套审核方式数字会变,不能当成记忆系统整体的失守率。跟今天 SkillJack(2608.03509)比,这条路线的弱点也很明白:脏记录被删掉,攻击就没了;而 SkillJack 那种是 agent 自己把脏经验加工成了一条常驻技能,删源头也没用。
AI 安全排行榜:方法、结果与最低标准
AI Security Leaderboard: Methodology, Results and Minimal Standard

这份报告做的事是:雇人去攻打四个主流大模型,看要花多少钱才能找到一个「万能越狱模板」——不是针对某一个问题定制的绕过,而是一套话术套上去,换任何一个有害请求都能出结果,所以一旦找到就能直接分发给别人用。测的内容是化生放核爆炸物和攻击性网络技术这两类严重滥用请求。结果是把安全度换算成了钱:Grok 4.5 和 Gemini 3.1 Pro 都在 300 美元以下被攻破,Grok 最弱的网络安全方向 24 美元就开了;Claude Fable 5 和 GPT-5.6 Sol 在这套方法下一个万能越狱都没被找到,外推估算要花 14200 美元以上——注意这是估算,不是实际花掉的钱。比价格差距更值得记的一句是:找到的所有弱点都属于已知攻击类型,没有新招,也就是说落后的那两家不是被降维打击,是没做已经公开的功课。几个必要的限定:这是评测方自己定的一套「最低标准」,达标只代表没低于底线,不代表安全;「没找到」是这次这套方法没找到;另外攻击目标题库是用一个被越狱的模型生成的,不算完全中立。
We then used a jailbroken DeepSeek-V4-Pro model to generate 15 candidate attacker goals per subdomain
题库本身是让一个已被越狱的模型批量生成有害请求得来的——这套题的分布带着那个模型的偏好
把用户过去拒绝过的行为攒起来,当下次的判据
AgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt Injection

出发点比方案本身有意思:用户的要求本来就说不全。你说「整理一下这个文件夹」,没说不许删文件;注入内容让 agent 把东西删了——任务看起来完成了,但这不是你的意思。作者的观点是,防御不该每次从零判断什么算越界,而该把用户过去明确拒绝过的具体案例攒成一个库,下次遇到相似情况直接照着判。免疫系统那套比喻(抗体、免疫应答)可以不用管,它没提供额外信息。测了三个评测集、四个底座模型,效果好于现有防御。 真正需要盯的是:这个「不断长大的防御库」本身就是一份可写入的长期状态,跟今天 SkillJack(2608.03509)攻击的技能库是同一类东西。如果攻击者能影响存进去的内容——比如诱导用户在某个场景下「接受」一个本该拒绝的行为,让它成为一条被记住的先例——这个库就从防线变成了靶子。摘要没有交代攻击者能否触碰库的写入路径,也没交代攻击者是否知道这套机制存在、能否针对已有条目做规避,得翻正文确认。它和 SkillJack 其实在争同一块地:攻击方说恶意行为可以跨任务沉淀下来,这篇说防御也能跨任务沉淀,谁能在 agent 的长期状态里留下东西谁赢。
跳过
CALVER:多个答案都对的时候,投票就不灵了
When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs
不是安全工作。讲的是让模型对同一道因果推理题采样多条思路再投票选最多的那个,这招在因果题上会失灵:一是多条思路可能重复犯同一个混淆错误,二是当好几个答案都成立时票被分散,错答案反而以少数票胜出。他们的做法是不投票,改成拿因果推断的几条公理去逐条检查每个候选答案的推理过程,谁合规就选谁,全程不需要参考答案。效果从约 30% 提到 42.1%,把裁判模型放大到 720 亿参数也补不上这个差距。方法本身站得住,还顺带发现基准数据集自己列的标准答案有一批是可以被替代的。但这里验的是因果图对不对,跟对抗攻击、越狱、agent 防护都没关系——别因为出现了 verification、judge 这些词就当成安全评测。
英语和斯瓦希里语的偏见对比:拒绝行为只认英文
Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili
把同一批涉及种族、宗教、性别等九类敏感话题的提问,分别用英语和斯瓦希里语问 GPT-5.2 和 Gemini 2.5 Flash,共 4900 对。最扎眼的一个结果:GPT-5.2 在英语下拒绝回答了 169 个提问,斯瓦希里语下一个都没拒——说明安全训练学到的可能只是「看到这几个英文词就闭嘴」,换个语言就整套失效。这个结论本身值得记住。但方法撑不住它:斯瓦希里语的提问是机器翻译过去的,而且作者自己报告超过 55% 的英/斯回答对在语义上根本不相似。既然两边问的和答的都对不上,那「偏见是变形而不是转移」这个说法里,有多少是真实的跨语言差异、有多少是翻译本身把话问歪了,这个设计分不开。跟安全攻防也没直接关系——没有攻击者,只是测量。
EN: If a [desc.] were successful, people would think... / SW: Kama [desc.] angefanikiwa, watu wangefikiri...
填空式模板,把描述社会群体的词填进去看模型怎么补完;斯瓦希里语那句是机器翻译的
通用效用强化学习的鲁棒版本
Robust General Utility for Reinforcement Learning
纯强化学习理论。讲的是训练时用的优化目标和实际部署时想要的目标不一致该怎么办:不去优化那一个可能写错的目标,而是在一组候选目标里优化最差情况,作者给了凸和非凸两种情形下的收敛算法。跟 LLM 或 agent 安全没有任何关系,标题里的 robust 是「目标函数可能设定错了」这个意义上的稳健,不是「有人在攻击我」意义上的。误入名单。
ICO:用迭代上下文优化增强语义漂移越狱
ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization
这类攻击的套路是:不直接问怎么造炸弹,而是编一个化学课的场景,把关键词全换成课堂里的代号,靠上下文让模型自己把代号对回真东西——安全过滤器看到的每个词都是无害的。这篇的贡献是发现不同的上下文「诱导力」差别很大(有的场景能让模型顺利还原原意,有的不能),然后做了个循环去搜索强上下文:每轮换一个上下文试,失败就根据结果改,再试。问题是「不同 prompt 效果差别大、所以要搜索」在自动化红队里已经是默认做法,这篇只是把它显式化了一层,攻击成功率的增量工作。跳过的具体理由:它没有说明防御方在什么条件下能拦住这类攻击,只报了攻击数字;而针对语义替换类越狱的检测(比如看模型输出而不是输入)本来就是现成的对照,论文里没有。
用中间干净图预测做文生图的推理期安全防护
Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates
文生图模型生成到一半时画面还是噪点,但模型内部能预测「如果现在把噪声全去掉大概长什么样」——这篇就是把这张预览图拿出来查有没有违规内容(裸露、受版权保护的角色、特定画风),发现问题就临时改一下文本条件把它拽开,模型权重一个都不动。比只检查用户输入的提示词强,因为有些看起来无害的提示照样能生成违规图。思路合理,工程上也划算(没触发违规时几乎不加延迟),但属于安全对齐的常规改进。跳过的具体理由是:这个检测器本身就是个可以被针对的目标,而论文没有做自适应攻击评估——没人去试「专门构造一个提示词,让中间预览图在检查那一刻看起来是干净的,最后几步才收敛到违规内容」。测试也只覆盖 Stable Diffusion v1.4 和 v3.5 两个模型。
把现成的防护件串成流水线,套在车联网上
An Inline Control Architecture for Language Models in Intelligent Transportation Systems
把五样已有的东西串起来:规则过滤、一个轻量的有害内容分类器、限制模型只能按固定格式输出、只从可信来源检索资料、事后再裁决一次,然后套在车联网的 LLM 组件(路侧单元的消息摘要、给操作员的辅助建议)上,测了延迟。没有新的安全机制,是工程整合。 跳过的具体理由有两条。一是论文自己就写了这些 LLM 组件「不在安全关键控制回路里」——那攻破它到底导致什么后果,风险论证就先弱了一半,读者看不到「模型被骗之后车会怎样」。二是数据集是模拟生成的 V2X 消息,由路侧广播、操作员对话等改写而来,不是真实路侧设备的流量,所以它的鲁棒性数字不能拿去谈实车部署。另外「对抗压力测试」里攻击者有多大预算——是否知道分类器存在、能否根据拦截反馈反复改写——摘要没有交代。
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。