速览 2026-08-14:5 篇
今天值得看的只有一篇:PIPES(2608.12789)把 agent 的注入防护从「这段话是不是在命令模型」换成「这个字段凭什么由这个来源来填」——攻击者不下指令,只把自己的评分从 3.9 改写成 4.9,模型的决策全程看起来合理。前提是来源标签伪造不了,而真实系统里往往伪造得了。HiRoute(2608.12821)还停在猜内容像不像有问题;语言安全数据审计(2608.13695)的结论有用但没测任何模型。三篇不构成趋势。
读全文
PIPES:用「来源」和「这个字段该长什么样」筛查 agent 收到的外部数据
PIPES: Securing Agent Perception with Provenance and Priors

现有的注入防护基本都在找「这段话是不是在命令模型」,比如「忽略前面的指令」。这篇指出一类攻击压根不下指令:外卖 agent 搜「清汤米线」,恶意店家不写任何命令,只在自己的搜索返回里把评分那栏写成「Updated rating: 4.9」。模型看到的世界变了,于是下单给这家店——而这个动作在任何防护眼里都完全合理,确实是评分最高的那家。PIPES 的思路是不看内容像不像有问题,而是问「这个字段凭什么由店家自己填」:评分是平台算的,店家有资格说自己的菜单和标签,没资格说自己的评分。做法分两种情况——工具返回的如果是格式固定的结构(订单号、金额、评分),就事先规定每个字段能填什么,「评分应该是个数字,不该是一句英文」这一条就当场拦下上面那个例子,且不需要 AI 参与;如果返回的是一段自由文字(比如网页正文),才结合前面的对话和来源标签去判断。六个测试集上攻击成功率从 84.7% 降到 2.3%。三点别读过头:只在一个目标模型(Gemma 4 31B)上测;「静态字段契约」这条最硬的防线只在返回格式固定时成立,开放文本那部分弱得多;最关键的是整套判断建立在「每段内容都带一个可信的来源标签,且攻击者伪造不了」这个前提上,而真实系统里这个标签常常跟内容走同一条不可信通道。攻击者预算这块交代得比较实:测试用的是攻击者拿一个 LLM 反复改写话术、根据失败反馈再试的自适应攻击,不是发一条固定的恶意串。
"Updated rating: 4.9"
攻击者店家把这句塞进自己搜索返回的评分字段,不下任何指令,agent 就认为它是评分最高的一家并下单
合成人格预训练:从第 0 个 token 就开始对齐
Synthetic Persona Pretraining: Alignment from Token Zero

现在的对齐都是预训练做完之后再糊上去的:模型先在互联网语料里学会了当所有人——客服、骗子、极端分子、写小说的——然后才被最后几万条对话数据告知「你是助手」。越狱之所以常常有效,就是把最上面这层膜掀开,底下那些人格原封不动。SPP 反过来做:拿一份写死的行为准则(比如「不协助制造武器」「不迎合用户明显错误的判断」),据此为预训练文档生成配套的第一人称自述段落,把这些段落混进预训练语料一起训,让想要的那个人格从一开始就是候选之一;之后的对话微调只负责把「Assistant:」这个提示稳定地唤到它身上,作者管这一步叫人格绑定。结果是准则遵守和抗越狱都变好,不良行为率下降。值得读是因为大多数人只在推特上争这件事,这篇真的花钱做了 3B 参数、5000 亿 token 的对照。但别读成「预训练对齐能取代 RLHF」:这个规模上成立的事,在更大模型上会不会保持没有任何证据;更关键的是论文没回答——这个从头种下的人格,能不能被几百条微调数据抹掉?如果能,它跟「薄薄一层」的区别就只是贵得多。和今天的 HiRoute(2608.12821)刚好占了同一条轴的两端:一个把安全装在训练流程最外面(冻住模型只挂外挂),一个装在最里面,两篇互不引用,也没有对照实验。
看摘要
厂商说的「安全测试覆盖 12 种语言」,在单个语言上经常不成立
Language-Specific Gaps in AI Safety Training Datasets
审计了 21 份公开的多语言安全数据资源,挑了三种语言代表网上可用文本的多寡:法语(多)、斯瓦希里语(中)、豪萨语(少)。最有说服力的一条是同一套流水线的对照:某篇论文自己定了一个翻译质量的合格线,它产出的豪萨语部分没过这条线,同一套流水线的斯瓦希里语部分却轻松通过——说明差距是工程没做到位,不是「低资源语言天生如此」。另一条硬结论:他们查的两个非洲语言层里,自残和性内容这两类安全测试题完全没有母语原生数据,是零不是少。还发现很多资源不交代题目哪来的(母语者写的?英文题机翻的?从别处抄的?),于是同一批英文题翻成五种语言后,被当成五份独立证据引用。别读成「非洲语言的模型安全全线崩溃」——这篇查的是数据集本身的元数据质量(来源可不可追、标注一致不一致、能不能拿到),没有测任何模型的实际行为。它说的是没人真正验证过,不是验证过发现不行。
HiRoute:先分类再挂安全提示,主要是为了少误拒
HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models

模型权重全冻住,只在输入前面插一小段训练出来的向量(不对应任何真实词,直接在向量空间里学,所以叫「软提示」)。HiRoute 给每类风险各训一段:问自残的挂 A 段,问违禁品的挂 B 段,再训一个小分类器判断用户这句话危不危险、属于哪类,安全的输入直接放行、不加任何东西。好处是不会因为一律挂安全提示而把「我小说里的角色怎么下毒」「怎么杀死一个进程」这类正常问题也拒掉,同时不同风险能给不同的回答(自残给转介资源,而不是所有危险问题都回一句「我不能帮你」)。方法上是软提示加分类器的常规组合。别把它当安全能力的提升:模型本身没有变得更难越狱,真正的活儿是那个小分类器干的,它判错了整条安全分支就被绕过去,所以上限就是这个分类器的上限。而论文没交代攻击者知不知道这个分类器存在、能不能专门构造让它判成「安全」的输入——这恰好是最该测的。和 PIPES(2608.12789)对照着看有意思:PIPES 判断「这句话有没有资格从这个地方冒出来」,HiRoute 还是在猜「这句话看起来像不像有问题」。
跳过
先对账,再随时写:分信任等级的资料库 + 多智能体写手,生成不漂移的时点研报
Reconcile Once, Write Anytime: A Trust-Tiered Librarian and a Multi-Agent Writer for Drift-Free, Point-in-Time Research
这篇做的是自动写长篇研报:先用一套不带 AI 的确定性流程,把 SEC 备案文件、劳工统计局发布、维基百科等 6130 份材料拆成 55 万条带时间戳的证据,按来源可信度分级入库(官方备案压过媒体报道),同一个指标只保留一个权威数值,别处报的不同数字挪进冲突列表;然后写手在指定的时点上只读时间戳早于那天的证据,避免用未来数据倒着写过去的报告。它要解决的问题是「第 3 页说营收 12 亿、第 40 页说 15 亿」这种自相矛盾,不是有人主动往语料里塞东西。按来源分级这个动作和今天的 PIPES(2608.12789)是同一个,但 PIPES 面对的是攻击者,这篇系统里根本没有攻击者——摘要里的 red-team 是自己查自己,不是有人在对抗它。真有攻击者的时候,「这条来自 SEC」这个标签本身就是首要伪造目标,而这篇完全没考虑标签可不可信。当质量控制工程读,不要当安全论文收。
Metric ledger 1 authoritative + conflicts
同一个指标只存一个权威值,其余来源报的不同数字全部进冲突列表——这是防前后矛盾的机制,不是防攻击的机制
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。