速览 2026-08-17:3 篇
今天三篇各走各的,没有共同线索。值得读的是愚人金(2608.17202):开源模型的安全训练几分钟就能被剥掉,这篇干脆放弃防守,改成让剥掉之后问出来的危险配方剂量和温度都是错的——把防护从「不让你拿到」换成「拿到的没用」。另外两篇(2608.09025 金融 agent 的动作放行、2508.09105 判断 RAG 答案里哪句来自检索库)摘要都被截断,没有实测数字,只能看个问题设定。
读全文
愚人金:用假答案对付「拆掉安全护栏」的攻击
Fool’s Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models
Mark Russinovich · 2026-08-17 · cs.AI

开源模型(权重公开、谁都能下载改的那种)的安全训练很容易被拆掉:有一种叫 abliteration 的手法,只要找出模型内部负责「拒绝」的那个方向,从权重里减掉,几分钟就能让模型什么都肯答,而且目前没有发布方能长期防住这件事。这篇论文的思路是:既然防不住,就让拆掉之后拿到的东西不值钱。做法是训练模型,让它在被拆掉安全护栏的状态下,对危险的操作性问题(比如怎么合成某种物质)给出语气自信、行文流畅但关键细节是假的答案——剂量错了、温度错了、步骤顺序反了。
技术上关键的一点是「在攻击的可微模拟里训练」:训练时把「减掉拒绝方向」这个操作本身写进计算图,于是模型学到的是「一旦我处在被拆过的状态就输出假答案」,而不是平时就胡说。另外加了两个约束,作者叫 refusal pin 和 benign leash,说白了就是:没被攻击时该拒绝的还是照常拒绝,正常问答的能力和原模型保持一致,不许退化。
数字:7 个模型、5 个家族、90 亿到 1220 亿参数,包含稠密模型和混合专家模型。6 个通过了事先登记的有效性门槛,在没见过的问题上,被攻击状态下 0.51 到 0.90 的回答是假答案,其中 0.27 到 0.84 是这套防御带来的增量(也就是说有一部分模型本来就会答错,得扣掉);第 7 个(较小的那个)没过关。
最需要说清楚的是威胁模型的边界,作者自己也承认了:这个防御的价值建立在「攻击者无法独立核实答案对不对」上。如果攻击者手上有别的信息源可以交叉验证,或者干脆知道有这套机制存在、专门去找触发它的痕迹,那假答案就只是浪费他一点时间。论文只针对 abliteration 这一种攻击做了模拟,没有交代对微调式的安全移除(用有害数据继续训几百步)是否同样有效,也没测「攻击者已知防御存在」这个自适应场景。还有一个论文没展开的风险:把「自信地说假话」这个能力显式训进权重里,本身就是个新的东西,正常状态下会不会被别的提示词勾出来,需要独立验证。
看摘要
上下文不等于授权:金融 agent 的运行时管控
Context Is Not Authority: Structured Runtime Governance for Financial Market Agents
Rui Tang、Qiangqiang Liu、Yichi Zhang、Youwei Yang 等 6 人 · 2026-08-17 · cs.AI

针对金融场景提出一套「授权交接」规则:管的不是 agent 说了什么话,而是它准备产生什么实际后果(下单、对客户做承诺、上线一条策略),把每个提议编译成有类型、绑定到具体执行接口的候选动作,再结合当前行情、账户、政策和对话状态判断该不该放行;缺失或过期的合规检查会被记成「欠账」。摘要被截断,没给出实测数字和攻击者模型。
这句话是谁说的:审计 RAG 系统的成员泄露
SMA: Who Said That? Auditing Membership Leakage in Semi-Black-box RAG Controlling
Shixuan Sun、Siyuan Liang、Jianjie Huang、Jingzhi Li 等 5 人 · 2026-08-17 · cs.AI

RAG 是让模型回答前先去外部知识库检索资料(比如把公司文档拼进提示词)。问题是生成的内容混在一起,分不清哪句来自预训练、哪句来自检索库、哪句来自用户输入,于是既有的「判断某条数据是否在训练集里」的方法失效了。这篇做的是在半黑盒(能控制检索但看不到模型内部)条件下把这个归因问题重新做一遍。摘要被截断,没有效果数字。
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。