速览 2026-08-15:1 篇
今天只有一篇,没有值得注意的趋势。唯一一篇是把「改神经元防越狱」从常开改成按需触发,工程上实在,但它把整个防御的成败押在一个判断「这是不是攻击」的前置判断器上,而这个判断器本身没被当成攻击目标测过。标题里的「统计认证」只认证了神经元筛选的误选率,不认证模型不会被越狱。
看摘要
Tripwire:只在需要时触发的「安全神经元」防越狱
Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons

做法是:平时对模型什么都不做,一旦判定当前这句输入像是攻击,就把模型里挑出来的一小撮数值单元强行按到某个固定值上——这个值是模型平常遇到「怎么造炸弹」这类请求时的平均激活水平。相当于在模型脑子里伪造一条「我刚看到了危险内容」的内部读数,逼它按训练时学过的方式拒绝。这是冲着旧方法的一个具体毛病去的:以前那类改神经元的防御是一直开着的,你让它写份辞职信,它也在被干扰,正常任务质量跟着掉;Tripwire 只在触发时才动,没攻击的时候不交这份税。挑哪些单元的办法也值得一提:对几万个单元逐个做「它跟安全有关吗」的统计检验,光靠运气就会蒙对一堆,所以先说好「最后挑出来这批里最多允许 5% 是蒙的」,再倒推检验门槛;同时把那些写代码、做数学时也亮的单元踢出去,只留几乎只在有害请求时才亮的。 标题里的 certified 容易被误读。它保证的只有一件事——挑出来的名单里误选比例受控;它完全没有说「模型在这个防御下不会被越狱」,安全性本身零保证。更要紧的是,整套机制吊在那个「这次是不是攻击」的判断器上,而这个判断器自己就是攻击面:它失灵,防御就等于没开,而摘要没交代攻击者是否知道它存在、能否针对它构造输入。作者报的「效用不掉」也是在他们选的那批正常任务上测的。
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。