速览 2026-08-18:1 篇
今天只有一篇,也没有值得注意的趋势。唯一这篇继续在「改模型内部神经元来防越狱」这条线上做,主要改进是把『纯安全』和『干正事也要用』的神经元分得更干净,从而少伤正常能力。真正没讲清的是防御什么时候被启动、启动的开关本身扛不扛得住攻击。
看摘要
Tripwire:找出模型内部的「安全开关」神经元,需要时把它按下去
Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons

大模型内部有成千上万个数值单元(神经元),研究者一直想找出哪几个负责「拒绝回答有害请求」,直接操控它们来防越狱。以前有两条路:一是把「有害语义」相关的单元全压制住,但这类语义散布在整个网络里,要堵就得动一大片,模型正常能力也跟着废;二是用外挂分类器挑出安全相关的单元,但挑出来的往往同时也是干正事要用的。这篇的做法是对每个单元单独做统计检验(并控制误判率),再加一道筛子把「对正常任务也重要」的排除掉,剩下的才算纯安全单元;防御时把这些单元的数值强行按到「模型见到有害输入时的典型值」,等于在模型内部伪造一个『我正在被攻击』的信号,让它自己触发拒绝。相对前人的增量主要在筛选环节更严格,以及不是全程开启、而是按需触发。但摘要没说清触发的判断由谁做——如果外面挂了一个判断器,那这个判断器本身就是新的攻击目标,而摘要里完全没交代攻击者能不能察觉、绕过它。攻击者预算(是否知道防御存在、能否根据失败反馈反复改写话术)也未交代,没有威胁模型的防御结论说服力有限。
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。