31:1 之下的伪共识:聚合视图既是防御前提,也是攻击的成立条件
「按单轮、单步或者重置过的会话去评测,会低估风险;只有把多轮聚合起来看,才认得出被拆散的恶意目标」——这条论断目前是 31 支持 1 反对。那唯一的反对来自 Collaborative Shadows testbed 上一个 codec-blind 的监控器(它看得见片段,但不知道片段是怎么编码的):”a codec-blind monitor sees all K fragments yet blocks 0/50 attacks; ASR stays 50/50, the same as the local baselines.” 同一篇论文(2607.11751,Qwen2.5-14B,5% benign-FPR 校准,n=50/cell)里还有一句正向证据:taint/provenance 监控”works while the payload remains in a tracked structured field, then collapses once the visible source-to-sink edge is removed”。
把这两条并排读,论断的表述就开始漏。它说的是”跨步会话状态能检测到组合式危害”,但那个 codec-blind 监控器持有全部 K 个片段、观测视图完整,依然 0/50。缺的不是状态,是 codec。状态是必要条件,不是充分条件——而 31 支持 1 反对的比例正在把这个区别抹平,各家已经在照着”建 session-state 监控”这个架构指令施工了。
对称性:同一个聚合动作
真正被忽略的是方向相反的那对证据。LogInject-1.0 那篇测到:ASR 从”all fragments co-occur within a 100-entry batch”(2607.14493)时的 81.4% 掉到”fragments span multiple batches”时的 34.2%——47 个点,作者自己的措辞是”retrieval architecture provides partial but incomplete protection”。同一篇写出的机制是”batch analysis concatenates fragments”,正是拼接这个动作让 Execute(Padv) 成立。
于是:把片段聚进同一视图,既让监控器有机会看见组合,也让 payload 具备装配条件。这条论断只记账了前半边。codec-blind 那 0/50 是后半边的极端点——聚合完成了,装配完成了,检测没完成,净收益为零。这两种情形不是两类系统,是同一个设计选择的两个投影。
判断:目前的证据无法区分”跨步状态带来了检测能力”与”跨步状态同时提供了装配面,只是在多数 benchmark 里检测收益碰巧为正”。在含 codec/编码式片段化的场景下,聚合的净收益方向未被任何引文确立。
翻供条件:若 2027-12-31 前出现任一跨步状态监控器,在含 codec/编码式片段化攻击的公开 benchmark 上把组合型 ASR 压到 <10%,且其聚合视图下的 ASR 不高于同系统分片视图下的 ASR(即聚合未引入新攻击面),本判断作废。
威胁模型:预算差异被证据比例吃掉了
支持侧的强结果几乎都在弱攻击者下取得。多步 polyglot 注入那篇 0.88% 的残余失败率(6/1000)对应的攻击者”controls sequenced web content injected across multiple agent steps, constrained by same webpage-content-only channel”——单通道、无反馈。SIF 那篇(一条自然语言请求被编排器自动拆成子任务,每个子任务都过审)的攻击者是 single-shot request submission、无外部注入能力、无提权。StepJack(2608.06477) 明确要求攻击者”must plan the attack open-loop before execution”,不能观察 CUA 的实时状态。
一旦允许闭环反馈,画面变了。ColluSkill(2608.09732):攻击者可用 GPT-5.5 生成、拆分并”反复查询目标扫描器获取反馈”,六个扫描器上平均 ASR 96.0%。MemCollusion 只有 5 次尝试预算、只能发外部平台内容,就拿到 75.0% ASR / 81.3% MSR。PIPES(2608.12789) 把 ASR 从 84.7% 打到 2.3%,其攻击者是”controls one field or provenance unit per instance, adapts payload over up to 10 attempts”——注意是单字段。
codec-blind 那条的攻击者预算写得最清楚也最低:控制 K 个 locally-benign 片段,选择 encoding/fragmentation/wrapper,不控制监控器、不碰权重。这不是强攻击者。0/50 是在这个预算下拿到的。
反过来,防御侧的正向数字也很少是”解决了”。link-tracker(一个带跨 PR 运行笔记的有状态监控器)是这批里最接近真跨步状态监控的,结果是把 gradual evasion 降到 CLI 65%、Flask 44%——论文自称”a large improvement on our other diff-based monitors”(2607.02514),但 44% 不是拦住了。Static ARG 把 ASR 降到 0.750,”leaves most reconstructed workflows successful”(2608.08264)。
预算提高一档,这个判断在哪里断
明确会断的一处:如果攻击者获得监控器的表示/解码知识(codec-blind 那格的威胁模型明确排除了这一项),我不知道会发生什么——因为方向可能是双向的。攻击者知道 codec 检测规则可以做自适应编码;但引文里没有任何一条测过”防御方知道 codec”这一格,那篇只报了 codec-blind 这一格,且明说”For this codec and observation view, the boundary is not a model-capability artifact”——它把结论限定在一个 codec、一个观测视图上了。
明确会断的第二处:LogInject 那 47 点降幅依赖”cannot control retrieval mechanism directly; relies on temporal/query co-location”。如果攻击者能影响检索排序或 batch 构造,把片段强行拉进同一窗口,34.2% 会往 81.4% 回走,”分批即防御”这条就没了。这一格没人测过。
我不知道的是:把 link-tracker 那类 rolling ledger 放进 codec 分片的场景,ASR 是多少。要知道这个,需要有人在同一 testbed 上跑 (监控视图 ∈ {单步, 全轨迹, 带 ledger}) × (payload 编码 ∈ {明文, codec}) 的完整交叉表,并且两侧都在同一 benign-FPR 上校准。在这张表出来之前,”维持跨步会话状态就能抓到组合式攻击”是一句没有威胁模型的话。
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。