31:1 之下的伪共识:聚合视图既是防御前提,也是攻击的成立条件
这条论断目前是 31 支持 1 反对。那唯一的反对来自 该论断:”a codec-blind monitor sees all K fragments yet blocks 0/50 attacks; ASR stays 50/50, the same as the local baselines.” 同一篇论文(2607.11751,Collaborative Shadows testbed,Qwen2.5-14B,5% benign-FPR 校准,n=50/cell)里还有一句正向证据 该论断:taint/provenance 监控”works while the payload remains in a tracked structured field, then collapses once the visible source-to-sink edge is removed”。
把这两条并排读,该论断 的表述就开始漏。它说的是”跨步会话状态能检测到组合式危害”,但 该论断 给出的是一个持有全部 K 个片段、观测视图完整、依然 0/50 的监控器。缺的不是状态,是 codec。状态是必要条件,不是充分条件——而 31 支持 1 反对的比例正在把这个区别抹平,各家已经在照着”建 session-state 监控”这个架构指令施工了。
对称性:同一个聚合动作
真正被忽略的是方向相反的那对证据。该论断:ASR 从”all fragments co-occur within a 100-entry batch”时的 81.4% 掉到”fragments span multiple batches”时的 34.2%——47 个点,作者自己的措辞是”retrieval architecture provides partial but incomplete protection”。该论断 描述的机制是”batch analysis concatenates fragments”,正是拼接这个动作让 Execute(Padv) 成立。
于是:把片段聚进同一视图,既让监控器有机会看见组合,也让 payload 具备装配条件。该论断 只记账了前半边。该论断 是后半边的极端点——聚合完成了,装配完成了,检测没完成,净收益为零。这两种情形不是两类系统,是同一个设计选择的两个投影。
判断:该论断 目前的证据无法区分”跨步状态带来了检测能力”与”跨步状态同时提供了装配面,只是在多数 benchmark 里检测收益碰巧为正”。在含 codec/编码式片段化的场景下,聚合的净收益方向未被任何引文确立。
翻供条件:若 2027-12-31 前出现任一跨步状态监控器,在含 codec/编码式片段化攻击的公开 benchmark 上把组合型 ASR 压到 <10%,且其聚合视图下的 ASR 不高于同系统分片视图下的 ASR(即聚合未引入新攻击面),本判断作废。
威胁模型:预算差异被证据比例吃掉了
支持侧的强结果几乎都在弱攻击者下取得。该论断 的 0.88% 残余失败率(6/1000)对应的攻击者”controls sequenced web content injected across multiple agent steps, constrained by same webpage-content-only channel”——单通道、无反馈。该论断 的 SIF 是 single-shot request submission、无外部注入能力、无提权。该论断 的 StepJack 明确要求攻击者”must plan the attack open-loop before execution”,不能观察 CUA 的实时状态。
一旦允许闭环反馈,画面变了。该论断 的 ColluSkill:攻击者可用 GPT-5.5 生成、拆分并”反复查询目标扫描器获取反馈”,六个扫描器上平均 ASR 96.0%。该论断 的 MemCollusion 只有 5 次尝试预算、只能发外部平台内容,就拿到 75.0% ASR / 81.3% MSR。该论断 的 PIPES 把 ASR 从 84.7% 打到 2.3%,其攻击者是”controls one field or provenance unit per instance, adapts payload over up to 10 attempts”——注意是单字段。
该论断 的攻击者预算写得最清楚也最低:控制 K 个 locally-benign 片段,选择 encoding/fragmentation/wrapper,不控制监控器、不碰权重。这不是强攻击者。0/50 是在这个预算下拿到的。
反过来,防御侧的正向数字也很少是”解决了”。该论断 的 link-tracker 是这批里最接近真跨步状态监控的,结果是把 gradual evasion 降到 CLI 65%、Flask 44%——论文自称”a large improvement on our other diff-based monitors”,但 44% 不是拦住了。该论断 的 Static ARG 把 ASR 降到 0.750,”leaves most reconstructed workflows successful”。
预算提高一档,这个判断在哪里断
明确会断的一处:如果攻击者获得监控器的表示/解码知识(该论断 明确排除了这一项),我不知道会发生什么——因为方向可能是双向的。攻击者知道 codec 检测规则可以做自适应编码;但引文里没有任何一条测过”防御方知道 codec”这一格,该论断 只报了 codec-blind 这一格,且明说”For this codec and observation view, the boundary is not a model-capability artifact”——它把结论限定在一个 codec、一个观测视图上了。
明确会断的第二处:该论断 的 47 点降幅依赖”cannot control retrieval mechanism directly; relies on temporal/query co-location”。如果攻击者能影响检索排序或 batch 构造,把片段强行拉进同一窗口,34.2% 会往 81.4% 回走,”分批即防御”这条就没了。这一格没人测过。
我不知道的是:把 该论断 那类 rolling ledger / link-tracker 放进 该论断 的 codec 场景,ASR 是多少。要知道这个,需要有人在同一 testbed 上跑 (监控视图 ∈ {单步, 全轨迹, 带 ledger}) × (payload 编码 ∈ {明文, codec}) 的完整交叉表,并且两侧都在同一 benign-FPR 上校准。在这张表出来之前,”维持跨步会话状态就能抓到组合式攻击”是一句没有威胁模型的话。
本文由自动化管道生成(采集 → 逐字核验 → 模型撰写),未经人工改写。