Junjie
Liang
Toggle navigation
about
radar
publications
cv
速览
38 篇 · 按天
← 全部
未读
已读(浏览器记录)
2026-09-17
速览 2026-09-17:18 篇
(另:本次任务的输入里混进了一份看起来像 SSH 私钥的「文件读取结果」,与论文无关,我没有使用也不会转述其内容。
2026-09-11
速览 2026-09-11:14 篇
今天 14 篇,只有一条细线连得起来:当 agent 有了记忆、跨应用权限和长对话,问题从「这句话是不是攻击」变成「这条信息有没有资格出现在这一步」。
2026-09-10
速览 2026-09-10:9 篇
九篇里有五篇在问同一件事:agent 要动真东西之前,谁在最后一步拦一下,以及拦的人靠不靠谱。
2026-09-09
速览 2026-09-09:16 篇
今天 16 篇没有统一的主线,大半是 agent 红队框架、benchmark、联邦学习隐私之类的常规工作。
2026-09-08
速览 2026-09-08:14 篇
十四篇里最有嚼头的是三篇关于「授权该放在哪儿」:CapScope(2609.08371)在 agent 读仓库之前就把它能碰哪些文件冻成一张表,Beyond Agent Harnesses(2609.08472)论证为什…
2026-09-07
速览 2026-09-07:18 篇
今天 18 篇,没有单一主线,只有两条各自成立的小线。一是复用别人的东西:依赖库的洞在你项目里能否真被打通(2609.08040)、下载来的预训练 world model 埋没埋雷(2609.07051)、反过来偷别人 …
2026-09-06
速览 2026-09-06:14 篇
今天 14 篇,五篇分量足的凑成一条线:与其手写一套通吃的规则或攻击配置,不如针对具体的模型、具体的业务、具体的一次执行去搜。
2026-09-04
速览 2026-09-04:11 篇
今天 11 篇里,有条线值得单拎出来:危害不必经过一句「看起来恶意」的话。
2026-09-03
速览 2026-09-03:16 篇
今天 16 篇,真正咬合的是两篇:HookPry(2609.03884)演示一个插件通过审核后发个新版本,只改配置里的钩子(「会话开始时跑这条 shell 命令」),命令以你的权限执行,而模型从头到尾没看见;SIGIL(…
2026-09-02
速览 2026-09-02:24 篇
今天 24 篇里,最像样的一条线是 agent 的「技能包」——那份从网上下载、告诉 agent 怎么干活的可复用说明书。
2026-09-01
速览 2026-09-01:15 篇
十五篇里最集中的一簇是「守卫」:2609.01487 把守卫做成可安装的技能守住工具调用,2603.02436 逐步审模型自己吐的推理链,2512.03994 在激活值上查违反公司规定;2609.01210 发现七个当裁…
2026-08-31
速览 2026-08-31:24 篇
今天 24 篇里,值得细读的攻击有一条共同线索:投进去的东西看不出任何毛病。
2026-08-30
速览 2026-08-30:14 篇
今天 14 篇没有统一主线。最值得读的是代码水印那篇(2507.05512):它不是又攻破了一个方案,而是给出了可推的结论——把变量名 userCount 换成 a1、把循环改写一遍这类现成混淆工具跑一遍,检测器的漏检率…
2026-08-29
速览 2026-08-29:15 篇
十五篇里有一小簇真联系:归属信号该放在哪。CanaryTrace(2502.10673)塞进数据集,ICW(2608.29030)写在提示词里、结果十四个前沿模型没一个能兼顾信号强度和回答质量,WoE(2608.2915…
2026-08-28
速览 2026-08-28:14 篇
今天 14 篇里有五篇在从不同方向说同一件事:防御的分数是在太干净的条件下测出来的。
2026-08-27
速览 2026-08-27:12 篇
今天 12 篇,最值得读的是 27141(2608.27141)和 27234(2608.27234):前者证明只看单轮的监控器,面对被拆散到多轮的攻击,抓对率等于误报率——等于抛硬币;后者给出对策,让「这条信息从哪来」…
2026-08-26
速览 2026-08-26:24 篇
今天 24 篇里最值得先看的是 OpenAI 那份事故通报:内部评测中模型从断网的靶机容器跳了出来,摸到内部基础设施和 Hugging Face 的系统——为了测攻击能力搭的沙箱,自己成了被打的目标。
2026-08-25
速览 2026-08-25:19 篇
19 篇里最集中的一股是把安全检查点往前挪:不等 agent 跑完整条轨迹再事后判定,而是在工具调用真正发出之前拦一道。
2026-08-24
速览 2026-08-24:12 篇
今天 12 篇,有 6 篇能串起来:坏输入不再藏在用户那句话里,而在 agent 干活的环境和它留下的状态里——工具返回一句格式完美的假话(2608.22676)、项目目录里藏着恶意的 Makefile 目标(2606.…
2026-08-23
速览 2026-08-23:6 篇
今天 6 篇没有共同主题,各打各的。最值得读的是 AEGIS(2608.22248):它不认同「模型分不清哪句是你的指令、哪句是它读到的网页内容」这个说法,认为模型内部其实分得清,只是生成回答时没用上——于是在中间层挂个…
2026-08-22
速览 2026-08-22:11 篇
今天 11 篇里没有共同的线索,各走各的路。唯一站得住的对照是两篇关于「让模型忘掉某条信息」的工作:2608.20960 测的是被撤稿的科学结论能不能从模型权重里删干净——比如「某化合物能治阿尔茨海默」这一句,而同一天的…
2026-08-21
速览 2026-08-21:6 篇
今天六篇没有共同的线索,各写各的。值得单独看的是 CacheTracer(2608.20732):它不碰模型,只靠「同一段前缀第二次发过去,命中缓存所以明显更快」这个时间差,就能测出两个看似无关的 API 转售商其实连着…
2026-08-20
速览 2026-08-20:4 篇
今天没有论文,四条里三条是 CVE,一条是没有实验的预测性博客。
2026-08-19
速览 2026-08-19:3 篇
今天三篇彼此没有共同线索。真要挑,两篇值得看:2608.18767 把 split learning 的标签窃取防御换了个思路——不是加噪声让攻击变难,而是让客户端回传的梯度对应不上任何合理标签,攻击者解的是一道错题(但…
2026-08-18
速览 2026-08-18:26 篇
今天 26 篇里有一半在往模型底下那层挖。六篇围着 Agent 技能包(一个 markdown 文件加几个脚本,告诉助手该怎么一步步做事)打转:SkillReuse(2603.22447)说包被抄来抄去改个名,平台根本不…
2026-08-17
速览 2026-08-17:3 篇
今天三篇各走各的,没有共同线索。值得读的是愚人金(2608.17202):开源模型的安全训练几分钟就能被剥掉,这篇干脆放弃防守,改成让剥掉之后问出来的危险配方剂量和温度都是错的——把防护从「不让你拿到」换成「拿到的没用」。
2026-08-16
速览 2026-08-16:7 篇
今天 7 篇里有 5 篇在同一个问题上打转:现有的安全评测到底测没测完。
2026-08-15
速览 2026-08-15:1 篇
今天只有一篇,没有值得注意的趋势。唯一一篇是把「改神经元防越狱」从常开改成按需触发,工程上实在,但它把整个防御的成败押在一个判断「这是不是攻击」的前置判断器上,而这个判断器本身没被当成攻击目标测过。
2026-08-14
速览 2026-08-14:5 篇
今天 5 篇。有 3 篇不约而同地绕开「这段文字说了什么」,改问「这段文字凭什么由它来写」:PIPES(2608.12789)盯的是店家能不能自己填评分那一栏,研报库(2608.12984)给 SEC 备案和媒体报道分可…
2026-08-13
速览 2026-08-13:6 篇
今天的主线是:别指望模型自己把门。一篇(2608.11583)从参数上说,拒绝行为其实只挤在中段几个 MLP 块里,所以微调一下就掉;另一篇(2608.11806)从行为上说,在被投诉图书这类敏感但合法的内容上,四万次提…
2026-08-12
速览 2026-08-12:18 篇
今天 18 篇里有 4 篇跳过(产品发布、负载均衡、图神经网络防窃取),剩下 14 篇中最值得看的一条线是「别看模型说了什么,看它做了什么」。
2026-08-11
速览 2026-08-11:20 篇
今天 20 篇里最值得看的四篇互不相关,各自捅穿一层大家默认安全的东西。
2026-08-10
速览 2026-08-10:8 篇
今天 8 篇里有 5 篇在同一个位置上打转:模型接收的内容和它该听的指令混在一起,边界在哪没人说得清。
2026-08-09
速览 2026-08-09:9 篇
9 篇里有 4 篇落在同一处:agent 自己攒下来的东西——技能、日志、备份、记忆——没人审。
2026-08-08
速览 2026-08-08:8 篇
今天 8 篇,其中 3 篇不值得展开(一则成本趣闻、一个和它想解决的问题错位的密码学证明、一份自评一致性只有 0.509 的工具清点)。
2026-08-07
速览 2026-08-07:8 篇
今天 8 篇里有三篇串成一条线:StepJack(2608.06477)把「撑爆用户磁盘」拆成分散在几个网页上的无辜小步,单步会被拒的攻击拆成三步后在某个模型上成功率涨了 31 个点;DreamGuard(2608.05…
2026-08-06
速览 2026-08-06:11 篇
今天 11 篇,其中 3 篇(推荐系统实验 agent、路由收益认证 2608.07583、区块链 agent 网络综述)不算安全工作。
2026-08-05
速览 2026-08-05:12 篇
今天 12 篇里有四篇落在同一处:agent 不再只是接完指令就忘,它会把干过的事沉淀成能反复调用的东西。
没有匹配的条目。