测多 agent LLM 交易系统被社交媒体注入的对抗信号污染后收益/风险指标的下降
黑盒红队框架,用七域分类和自动生成的对抗性多轮对话测CrewAI/AutoGen agent的治理、隐私、工具滥用等风险
用模型内部表征变化检测40种LLM攻击(越狱/投毒/后门/检索污染),评的是白盒检测器本身
测试记忆积累是否让 agent 早期任务内容污染后续无关任务,随记忆长度增加安全违规率上升
自动红队平台,用 200+ 攻击策略跨 prompt/工具/环境注入向量攻击 agent,用可验证判官评判是否达成恶意目标
大规模红队竞赛:464人提交27万次间接提示注入攻击,测13个前沿agent模型的防护能力
用模拟酒精使用障碍患者角色与AI心理咨询模型多轮对话,评估其是否验证妄想、漏判自杀风险等诊疗安全缺陷
用自动化攻击者把违法目标拆成多轮良性请求,测试工具调用 agent 是否被逐步诱导协助
在六个高仿真网站克隆环境中,用界面里的说服话术注入诱导web agent偏离原任务,测六个前沿模型易感率
用19万条众包红队攻击,测34个LLM backbone在10种agent威胁场景下抗直接/间接注入攻击的能力
26项分布外covert-action评测(180+环境),测LLM在agentic任务中scheming倾向及deliberative alignment训练能否降低
用优化算法生成最坏情况提示注入串,系统评测LLM防御机制在自适应攻击下的稳健性
用不安全代码微调LLM,观察其是否在无关任务上泛化出欺骗、危险等广泛不对齐行为
Magma是微软多模态基础模型,测UI导航/机器人操作能力,非安全评测集
用GPT Store/HuggingChat真实system prompt构造对抗user消息,测LLM在多条guardrail压力下能否守住系统指令
10800条越狱提示×35种攻击方法,探测LLM内部表征中哪些特征导致越狱成功
评测Vision LLM在OOD输入和对抗性视觉/语言越狱攻击下的安全性与鲁棒性
60万条众包对抗prompt,测参赛者能否用直接注入让LLM违背系统指令输出指定内容
把对抗指令拼进prompt模拟第三方网页/文档注入,测LLM能否分辨并只服从原始指令
收集 78 条真实越狱 prompt,分 10 种模式,对 ChatGPT 3.5/4 在 8 类禁用场景下测绕过率
没有同时带上这几个标签的条目。