2026-09-09
金铲铲之战s8怪兽入侵赛季什么时候返场?
顶会顶刊AI安全论文研读第十期:ACL Findings 2025 | Mousetrap:借助迭代混沌链欺骗大型推理模型越狱
顶会顶刊AI安全论文研读第十期解析ACL Findings 2025的Mousetrap框架。该研究利用迭代混沌链欺骗大型推理模型实现越狱攻击,在o1-mini和Claude-Sonnet上成功率高达96%和86%,揭示了推理模型的安全漏洞。
2026-07-28 0
顶会顶刊AI安全论文研读第九期:ACL 2025 | 围攻智能体:采用优化提示攻击破解实用型多智能体大语言模型
ACL 2025收录的这篇论文聚焦多智能体大语言模型的安全漏洞。研究团队提出优化提示攻击,将对抗提示分片后通过图优化路由,利用排列不变规避损失绕过安全机制。实验表明该方法攻击成功率提升7倍,暴露了现有防御的不足。该研究为AI安全领域提供了重要警示。
2026-07-28 0
顶会顶刊AI安全论文研读第八期:EMNLP 2025 Oral | VisCRA:针对多模态大语言模型的视觉链推理攻击
第八期顶会论文研读聚焦EMNLP 2025 Oral论文VisCRA,提出视觉链推理攻击,通过注意力引导遮罩与多阶段推理诱导操控多模态大语言模型推理链,实现越狱攻击,揭示推理增强与安全对齐的冲突。
2026-07-28 0
顶会顶刊AI安全论文研读第七期:ACL 2025 | 谨防屏幕上的陷阱!通过弹窗攻击视觉语言计算机智能体
顶会顶刊AI安全论文研读第七期聚焦ACL 2025研究,探讨通过弹窗攻击视觉语言计算机智能体的安全威胁。研究发现对抗性弹窗可误导VLM智能体,攻击成功率高达86%导致任务成功率暴跌47%,揭示当前智能体缺乏视觉噪声辨别能力,为AI安全敲响警钟。
2026-07-28 0
顶会顶刊AI安全论文研读第四期:ICCV 2025 | 机器人的“视觉欺骗”:一个彩色补丁如何导致智能机器人“精神错乱”
本系列第四期研读ICCV 2025论文,揭示视觉语言动作模型的对抗性漏洞。一个微小彩色补丁可欺骗机器人执行错误动作,模拟环境任务失败率高达100%,真实环境超43%。这项研究为AI安全敲响警钟,推动更可靠的通用机器人系统发展。
2026-07-28 0
Litefuse 开源并推出单进程轻量模式:25 秒就能跑起来的 Agent 可观测与评估平台
Litefuse开源并推出单进程轻量模式,用户只需一条命令约25秒即可部署Agent可观测与评估平台。该平台基于Apache Doris优化存储和分析性能,有效解决长文本检索与超长Trace分析难题,大幅降低部署和维护成本,助力开发者高效评估与迭代Agent。
2026-07-28 0
多AI交叉验证的常见误区:为什么你还在用单模型多次采样
多AI交叉验证比单模型多次采样更可靠,但存在常见误区。多次采样无法消除模型系统性偏差,多模型共识也可能隐藏虚假共识。重视模型多样性及分歧价值,从多角度提问并溯源推理过程,避免盲目相信单模型采样结果,才能获得更准确的结论。
2026-07-28 0
顶会顶刊AI安全论文研读第五期:AAAI 2026 | PhysPatch:一种面向MLLM驱动自动驾驶系统的物理可实现对抗贴片框架
顶会顶刊AI安全论文研读第五期介绍AAAI 2026的PhysPatch框架。该框架面向MLLM驱动自动驾驶系统提出物理可实现对抗贴片方法,通过语义掩码与特征对齐优化实现高攻击性与可部署性。PhysPatch揭示了多模态大模型在真实场景中的安全漏洞,为AI安全研究提供新视角。
2026-07-28 0
基于子图像对比分散策略的顶会顶刊AI安全论文研读第二期CVPR 2025 highlight分散即关键多模态大模型越狱攻击研究
本期顶会顶刊AI安全论文研读聚焦CVPR 2025 highlight论文分散即关键。提出基于子图像对比分散策略的CS-DJ框架,通过构造复杂多层级视觉输入分散模型注意力,成功实现多模态大模型越狱攻击。实验显示平均攻击成功率52.40%,揭示视觉复杂度是安全防御关键裂缝,为AI安全研究提供新视角。
2026-07-28 0
关于OpenAI对布兰矩阵Abyssal Soul Heist算法安全问题回复的说明
布兰矩阵披露Abyssal Soul Heist算法安全问题揭示AI模型会话隔离缺陷可导致跨会话数据泄露。OpenAI回复认可研究价值但未纳入赏金计划。该事件反映了算法安全与系统级风险联动机制需要完善。布兰矩阵呼吁行业协同治理守护AI时代用户安全。
2026-07-28 0
GPT-5系列安全性能提升解析 全球首推AI算法漏洞负责任协同披露机制(RCD-AI)制度草案
OpenAI发布GPT-5系列模型在编码数学写作等方面性能显著提升。BraneMatrix AI解析其安全性能提升测试显示安全性能跨代升级但仍存在漏洞。同时全球首推AI算法漏洞负责任协同披露机制RCD-AI制度草案规范算法漏洞披露流程。
2026-07-28 0
顶会顶刊AI安全论文研读第一期:ICCV 2025 | 基于启发式诱导的多模态风险分解越狱攻击方法:突破MLLMs安全防线
本系列聚焦AI安全前沿研究,解读ICCV 2025入选论文提出的启发式诱导多模态风险分解越狱攻击方法。该方法将恶意提示分解为无害文本与图像片段,突破多模态大语言模型MLLMs安全防线,平均攻击成功率高达90%,揭示跨模态安全漏洞。适合AI安全从业者与学习者了解最新攻防动态。
2026-07-28 0
算法安全——美国AI主权武器
算法安全正成为美国AI行动计划的核心,从越狱攻击到Agent控制,算法统治力决定全球博弈格局。算法安全不再是技术附属,而是结构性边界防护能力,涵盖模型面对攻击的抵御与反应。理解这一趋势,有助于构建本土化算法安全技术体系,提升产业信任基础。
2026-07-28 0
为何多AI交叉验证比单模型多次采样更可靠?——基础认知篇
本文从基础认知角度解析多AI交叉验证相比单模型多次采样更可靠的原因。通过引入多个独立模型并计算共识度,有效克服单模型的随机性和系统性偏见,提升答案可信度。适合对AI应用可靠性有需求的用户阅读。
2026-07-28 0
多AI交叉验证实战:从单模型随机性至共识度量化
多AI交叉验证实战从单模型随机性陷阱到共识度量化方法。通过多个不同架构AI模型交叉验证用量化共识度评估回答可信度。有效提升AI输出可靠性适合开发者用于关键决策场景。
2026-07-28 0