一个拥有正常权限的Agent,可能在合法身份、合法工具、合法流程下,执行出违背业务意图的错误结果——这就是智能体安全最难治理的地方。360 AI安全研究院发布的报告,构建了Agent安全六层攻击面模型,提出了“合法动作的非法后果”核心概念,并分析了三类新型交互式攻击方式。本文深度拆解智能体攻击面的六层结构,揭示从“非法访问”到“合法执行造成错误后果”的安全范式跃迁。
智能体攻击面——从漏洞到交互点
六层攻击面定义
传统安全的攻击面定义主要围绕“系统漏洞”展开。但在智能体场景下,攻击面不再是静态漏洞集合,而是智能体运行体系中的每一个“可被利用的交互点”。报告提出六层攻击面模型:人机交互层(用户输入与AI输出)、通信调用层(API通信与数据传输)、组件间层(模型与组件间交互)、智能体之间(Agent间协作通信)、工具调用层(外部工具调用含Skill/MCP)、基础运行环境层(推理框架与部署环境)。
截至2026年3月,360已发现近40个智能体相关漏洞,涉及llama.cpp、Dify、langchain、BentoML、pandasai等主流框架。仅OpenClaw就披露了10个超高危/高危漏洞。这说明智能体攻击面不仅在理论层面存在,更在真实技术栈中广泛分布。
各层风险与防护重点
人机交互层的核心风险是提示词注入和违规输出,防护重点为输入净化和意图检测。通信调用层的核心风险是API通信劫持和参数投毒,防护重点为通信加密和完整性校验。组件间层的核心风险是记忆投毒和意图篡改,防护重点为组件隔离和意图验证。智能体之间的核心风险是身份假冒和访问越权,防护重点为身份认证和权限隔离。工具调用层的核心风险是工具伪造和返回值污染,防护重点为工具白名单和Skill检测。基础运行环境层的核心风险是框架漏洞和配置错误,防护重点为漏洞扫描和沙箱隔离。
合法动作的非法后果——智能体风险的核心特征
不是漏洞,而是可执行的失控
报告提出了一个核心原创概念:“合法动作的非法后果”。传统安全漏洞的逻辑链是“代码缺陷→攻击者利用→系统异常”。但智能体风险的逻辑链完全不同:正常权限 + 错误目标 + 不可信上下文 + 自动执行 → 合法动作造成非法后果。
所谓“合法动作的非法后果”,是指Agent在未突破传统权限控制、未利用系统漏洞的情况下,仅通过正常身份、正常工具和正常流程,执行出违背业务意图或安全边界的结果。传统安全关注“非法访问”,智能体安全更要关注“合法执行造成错误后果”。
典型案例推演:知识库Agent被诱导读取并返回了本应仅限管理层访问的薪酬文件——所有操作都是“合法的”,只是被诱导读取了不该读取的部分。办公自动化Agent通过间接Prompt注入将审批金额篡改为异常数值——整个操作链路中没有“违规”,只是在执行被“告知”的操作。
三类新型交互式攻击
报告梳理了三类新型交互式攻击方式。间接提示词注入——攻击者在外部数据源(网页、文档、邮件)中嵌入隐藏指令,当Agent处理这些数据时恶意指令被悄然激活。典型案例:Notion AI Agents被钓鱼攻击窃取用户私密数据。
地毯式骗局——合法工具在特定调用次数后改变行为,低频触发、延迟作恶,绕过基于行为基线的检测。这类攻击的难点在于传统基线检测方法很难区分“正常行为的累积效应”和“精心设计的延迟触发”。
工具投毒攻击——通过工具描述或Skill描述插入隐藏指令,操纵Agent对工具的调用逻辑。由于工具描述本身就是给模型阅读的“自然语言”,传统安全扫描器无法识别其中嵌入的恶意指令。
AER执行风险指数
风险分级工具
报告提出了“Agent执行风险指数”(AER),用于启发式评估智能体在实际业务中的执行风险等级:AER = 权限范围 × 工具能力 × 数据敏感度 × 自主程度 ÷ 可逆性系数。
五个因子分别为:权限范围(1=只读单系统,5=读写全系统多权限)、工具能力(1=无工具,5=完整工具链含写入外联)、数据敏感度(1=公开数据,5=核心机密数据)、自主程度(1=单步人工确认,5=全自主执行)、可逆性系数(5=完全可逆可回滚,1=不可逆)。
AER的应用价值
企业可以根据AER评分决定不同Agent的安全治理强度。AER评分高的Agent需要最强级别的安全防护;AER评分低的Agent可以采用相对轻量化的治理方案。核心判断:Agent越能干活,越需要被管理;越接近自治,越需要安全边界。
报告同时指出,AER并非精确风险计算公式,而是用于企业内部快速分级的事后评估工具。企业在实际落地时可根据业务重要性、合规要求、数据敏感度和事故影响调整各因子权重。
传统安全手段为什么不够
报告指出,面对智能体攻击面,传统安全手段面临三个核心局限。边界防御局限——传统安全假设“内外有别”,但智能体本身就是“内部系统”,拥有合法身份和权限,防火墙和访问控制无法区分“合法调用”和“恶意诱导”。漏洞扫描局限——智能体的风险不在代码中,而在运行时的行为决策中,无法通过扫描代码来发现“Agent可能被诱导去删除数据库”。审计追溯局限——当Agent的决策链路涉及模型推理、工具调用、数据检索、记忆读取等多个环节时,“为什么Agent做了这个决定”变得极难追溯。
这些局限共同指向一个结论:企业需要一套专门针对智能体攻击面的新安全体系,而不是在传统安全工具上叠加AI模块。