大模型会“说错话”,智能体会“做错事”。2026年,AI安全的主战场正在从“生成风险”转向“执行风险”。360 AI安全研究院发布的《智能体安全新范式》报告,首次提出了“合法动作的非法后果”这一核心概念——Agent在正常权限范围内被诱导执行了错误操作。这份报告构建了Agent安全六层攻击面模型、AER执行风险指数和ASM成熟度模型,并基于约5万个公开Skill样本检测,揭示了智能体生态中正在形成的供应链风险。
智能体安全为什么成为新问题
从“会回答”到“会执行”的本质变化
2022年大模型爆发时,行业的安全讨论聚焦于“模型会说什么”——幻觉、越狱、Prompt注入、敏感信息泄露,核心问题是模型输出是否可靠、是否安全。但当智能体开始调用工具、访问数据、执行工作流时,安全问题的性质发生了根本变化。
智能体与对话式模型的本质区别在于:Chatbot主要影响认知,Agent可能影响系统;Chatbot的错误停留在内容层,Agent的错误可能进入业务流程、数据资产和真实操作。报告的核心判断是:大模型的风险是“说错话”,智能体的风险是“做错事”。
三个根本变化
智能体安全不是传统AI安全的简单延伸。报告识别出三个根本变化:风险层级变了——从内容生成风险进入执行风险层;攻击路径变了——攻击者不一定需要攻破系统,只要诱导一个拥有正常权限的Agent去做错误动作;治理对象变了——从治理模型和输出扩展到治理一整套运行体系。
行业信号也在印证这一判断。Microsoft将Zero Trust扩展到agentic workforce,OWASP发布了面向Agentic Applications的风险清单,Gartner提出AI Agent Sprawl问题。这些信号表明:智能体安全已经从单一模型问题变成了企业身份、权限、工具、数据和行为治理的综合问题。
核心框架——六层攻击面、五类治理对象与AER指数
六层攻击面模型
报告提出了“Agent安全六层攻击面模型”:人机交互层(提示词注入、违规输出)、通信调用层(API通信投毒、数据篡改)、组件间层(记忆投毒、意图篡改)、智能体之间(身份假冒、访问越权)、工具调用层(工具伪造、返回值污染)、基础运行环境层(框架漏洞、配置错误)。截至2026年3月,360已发现近40个智能体相关漏洞,涉及llama.cpp、Dify、langchain等主流框架。
五类治理对象
六层攻击面用于识别风险来源,五类治理对象用于建立安全边界:身份——Agent代表谁执行;工具——Agent能调用什么;数据——Agent能读取什么;记忆——Agent会记住什么;行为——Agent实际做了什么。只有把两者结合,企业才能从“发现风险”走向“体系化治理”。
AER执行风险指数
报告提出了“Agent执行风险指数”(AER)= 权限范围 × 工具能力 × 数据敏感度 × 自主程度 ÷ 可逆性系数。核心判断:Agent越能干活,越需要被管理;越接近自治,越需要安全边界。
合法动作的非法后果
智能体风险的核心特征
报告提出了核心原创概念:“合法动作的非法后果”。传统安全关注“非法访问”,智能体安全更要关注“合法执行造成错误后果”——Agent在未突破传统权限控制的情况下,通过正常身份、正常工具和正常流程,执行出违背业务意图或安全边界的结果。
新型交互式攻击
报告梳理了三类新型交互式攻击:间接提示词注入、地毯式骗局、工具投毒攻击。这些攻击的共同特征是:攻击入口不是系统漏洞,而是AI的自然语言理解能力本身。攻击者不需要“攻破”系统,而是“说服”系统去做错误的事。
Skill安全——供应链风险入口
基于约5万个公开Skill样本检测,报告识别出十大高风险Skill类型:数据外泄、凭证/密钥窃取、资产转移/盗用、恶意扣费/诱导付费、违规内容导流、隐蔽外联、远程下载执行、提示词/指令投毒、商业推广/刷单/黑灰产导流、持久化/后门控制。Skill安全本质上是Agent时代的新型供应链安全。企业不能只管Agent本体,还要管理Agent所调用的Skill、工具和外部组件。
ASM成熟度模型与建设路线图
报告提出了五阶段ASM模型:L1无感使用→L2工具管控→L3行为审计→L4风险控制→L5智能防御。建设路线图分四个阶段:1-3个月完成资产盘点与管控;3-6个月部署审计体系;6-12个月引入策略引擎;12个月以上建设智能防御体系。核心判断:企业部署Agent不能只看效率和自治能力,而要建立风险分级和治理路线图。没有边界的自治是风险,有边界的自治才是生产力。