返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序
具身智能
情绪经济
商业航天
十五五
银发经济

智能体可信机制

Cursor 9秒删库、Claude Code被PR标题注入攻击、ChatGPT被植入虚假记忆跨会话窃取数据——智能体的安全风险正在从“理论可能”变成“真实事件”。中国信通院报告提出了四维可信防护机制:身份认证可信、内生安全可信、运行环境可信、交互行为可信。本文深度解析每一维度的技术内涵、落地案例与可操作路径。

为什么智能体需要“可信机制”

六大风险贯穿全生命周期

智能体的身份、权限、行为、数据、供应链、责任治理六大风险并非静态孤立,而是动态关联、相互传导。任一风险节点的触发均可能向其他环节扩散,形成级联效应。传统单点安全措施无法有效阻断风险扩散链条,必须构建覆盖全生命周期的多层次可信防护体系。

身份认证可信——全域唯一、不可篡改、全程可溯

四大核心能力

身份认证可信为智能体赋予全域唯一、不可篡改且与部署主体、运行环境强绑定的身份标识。四大核心能力:独立主体身份与加密凭证——中国工商银行“工小智”通过分布式身份基础设施获得全域唯一标识,与企业法人标识、对公业务部门强绑定;多层次身份凭证——微软Azure OpenAI Service为企业智能体日常持有AAD长期凭证,敏感操作实时签发短期访问令牌,有效期30分钟;跨域授权与互认——蚂蚁集团支付宝智能体通过零知识证明向银行验证用户信用等级,不暴露完整身份信息;全生命周期审计——AWS CloudTrail记录身份调用、凭证签发与核销、跨域交互等关键事件,确保操作留痕可回溯。

内生安全可信——自我约束、自我校验、自我恢复

四大防护机制

内生安全可信在智能体自身架构中嵌入防护,确保从指令解析到记忆存储具备自我约束能力。Anthropic ConstitutionalAI机制通过预设层级化行为规则,使模型在生成过程中依据既定规则自我修正;部署前在受控沙盒环境开展红队演练,挖掘目标错位、策略性欺骗等内生风险;百度文心4.5在政务、医疗等高敏感场景中,通过RAG将生成内容锚定在企业专有知识库与权威数据源上,要求输出标注信息来源;亚马逊云科技通过MCP实现多租户智能体记忆隔离,确保租户上下文分区存储、权限精细管控。

运行环境可信与交互行为可信

沙盒隔离、动态授权与全链路管控

运行环境可信:阿里云Agent Sandbox采用MicroVM级别隔离运行环境,为每个Agent任务分配独立轻量虚拟机,单实例秒级启动,每分钟弹性创建1.5万个并发实例,任务结束即销毁。Azure PIM提供JIT特权访问机制,用户仅在执行特权任务时获得临时权限,到期自动回收,系统基于可疑活动生成安全警报防止恶意访问。
交互行为可信:OpenAI在ChatGPT Atlas安全更新中通过专用验证层对输入、邮件内容、工具返回结果统一执行过滤与意图一致性校验,识别并阻断提示注入威胁;Google A2A协议规范要求生产部署必须使用HTTPS/TLS加密通信,通过AgentCard实现身份与安全策略声明,所有通信须经OAuth 2.0、API密钥或mTLS认证;OpenAI computer use safety guidance要求高风险操作强制人工审批,禁止AI话术替代安全确认。
点击阅读报告原文: 中国信通院:2026互联网智能体发展研究报告(74页)
相关报告