当OpenAI Codex追求“让Agent完成更复杂的软件任务”时,Anthropic Claude Code则在思考另一个问题:如何让Agent在真实代码库中安全可靠地行动?北大青鸟人工智能研究院这份报告拆解了Claude Code的三大核心Harness设计——细粒度权限控制体系、Compaction上下文协同机制、人机协作风险控制系统,揭示了“获得能力的同时严控执行动作风险”的工程哲学。
Claude Code的核心理念——安全自主执行
在真实代码库中可靠行动
Anthropic Claude Code的核心关注点是“安全自主执行”——如何让Agent在获得强大能力的同时,严格控制在真实环境中执行动作的风险。其核心理念是:Agent可以行动,但行动必须经过权限边界。Claude Code重点解决的是如何让Agent安全地操作真实环境的问题。
三大核心设计
Claude Code的Harness设计围绕三个核心展开:Constraints层通过细粒度权限控制体系(文件读取/修改、Shell执行,Allow/Ask/Deny策略)实现最小权限原则;Execution Loop层通过Compaction维持上下文连贯、CLAUDE.md/Memory机制保持项目理解、MCP/Skills工具扩展能力;Quality Gate层通过人机协作控制体系确保高风险命令需确认、修改文件需授权,利用ML分类器减少确认疲劳、提升自动审批率。
Constraints——细粒度权限控制体系
Allow/Ask/Deny三档权限策略
Claude Code建立了细粒度权限控制体系,涵盖文件读取、文件修改、Shell命令执行等不同操作,对应不同授权策略。用户可以通过规则控制不同工具的Allow/Ask/Deny权限。这一设计对应Harness中的Least Privilege + Explicit Constraints原则——Agent可以行动,但行动必须经过权限边界。最小权限原则确保Agent只能访问完成任务所必需的工具和资源。
Hook让规则成为自动控制流程
Claude Code通过Hook机制在工具调用前、调用后、会话初始化等关键生命周期节点自动触发检查逻辑,规则由“模型需要主动遵守”转变为“系统自动执行”。规则只有具备可验证、可拦截、可执行的能力,才能真正成为系统的一部分。
Execution Loop——长任务上下文管理
Compaction上下文压缩与CLAUDE.md记忆机制
为支持长任务,Claude Code需要处理上下文压缩、项目记忆、工具状态、会话恢复等问题。通过Compaction机制在上下文窗口填满时维持长任务的连贯性;通过CLAUDE.md、Memory机制让Agent持续理解项目环境;通过MCP、Skills、Subagent等工具扩展机制增强能力边界。这些机制共同确保了Agent在数小时甚至数天的长周期任务中保持上下文连贯性。
Quality Gate——人机协作风险控制
高风险命令确认与ML分类器辅助审批
Claude Code的人机协作控制体系确保高风险命令需要确认、修改文件需要授权、自动模式需要额外的安全机制。通过ML分类器减少确认疲劳,显著提升自动审批率。这一设计体现了“风险决定自主权”的原则——根据任务风险决定自动化程度,高风险操作保留人工介入。
Anthropic Claude Code与OpenAI Codex代表了Agent Engineering的两种典型路线。OpenAI更关注“如何让Agent完成越来越复杂的软件任务”,Anthropic更关注“如何让Agent在真实环境中安全可靠地行动”。但两者最终走向相同:通过约束控制行为,通过循环提升能力,通过验证保证质量。Claude Code的细粒度权限控制、Compaction上下文管理、人机协作风险控制——这些Harness设计共同回答了一个核心问题:如何让AI Agent在获得强大能力的同时,始终保持可控和可信。