当AI Agent从演示走向真实生产环境,模型能力的提升并不意味着系统可靠性的提升。任务漂移、上下文遗忘、执行失控——这些挑战催生了AI Agent工程实践的四阶段演进:从Prompt Engineering到Context Engineering,再到Harness Engineering,最终走向Loop Engineering。北大青鸟人工智能研究院这份报告系统梳理了这一演进路径,提出了Agent=Model+Harness的核心公式,揭示了决定Agent能否进入生产环境的关键不在于模型能力本身,而在于围绕模型构建的执行系统。
AI Agent工程实践的演进历程——四阶段跃迁
从Prompt到Loop的嵌套演进
报告将AI Agent工程实践划分为四个递进阶段。Prompt Engineering(提示工程)核心关注“如何说对话”,适用于单轮或短任务;Context Engineering(上下文工程)核心关注“模型看到什么”,适用于多轮对话和知识密集型任务;Harness Engineering(驾驭工程)核心关注“整个系统如何可靠运行”;Loop Engineering(循环工程)核心关注“如何实现长期自主运行”。
四阶段层层递进、嵌套包含:Prompt ⊂ Context ⊂ Harness ⊂ Loop。工程焦点从模型提示外移到信息环境,再到运行约束,最后到自动化循环系统。人类从“写Prompt/代码”转向“设计环境与规则”,再到“设计循环系统”。
Harness Engineering——从写Prompt到设计运行环境
Harness Engineering的核心公式为:Agent = Model + Harness。Model是智能核心,Harness是模型之外的一切:系统提示、工具接口、权限控制、沙箱、反馈循环、验证机制等。这一概念由HashiCorp联合创始人Mitchell Hashimoto于2026年2月首次提出并命名。OpenAI随后发布报告,实证三人团队5个月生成约100万行生产代码、1500个PR。Anthropic也发布多篇工程文章,聚焦长运行Agent的Harness设计。
Harness核心架构——五大模块与三大原则
五大工程模块
Harness的核心架构由五大工程模块构成。Context解决“AI应该知道什么”,涵盖Knowledge、Memory、Compression;Orchestration & State解决“任务如何推进、现在做到哪里”,涵盖Workflow、Runtime、Multi-Agent、State Management;Feedback & Verification解决“如何证明任务真正完成”,让AI从“认为完成”变成“证明完成”;Observability解决“系统如何长期运行”;Governance解决“如何安全、可维护地运行”。
三大设计原则
原则一是“约束要小而明确”——最小权限、显式约束、失败收敛,让模型始终运行在可预测的范围内。原则二是“循环要可控可恢复”——状态可恢复、反馈结构化、循环有边界。原则三是“质量要可验证不可假设”——验证优于信任、风险决定自主权、可观测性。
OpenAI vs Anthropic——两种典型实践路线
OpenAI Codex——像工程师一样工作
OpenAI Codex代表“让Agent进入真实开发流程”的路线。三人团队5个月产出100万行生产代码、1500个PR。Constraints层补充工程基础设施而非优化Prompt;Execution Loop层人定义目标、AI执行循环;Quality Gate层通过Agent互审达成共识。
Anthropic Claude Code——严控执行动作风险
Anthropic Claude Code代表“严控执行动作风险”的路线。细粒度权限控制体系涵盖文件读取/修改、Shell执行,通过Allow/Ask/Deny策略实现最小权限原则;通过Compaction维持上下文连贯;高风险命令需确认、修改文件需授权。
两者走向相同——Harness三层模型成为基础工程范式
两者最终走向相同:通过约束控制行为,通过循环提升能力,通过验证保证质量。这验证了Harness三层模型——Constraints → Execution Loop → Quality Gate——正在成为构建下一代Agent系统的基础工程范式。
北大青鸟这份Harness Engineering报告的最大价值在于:它把“驯服Agent”从一个模糊的工程直觉,提炼为一套可复用的工程范式。当AI Agent从演示走向生产环境,真正的挑战不是模型能否生成内容,而是系统能否保证任务被可靠完成。Agent=Model+Harness的核心公式、四阶段演进路径、三大设计原则——这些共同构成了驾驭Agent的方法论基础。未来属于那些善于设计规则、构建环境,并勇敢驾驭智能系统的人。