同一前沿模型,只改周围的基础设施,性能排行跃升二十多位——决定AI好不好用的不只是模型本身,还有你为它搭的那个运行环境。腾讯研究院这份报告系统解析了“驾驭工程”(Harness Engineering)的完整框架:从提示词工程到上下文工程再到驾驭工程的范式跃迁、前馈/反馈四象限组件体系、从“人在环内”到“人在环上”的位置跃迁。当AI的能力边界由你设计的Harness定义,人机协作正在从“与模型对话”走向“设计AI运行的环境”。
范式跃迁——从提示词工程到驾驭工程的三阶段
三阶段演进清晰可辨。2023-2024年提示词工程:研究怎么跟AI说话,调措辞、加示例、试格式,优化的是一次性输入。2025年上下文工程:光说清楚不够,AI还得看到正确的背景信息——文档、代码片段、历史对话,优化“给AI看什么”。2026年驾驭工程:不再优化输入,直接设计AI运行的环境——约束系统、反馈循环、验证机制、状态管理。
HashiCorp联合创始人Mitchell Hashimoto引爆这个概念:每次发现Agent犯了一个错,你花时间把解决方案工程化,让它再也不能犯同样的错。日积月累,约束、反馈循环、自动验证、文档同步、架构强制——加在一起就是Harness。XP极限编程早期实践者Chad Fowler给出精炼公式:概率在内部,确定性在边界。让AI在边界内自由发挥,边界本身严格、显式、机械化强制。
四象限组件——前馈、反馈、确定性与推理性的交叉矩阵
ThoughtWorks工程师Birgitta Boeckeler提出分类体系。控制方向分为前馈(AI行动之前预防)和反馈(之后检测纠正);信息性质分为确定性和推理性。两个维度交叉形成四个象限:前馈×确定性=模板和规范;前馈×推理性=设计原则和价值观;反馈×确定性=自动化检查(linter、测试、pre-commit hook);反馈×推理性=AI互审和专家评审。
大多数人只做了前馈,很少有人做反馈,更少人将反馈建立成一套系统。约束有三种不同经济学:规则约束是零和博弈(文本指令消耗上下文窗口,苏黎世联邦理工和清华研究:60行规则提升成功率4%,200行AI生成规则反而降低3%);工具约束是正和博弈(自动化检查不消耗注意力,正向提示注入使每次违规变成微型培训);架构约束是乘数效应(搭建更高效的架构让前两者处处生效)。
人的位置跃迁——从IntheLoop到OntheLoop
四阶段理解人在人机协作中的位置。第一阶段人在环外:给Agent一个任务然后听天由命。第二阶段人在环内:审查每一行产出,安全了但人成了瓶颈,很多人得出“AI没省时间”的结论。第三阶段人在环上:不满意时修产生产出物的系统,这是一个认知跳跃——要求从做事的人变成设计环境的人。第四阶段飞轮:用Agent改进Harness自身,评估表现、推荐改进、审批后自动应用。
从IntheLoop到OntheLoop的跳跃比想象中难——需要克制直接改产出的冲动。腾讯研究院内部经验:从200行规则精简到50行核心规则,Agent行为反而更稳定。更重要的转变是从修AI的输出转向修产生输出的系统。
大模型派与Harness派的辩论仍在继续。Anthropic工程师Boris Cherny称架构是“模型上最薄的包被”,OpenAI推理研究员Noam Brown认为在推理模型之上构建脚手架往往适得其反。但实际情况是双飞轮:更好的模型让Harness变薄,更好的Harness让模型在更复杂任务上可靠运行。Manus在6个月内重建5次,每次减少复杂度但同时开发了更多功能;Anthropic定期从Claude Code中删除规划步骤,但引入Claude Cowork和Claude Design等新Harness。