【上下文工程/Agent】上下文工程与 Agent 设计的新趋势:
Google关于Harness Engineering的综述pdf 2026年AI工程的核心公式:Agent = Model + Harness。 一份汇总了 Google、OpenAI、Anthropic、LangChain 和 Cursor 工程师实践的综合文档揭示了为什么 95% 的企业 AI Agent 不能成功上线——不是模型不够强,而是缺了一个叫「harness engineering」的东西。 1. 从 Prompt 到 Context 再到 Harness,三段式的进化 2023 到 2024 年在优化 prompt:措辞、例子、思维链。 2025 年在设计上下文系统:RAG、MCP、记忆、检索。 到了 2026 年初,从业者汇聚到了一个更高层级的方法——Harness Engineering。 每个阶段都包含了前一个阶段的要点。一个 harness 包含上下文管道和 prompt,同时还包含验证机制、权限控制、可观测性和状态持久化。 Prompt engineering 决定模型说什么,context engineering 决定模型看到什么,而 harness engineering 决定模型能做什么、失败后发生什么、什么叫成功完成。 2.换 harness 比换模型带来的提升更大 1)把 Claude Sonnet 4.5 放到 GAIA 基准上测试,最小 harness 下得分 30.91%,升级生产级 harness 后得分为 74.55%。同样的模型,纯靠换 harness 提升了 43.64 分——比大多数相邻代际的模型升级带来的差距还要大。 2)LangChain 团队把编码 Agent 在 Terminal Bench 上的排名从第 30 位提升到第 5 位,没有更换模型。提升完全来自 harness 优化:更好的 guide 规则、更紧密的传感器循环、改进了错误恢复和工具配置。 3)安全研究员在一个下午改了 16 个不同 LLM 的工具调用格式和编辑方式,几乎所有模型的分数都有改善。没有微调、没有重训、没有替换模型。 保持模型固定,只换 harness——这个变量就能产生堪比模型升级的效果。 3.六层架构:构成完整 harness 的基础设施一个无人值守运行的 Agent,最少需要六层结构。每一层解决一个特定的问题。 第一层是 Guides(引导),即执行前的前置控制。核心文件是 AGENTS.md、CLAUDE.md、.cursorrules。每一行代表一次过去失败的修复方案。Mitchell Hashimoto 的做法是把 Agent 犯错的每一个 case 逐行写入 guide,每个 entry 对应一个具体的错误。Guide 应该包含可执行的行动和可观察的标准,而不是口号——用 lint 命令和测试命令代替「写好代码」这种空话。 这里有一个关键概念叫棘轮原理:每次出错后,永久改进系统。流程是六个步骤——Agent 犯错、归类失败类型、确定最强修复层级(guide、sensor、tool 或 permission)、编码修复、验证防复发、监控回归。prompt 补丁只能修一次对话,guide 规则可以防止每一次未来的运行。 第二层是 Sensors(传感器),即执行后的反馈控制。传感器的经济账很清楚:计算型传感器(linter、类型检查器、单元测试)每次运行成本几乎为零,返回确定性结果;推理型传感器(LLM as judge)成本高、结果不确定。原则是先用计算型传感器,覆盖不了的再考虑推理型。 最强的 h…
吴恩达(Andrew NG):一项关键的 AI 工程技能,就是会使用编码智能体(coding agents)。 你越擅长指挥它们 —— 无论是写代码,还是分析数据、管理系统这类非代码的活 —— 能干成的事就越多。 编码智能体更新换代很快,所以这项技能本身也日新月异,迭代速度比大多数顶级 AI 工程技能都要快。专有智能体(如 Claude Code、Codex、Cursor)和开源智能体(如 OpenCode、Pi)在框架和模型两个层面都在大步前进。想跟得上它们的使用方法,就得不断地实验、动手搭建、持续学习。 我们采访了几十位顶级 AI 工程师,也复盘了自己团队用编码智能体的经验,发现用它们开发软件有一套一致的高层工作流,关键环节如下: 1. 规划。 这一步包括:(i)头脑风暴 —— 可能要查资料、做实验、摸清现有代码库(如果有的话);(ii)写一份规格说明,把需求、技术设计和架构都写清楚,再据此生成执行计划。写完后你可能还要回头审视计划,追问关键假设是否成立,检查有没有