【上下文工程/Agent】上下文工程与 Agent 设计的新趋势:
Google关于Harness Engineering的综述pdf 2026年AI工程的核心公式:Agent = Model + Harness。 一份汇总了 Google、OpenAI、Anthropic、LangChain 和 Cursor 工程师实践的综合文档揭示了为什么 95% 的企业 AI Agent 不能成功上线——不是模型不够强,而是缺了一个叫「harness engineering」的东西。 1. 从 Prompt 到 Context 再到 Harness,三段式的进化 2023 到 2024 年在优化 prompt:措辞、例子、思维链。 2025 年在设计上下文系统:RAG、MCP、记忆、检索。 到了 2026 年初,从业者汇聚到了一个更高层级的方法——Harness Engineering。 每个阶段都包含了前一个阶段的要点。一个 harness 包含上下文管道和 prompt,同时还包含验证机制、权限控制、可观测性和状态持久化。 Prompt engineering 决定模型说什么,context engineering 决定模型看到什么,而 harness engineering 决定模型能做什么、失败后发生什么、什么叫成功完成。 2.换 harness 比换模型带来的提升更大 1)把 Claude Sonnet 4.5 放到 GAIA 基准上测试,最小 harness 下得分 30.91%,升级生产级 harness 后得分为 74.55%。同样的模型,纯靠换 harness 提升了 43.64 分——比大多数相邻代际的模型升级带来的差距还要大。 2)LangChain 团队把编码 Agent 在 Terminal Bench 上的排名从第 30 位提升到第 5 位,没有更换模型。提升完全来自 harness 优化:更好的 guide 规则、更紧密的传感器循环、改进了错误恢复和工具配置。 3)安全研究员在一个下午改了 16 个不同 LLM 的工具调用格式和编辑方式,几乎所有模型的分数都有改善。没有微调、没有重训、没有替换模型。 保持模型固定,只换 harness——这个变量就能产生堪比模型升级的效果。 3.六层架构:构成完整 harness 的基础设施一个无人值守运行的 Agent,最少需要六层结构。每一层解决一个特定的问题。 第一层是 Guides(引导),即执行前的前置控制。核心文件是 AGENTS.md、CLAUDE.md、.cursorrules。每一行代表一次过去失败的修复方案。Mitchell Hashimoto 的做法是把 Agent 犯错的每一个 case 逐行写入 guide,每个 entry 对应一个具体的错误。Guide 应该包含可执行的行动和可观察的标准,而不是口号——用 lint 命令和测试命令代替「写好代码」这种空话。 这里有一个关键概念叫棘轮原理:每次出错后,永久改进系统。流程是六个步骤——Agent 犯错、归类失败类型、确定最强修复层级(guide、sensor、tool 或 permission)、编码修复、验证防复发、监控回归。prompt 补丁只能修一次对话,guide 规则可以防止每一次未来的运行。 第二层是 Sensors(传感器),即执行后的反馈控制。传感器的经济账很清楚:计算型传感器(linter、类型检查器、单元测试)每次运行成本几乎为零,返回确定性结果;推理型传感器(LLM as judge)成本高、结果不确定。原则是先用计算型传感器,覆盖不了的再考虑推理型。 最强的 h…
看了晚点团队写的文章《汽车企业用 AI,为什么从飞书开始?》,还是很有收获的,虽然看着像是飞书的广告。 有一个问题值得想一想:同样一个 AI 大模型,为什么进了 A 公司能帮大忙,进了 B 公司却只会写写总结、做做会议记录? 差别不在模型本身,在于这个 AI 到底了不了解这家公司。 它需要知道公司正在推进什么项目、过去做过哪些决定、中间出过什么问题。这些信息,行话叫“上下文”。没有上下文,AI 就像一个刚入职的实习生,什么都不知道,你问它啥它只能给你一个通用答案。 汽车行业把这件事说得最清楚。造一辆车,背后牵着需求、软件、硬件、测试、制造、供应链一整条链。改一个辅助驾驶功能,算法、控制器、整车测试全都要跟着动。如果 AI 只看到一份文件,根本不知道这个改动影响了哪些地方。 过去,这些信息散落在邮件、Word、Excel、会议记录里,东一块西一块,人找起来都费劲,更别说 AI 了。 于是一批车企开始用飞书,把文档、消息、会议、表格、项目流程都汇到同一个地方。上汽和联合汽车