
DeepSeek Harness 就是这种路数。GitHub 的 Star 已经快到 16 万。热闹是真的热闹,围观的人也多,真掏钱下筷子的,开始发现味道有点怪。
怪在哪。

不是框架先掉链子,是“脑子”先卡壳。
前面很多人已经试过,DeepSeek V4 Flash 其实挺能打。写个网页版 Excel,搭个 3D 引擎,很多任务一把过。这种水平,放开源模型里,算站在前排了,不是凑数的。

可一换到 DeepSeek V4 Pro 正式版,事情就有点像刚换了台新发动机,马力表看着漂亮,真上路却频频熄火。接入 Codex 后,写个植物大战僵尸,豌豆打在僵尸身上,像雨点落棉花,没反应。再写个网页版 Excel,功能东缺一块西少一角,撤销恢复没有,左右对齐和居中像是摆设。
你说这是小毛病?

对开发者来说,这种毛病最烦。像菜市场买了条活鱼,回家一开膛,发现鱼肚子里是空的。不是不能吃,是膈应。
当时圈子里就有个普遍判断:别急,可能得配 Harness 一起用,才算把这台机器真正拧上电门。结果 Harness 一发,大家上手一试,还是那种熟悉的拧巴感。并不是个别倒霉蛋踩坑,社区实测反馈很一致——“V4 Pro 正式版 + Harness”,离灰度测试时那股子猛劲,还有距离。

问题慢慢就浮出来了。
有开发者说得很直白,V4 Pro 对 API 里“你把什么工具摆在它眼前”这件事,敏感得有点过头。像个新来的学徒,进厨房先不看菜谱,先看台面上摆了几把刀。刀多了,它反而发懵;刀少两把,手脚倒利索。

于是就出现了很滑稽的一幕。
Harness 的极简模式,只给 2 个核心工具。标准模式,一下摆出 25 个工具。照理说,工具多,路子该更宽。现实却像农村老汉分地,地块越多,越站在田埂上发呆,不知道先锄哪一垄。

极简模式下,模型轨迹里常能看到“we need”这类词,像几个人围着桌子摊图纸,先定主梁再砌墙。标准模式和 PTC 模式下,更常冒出“let me”,听着就像一个人边挠头边试探,“我先来一下看看”。社区把这两种状态,干脆叫成了“高效”和“低效”。
名字土。意思很准。
有人实测用标准模式做网页版 Excel,轨迹板里确实能看到“let me”。换成极简模式,成功率立刻往上蹿,一次把任务做完整,轨迹里也真的更多出现“we need”。
这说明什么。
不是它不会做。是它容易被带偏。
像一头本来能拉车的骡子,看见路边挂了二十五串玉米,先去闻哪串,反倒把车辕忘了。模型核心能力没丢,丢的是起跑姿势。
社区随后给了个很像老师傅“垫砖找平”的办法。GitHub 开发者 xiaobright 搞了个插件,叫 dsh-anchored-standard。玩法不复杂,心眼很深:第一轮只亮出 2 个核心工具,先把模型推上“高效轨道”;一旦它发出第一次 Tool Call,后面再把 25 个标准工具全放出来。
先给你一把剔骨刀。等你找准骨缝,再把整套家伙端上来。
这招有点意思。
装上之后,Harness 主界面里会多一个 “Anchored Standard (experimental)” 模式。这个模式下,植物大战僵尸那个“子弹打不中僵尸”的 bug 还在,说明问题没被一锅端。可网页版 Excel,已经能一次做成了。
这就很像修老电视。啪一下拍机壳,不是所有雪花点都没了,但至少能出人声了。
更关键的是,复杂任务开始有起色。
有个测试很能看门道。给开源 Excel 项目 Luckysheet 加权限管理系统,还得把原本“角色-权限”这套,细到“用户 ID - 角色 - 权限”。这活儿不是拼一个按钮一个页面,是得在接近 5 万个文件、几十个功能模块的老工程里穿针引线。谁能看懂业务脉络,谁才有资格下刀。
在 Anchored Standard 模式下,把思考强度拉到 Max,DeepSeek 能把这最后一题处理得不错。这种任务最怕“表面聪明”,一顿输出,改了一百处,漏掉最要命的那三处。它如果真能过去,说明跨模块理解和业务连线这块,至少摸到门槛了。
还没完。
有人又拿更硬的骨头试它:用 Three.js 写高精度人形机器人 3D 交互仿真系统。要求很离谱,几乎是照着机械工程系期末大作业来的。头、颈、胸腔、骨盆、上下肢、五指灵巧手,全都要。关节里还得讲减速器、执行器、轴承、法兰、螺栓。下蹲、行走、信息面板、视图切换,也都得有。
这种任务,平常很多模型写出来,外壳像人,骨头像晾衣架。远看是机器人,近看像五金店打烊前剩下的边角料拼起来的。
可这次做出来的东西,居然挺完整。界面里有零件信息面板,能看状态,能切运动模式,机器人本体也像模像样。选“下蹲”,它真能顺滑地下去,再起身。细看当然还不够,放大关节,看不到减速器那种机械细节。可别忘了,V4 Pro 没原生多模态能力,它是靠一堆几何和三角函数硬把空间关系算出来的。
这就有点像没见过活猪的人,靠屠宰场传下来的骨架图,居然把整头猪的站姿给拼出来了。
反过来看标准模式下的表现,就更扎眼。那边的机器人本体设计里塞了很多“线轴”充数,动作单一,只有走路,还是同手同脚,像刚学会遛弯的木偶。信息面板也贫血得厉害。
落差摆在那儿。
所以现在社区很多人基本认一个判断:所谓“高效模式”和“低效模式”,大概率不是幻觉。高效状态下,V4 Pro 的能力已经逼近 Claude Opus 4.8 这一档。至于要碰 Claude Fable 5,那还差点火候,至少从视觉建模效果看,没到那一步。
这件事有意思的地方,不在谁赢谁输。
在于模型太容易被“无关线索”牵鼻子走。
学界这些年一直盯着这个毛病。2026 年那篇《Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?》说得很明白:跟任务本身没啥关系的提示,也能把模型行为拐弯,甚至拐得更好。另一篇《Measuring LLMs’ Sensitivity to Paraphrased Opinion Prompt》更狠,意思差不多的话,你换个说法,模型反应差距很大,那后训练环节多半有点问题。
说白了,这玩意儿像个脾气古怪的伙计。你跟他说“把桌子搬过去”,他未必动。你换成“咱先把这块地方腾出来”,他反倒麻利了。
荒唐吧。
可现在看,真有点像这么回事。
当然,实锤还谈不上。官方没出来拍板,大家也只能拿一堆实验现象拼图。拼图像不像答案,是一回事。答案是不是官方认的那张图,又是另一回事。
再往下看,Harness 真正让人上头的地方,其实不是“它能不能把 Excel 和机器人写出来”,而是它那个能在运行时改控制流骨架的底子。有人已经开始做二创插件了。GitHub 上,补视觉能力的、自定义主题的,是最多的一拨。还有人把它改成自己的 Codex、WorkBuddy,甚至搞“套娃”:Harness 里嵌 Codex,Codex 里再套 Harness。
听着像俄罗斯套娃。真跑起来,更像后厨加灶台,锅上还架锅。
有开发者说,Harness 最大的特别之处,是运行时可以把单 agent 循环改成多 agent 协作循环。别家很多框架做不到这一手。它不是只给你一把锤子,是连你的手臂关节都允许临时改装。问题也来了:这种能力,到底在哪些场景里真有必要?
现在没人能给硬答案。
连测试那个复杂机器人仿真的案例里,DeepSeek 最后也只用了单一 Agent Loop。等于工具箱已经摆上满汉全席,最后还是只夹了盘花生米。
热闹归热闹,门道也有了。可那层窗户纸,离捅破还差一指头。
屏幕那头的人还在改插件,刷日志,看轨迹板上那几个词来回跳。像修车铺里几个师傅围着一台新来的怪车,扳手油乎乎的,嘴里却都没把话说满。