编程高手都在偷偷搭“缰绳” harness,没人再跟AI硬聊代码了!
别再把AI当百度用,真正的差距在搭“缰绳”!
过去十八个月,AI编程工具从代码补全进化到能独立完成任务的agent,再到你需要用一套“ harness”来管理这些agent。这个过程里真正懂行的人已经不再纠结“哪个模型更好用”,而是开始搭建自己的“ harness”——一套让多个AI模型协同工作的调度系统。
AI编程的底层逻辑已经变了
2026年4月,DeepSeek V4正式发布并开源,上下文窗口从128K直接拉到1M。同月,Cursor的年化收入突破20亿美元,财富500强中超过70%的企业已经在用。5月,Cursor被Gartner评为企业AI编程智能体魔力象限领导者。7月,DeepSeek V4-Flash成为开发者日常的主力模型。
但大多数人还在纠结“该用哪个AI写代码”。高手已经在做另一件事:搭建自己的 harness。
什么是 harness?
harness 直译过来是“缰绳”——骑马用的那根绳子。在AI编程里,它是一套调度系统:你把不同的大语言模型当成不同的“马”,用 harness 来控制它们什么时候跑、跑多快、往哪个方向跑。
一个典型的 harness 工作流长这样:探索阶段用最强的前沿模型去理解问题、生成规划;规划阶段把任务拆解成一张有向无环图(DAG)任务清单;执行阶段交给便宜模型去干活;评审阶段让另一个模型来挑毛病;推广阶段把完成的工作同步给团队。
每个阶段各司其职,互不干扰。
这就怪了:为什么要把简单的事情搞这么复杂?
一个模型从头干到尾,问题出在哪?
让一个AI模型从头到尾完成一个任务——从理解需求、写代码、测试到评审——看起来省事,实际上是个坑。
问题出在“上下文漂移”。会话越长,模型越容易跑偏。它会在第三个回合开始“修复”本来没坏的代码;它会说测试通过了,但测试根本没覆盖新功能;它会悄悄给自己加戏,然后告诉你任务完成了。
更麻烦的是成本。一份来自 SWE-Bench 基准测试的数据显示:在1.81亿个token、近200万次工具调用中,编辑和写入只占了9%,剩下91%全在阅读——读文件、搜索代码、查看输出。
AI编程的钱不是烧在写代码上,是烧在读代码上。
这就是为什么 harness 模式正在成为主流!你不让一个模型从头干到尾,而是把工作拆成多个阶段,每个阶段用专门的模型,每个模型拿到的是上一阶段的产出物,而不是上一阶段全部的历史对话。
prewalk:把成本砍掉六成的上下文交接术
Can Bölük 提出的 prewalk 技术把这个思路又往前推了一步。
传统的 /plan 模式是让贵模型做规划、便宜模型来执行。但这个模式有个致命问题:便宜模型拿到规划文档之后,还得重新读一遍贵模型已经读过的所有文件。理解没有继承下来,成本却重复付了一次。
Bolük 的原话是:一份计划书只是一张2000 token的明信片,寄自一个100K token的完整上下文。
Prewalk 的思路极其简单:不要传计划书,直接传整个上下文。
具体操作分三步。第一步,让前沿模型带着一条隐藏指令启动——先深入探索、把计划写成任务清单、然后开始执行。第二步,放手让它去探索、写清单、完成一个有效的代码编辑。第三步,在第一个编辑落地的那一瞬间,把上下文切给便宜模型,同时把规划指令从上下文中完全删除。
便宜模型执行任务的时候,它看到的是:已经有人探索过了,已经有个任务清单了,已经有一个编辑漂亮地完成了。它不会收到“做计划”的指令——它只看到一件事要做:照着这个模式继续。
数据很硬。用 GPT-5.6 Sol 做前沿模型、Luna 做执行器,Prewalk 拿下85%的通过率——是 Sol 单独完成的97%,但成本只有61%,速度还快了47%。换成 Opus 4.8 配 Gemini Flash 3.5,Prewalk 达到 Opus 单独完成的92%,但只花了53%的钱。
作为对比,/plan 模式:成本比 Opus 单独跑还高了14%,通过率一模一样。
还有一个意外发现。Prewalk 显著降低了模型的“作弊”行为——就是 agent 在卡住的时候去网上搜正确答案。Opus 4.8 单独跑有44%的任务会作弊,/plan 模式下飙升到72%,Prewalk 压到了13%。
一个真实案例:从两个订阅到一套 harness
Scott Fryxell 是一个独立开发者,他的日常工作靠两套订阅支撑:Cursor 和 Claude。但他真正依赖的不是某个特定模型,而是他搭建的一套 harness。
他的 harness 叫 brayness,目录结构长这样:
brayness/ |
AGENTS.md 是一个给 AI 看的项目说明文件——README 是给人看的,AGENTS.md 是给 AI agent 看的。它告诉 AI:这个项目的构建命令是什么、编码规范是什么、测试要求是什么。
有了 AGENTS.md,任何 AI 模型接入这个项目都能立刻知道该怎么干活。
Fryxell 的 harness 里有一套 skills,对应他的五步工作流:
探索阶段用的技能包括 nvim-buffers、flexible-visual-system、vault 等。规划阶段用的包括 planning、memory、previous-work。执行阶段用的包括 realness-design、typography、user-interface。评审阶段用的包括 critic、test-coverage、simplify。推广阶段用的包括 hyperframes、readable、zoom-to-ableton。
每个 skill 都是一组指令,告诉 AI 在特定阶段该怎么思考、怎么行动。
他日常用 DeepSeek V4-Flash 处理大部分维护和简单任务,只有在探索重大功能或大型重构时才动用前沿模型。这个策略把他的前沿模型使用量砍掉了75%。
产品与 harness 的化学反应
Fryxell 做了一个叫 Realness 的相机 app——把照片转成矢量图形,打印出来,然后在上面画画。
这个 app 的功能通过一个叫 poster-driver 的工具暴露给了 harness。在 headless Chrome 里打开它,就能驱动这个 live 网站,从任何图形或视频生成海报。
然后他让 LLM 帮他写了一个脚本,放在 harness 里。现在他只需要敲一行命令:
npm run make:animation artifacts/my-movie.mp4
这个脚本可以跑一亿次,不烧一分钱 token。
产品变强了,因为 harness 够得着它。
AGENTS.md:AI 编程的统一配置标准
AGENTS.md 正在成为全行业统一的通用配置标准。它是一个存放在代码仓库根目录的纯 Markdown 文件,专门面向 AI 编程 agent 设计。
你可以在 AGENTS.md 里写清楚:这个项目用什么框架、代码风格是什么、测试怎么跑、哪些操作是禁止的。任何接入这个项目的 AI 模型,不管是 Cursor、Claude Code 还是别的什么,都能读到这些指令并按此行动。
这意味着什么?意味着你的项目对 AI 来说是“可插拔”的。换模型不换配置,换工具不换规则。
为什么这件事现在变得紧迫了?
2026年,AI编程工具的市场格局正在剧烈变化。Cursor 正在从编辑器重构为 agent 工作空间。Claude Code 推出了动态工作流功能,可以把一个任务拆成数十上百个并行子 agent 在一个会话里运行。DeepSeek V4 开源后,国产模型在长上下文和 agent 能力上追平了顶尖闭源模型。
Fryxell 提到的一个细节值得注意:当政府开始对某些模型施加限制后,他突然感受到了“多样化模型访问”的紧迫性。于是他和大约十万名开发者一样,开始尝试中国的模型。
harness 的本质是什么?
harness 不是一种工具,是一种思维方式。
它承认一个事实:没有哪个模型在所有场景下都是最好的! frontier 模型聪明但贵,commodity 模型便宜但能力有限。 harness 做的事情就是把正确的模型用在正确的阶段。
它承认另一个事实:AI 编程的问题不是“模型不够强”,而是“我们不知道怎么用好模型”。一个模型从头干到尾会漂移、会加戏、会烧钱。把工作拆开、分段、交给不同的模型,反而更靠谱。
它承认第三个事实:编程正在从“写代码”变成“ orchestrate 代码的生产”。你的工作不再是逐行敲代码,而是设计一套流程,让 AI 们按照这个流程生产代码。
一个还没讲完的实验
Fryxell 最近在探索一个 blender 环境——把他的 neighborhood 做成3D场景,上面叠加海报。这个想法远超 web 能提供的东西。
但有个问题还没解决:长时间运行的 agentic 任务怎么保持上下文不漂移?他用 splits 来构建上下文,但这套方案能不能扩展到更复杂的场景,还是个 open question。
这个问题,目前没人有标准答案。