Pi+OpenCode Go+Herdr:极简Harness每月省出六倍token!

别再迷信那些花里胡哨的AI编程工具了!你被工具绑架了,而你自己还不知道!

2026年,AI编程工具遍地都是,但真正能帮你写代码的,可能恰恰是最不起眼的那一个。



过去一年,AI编程工具市场彻底疯了。从Anthropic的Claude Code到GitHub Copilot,从Cursor到各种开源方案,每个开发者手里至少捏着两三个工具。但一个诡异的现象正在发生——工具越用越多,代码越写越慢。有人花10分钟让AI改一个函数,有人2分钟搞定同样的事。

差别不在模型,而在那层包裹模型的壳。这层壳,行话叫“harness”,中文可以理解为“鞍具”——你骑的是AI这匹马,但真正决定你跑多快的是你给它套了什么鞍。

更离谱的是,Composio公司做了一组对照测试:把同一个AI模型塞进8种不同的鞍具里,跑同样的30个任务。结果Pi Agent跑通了20个,胜率66.7%,而OpenCode只过了14个。模型一模一样,差距接近一半。这就怪了!



你以为你在用AI,其实你在被工具喂“思维垃圾”

打开Claude Code,系统提示词先往上下文里塞上万字。行为规则、格式要求、安全约束、工具使用范例——每一层都是“好心”的指导,每一层都在吃掉你的上下文窗口。你问它一个简单问题,它先背一遍说明书。你问它改三行代码,它先把整本“员工手册”读给你听。

Pi的开发者Mario Zechner——就是那个写了libGDX游戏框架的人——干了件反直觉的事。他把Pi的系统提示词砍到了200个token左右。200个token什么概念?大概就是“你好,请帮我写代码”这句话的30倍。Claude Code塞一万字说明书的时候,Pi只说了四个字:“写吧,我看着。”

结果呢?Composio那组测试里,Pi不仅任务完成率最高,单次成功任务的成本只要0.028美元。四个工具、一句提示、一个循环,没了。没有子代理、没有MCP服务器、没有计划模式、没有权限弹窗。你需要的功能,自己用扩展加进去;你不需要的,它一个字都不多写。

更狠的是Pi能自己改自己。用户提个需求,它直接编辑自己的提示词、工具和扩展库。你的工作流在变,它跟着变。别的工具让你适应它,Pi让它适应你。这不是一个编码助手,这是一个会自我进化的编码生物。



但等等,极简主义真的是唯一答案吗?

别急着卸载你手里的Claude Code。事情没那么简单!

Moonshot公司(就是做Kimi K3那个团队)发过一个重要警告:他们的模型是专门训练来保留思考历史的,如果鞍具不能正确返回这段历史,模型表现会变得极其不稳定。换句话说,不是所有模型都适合“裸奔”。有些模型需要鞍具帮它“背台词”,你把它扒光了,它反而不会演了。

Composio的另一组测试也印证了这一点。把Kimi K3分别装进三个不同的鞍具——Kimi Code、Hermes和Claude Code——完成率都在20-22个任务之间,差别不大。但中间消耗的token数,从6.1万到34万不等,差了将近六倍。任务做完了,但有的人花了一块钱,有的人花了六块钱。同一个模型,同一组任务,账单差了六倍。这不是模型的问题,这是鞍具在烧你的钱。

Moonshot自己也在不同测试里用不同的鞍具——Kimi Code、Claude Code、Codex换着用。他们自己都没找到一个“万能鞍”。这说明什么?说明鞍具和模型之间是配对关系,不是谁比谁绝对好。你用Claude自家的模型配上Claude Code,可能丝般顺滑;但你非要把Kimi塞进Claude Code里,那就是给法拉利发动机配了个拖拉机的变速箱。

所以极简主义不是万能药。Pi的“裸奔”策略在某些模型上跑得飞快,换一个模型可能就翻车。关键在于——你知道自己在配什么吗?



“每月10美元随便用”——这个定价在骗谁?

OpenCode Go,每月10美元,首月只要5美元。给你访问十几个开源编程模型,包括DeepSeek V4、Qwen3.7 Max、Kimi K2.7 Code。不用自己对接API、不用管计费、不用操心密钥管理。听起来像是把AI模型做成了Netflix订阅——付一次钱,随便看。

但仔细看细则:每月60美元的使用额度封顶。每5小时滚动限制12美元。这哪里是“随便用”?这是“给你一个预算,超了自己想办法”。只不过他们把预算打包进了月费里,让你感觉不到单次调用的疼痛。

问题是——你真的用得了那么多吗?如果你用Pi这种token效率极高的鞍具,每月10美元可能绰绰有余。但如果你用Claude Code那种动辄34万token完成一个任务的鞍具,10美元?一个复杂任务就烧掉2美元。月费60美元的额度,撑死做30个任务。这哪里是订阅,这是预付费套餐换了件马甲。

更微妙的是,OpenCode Go给的是“开源编程模型”的入口。这些模型本身是开源的,你完全可以自己部署、自己调API。他们卖的不是模型,是“省事”——你不用自己搭服务器、不用自己管负载均衡、不用自己处理计费。但对于真正在乎成本的开发者来说,省事和省钱从来不是一回事。



Herdr:让AI代理学会“放牧”自己

如果你还在用tmux管理终端窗口,Herdr可能会让你重新思考什么叫“终端复用”。

Herdr本质上是一个专门为AI代理设计的终端多路复用器。打开它,所有正在运行的代理一览无余——哪些在干活、哪些卡住了、哪些已经干完了。你可以随时detach离开,代理在后台继续跑;从任何终端重新attach回来,会话完好无损。甚至通过SSH远程重连都行。

但真正狠的是这个:代理自己可以用Herdr。Herdr提供了一个纯socket API,代理可以自己创建面板、读取输出、等待其他代理完成。这意味着什么?意味着一个Pi代理可以自己启动另一个Pi代理,让它去干别的活,然后等它干完再把结果拿回来。

原文里提到一个细节:他不使用任何支持子代理的Pi扩展,因为Herdr本身就解决了这个问题。一个主控代理通过Herdr启动多个工作代理,每个代理在自己的工作树里干活,互不干扰。没有后台运行的子代理,所有输出都可以随时检查和验证。这哪里是终端复用器,这是一个代理编排系统!

Herdr用Rust写的,单二进制文件,不需要Electron那种庞然大物。你已经在用的终端,直接跑就行。键盘和鼠标都支持——想用tmux风格的前缀键也行,想点鼠标拖拽分屏也行。这是一个把“终端工具”做到极致的产物。它不试图取代你的IDE,它只做一件事——让多个AI代理在同一个终端里协同工作,而且让你看得清清楚楚。



一个4000万token的陷阱:你以为省了,其实亏大了

2026年3月到4月,Anthropic的Claude Code出了大事。连续三个产品层的改动导致大量用户的使用体验严重退化。Anthropic不得不公开发布事故报告——这在AI工具厂商里极其罕见。

但比事故本身更值得琢磨的是事故背后的逻辑。Claude Code的系统提示词上万字,工具十几个,权限管理分五档,子代理、MCP、计划模式一应俱全。这是一个精心设计的“安全网”——每多一层保护,就多一层token消耗;每多一个功能,就多一次上下文轮转。

Pi的作者在对比文档里写了一句值得玩味的话:“编码代理的安全基本上都是演戏;如果它能写代码和跑代码,游戏就已经结束了”。翻译一下:你给AI装再多的权限弹窗和安全沙箱,它本质上还是一个能执行任意代码的程序。真正的安全不来自工具的限制,来自你盯着它干活。

Pi的信任模型更简单:“前沿模型已经被RL训练得够够了,它们天生就知道编码代理是什么”。与其给模型上万字的“行为守则”,不如相信它本来就会干活。Claude Code选择把复杂性藏在鞍具里——用户不用想,但代价是token狂烧。Pi选择把复杂性交到用户手里——你想加什么自己加,不想加就别加。两种哲学,两种账单。

Composio的测试把这件事量化得清清楚楚。握住模型不变,只换外面的鞍具——系统提示词、工具循环、上下文管理这些“编排选择”——产生的经济差异比成功率本身的差异大得多。你选错鞍具,不是在选错工具,是在选错账单。



“三个相似的代码行比过早的抽象好”

这句出自Pi对比文档里的话,几乎可以当成整个极简主义编程哲学的墓志铭。

Claude Code的哲学是“为每个工程师准备的工具”——电池全包,什么水平的人都能用。Pi的哲学是“如果我不需要它,它就不会被构建”——只为一个工程师的工作流服务,极简、有主见。前者讨好所有人,后者只讨好自己。但问题是——你到底是“所有人”中的一个,还是那个“自己”?

Pi只有四个核心工具:读、写、编辑、bash。系统提示词不到1000个token。它不原生支持子代理、不原生支持MCP服务器、不原生支持插件。它给的是一个空白画布,以及一套让你自己往上画东西的工具。你要web访问?装个扩展。你要MCP?装个适配器。你要知识图谱?再装一个。每一样都是可选的,每一样都是你主动加进去的。

这种“乐高式”的搭建方式,和Claude Code那种“开箱即用”的体验,背后是两种完全不同的时间观。Claude Code帮你省了搭建的时间,但每次调用都多花token的钱。Pi让你花时间搭建,但每次调用都省token的钱。短期看,Claude Code赢;长期看,Pi赢。问题只在于——你的项目活得了那么久吗?



你回不去了

读到这里,你已经知道了一个没法逆转的事实:AI编程工具的效率差距,不在模型,在鞍具。同一个模型,换一个壳,token消耗能差六倍。这不是优化问题,这是架构选择问题。你选的不是工具,你选的是成本结构。

你也没法再天真地相信“功能越多越好”了。Claude Code的每一次版本更新都可能让性能倒退;Pi每次迭代都在砍掉不需要的东西。堆功能不是进步,堆功能是在给上下文窗口喂安眠药。

你更没法假装没看见那个核心矛盾了:工具厂商希望你用得越多越好——token越多、调用越多、订阅越贵,他们赚得越多。但你希望花得越少越好——token越省、速度越快、账单越便宜。这两个目标根本是反的。你信了厂商的“为你着想”,就是在帮他们掏你的钱包。

Pi、OpenCode Go、Herdr这套组合拳打的是同一个方向:把控制权还给你。Pi让你自己决定加什么功能;OpenCode Go把模型入口打包成月费,让你不用关心单次调用的疼痛;Herdr让你同时盯着所有代理干活,而不是在黑盒里猜它们在干嘛。这三样东西拼在一起,是一个完整的“反工具崇拜”工具箱。

但别高兴太早。Herdr还在活跃开发中,核心功能能用但别指望生产级稳定。Pi的“裸奔”策略在某些模型上可能翻车。OpenCode Go的“10美元随便用”细看是60美元封顶的预付费套餐。这套东西远称不上完美——原文作者自己都说“每天都在折腾”。

但至少方向对了。方向是——工具应该消失,而不是刷存在感。你打开终端,敲几个命令,AI帮你把活干了,你关掉终端去干别的事。中间不需要弹窗、不需要权限确认、不需要读一万字的系统提示词。工具越透明,你越自由。

这事还没完。Composio那组测试里,Pi跑了66.7%的胜率,但剩下33.3%的任务它也没搞定。是模型不行还是鞍具不行?没人知道。因为测试只换了鞍具,没换模型。如果把DeepSeek V4 Flash换成Claude Opus 4.8,Pi还能跑出同样的胜率吗?如果换成一个更便宜的开源模型,Pi的“裸奔”策略还奏效吗?这些实验还没人做。而这些答案,才是真正决定你该选什么工具的关键。

你可以在评论区告诉我你的答案。或者更好——自己去跑一遍实验,然后告诉我结果。

总结:

  • Pi 负责“脑子怎么转”——它是执行代码任务的鞍具(Harness),管的是代理循环、工具调用和系统提示词怎么跑;
  • OpenCode Go 负责“燃料从哪来”——它是大模型的入口(Gateway),每月10美元让你调取DeepSeek V4、GLM等开源模型,没有它Pi就是个空壳子,没脑子可用;
  • Herdr 负责“手脚怎么配合”——它是终端编排器(Orchestrator),让Pi能自己开新窗口、分屏干活,甚至再启动另一个Pi实例去干别的活。