智能体版OpenRouter上线:AgentSky让Claude Code和DeepSeek当面打架

150美元一次的任务,换了个工具只要2美元,中间差的148美元到底去哪了!

同一个任务,一次花掉150美元,另一次只花了2美元,差别大到让人怀疑是不是算错了!


同一个编程任务,用Claude Code跑一遍花了150美元,换成DeepSeek的代理工具跑,只花了2美元。这不是什么打折促销,也不是什么bug,就是实打实的两笔账单摆在你面前。150美元对2美元,整整75倍的差距。你自己跑一遍同样的任务,结果也一样。

这不是个别现象。Claude Code在企业部署场景下,每个开发者每个活跃日的平均成本大约是13美元,折算下来每月150到250美元。而DeepSeek V4 Flash的定价呢?输入每百万tokens只要0.14美元,输出0.28美元。一个天上一个地下。更夸张的是,DeepSeek V4 Pro的API价格只有Claude Fable 5的六十分之一。

所以问题来了:跑同一件事,凭什么差这么多?贵的那个到底贵在哪?便宜的那个真的能打吗?


贵的那个,钱烧在了你看不见的地方

先别急着下结论说哪个好哪个坏。你得先搞清楚这150美元是怎么烧掉的。

Claude Code的计费方式是按token算的。Opus 4.6每百万输入tokens收5美元,每百万输出tokens收25美元。一个稍微复杂点的编程任务,来回对话几十轮,token消耗轻松破百万。再加上代理在工作过程中会反复调用工具、读取文件、生成代码、检查错误,每一步都在烧token。

而且这还不是全部。Claude Code官方文档自己都承认,企业部署场景下每个开发者每月要花150到250美元。注意,这是官方估算,不是网友瞎猜的。更狠的是,Anthropic还悄悄上调过这个估算,从原来的每天6美元翻倍到13美元。也就是说,连官方自己都觉得之前算少了。

有人会说,那我订阅Pro套餐不就行了?20美元一个月随便用。但问题是,Pro套餐的额度是有限的,一旦超出,还是按token计费。重度用户每月花到1200美元以上的比比皆是。所谓订阅,不过是个入门券而已。

那DeepSeek呢?V4 Flash每百万输入tokens只要0.14美元,输出0.28美元。同样是跑一个任务,token消耗量差不多,但单价差了十几倍到几十倍。2美元对150美元,就是这么来的。

但等等——如果只是模型调用费差这么多,那为什么不所有人都用便宜的?事情没那么简单!


便宜的那个,藏着更大的麻烦

便宜有便宜的道理,但便宜也有便宜的代价。

DeepSeek的模型确实便宜,但便宜不意味着好用。有人花了整整一周时间用DeepSeek配合编排器排查一个严重bug,多个提示器全天候运行,一周后bug还在。换成Claude Opus 5,三个小时就搞定了。

这不是个例。在编码任务上,Claude Code的速度和完成率确实有优势。但问题是,这种优势值不值那个差价?有人做过对比:Claude Code搭配Fable 5的完成率是97.6%,Codex搭配GPT-5.6 Sol是95.9%,只差了1.7个百分点,但后者的价格只有前者的一半不到。另一个测试里,两者的完成率只差0.9分,但中位数价格差了2.6倍。

也就是说,贵的那个不一定好那么多,便宜的那个也不一定差那么多。问题的关键变成了:你怎么知道哪个工具适合哪个任务?

更麻烦的是,每个代理工具都有自己的运行环境、工具链、状态管理方式。Claude Code有一套,Codex有一套,DeepSeek的代理工具又有自己的一套。你想换一个试试?重新配置环境、重新挂载工具、重新初始化状态,折腾下来半天就没了。有人说得特别直接:每次想试新东西都要重新搭建工作流,太烦了。

这就是那个150美元和2美元故事背后真正让人头疼的问题——你根本不知道哪个工具最适合当前这个任务,而试错的成本太高了!


一个API通吃所有代理,这招够狠

如果有一个东西,让你用一个API就能调用所有主流代理工具,还能在浏览器里并排对比它们跑同一个任务的表现,你会不会想试试?

这就是AgentSky在做的事。它把自己定位成"智能体版的OpenRouter"——OpenRouter是让一个API调用多个大模型,AgentSky是让一个API调用多个代理工具。Claude Code、Codex、DeepSeek、Kimi、OpenCode,你想用哪个就用哪个,不用重新搭建环境,不用重新配置工具。

听起来像个路由器对吧?但创始人自己说了:我们是一家伪装成路由公司的基础设施公司。什么意思?路由只是表面,真正难的是状态管理和工具兼容性。

你想啊,一个代理在工作过程中会产生大量状态——读了什么文件、执行了什么命令、生成了什么代码、跟哪些外部工具发生了交互。如果从Claude Code切换到DeepSeek,这些状态怎么继承?工具怎么重新挂载?会话上下文怎么延续?这些问题才是真正的拦路虎。AgentSky把这些全包了。

更狠的是它的定价模式。没有订阅费,没有按座收费,注册就送3美元额度。代理在工作的时候才收费,闲置或暂停的时候完全免费。一个4GB的默认机器,每小时 awake 状态只收大约0.07美元。

有人算过一笔账:自己维护一个AI代理,光是运维的人力成本每月就要150到250美元。AgentSky把这块全砍掉了。你只需要选择要用的代理框架和模型,一键启动,剩下的全交给云端。

但等等——免费停放听起来很美好,可如果代理悄悄死掉了,你也不知道,账单上看起来和正常运行一模一样,这不是更麻烦了吗?


并排对比,让代理们当面打一架

AgentSky最狠的一个功能叫Agent Playground。

什么意思呢?你在浏览器里打开它,给Claude Code、Codex、DeepSeek同时下达同一个任务,让它们并排跑。时间、成本、token消耗,全部实时对比。这相当于让几个代理当面打一架,谁快谁慢、谁贵谁便宜,一目了然。

有人专门干这种事——反复跑同一个任务来测试不同代理的表现。但以前你得自己搭环境、自己记录数据、自己对比。Agent Playground把这些全自动化了。

更重要的是,你可以用自己真实的工具来测试——GitHub、Gmail、Slack,你想挂什么挂什么。不是跑什么标准化benchmark,而是跑你自己的任务,用你自己的数据,看哪个代理真的能帮到你。

这解决了什么问题?解决了"不知道该选哪个"的问题。以前你只能听别人说哪个好,现在你可以自己试。而且试错的成本几乎为零——注册送3美元额度,闲置免费,跑一次任务可能也就几美元。

有人质疑:LiteLLM也能做类似的事情,而且是开源的。但LiteLLM做的是模型路由,AgentSky做的是代理路由,这两件事的复杂程度完全不在一个量级。模型路由只需要把请求转发给不同的模型API就行了。代理路由要考虑状态持久化、工具兼容性、会话连续性、跨渠道访问。一个代理可以在WhatsApp上启动任务,切换到Slack继续,再从网页查看进度,同一个代理跟着你走。这哪是路由,这是托管。

那问题又来了:如果切换代理这么容易,用户会不会每次都选最便宜的那个?那贵的代理还怎么活?


贵的和便宜的,谁也别想一家独大

回到最开始那个问题:150美元和2美元,到底哪个才是正确答案?

答案是:看任务。

有人用DeepSeek花了一周都没修好的bug,Claude Opus 5三个小时就搞定了。这种情况下,150美元比2美元划算——省下来的时间价值远远超过148美元的差价。反过来,如果只是个简单的代码重构或者文档生成,用DeepSeek两块钱搞定,何必花150?

问题的核心不是哪个便宜,而是你能不能快速判断哪个适合当前任务。AgentSky的逻辑就是:别纠结了,都试一遍。反正切换没成本,对比有工具,试完就知道了。

这个逻辑往深了想,其实在颠覆整个代理工具的商业模式。以前代理工具厂商卖的是"你只能选我"。Claude Code希望你只用Claude Code,DeepSeek希望你只用DeepSeek。但AgentSky让你可以同时用所有。你今天用Claude Code跑复杂任务,明天用DeepSeek跑简单任务,后天试试Kimi有没有新惊喜。没有忠诚度,只有性价比。

这对谁最有利?对用户。对谁最不利?对那些靠锁定用户吃饭的厂商。如果一个代理工具做得不够好,用户下一秒就切走了。没有什么比"一键切换"更能逼着厂商提升产品了。

但有一个细节值得琢磨:AgentSky自己不对模型API加价。它的收入来自哪里?来自代理的托管费和计算资源费。也就是说,它越能让用户频繁切换代理、越能让用户跑更多任务,它就赚得越多。它的利益和用户的利益是一致的——用户多试多对比,它多收托管费。这跟传统的"卖你一个工具然后希望你一直用"的逻辑完全不同。

这就能解释为什么创始人敢说"我们是一家基础设施公司"。基础设施不站队,谁的车都能在上面跑。


跑一次150美元和跑一次2美元,差别不是钱

有个细节特别有意思。有人在Product Hunt上给AgentSky提了一个尖锐的问题:如果代理免费停放,那一个死掉的代理和一个正常完成任务的代理,在账单上看起来一模一样——都是零费用。以前高昂的账单本身就是个信号,告诉你"出事了"。现在这个信号被故意去掉了。那你怎么知道代理是完成了、还在跑、还是已经悄无声息地挂了?

创始人没有回避这个问题。他说他们正在设计一个机制:代理启动时声明一个预期的活动节奏,平台来监控这个节奏,如果该醒的时候没醒,就主动报警。而不是让沉默本身成为信息——因为沉默可能意味着任何事。

这个细节暴露了一个更深层的问题:当基础设施变得太好用、太便宜的时候,你反而可能失去了一些原本用来判断"是否正常"的信号。就像服务器太稳定了你就不看监控了,结果出了问题也不知道。AgentSky正在解决的问题,恰恰是它自己制造的新问题。

还有一个更棘手的技术细节:如果代理在执行过程中拍了快照,恢复的时候,快照恰好拍在了一个外部操作(比如发送WhatsApp消息)的中间。恢复之后,代理不知道那条消息到底有没有发出去。重发一遍可能重复,跳过可能遗漏,而这两种错误只有一种能被用户看到。

这种问题没有标准答案。每个场景、每个工具、每个外部系统都不一样。AgentSky声称自己处理"工具状态和工具兼容性",但处理到什么程度、边界在哪里、出错了怎么办——这些问题的答案,目前还没人知道。

所以回到那个150美元和2美元的故事。那2美元的任务,真的完成了和150美元一样的结果吗?还是说它省了钱,但留下了你没发现的坑?那150美元的任务,是真的需要那么贵,还是说有一部分钱其实是在为你"不知道自己在做什么"买单?

没人能给你一个确定的答案。唯一确定的是:你可以自己去跑一遍试试。反正注册不要钱,前3美元免费。跑完了,你就有自己的答案了。