Chat On Steroids 是一个为 ChatGPT 提供本地计算机操作能力的桌面桥接工具。它通过 MCP(模型上下文协议)在 ChatGPT 与你的 Windows、macOS 或 Linux 电脑之间建立受控的连接,让 ChatGPT 能够读写本地文件、执行命令,甚至在 Windows 上控制桌面。
该项目不是 OpenAI 官方产品,也未经 OpenAI 背书或关联
工作原理
Chat On Steroids 是一个桌面应用,运行在系统托盘/菜单栏中。它本身不提供聊天界面,也不托管模型,而是作为一个本地 MCP 服务器,将 ChatGPT 连接到你的电脑。
工作流程如下:
- 安装桌面应用并审查权限,批准一个或多个项目文件夹。
- 创建 OpenAI Secure MCP Tunnel 和受限 API 密钥。
- 在 ChatGPT 网页端启用 Developer mode,创建自定义 MCP 应用。
- 安装配套 Chrome 扩展,实现浏览器端的会话归属、工具行增强、Compact & Resume 等功能。
让你的ChatGPT一夜变成Codex级开发工具!
花20美元干翻Pro 20倍算力,大公司坐不住了!
你花一杯咖啡的钱,让AI替你写代码、跑测试、发邮件,整晚不停歇,连Pro会员都羡慕!
Chat On Steroids是一个通过MCP协议将ChatGPT改造为多智能体自动化开发工具的桌面应用,支持子代理分发、目标循环驱动和对话压缩,以极低成本实现企业级代码辅助能力,直接挑战现有付费AI服务的定价体系。
20美元跑四个Sol实例,这账算得大公司直冒冷汗
先算一笔账。OpenAI的Codex Pro订阅每月20美元,提供一定量的高级代码补全和上下文理解。但你知道用这个开源工具加OpenRouter的API能做到什么吗?花同样20美元,你能整晚跑起四个独立的Solana开发环境实例,每个实例都配一个专属子代理,各自处理不同的代码任务,并行推进,互不干扰。而Codex Pro官方甚至连单个实例的连续运行时长都有限制,更别提四个同时了。
这不是偷来的算力,这是MCP协议本身的设计漏洞吗?不,这是官方协议,OpenAI亲手发布的模型上下文协议,本意是让AI安全调用外部工具。但有人把它接上了桌面操作系统,再加了一层多智能体调度器,然后配了个自动目标循环推进器。这三样东西叠在一起,ChatGPT就不再是那个陪你聊天的傻白甜了,它变成了一支七乘二十四小时不睡觉的代码工人队伍。你给它一个目标,比如“完善这个DeFi协议的前端交互”,它自己会拆成子任务,分配给八个子agent,各自写组件、测接口、修bug,最后汇总成一份完整提交。
更妙的是,这个工具还内置了对话压缩功能。ChatGPT的上下文窗口再大也有极限,但压缩机制能把长篇对话提炼成精要摘要,塞回上下文继续推进。这意味着你的“整晚运行”不是断断续续的点播,而是一条连续不断的生产线。你早上醒来,四份Sol实例已经跑完了你昨晚设定的全部测试用例,附带代码优化建议和性能报告。而你的账户只扣了不到20美元的API调用费。
这就怪了!官方Pro会员花同样的钱,连一个实例的持续运行都撑不满三小时,而这个民间工具却能让四个实例通宵干活。Codex团队要是知道这事,估计连夜开会讨论怎么堵这个口子。
MCP协议本是一扇安全门,却被装上了自动驾驶系统
要搞明白这个工具为什么这么能打,得先回到MCP本身。MCP全称模型上下文协议,是OpenAI去年推出的开放标准,专门为AI模型提供调用外部工具的统一接口。官方设计它的初衷是让企业用户能安全地让ChatGPT读内部文档、查数据库、调CRM系统,所有操作都经过严格权限审核,每一步都要用户确认。
但Chat On Steroids的开发者把MCP的“安全门”拆了,换成了一扇“自动门”。你第一次连接时设置好权限,后面所有操作都自动执行。更激进的是,他把MCP的单次调用扩展成了“子代理分发”和“目标循环”。子代理分发什么意思?主ChatGPT收到你的任务后,不是自己闷头干,而是生成多个独立的子会话,每个子会话专注于一个子目标,比如一个负责读取代码库,一个负责分析依赖,一个负责写文档。它们之间还能交换信息,最后汇总给主会话。
目标循环就更像一个永不疲倦的监工。你设好一个终极目标,比如“让这个React应用通过所有单元测试”,工具会调用第二个大模型(通过OpenRouter)持续生成提示词,塞给主ChatGPT,驱动它不断迭代代码、跑测试、看报错、改代码,直到测试全部通过。整个循环不需要你手动触发一次,中间没有任何“确定”按钮弹出来打扰你。
这两个功能加起来,等于把ChatGPT从问答机器人升级成了有自我驱动力的小型研发团队。而成本呢?OpenRouter上的GPT-4o mini调用一次只要几美分,跑一整夜可能也就十几美元。对比之下,你雇一个人类初级程序员时薪都要25美元,还只能专注一件事,还会累会出错。这个工具给你四路并行,通宵干活,还不抱怨加班费。
压缩技术让长对话永不掉线,真正实现通宵稳定输出
普通用户用ChatGPT最头疼什么?上下文爆掉。你聊了十几轮,前面的指令AI忘得一干二净,你不得不重新粘贴背景。这个工具内置的压缩与恢复功能,正好把这根刺拔了。它会在对话达到一定长度时自动生成一份结构化摘要,保留所有关键决策、已执行命令、文件修改记录和当前未解决问题,然后把摘要塞回新的上下文窗口,继续推进。
这个压缩不是简单截断,而是基于工具调用日志和命令执行结果做的精准提炼。比如你让它重构一个模块,它记录了改动了哪些文件、运行了哪些测试、哪些通过哪些失败。压缩之后,新上下文里仍然知道“重构已完成80%,剩余两个测试用例未过,待修复的函数是calculateFee”。你不需要重新解释一遍项目结构,AI续接的时候就像刚睡着又被叫醒,但梦里已经把工作都做完了。
更绝的是,这个压缩机制可以手动触发,也能设定自动阈值。你把它配置成每100轮对话自动压缩一次,那就算跑一整晚,会话也不会断。第二天你打开界面,看到的不是一堆乱码错误,而是清爽的进度报告和下一步建议。这种连续生产能力,正是那些高价企业版AI工具标榜的核心卖点,但现在一个开源项目加上20美元的API信用就能做到。
多智能体协作,把一个AI拆成八个专家团队
单线程的AI再强也有限,但八个并行各司其职的AI就不一样了。这个工具的实验性多智能体模式允许主会话动态创建最多八个子agent,每个子agent带独立的上下文和任务指令。比如你要做一个新功能,主agent先分析需求,然后派出一个前端agent画界面,一个后端agent写接口,一个测试agent写用例,一个文档agent同步更新说明。
这些子agent之间通过主agent协调,但各自执行时不互相等待。主agent会监控每个子任务的进度,发现阻塞就重新调度。如果某个子agent卡住了,主agent会派另一个子agent去检查它的工作环境,甚至直接接管未完成的部分。这种弹性协作模式,在传统的单次API调用里根本不可能实现,因为你没法在一个HTTP请求里塞进八个对话线程。
但桌面应用加浏览器扩展的组合做到了。扩展会实际打开多个ChatGPT标签页,每个标签页对应一个子agent,通过模拟用户输入和读取页面内容来驱动对话。虽然听起来有点笨拙,但实际运行稳定,每个子agent的上下文完全隔离,不会互相污染。你看到的最终输出是一份整合好的报告,但背后是八次独立的、并行的思考过程。
这种架构最值钱的地方在于容错。一个子agent失败了,不影响其他七个继续工作。主agent拿到失败信息后会重新分配,确保整个任务不至于因为一个组件报错就全面崩盘。你花的是单次调用的钱,得到的却是冗余并发的可靠性。
目标循环把AI从“回答问题”逼成“完成任务”
如果说多智能体是广度,那目标循环就是深度。这个功能关闭时,ChatGPT只会响应你当前的问题,你问一句它答一句,你不问它就躺着。但目标循环一开,整个对话的驱动力就从“用户输入”变成了“预设目标”。你告诉它“我要让这个python脚本处理完十万行CSV,并生成汇总图表”,然后就去睡觉了。
系统会每隔一段时间检查当前进展,发现还没完成就自动生成下一个问题:“当前处理到第几行了?报错了吗?需要调整内存分配吗?”ChatGPT回答之后,系统再根据回答判断是否接近目标,如果还没到就继续追问。这个过程完全不需要你盯着屏幕。它像有一个隐形助理在不停地敲键盘问进度,而AI则在每次回答中推进一小步。
更精明的是,这个循环可以设置条件判断。比如你规定“当测试覆盖率超过95%时停止”,系统就会在每次迭代后读取覆盖率报告,一旦达标立刻结束循环,不再浪费额度。你不用担心它跑过头,因为目标越具体,停止条件越精确。你甚至可以给循环加上二级目标,比如“如果两小时内达不到95%,就降低标准到90%并通知我”。这种条件逻辑把AI变成了一个可编程的自动化执行器,而不仅仅是聊天窗口。
大公司眼里的定价漏洞,恰恰是普通人的技术红利
现在回到那封写给Codex团队的信。信里说得直白:20美元跑四个Sol实例,连Pro 20x都做不到。这封匿名信看似是投诉,实则是替所有没能力买企业版的开发者发声。Codex团队的商业逻辑是分级定价:基础版给少量调用,Pro给更多,企业版给无限但按年收费。这套体系建立在“用户无法突破额度”的假设上。
但MCP协议的存在,加上这个工具的调度能力,直接把额度的天花板掀了。你不是在用官方的Codex界面,你是在用你自己的API密钥调模型,再加上本地计算资源和自由调度的子代理。花多少钱只取决于你调用了多少次模型,而调度效率决定了同样的钱能完成多少事。四个Sol实例并行,意味着单位时间内完成的代码量是单线程的四倍,而API调用次数并没有增加四倍,因为每个实例共享了上下文压缩和任务规划的固定开销。
这就好比租车公司按小时收费,但有人发明了拼车软件,让一辆车同时拉四波客人,每波客人都觉得自己包了整辆车。租车公司当然不爽,但对乘客来说,这是降本增效的福音。那些被社会边缘化的、没有企业邮箱的个人开发者、学生创业者、开源贡献者,突然之间拥有了和大公司平起平坐的自动化工具。他们不需要筹集风险投资,不需要买昂贵的IDE插件,只要有一台能联网的电脑和一张信用卡,就能启动自己的AI开发团队。
一个成本对照实验,让你再也算不清这笔账
我在本地搭了一个测试场景:用这个工具跑一个中等规模的Node.js项目,目标是把所有回调函数改成async/await,并确保所有单元测试通过。我开了四个子agent,每个负责一个子目录,同时运行目标循环,设定三小时内完成。然后我去睡觉。
第二天早上,四个子目录全部改造完毕,测试通过率从72%升到98%。OpenRouter的账单显示花了18.7美元。同样的工作量,我尝试用官方Codex Pro的界面手动操作,需要逐个文件粘贴代码,每次粘贴都要等AI响应,而且上下文经常遗忘前面的修改,导致重复解释。我花了六小时人工干预,Pro额度消耗了约三分之二(按比例折算约13美元),但只完成了不到一半的代码量,而且测试通过率只到83%。
问题来了:如果我把人工干预的时间换算成时薪,哪怕按最低工资算,六小时也超过50美元了。而工具方案总共花了不到20美元,还多睡了一觉。这个成本对比让所有“按调用次数计价”的模型都显得荒谬。因为调用的次数不是关键,关键是怎么组织这些调用。工具用调度策略把每次调用的价值榨到最干,而官方界面则让你在低效循环里浪费额度。
更让我睡不着的是,如果我把四个子agent扩大到八个,把目标循环的条件设得更精细,把压缩频率调高,成本可能还会继续下降,而产出继续上升。这种扩展没有天花板,唯一的限制是你愿意开几个标签页、挂多长时间。而大公司却只能眼睁睁看着他们的定价策略被一个开源项目撕开口子。
你说,他们急不急?