OpenRouter偷偷上线神秘模型,号称一周免费无限用,实测速度慢到怀疑人生!
免费的午餐真的存在吗?点进来看看这场大型翻车现场!
一款代号union-alpha的匿名大模型悄悄登陆OpenRouter平台,宣称对标顶级前沿模型且限时免费开放。实测吞吐量却只有每秒15到19个token,用户排队等回复等到睡着,跑分图表和真实编程体验严重脱节,所谓无限使用背后藏着速率限制的猫腻,这场免费试用到底值不值得凑热闹?
OpenRouter突然冒出一个匿名模型,谁在背后憋大招
OpenRouter是一个把全球各家大模型API聚合到一起的中转平台,开发者只要注册一个账号,就能通过统一接口调用OpenAI、Anthropic、Google、DeepSeek等几十家厂商的模型,不用一家一家去申请密钥。这个平台还有一个隐藏玩法,叫做stealth model,翻译过来就是隐身模型,专门用来让某些实验室匿名发布还没正式命名的新版本,收集真实用户的盲测反馈。
最近这个平台上冒出一个新条目,路径写着stealth/union-alpha。发布方没有公开自己的身份,模型卡片上也没有参数量、训练数据、上下文窗口这些关键信息,只挂了一张跑分图和一行小字,说接下来一周免费开放使用。
消息一出,围观群众立刻炸锅。有人猜是智谱清言的GLM系列新版本,理由是上一次类似操作的隐身模型最后被扒出来是GLM 5.3 Flash;有人猜是DeepSeek即将发布的V4.1;还有人猜是Anthropic或者xAI在憋大招。但截止目前,官方没有任何一家跳出来认领,真实身份成谜。
匿名发布这个玩法本身就很有意思。厂商这么做的动机很直接,就是想在不带品牌光环、不受粉丝滤镜影响的情况下,看看模型的裸实力到底怎么样。如果口碑好,正式发布时就能拿实测数据当宣传素材;如果翻车,反正没人知道是自家产品,悄悄撤下来重新调优就行了。
跑分图表画得漂亮,横坐标从60开始耍流氓
union-alpha挂出来的那张跑分图,第一眼看上去确实唬人。图上把它和Astra Max、Sol Medium、Luna Max、Gemini 3.8 Flash、DeepSeek V4.1这几个当红模型排在一起比,柱状图显示union-alpha在Deep SWE这个编程能力测试上的得分几乎顶到了榜首。
Deep SWE全称是SWE-Bench,是普林斯顿大学在2023年发布的一个软件工程基准测试,专门用来评估大模型解决GitHub真实issue的能力。测试方法是给模型一个开源项目的bug报告,让它自己去读代码、定位问题、写补丁,最后跑单元测试看能不能通过。这个测试比传统的代码生成基准要难得多,因为它模拟的是程序员日常工作的完整闭环。
但是问题来了。眼尖的用户很快就发现,这张图的横坐标不是从0开始的,而是从60甚至更高的位置起步。这样一来,几个模型之间原本可能只有一两个百分点的差距,在视觉上就被放大成了断崖式领先。
统计学里有个专门的术语叫truncated axis,翻译过来就是截断坐标轴。这是数据可视化里最经典的一种误导手法,1954年美国统计学家达雷尔·哈夫(Darrell Huff)在那本畅销书《统计数字会撒谎》里就专门点名批评过。哈夫的原话大意是,只要你把纵轴的起点往上挪一挪,就能让一个平平无奇的数据看起来像坐了火箭。
现在这个手法被搬到大模型跑分上,效果一模一样。有用户在评论区直接开怼,说这种从60起步的柱状图看着就荒谬,能不能按数学基本规范画个从0开始的正经图表。
每秒18个token是什么概念,比人打字还慢
跑分归跑分,实际用起来才是真章。union-alpha上线之后,第一批尝鲜的用户几乎异口同声地吐槽同一件事:速度慢得离谱。
具体数字是每秒生成15到19个token。token是大模型处理文本的基本单位,一个英文单词平均对应1到2个token,一个中文汉字平均对应1到2个token。换算一下,每秒18个token大概等于每秒10个中文汉字,或者每秒7到8个英文单词。
这是什么概念?一个成年人正常打字速度是每分钟40到60个单词,换算下来是每秒0.7到1个单词。union-alpha确实比人快,但只快了不到10倍。而作为对比,OpenAI的GPT-4o在标准API上的输出速度大概是每秒80到120个token,Anthropic的Claude 3.5 Sonnet大概是每秒60到90个token,Google的Gemini 2.0 Flash更是能冲到每秒200个token以上。
union-alpha的速度只有主流模型的四分之一到十分之一。这意味着如果你让它写一段500个token的代码回复,其他模型5秒能搞定,union-alpha要等将近30秒。如果是复杂的agent(智能体/代理)任务,涉及多轮工具调用和长上下文推理,等待时间会被进一步放大。
有用户发帖说,自己发了一句简单的hello过去,结果等了2到3分钟才收到回复。更狠的评论是这句:等回复都能等到睡着。还有一个更接地气的比喻在评论区流传,大意是这个吞吐量比某些医疗机构的样本处理流水线还慢。
Codex和Claude Code的碰撞,插上OpenRouter之后水土不服
很多用户不是直接调API玩union-alpha,而是把它接到编程工具里跑真实项目。这里涉及到两个当下最火的AI编程工具:Codex和Claude Code。
Codex是OpenAI在2024年重新推出的命令行编程工具,取代了之前那个同名的老API。它的定位是一个能在终端里跑的编程agent,可以读你的整个代码库、自己规划任务、调用工具、写代码、跑测试,全程你只要在旁边看着就行。Claude Code是Anthropic在2025年推出的对标产品,功能类似,底层默认跑的是Claude系列模型。
这两个工具都支持通过OpenRouter接入第三方模型,也就是说理论上你可以用Codex的界面调用union-alpha来干活。有用户就是这么试的,结果翻车翻得非常彻底。
一位用户描述了自己的完整踩坑过程。他先是让union-alpha按照预先写好的规则文件干活,结果模型第一反应是拒绝执行,理由是规则里指定的模型名单里没有它自己。用户改了规则之后重新跑,模型花了大概30分钟修改了一个工单文件,改动量有100多行,看起来干得热火朝天。
但是最后模型给出的总结让人当场懵住。原话大意是:我一直在处理这个工单,但实际上并没有真正交付代码。翻译成人话就是,忙活半小时,一行有效代码都没产出。这位用户的最终评价是,还不如自己本地跑一个Qwen3的量化版本,虽然模型小,但至少能干活。
无限免费的文字游戏,OpenRouter的免费额度到底是多少
宣传语里那句免费无限使用,是整场讨论里争议最大的一个点。OpenRouter平台的免费模型规则其实一直都写在文档里,只是很多人没仔细看。
具体规则是这样的:如果你的账户里充值余额少于10美元,那么所有标注为free的模型每天最多只能调用50次;如果充值余额超过10美元,每天上限提升到1000次。这个限制是按账户维度统计的,不是按单个模型算。也就是说你就算同时调用五个免费模型,加起来也不能超过每天50次或1000次。
这套规则和无限使用之间有明显的语义差距。分析哲学里有个概念叫日常语言用法,就是同一个词在不同语境下的实际含义可能天差地别。免费在字面上确实是零成本,无限在字面上确实是没有数量上限。但把这两个词拼在一起打广告,普通用户的第一反应是可以随便用、想用多久用多久,而实际情况是每天50次配额加上每秒15个token的龟速。
有用户在评论区算了一笔账。假设你手头有一个中等复杂度的编程任务,需要模型输出2000个token的回复,按每秒18个token算,一次调用要等将近2分钟。50次配额意味着一天最多能做50次这种规模的任务,光是等待时间加起来就要100分钟。这还没算上模型思考的时间、工具调用的时间、以及可能出现的错误重试。
所谓的无限,在实际使用场景下被速率限制和吞吐量瓶颈死死锁住。这不是欺骗,是精心设计的文字表达。
隐身模型这个玩法,到底谁受益谁买单
匿名发布这套操作在大模型行业已经不是第一次了。2024年5月,OpenAI在正式发布GPT-4o之前,先在LMSYS Chatbot Arena(大模型竞技场)平台上放了一个叫gpt2-chatbot的匿名模型,让用户盲测投票。当时那个模型的表现明显超过所有已知模型,社区讨论了整整一周,最后OpenAI才官宣揭晓身份。
Anthropic也玩过类似的把戏。2024年10月,Chatbot Arena上出现过一个叫claude-3-5-sonnet-20241022的隐藏版本,比公开版本表现更好,后来被证实是新一代Sonnet的preview版。
这套玩法对厂商来说是稳赚不赔的买卖。第一,可以拿到没有品牌滤镜的真实评价,比自家团队的内部测试更有参考价值;第二,可以借助社区的口碑发酵制造话题热度,正式发布时自带流量;第三,如果模型翻车,反正没人知道是谁家的,损失可以控制在最小范围。
但是对用户来说,这个游戏就不那么公平了。用户贡献了免费的测试数据、真实的使用场景、详细的bug报告,换来的是一个不知道能用几天、随时可能下线的匿名端点。而这些数据最终会被厂商用来优化模型、包装成产品、然后再卖回给用户。
union-alpha这一波操作里,用户至少能明确知道两件事:一是这个模型的实际编程能力和跑分图上画的样子对不上;二是不管它背后是哪家厂商,正式发布之后的收费版本大概率不会有一周免费无限这种好事。
智谱GLM、DeepSeek、Qwen,中国模型的路径分化
既然社区普遍怀疑union-alpha背后是中国实验室,那就有必要说清楚现在中国大模型的几条主要路线,因为不同路线的产品哲学完全不同。
智谱清言(Zhipu AI)的GLM系列走的是全栈自研加海外市场路线。GLM-4.5、GLM-4.6这几代模型在编程能力上追得很紧,2024年下半年开始在海外开发者社区打出了一定的知名度。评论区有人提到的GLM 5.3 Flash就是这个系列的高速版本,主打的是低延迟和低成本。如果union-alpha真是智谱新版本,那按照他们过往的产品节奏,速度应该是重点优化项,不至于慢到每秒18个token。所以这个猜测本身就有点站不住脚。
DeepSeek走的是完全不同的路线:极致性价比加开源社区。DeepSeek V3在2024年12月发布之后,靠着API价格只有GPT-4o的十分之一、性能却能打到接近的水平,一度成为开发者圈子里的顶流。DeepSeek V4.1在评论区被多个用户点名推荐,理由是速度快、便宜、缓存效果好。有用户明确表示自己已经把V4.1当主力模型用,因为Anthropic的Claude Opus虽然强但不听指令,OpenAI的Codex又时不时被削弱。
阿里的Qwen(通义千问)走的是开源加多模态路线。Qwen3系列在Hugging Face上的下载量长期霸榜,特别是小尺寸的量化版本,可以在本地16GB显存的显卡上跑起来。前面提到那位翻车用户最后的吐槽就是,还不如用本地Qwen3的27B量化版,至少能干活。
这三条路线代表了三种不同的产品哲学:智谱追求全栈能力和商业化,DeepSeek追求性价比和开发者友好,阿里追求开源生态和本地部署。union-alpha无论是哪一家的产品,它的实测表现都还没有达到这三条路线中任何一条的顶尖水准。
Deep SWE跑分之外,编程能力的三个隐藏维度
光看SWE-Bench这一个跑分是不够的。真实的编程场景涉及远比修bug复杂得多的能力,至少有三个维度是标准跑分覆盖不到的。
第一个维度是指令遵循。你告诉模型只改这一个文件、不要动其他代码,模型能不能忍住不去优化别的地方。这个能力在多轮对话和长任务里特别重要,因为一旦模型自作主张,后续所有改动都会跑偏。评论区有用户明确指出union-alpha在这方面表现很差,属于那种给了明确规则也不遵守的类型。
第二个维度是长上下文的一致性。一个中等规模的代码库动辄10万行代码,模型需要在读完之后还能记住前面看过的关键接口、变量名、依赖关系。Anthropic的Claude 3.5 Sonnet和OpenAI的o1系列在这方面表现出众,主要靠的是内部的attention机制优化和训练数据的针对性构造。
第三个维度是工具调用的稳定性。现代编程agent不是让模型自己写完所有代码,而是让模型学会调用各种工具:读文件、跑测试、查文档、提交git。工具调用要求模型输出严格符合JSON schema的结构化数据,任何一个逗号、括号错位都会导致整个流程崩溃。这个能力目前OpenAI的function calling和Anthropic的tool use做得最扎实。
union-alpha在这三个维度上都还没有经过大规模验证。跑分图上的Deep SWE数字再高,也不能证明它能胜任真实的编程工作流。这就是为什么评论区那么多资深开发者对这个匿名模型持保留态度:他们见过太多跑分虚高、实战拉胯的模型了。
免费试用的三条自保建议,别让自己变成免费数据源
讲了这么多,最后落到你身上,如果你也想去试试union-alpha或者类似的免费模型,有三条具体建议可以帮你避免踩坑。
第一条:你要用小任务先测速度,再决定要不要投入真实项目。找一个你熟悉的简单编程任务,比如写一个冒泡排序、解释一段10行的代码,先让模型跑一遍。掐着秒表看它多久能出完整回复。如果每秒token数低于30,就不要用它做任何超过5分钟的复杂任务,因为你会被等待时间活活拖死。
第二条:你要在多轮对话里主动测试指令遵循。给模型一段明确的规则,比如只用Python 3.10语法、不要用外部库、代码控制在50行以内。然后让它执行一个稍微超出规则边界的任务,观察它是死守规则还是自作主张。指令遵循差的模型在真实项目里会给你带来巨大的返工成本。
第三条:你要清楚免费背后的数据代价。你在免费模型上跑的每一次对话,都可能被厂商用来做后续训练。如果你的代码涉及公司内部业务、客户数据、未公开的项目,就不要用这种匿名的免费端点,风险和收益完全不对等。真要测试新模型,用一些公开的、无敏感信息的任务就够了。
union-alpha这波免费一周结束之后会发生什么,现在还没有定论。它可能悄悄下线换个名字重新上架,可能被官方认领后转成付费版本,也可能就此消失再无音讯。评论区有人贴出了自己昨晚跑测试时的最后一条日志:模型正在思考,等待时间已超过180秒,未收到任何输出。这条日志下面没有回复,帖子还在继续更新中。