这可能是 2026 年 AI 圈最离奇的事件。一款代号 Ox Alpha 的神秘模型,没有发布会、没有技术报告、没有开发团队署名,就这么静悄悄地上架了 OpenRouter。
80% 对 65%:十道题撕开的认知裂缝
8 月 20 日,OpenRouter 没有召开任何发布会,就用一个忍者表情放出了一款代号为“Ox Alpha”的匿名模型。模型页面写得极简:面向高效编程、长时间智能体任务和真实生产环境,拥有 100 万 Token 上下文窗口,支持文本、图像和视频输入。除此之外,模型参数、训练数据、架构、基准成绩以及开发团队全部处于保密状态。
开发者 Ben Davis 坐不住了。他让 Ox Alpha 跑了一遍 DeepSWE——这是一个专门用来衡量 AI 读取真实代码库、识别漏洞并生成有效补丁能力的基准测试。DeepSWE 跟那些可能被“刷榜”污染的旧基准不同,它的 113 道任务全部是从头编写的原创题,没有模型在预训练阶段见过答案。验证器的手写行为测试假阳性率只有 0.3%、假阴性率只有 1.1%,比 SWE-Bench Pro 那 8.5% 的假阳性率干净了不止一个数量级。
结果呢?Davis 跑了 10 个任务:Ox Alpha 的 Pass@1 达到了 80%,修正了对“x”字符的接近错误后甚至超过 80%。作为对比:Claude Fable 5 是 65%,GLM-5.3 是 62%,Grok 4.6 是 62%,GPT-5.6 Sol 只有 52%。
等等,一个没名没姓的模型,在“零污染”的编程基准上,把公认的头部模型按在地上摩擦?
事情没那么简单。样本量只有 10 个任务,批评者说这太薄了,80% 可能是运气。有人跑了 61 个已完成任务,只拿到 36%,离 80% 差得远。还有人用 4.7 万平均输出 Token 跑了一个子集,得分约 63%。
但注意一个细节:在“meriyah-explicit-resource-declarations”这个任务上,Ox Alpha 一次通过,而 GLM-5.3、GPT-5.6-sol 和 Grok 4.6 此前全部以 0/4 告终。同时,Ox Alpha 在一次包含 69 次工具调用的智能体任务中只出现一次错误,没有发生重试循环,保持了 51,469 项回归测试全部通过。
这就怪了。如果只是运气好,怎么可能在别人全军覆没的任务上一次性通关?
指纹对上了:分词器、视频编码器、75 个 Token 的偏差
全世界开始了一场大型“猜模型”游戏。Google Gemini、小米 MiMo V3、腾讯混元新模型、DeepSeek、Grok——各种猜测满天飞。
Ben Davis 给出了一个惊人的结论:他“99% 确定”Ox Alpha 属于智谱 GLM-5.x 系列。证据链相当硬核。
第一,分词器指纹。研究人员对 25 个不同提示词进行测试后发现,Ox Alpha 的 Token 数量与 GLM-5.3 几乎完全吻合,仅存在恒定的 75 个 Token 包装层偏差。Tokenizer 是模型的“指纹”——两个不同基础模型在 25 组多样化 Prompt 上产生完全相同的 Token 分割序列,巧合概率极低。
第二,视频编码器。在四组受控视频中,Ox Alpha 与 GLM-5V-Turbo 的 Video Token 消耗完全一致,两者均呈现相同的三项特征:帧率无关的帧采样方式、约每秒 147 Token 的时长缩放比例、逐帧分辨率缩放机制。相比之下,MiMo v2.5、Qwen 3.8 Max 和 GLM-4.6V 等候选模型均表现出明显不同的视频编码特征。
第三,行为模式。Ox Alpha 拒绝音频输入的行为与 GLM-5V 完全一致。API 响应特征也与智谱架构高度吻合。
而且智谱有“前科”。2026 年 2 月,智谱就曾以“Pony Alpha”的匿名代号测试过 GLM-5。动物代号加“Alpha”后缀——这次是“Ox Alpha”,手法如出一辙。
但等等。如果 Ox Alpha 就是 GLM-5.3 的变体,那它在 Kingbench 上的表现又说不通了——Ox Alpha 得分 87.5%,而 GLM-5.3 是 91.25%。一个“下一代模型”居然比上一代还低?
更吊诡的是,GLM-5.3 公开版本不支持视觉或视频输入,而 Ox Alpha 却在首页高调宣传多模态能力。这要么是智谱藏了一手多模态版本没发,要么是有人在 GLM 的骨架上做了深度改造。Davis 据此认为,Ox Alpha 的能力已经明显强于 GLM-5.3,更像是下一代模型检查点。
免费背后的算账:3344 万次请求、2.4 万亿 Token、60 万美元
Ox Alpha 上线后的数据令人瞠目。
上线 29 小时,Prompt Token 达到 2.40 万亿,请求数 3344 万+。按 GLM-5.3 公开价格折算,这 29 小时仅 OpenRouter 一个渠道就相当于约 60 万美元的推理账单。对比 OpenRouter 周榜:DeepSeek V4 Pro 全周 1.96 万亿,GLM-5.2 全周 3.79 万亿。Ox Alpha 一天半就冲进了同一个量级,而且全程免费。
OpenCode 宣布为这款模型准备了每天 100 万亿 Token 的调用容量。每秒 11.6 亿 Token 的吞吐量。这个数字意味着什么?全球没有几家实验室撑得起这个规模的推理集群。智谱确实有这个算力——它已经运行了多个万卡 GPU 集群,刚刚启用了一个 1GW 的数据中心。DeepSeek 呢?最近刚提高了 V4-Flash 的价格,说明算力并不富裕。
但真正让人坐不住的是数据条款。OpenRouter 的 Stealth EULA 第 3 条写得清清楚楚:免费的“对价”就是你的 User Content;第 1 条说输入会被收集并交给匿名 Provider,“用于 Stealth Model 训练和改进”。所谓“Zero Data Retention”,指的是不用于训练“其他模型”——喂给这个神秘模型本身是允许的。
换句话说:你免费用的每一分钟,都在帮一个匿名模型做 RLHF 数据采集。
这背后有一个更深的逻辑。Ilya Sutskever 创立的 Safe Superintelligence(SSI)两年来几乎保持沉默,既没有发布任何模型,也没有销售任何产品。但据 2026 年 8 月爆料,SSI 的核心研究方向是基于 TTT(Test-Time Training,测试时训练)的小型推理引擎——该技术允许模型在推理时动态更新部分权重。2026 年 8 月 4 日,知名投资人 Gavin Baker 公开透露“SSI 本月将发模型”。英伟达在罕见获准进入 SSI 实验室后,已投资 5 亿美元。
如果 Ox Alpha 是 SSI 借 GLM 底座跑 Self-Improvement RL 呢?免费一周就是为了大规模采集真实环境的 Agent 轨迹。Self-Play RL 最缺的东西就是真实环境的 Agent 轨迹——每次工具调用、每条重试都是训练料。这种数据买不到,只能靠大规模真实投放来收。29 小时 3344 万次请求,每次调用都是一条珍贵的训练样本。
牛还是狼:这头“公牛”到底想干什么
Ox Alpha 的自我定位很克制。它只会说自己是“ox-alpha,由未公开组织开发”,拒绝声称自己是 GPT、Claude、Gemini、Grok、GLM、Qwen 或 Kimi。OpenRouter 页面写得也很清楚:它只是一个路由平台,不是开发者、所有者或提供商。
这个匿名模型在基准测试中展现出的能力毋庸置疑。但围绕它的疑问比答案多得多。
Ox Alpha 会是 Ilya 的 SSI 吗?SSI 确实被曝本月将发布首个模型。但 Ox Alpha 的视频编码器、分词器指纹几乎全部指向智谱。如果 SSI 要在 GLM 骨架上做后训练,为什么不用自己的架构?
Ox Alpha 会是 Cursor 团队基于 GLM 系列后训练出来的 Composer 新模型吗?Cursor 团队有足够的工程能力做这件事。但 Cursor 什么时候变成模型训练方了?
更让人困惑的是实际任务表现的分裂。有人在 DeepSWE 子集上跑出 80%,有人在同样子集上只拿到 63%。有人觉得它“clearly better than 5.6 sol”,有人评价“seems very benchmaxxed”。Ox Alpha 的 P50 延迟约 1.92 秒,吞吐量约 52 Token/秒,近 3 天可用率做到 99.99%。这个速度不算惊艳,但胜在稳定。
Ox Alpha 在多个基准上的表现都非常出色,但与 GLM-5.3 在 Kingbench 上的分数差距又让人不得不怀疑它是否被过度优化。有分析认为,这很可能是一个专门针对编程和智能体任务进行优化的检查点,而非通用能力的全面跃升。
截至 8 月 22 日,没有任何实验室站出来认领 Ox Alpha。智谱官方保持沉默。OpenRouter 的提供商一栏仍然只写着“Stealth”。
一周免费期结束后会怎样?Ox Alpha 是会收费、下线,还是突然被某个实验室正式认领?如果它真的是智谱的 GLM-5.5 或 GLM-5.3V,为什么选择匿名发布而不是高调宣发?如果它不是智谱,那又是谁有本事把 GLM 的指纹模仿得如此逼真——连视频编码器的帧采样方式都一模一样?
最关键的是:一个匿名模型在“零污染”的编程基准上碾压头部产品,却没人知道它是谁做的。这本身就是 2026 年 AI 行业最荒诞也最真实的注脚。