Ox Alpha 很可能是运行在 Z.ai 服务栈上的 GLM-5.x 多模态模型。这是目前公开线索能支持的最稳结论。再往前一步,说它就是 GLM-5.3 Flash,证据还差一张官方模型卡。OpenRouter 和 Z.ai 都没确认。
偏偏这个匿名模型已经做出了一些让人很难不多看两眼的结果。Reddit 有人用一句话让它画“骑自行车的龙”,评论区注意到龙腿在车架后面、自行车在路上,还有链条。测试很小,却很具体。大家关心的不只是“谁做的”,也在看它到底会不会干活。
下面按时间把故事拼起来,再把标准 GLM-5.3 的官方数据和 Ox Alpha 的网友实测分开。如果不想继续猜代号,也可以直接打开 Tabbit 的 GLM-5.3 Flash 模型页,拿自己的文字、图片和 Agent 任务试一轮。
先说结论
OpenRouter 确认的是匿名第三方模型、1,048,576 token 上下文,以及文本、图像、视频输入。官方资料没有出现 Z.ai 或 GLM 名称。
Tokenizer、视频 token 预算和服务端报错共同指向 GLM-5.x 家族与 Z.ai 服务栈,但还不能锁定具体 checkpoint。
Z.ai 表示公开版 GLM-5.3 与 GLM-5.2 使用同一个 base model,提升来自后训练。如果 Flash 归因正确,“GLM-5.2 的智能底座加原生多模态”就说得通。
Ox Alpha 的好成绩大多来自个人测试、子集或单个任务。它们值得跟进,不能冒充完整 benchmark。
Tabbit 已按 GLM-5.3 Flash 提供使用入口。产品名称解决的是怎么用,不等于替官方完成身份确认。
Ox Alpha 身份线索一览
| 说法 | 现有证据 | 可信度 | 还不能证明什么 |
|---|---|---|---|
| Ox Alpha 是真实存在的匿名预览模型 | OpenRouter 模型记录 | 已确认 | 谁开发、谁运营底层 checkpoint |
| 它有 1M 上下文并支持多模态 | OpenRouter 官方公告写明文本、图片、视频输入 | 已确认 | 视觉准确率、稳定的视频上限、长期可用性 |
| 它属于 GLM-5.x 家族 | 技术社区长文汇总 tokenizer、视频 token 和报错指纹 | 较强推论 | 权重相同或公开 SKU 相同 |
| 它就是 GLM-5.3 Flash | Di Zhang 的归因帖等社区说法 | 未确认 | 官方产品名、API ID、Z.ai 官宣 |
| 它继承了 GLM-5.2 的智能底座 | Z.ai 说明公开 GLM-5.3 与 GLM-5.2 同 base | 有条件成立 | Ox Alpha 一定使用相同 checkpoint 和全部训练流程 |
压成一句话:GLM 家族很像,Z.ai 托管也很像,具体叫不叫 GLM-5.3 Flash 还没实锤。
这场身份猜测是怎么开始的
8 月 14 日:标准 GLM-5.3 先发布
Z.ai 在 GLM-5.3 技术博客里写得很直白:GLM-5.3 和 GLM-5.2 使用同一个 base model,所有增益来自继续扩大后训练。新的训练覆盖更多环境、更复杂的长任务和更大的计算量。
这给后来的 Flash 猜测补上了一条技术路线。一个更快、支持视觉的分支,不必抛弃 GLM-5.2 的语言与推理底座。它可以保留这套能力,再换一套服务配置并接入视觉输入。已经用过 Tabbit 中的 GLM-5.2 的人,也正好有一个可以对照语气和指令遵循的基线。
边界也很清楚:Z.ai 这篇文章只讲公开版 GLM-5.3,没有出现 Ox Alpha 或 GLM-5.3 Flash。
8 月 21 日:Ox Alpha 匿名上线
OpenRouter 把 stealth/ox-alpha 作为免费预览模型上线。模型页给出的定位是编码、持续 Agent 工作和生产任务。上下文窗口为 1,048,576 token,最大输出 131,072 token。
真正让身份调查热起来的是另一项规格:OpenRouter 官方 X 账号写明它接受文本、图像和视频。公开版 GLM-5.3 有长上下文和编码能力,GLM-5V-Turbo 则是 GLM 家族里现成的视觉路线。Ox Alpha 看上去像两条线在一张尚未公开的模型卡上汇合了。
OpenRouter 同时说明,模型由匿名第三方开发和运营,它只负责路由。提供商会保留 prompt 和 completion,但不用于训练,其他用途受 Stealth Model Terms 约束。免费很好用,不等于没有隐私成本。
8 月 23 日到 25 日:社区开始“验指纹”
TechCrunch 的早期报道记录了第一轮混乱:有人猜 GLM,也有人猜微软 MAI,Reddit 上的判断更分散。当时根本谈不上共识。
随后出现的技术线索扎实得多。Jonathan Turner 在 8 月 25 日的汇总中写到,Ox Alpha 对 50 条测试字符串的 token 计数与公开 GLM-5.3 50/50 匹配;四段视频的 token 预算与 GLM-5V-Turbo 一致;部分 Java/Spring 报错和业务码也与公开 GLM-5.3 后端逐字节相同。
几组线索互相呼应,但它们不是权重哈希。Turner 也说明,这些测量来自其他调查者,他没有在文章里重跑。Tokenizer 可以共用,视频编码器可以复用,Z.ai 服务器也能托管外部模型。所以比较稳的终点仍是“GLM 家族的多模态分支”,不是“破案成功”。
“GLM-5.2 的智慧加原生多模态”是什么意思
这句话听着像宣传语,拆开后其实是两个可核对的判断。
第一,标准 GLM-5.3 确实延续 GLM-5.2 的底座。Z.ai 把能力增益归因于长程编码、工具调用和真实任务环境上的后训练。它处理的是计划、行动、观察再继续的循环,我们在 Agentic Reasoning 指南里也解释过这类工作方式。
第二,Ox Alpha 的产品入口原生接受视觉输入。OpenRouter 列的是文本、图像、视频输入,并不是在外面再挂一个 OCR 工具。把它称为“原生多模态”对使用界面来说是准确的,但公开资料没有说明底层架构如何组合。
这样看,GLM-5.3 Flash 的猜测就有了来由:沿用 GLM-5.2/5.3 这一代的推理与 Agent 路线,再把视觉上下文放进同一个模型体验。至于 Flash 是否代表更快的服务档位,只是从名字做出的联想,不能算证据。
公开模型卡还有一个提醒。标准 GLM-5.3 是 1M 文本模型,GLM-5V-Turbo 是窗口更小的视觉模型,Ox Alpha 却是 1M 多模态入口。它像两者,但不等于任何一个公开产品。
网友测出来的数据到底能说明什么
Z.ai 给标准 GLM-5.3 公布了一组明显优于 GLM-5.2 的结果。这些数字解释了为什么一个可能的 5.3 分支会引起注意,却不能贴到 Ox Alpha 身上。
| 官方 benchmark | GLM-5.3 | GLM-5.2 | 适用对象 |
|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 公开标准 GLM 模型 |
| DeepSWE v1.1 | 66.9 | 46.2 | 公开标准 GLM 模型 |
| CyberGym | 84.5 | 77.2 | 公开标准 GLM 模型 |
| AutomationBench | 48.2 | 26.2 | 公开标准 GLM 模型 |
Ox Alpha 的证据是另一套:
| 测试或反馈 | 报告结果 | 可以得出的结论 | 局限 |
|---|---|---|---|
| Wenqi/Kevin 的 DeepSWE 子集 | 平均输出 47K token 时约 63% | 长程任务表现值得继续测 | 个人子集,没有完整 prompt、任务数、harness 和代码 |
| Cline 的真实仓库 bug | Ox 与 Fable 都修好,Ox 输出 token 约少 3 倍 | 有一个简洁且正确的 Agent 输出案例 | 单个未公开 bug,没有 raw token 表和重复运行 |
| Reddit 的自行车 SVG | 评论者认可腿、道路、自行车和链条关系 | 是个方便复现的视觉烟雾测试 | 单图、非盲测、参数未知 |
| Reddit 的定制语言游戏 | 10 关游戏能运行,还加了 modulo;关卡设计一般 | 有读取陌生文档并持续实现的迹象 | 没有仓库、commit、完整 prompt 和测试日志 |
也别漏掉负面反馈。免费期涌入大量用户后,OpenCode 社区出现了过载、慢启动和上游 endpoint 错误。它更像预览服务的容量问题,不代表模型变笨,但会直接决定一次长 Agent 任务能不能跑完。
想找另一个百万上下文模型做参照,可以看 GPT-5.6 Sol 的 1M 上下文说明。两边都提醒了同一件事:窗口大小、产品默认值、费用和任务成功率是四个不同指标。
在 Tabbit 里把猜测变成自己的测试
Tabbit Browser 目前已经提供 GLM-5.3 Flash 模型页。匿名预览最麻烦的地方,是资料、prompt、截图和输出散落在不同网站与客户端。Tabbit 可以把这些东西留在同一个浏览器里比较。

一轮干净的测试分四步:
打开 GLM-5.3 Flash 模型页,先给一个成功条件明确的任务,保存 prompt 和输出。
在同一个浏览器里换成 GLM-5.2 或另一款模型,任务不变,只换模型。
加一张图片或截图,检查回答有没有真正用到画面细节,而不是复述题目。
多步骤网页任务再用 Agent Mode。只选公开、可回滚的任务,记录工具调用、重试、耗时和最终产物。
接入编码 harness 时也一样。我们的 DeepSeek Harness 浏览器指南会把浏览器控制和模型质量拆开看。Ox Alpha 也该这么测:好模型可能卡在拥堵路由上,重试做得好的客户端也可能只是在反复提交坏答案。
做资料研究,可以先把来源标签页附上,让模型在下结论前生成证据表。研究用 AI 浏览器工作流比把一堆 URL 扔进无记录聊天更容易复核。第一次用产品,可以先看 Tabbit 功能总览,里面讲了 @ 引用、多模型对话和 Agent Mode。
这里的取舍很简单。Tabbit 让 GLM-5.3 Flash 更容易调用和对比,但不会把社区归因变成官方模型卡。GLM-5.3-Flash 是当前产品入口,Ox Alpha = GLM-5.3-Flash 仍是待验证假设。
现在应该相信到哪一步
| 你要判断的问题 | 当前答案 | 原因 |
|---|---|---|
| Ox Alpha 值得拿来做编码和 Agent 测试吗 | 值得做受控测试 | 已有几条具体正向反馈,但样本很小 |
| 它和 GLM 有关系吗 | 大概率有 | 多组独立指纹指向同一方向 |
| 它确定是 GLM-5.3 Flash 吗 | 不能确定 | 没有一手官宣、公开模型 ID 或权重匹配 |
| 63% 能当排行榜成绩吗 | 不能 | 它来自方法未完整公开的 DeepSWE 子集 |
| 能把敏感生产数据交给它吗 | 匿名阶段不建议 | 保留条款和运营者身份还不足以支撑合规结论 |
| Tabbit 适合试用吗 | 适合可回滚的文字、图片和网页任务 | 模型入口、上下文和对比工作流都在同一浏览器里 |
谜底已经缩小到一个很实用的范围。Ox Alpha 表现得像 GLM 家族,服务栈也指向 Z.ai,还把百万上下文和多模态输入放在了一起。GLM-5.3 Flash 是目前最顺的名字,但仍然只是猜测。
任务合适就去用,顺手把证据留好。等 Z.ai 或 OpenRouter 真正公布 checkpoint,这篇文章也很好更新,因为事实和推论从头到尾没有混在一起。
常见问题
Ox Alpha 是什么模型?
Ox Alpha 是 OpenRouter 在 2026 年 8 月 21 日上线的匿名预览模型。公开规格包括 1,048,576 token 上下文、最高 131,072 token 输出,以及编码、持续 Agent 与生产任务定位。开发者和具体 checkpoint 尚未公布。
Ox Alpha 已经确定是 GLM-5.3 Flash 吗?
还没有。OpenRouter 和 Z.ai 都没有正式宣布 Ox Alpha 就是 GLM-5.3 Flash。社区指纹较强地指向 GLM-5.x 家族与 Z.ai 服务栈,但 Flash 仍是归因判断,不是官方产品身份。
为什么大家认为 Ox Alpha 属于 GLM?
社区调查者报告了三组线索:50 条字符串的 token 计数与 GLM-5.3 全部匹配,视频 token 预算接近 GLM-5V-Turbo,部分服务端报错与 Z.ai 的 GLM 后端一致。这些线索支持家族关系,但 tokenizer 和托管环境相同并不等于 checkpoint 相同。
Ox Alpha 支持多模态吗?
支持。OpenRouter 官方公告写明它接受文本、图像和视频输入,输出文本。这只能确认输入形态,不能替代视觉 benchmark,也没有公开视频长度上限和底层架构。
Ox Alpha 真的继承了 GLM-5.2 的能力吗?
Z.ai 明确表示公开版 GLM-5.3 与 GLM-5.2 使用同一个 base model,能力提升来自额外后训练。如果 Ox Alpha 确实是社区猜测的 GLM-5.3 Flash,这种说法有合理的技术来源;目前它还不是针对 Ox Alpha 的官方架构说明。
如何在 Tabbit 中使用 GLM-5.3 Flash?
打开 Tabbit 的 GLM-5.3 Flash 模型页,输入文字、图片或 Agent 任务,再选择在 Tabbit 中使用。建议保存 prompt 与输出,把身份猜测和任务结果分开判断;匿名预览阶段不要提交敏感代码、凭据或客户数据。