Tabbit博客

Ox Alpha 身份揭晓:GLM-5.3-Flash

Ox Alpha 就是 GLM-5.3-Flash。沿着匿名内测、模型指纹和社区实测,看看它如何把 GLM-5.2 一脉的智慧与原生多模态放进 Tabbit。

本文目录
  1. 关键结论
  2. Ox Alpha 时间线
  3. 这场匿名内测为什么有意思
  4. X 和 Google 怎么一步步接近答案
  5. GLM-5.2 的智慧,加上原生多模态
  6. 网友测评到底说明了什么
  7. 在 Tabbit 中使用 GLM-5.3-Flash
  8. 哪些任务适合 GLM-5.3-Flash

Ox Alpha 就是 GLM-5.3-Flash。8 月 27 日,名字终于和过去一周的匿名模型对上了。在身份公开之前,它已经通过 OpenRouter 跑过真实仓库、图片、视频和很长的 Agent 任务。

一位开发者在 RandomAI 的视频下留言,说自己用 Ox Alpha 在单次会话里完成了整个版本升级工作流。这是一条个人体验,不是 benchmark。它解释了这次揭晓为什么有人在意:大家不是围着一个模型名猜参数,很多人已经拿它干活了。

GLM-5.3-Flash 延续 GLM-5.2 与标准 GLM-5.3 的智能路线,再加上原生多模态。现在可以在 Tabbit Browser 里选择它,让模型直接看你正在看的页面、图片或文件。

关键结论

  • Ox Alpha 在 2026 年 8 月 20 日出现在 OpenRouter,100 万 token 上下文,匿名提供方,内测期免费。

  • 它原生接受文本、图片和视频,主要用于编码与长程 Agent。普通聊天只是更轻的用法。

  • 8 月 27 日揭晓前,研究者已经通过 tokenizer、视频 token 预算和 Z.ai 风格错误码把范围收窄到 GLM 家族。

  • 早期测评值得看,但不是整齐的总榜。DeepSWE 子集和 Cline 单仓库对照都只能回答各自的问题。

  • GLM-5.3-Flash 已进入 Tabbit 的 Chat 与 Agent 工作流。页面、截图、文档和浏览器操作混在一起时,它最有用。

Ox Alpha 时间线

日期公开了什么当时能得出什么结论
8 月 20 日OpenRouter 上线 Ox Alpha,标注为匿名第三方预览模型真实存在,有 1M 上下文,面向编码与长任务;开发者未知
8 月 21 日OpenRouter 官方 X 写明文本、图片和视频输入API 表面是原生多模态,仍不能判断实验室
8 月 21 至 25 日tokenizer、视频 token、服务错误和社区测试陆续出现GLM 成为最强家族归因,但家族指纹不等于正式产品名
8 月 25 日Di Zhang 直接写出 GLM-5.3-Flash from Zhipuexact name 进入公开讨论,当时仍是社区来源
8 月 27 日Ox Alpha 揭晓为 GLM-5.3-Flash代号和产品身份终于合上;旧测评成为 Flash 的内测证据,原有限制仍然保留

顺序不能倒过来写。8 月 23 日,TechCrunch 还在同时记录 GLM 和微软 MAI 等猜测。那几天确实没人能把答案写死。

这场匿名内测为什么有意思

OpenRouter 对 Ox Alpha 的描述很具体:reasoning model,面向 coding、持续 Agent 工作和生产负载;上下文 1,048,576 token,最大输出 131,072 token。预览期免费,背后只有一家匿名提供方。

匿名拿走了最省事的品牌判断。用户不能因为它叫 GLM、Claude 或 GPT 就先入为主,只能看任务有没有做完。当然,公开体验不会因此自动变成科学实验,但这一周的反馈确实比普通发布会更接近真实使用。

模型页还有一条不太适合写进宣传海报的事实:提供方会保留 prompt 和 completion,但声称不用于训练。测试私有代码前仍要读 stealth 条款。免费不能替代脱敏。

页面上的延迟、吞吐和可用性是动态服务数据。流量一变,数字就会变。它们不能写成模型固定速度,内测免费也不能写成永久价格。

X 和 Google 怎么一步步接近答案

最好用的线索不是模型自我介绍,而是它很难靠一句 system prompt 伪装的行为。Jonathan Turner 在 8 月 26 日的长文 汇总了几组独立测试:

信号公开结果能说明什么单独不能说明什么
TokenizerOx Alpha 与公开 GLM-5.3 在 50 个字符串上 50/50 一致很像 GLM-5.x 词表,外加 stealth wrapperexact weights 或正式 SKU
视频 token 预算4 段视频逐段匹配 GLM-5V-Turbo很像 GLM-V 视觉编码器它就是公开的 GLM-5V-Turbo
服务端错误Java 包路径与业务错误码匹配 Z.ai PaaS v4 / GLM-5.3服务跑在 Z.ai 风格后端后训练每一步由谁完成
产品卡Ox 是 1M + 视觉;公开 5.3 是文本,5V-Turbo 是 200K更像未发布的多模态 GLM-5.x 兄弟型号最终名字

Google 搜索结果也跟着调查变化。最初是「谁做了 Ox Alpha」,后来 PAA 直接出现「OxAlpha 是不是智谱 GLM-5.3-Flash」。Reddit 标题开始喊 confirmed,X 上仍有人猜 MiMo、MAI 或其他模型。搜索把争论收集起来,但没替大家判案。

Turner 当时的措辞很克制:家族像 GLM,服务栈像 Z.ai,具体产品名仍未知。随后 Di Zhang 把 exact name 写了出来。8 月 27 日,最后一个空格被填上。

GLM-5.2 的智慧,加上原生多模态

Z.ai 的 GLM-5.3 技术文章 明确写道,标准 GLM-5.3 与 GLM-5.2 使用相同基座。能力提升来自又一个月的规模化后训练:更多可执行环境、更长更多样的任务,以及投入这些轨迹的更多训练算力。

所以「继承 GLM-5.2 的智慧」不是一句玄学。它指向同一个基座与长程训练路线。标准 GLM-5.3 又把编码、工具调用和 Agent 任务推得更远。想先理解上一代,可看 Tabbit 中的 GLM-5.2GLM-5.1 使用路径

GLM-5.3-Flash 的变化是把原生多模态放进这条路线。Ox Alpha 内测时,同一路由可以接收文本、图片和视频。碰到半视觉任务时,它能先看截图、核对 UI,再继续读规格、代码或文档,不必把视觉理解拆给另一个模型。

但别把标准 GLM-5.3 的分数直接贴到 Flash 身上。Z.ai 公布的 DeepSWE v1.1 66.9、Terminal-Bench 3.0 28.3 等数据属于标准 5.3,而且是厂商在公开说明的 harness 下自报。它们是家族基线,不是 Flash 独立成绩。

网友测评到底说明了什么

目前最值得保留的两组测试,都给了具体任务或数字。

Wenqi/Kevin 报告,Ox Alpha 在一个 DeepSWE 子集上约 63%,平均每个任务输出约 47K token。他把它评价为开源模型中的 Pareto 前沿。帖子没有公开完整任务列表、重复次数和标准榜单提交,所以更准确的结论是:这是一个不错的编码 Agent 信号。

Cline 用自己仓库里的一个真实 bug 对比 Ox Alpha 和 Fable。两个模型都修好了。Cline 称 Ox Alpha 更少重复推理,在相近工作量下输出 token 约少三倍。一次正确修复排不了总榜,但它指出了一个很实用的特点:得出结论后开始行动,不把同一句根因说七遍。

YouTube 评论区那条「单会话完成整个版本升级」提供了第三种信号:长任务的连续性。没有仓库、diff 和测试日志,它不能证明成功率,只能说明为什么用户愿意在内测期间投入大量 token。

这三条反馈都符合长程后训练的方向。判断这类模型,重点不是第一句答得多漂亮,而是它能不能把任务做到收尾。想了解 Chat 与 Agent 循环的区别,可以看 Agentic reasoning 指南。如果你关心角色扮演与 preset,请转到独立的 GLM-5.3 SillyTavern 指南,那是另一种负载。

在 Tabbit 中使用 GLM-5.3-Flash

Tabbit 很适合承接这个模型,因为多模态上下文本来就在浏览器里。你不用先下载图片、复制网页,再去另一个聊天窗口重建任务。

  1. 打开 Tabbit Browser。分析用 Chat,多步网页任务用 Agent Mode

  2. 在模型选择器里选择 GLM-5.3-Flash

  3. 输入 @,引用当前页面、标签组、截图或本地文件。

  4. 写清交付物和检查项。Agent 任务还要说明什么算完成、哪些内容不能改。

Tabbit 多模型界面,GPT、Claude、Kimi、Qwen 与 GLM 并排回复
Tabbit 可以并排运行不同模型家族。这张较早的界面显示 GLM-5.2;GLM-5.3-Flash 沿用同样的模型选择工作流。

第一次可以给它一个混合但有边界的任务:附上产品截图和对应规格页,让 Flash 列出不一致,再让 Agent Mode 逐页核对。做研究也一样,把报告和实时来源放进标签组;研究型浏览器指南 有完整做法。

边界也很清楚。Tabbit 不是 IDE 里的 coding harness,选择模型也不等于永久拥有内测期的无限额度。当前限额看 Tabbit 价格。工作完全在代码仓库里,coding agent 更合适;证据散在网页、图片和文件中,浏览器才是 Flash 原生多模态最顺手的环境。

哪些任务适合 GLM-5.3-Flash

任务适合度怎么用边界
对照 UI 截图与网页规格@ 两份材料,先出差异表,再让 Agent 核对要求保留来源和视觉证据
跨网页、图表和 PDF 的长研究资料放进标签组,要求带引用总结不要只要一篇没有出处的长答案
需要识别页面视觉状态的浏览器流程独立标签组运行,模型边看边做写清停止条件,复核修改
大仓库补丁一般Tabbit 看文档和截图,代码修改与测试留在 coding harness浏览器不替代 git 和 CI
普通文字问答可用但未必必要不挂附件直接 Chat小模型可能更快
需要永久免费的 endpoint不适合这样假设看当前模型选择器和套餐Ox Alpha 免费只是预览条件

结论不需要喊得很大。GLM-5.3-Flash 真正有意思的地方,是 GLM 一脉的长程推理碰上了视觉上下文。现有测试足以支持拿真实 Agent 任务试一试,不足以把标准 5.3 的全部分数复制过来,也不足以宣布它在所有场景第一。

任务从网页、截图、PDF 或浏览器操作开始,就在 Tabbit 里选择 GLM-5.3-Flash,并给它一条明确的终点线。如果你想拿它和百万上下文的 coding model 横向理解,可以继续看 GPT-5.6 Sol 上下文指南

常见问题

Ox Alpha 真的是 GLM-5.3-Flash 吗?

是。2026 年 8 月 27 日,Ox Alpha 的身份揭晓为 GLM-5.3-Flash。在此之前,OpenRouter 只把它列为匿名的 stealth/ox-alpha;独立研究者已经从 tokenizer、视频 token 预算和服务端错误,把范围收窄到 GLM 家族与 Z.ai 服务栈。

GLM-5.3-Flash 和标准 GLM-5.3 是同一个模型吗?

不是。标准 GLM-5.3 是面向编码和长程 Agent 的文本模型。GLM-5.3-Flash 延续这条智能路线,并原生接受文本、图片和视频。除非 Flash 在相同条件下独立运行,否则不能把标准 5.3 的分数直接搬给 Flash。

GLM-5.3-Flash 从 GLM-5.2 继承了什么?

Z.ai 表示标准 GLM-5.3 与 GLM-5.2 使用同一个基座,提升来自规模化后训练,重点是编码、工具使用和长程任务。GLM-5.3-Flash 把这条智能路线与原生多模态输入组合在一起,而不是给文本模型临时外挂视觉模块。

Ox Alpha 内测时支持哪些输入?

OpenRouter 模型页和官方 X 帖显示,它有 100 万 token 上下文,支持文本、图片和视频输入,输出文本。它被定位为编码、持续 Agent 工作和生产任务模型。内测时的免费价格与限额不等于 GLM-5.3-Flash 的永久条款。

Ox Alpha 的早期测评成绩怎么样?

信号很好,但证据不完整。Wenqi/Kevin 报告 DeepSWE 子集约 63%,平均输出约 47K token;Cline 报告一个真实仓库 bug 两个模型都修好,而 Ox Alpha 输出 token 约少三倍。两组数据都不能替代完整独立榜单。

怎么在 Tabbit 里使用 GLM-5.3-Flash?

打开 Tabbit Browser,在 Chat 或 Agent 任务中选择 GLM-5.3-Flash。如果任务需要页面或视觉上下文,输入 @ 引用当前标签页、标签组、截图或本地文件。模型可用性和套餐限额会变化,请以当前选择器与 Tabbit 价格页为准。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。