Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.3-Flash · 社区来源 · 编辑分析

X @winkey_h:Ox Alpha 的 DeepSWE 子集体测与社区反馈

Wenqi/Kevin 分享了自己的早期体感与一个 DeepSWE 子集结果:平均每个任务约 47K 输出 token 时,Ox Alpha 得到约 **63%**。作者认为它在开源模型中处于 Pareto 前沿,与闭源模型相比仅略逊于 Grok 4.6;这属于个人测试与主观判断,不是标准化排行榜。 该帖引用了 OpenCode 关于 Ox Alpha 的公开信息(1M 上下文、多模态、零数据保留),但没有给出完整 prompt 集、任务数量、运行配置或代码。它也没有证明 Ox Alpha 的 GLM-5.3 Flash 身份。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源编辑分析编辑日期 2026-09-20

测试条件速查

模型/版本
GLM-5.3 Flash; exact snapshot follows the source
来源日期
2026-08-21
方法/客户端
OpenRouter public record, Z.ai materials, or community X post; exact client follows the source
复核状态
2026-09-20 未重新打开动态来源,数值保持未核实

关键数据与适用场景

核心内容摘要

Wenqi/Kevin 分享了自己的早期体感与一个 DeepSWE 子集结果:平均每个任务约 47K 输出 token 时,Ox Alpha 得到约 63%。作者认为它在开源模型中处于 Pareto 前沿,与闭源模型相比仅略逊于 Grok 4.6;这属于个人测试与主观判断,不是标准化排行榜。

该帖引用了 OpenCode 关于 Ox Alpha 的公开信息(1M 上下文、多模态、零数据保留),但没有给出完整 prompt 集、任务数量、运行配置或代码。它也没有证明 Ox Alpha 的 GLM-5.3 Flash 身份。

能写入落地页的版本

“早期社区测试显示 Ox Alpha 在长程编码任务上有竞争力;但 63% 来自一个 DeepSWE 子集,不能替代完整 benchmark,也不能单独证明模型身份。”

测评价值

该结果的价值是提供可追溯的个人实测数字;局限是子集、单次测试条件不透明,不能与 Z.ai 官方 GLM-5.3 v1.1 分数直接比较。

能支持的判断

  • Wenqi/Kevin 分享了自己的早期体感与一个 DeepSWE 子集结果:平均每个任务约 47K 输出 token 时,Ox Alpha 得到约 **63%**。作者认为它在开源模型中处于 Pareto 前沿,与闭源模型相比仅略逊于 Grok 4.6;这属于个人测试与主观判断,不是标准化排行榜。 该帖引用了 OpenCode 关于 Ox Alpha 的公开信息(1M 上下文、多模态、零数据保留),但没有给出完整 prompt 集、任务数量、运行配置或代码。它也没有证明 Ox Alpha 的 GLM-5.3 Flash 身份。

不能支持的判断

  • 作者未公开 DeepSWE 子集任务数、完整提示、运行配置、代码和重复次数;47K 输出 token 与约 63% 仅是单人快照,而且该测试没有证明 Ox Alpha 的 GLM-5.3 Flash 身份。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X(Twitter) · Wenqi/Kevin(@winkeyh) · 原文发布日期 2026-08-21 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.3-Flash

在 Tabbit 中比较 GLM-5.3-Flash

下载 Tabbit 客户端后检查模型可用性

相关评测

X @OpenRouter:Ox Alpha 首次公开——1M 上下文与多模态输入OpenRouter 的官方账号将 Ox Alpha 称为“new stealth model”,定位为面向高效编码、持续 Agent 工作与现实生产使用的前沿模型。帖子给出两项关键规格:**100 万 token 上下文窗口**,以及**文本、图像和视频输入**,并引导用户到 Ox Alpha 页面试用和反馈。X @di_zhang_fdu:Ox Alpha 被指认为 GLM-5.3 Flash,但仍未官宣Di Zhang 在 X 上直接写道:“Source: OxAlpha is GLM-5.3-Flash from Zhipu”,并引用了 OpenCode 关于 Ox Alpha 的公开信息(1M 上下文、多模态、零数据保留)。这是一条明确的社区归因,但不是 Z.ai 或 OpenRouter 的官方确认。OpenRouter:Ox Alpha 的公开规格——神秘模型首次现身OpenRouter 将 Ox Alpha 列为匿名 stealth model,明确说明它由选择保持匿名的第三方开发和运营,OpenRouter 只是路由方。页面把它定位为 reasoning model,适合编码、持续 Agent 工作和生产负载,并强调结合视觉上下文的工作流。Z.ai 官方 GLM-5.3:承袭 GLM-5.2 基座的后训练能力基线Z.ai 对标准 GLM-5.3 的公开定位是:与 GLM-5.2 使用相同基座,能力提升来自扩展后训练,而不是更换预训练基座。重点方向包括长程软件工程、终端任务、工具调用和真实 Agent 工作单元。该基线可以解释为什么社区把一个 GLM-5.x 多模态变体称作“集成 GLM-5.2 级别智商”,但**不等于** Flash 已被官方命名或与标准 5.3 完全同构。