TabbitBlog

Ox Alpha의 정체는? GLM-5.3 Flash설의 근거

Ox Alpha는 GLM-5.x 계열의 멀티모달 모델처럼 보이지만 GLM-5.3 Flash라는 이름은 아직 확인되지 않았습니다. 단서, 테스트, Tabbit 사용법을 정리합니다.

이 글의 목차
  1. 핵심 요약
  2. 신원 증거 한눈에 보기
  3. 미스터리 모델이 등장한 과정
  4. GLM-5.2 지능과 네이티브 멀티모달
  5. 숫자는 대상별로 분리해야 한다
  6. Tabbit에서 직접 검증하기
  7. 현재 판단

Ox Alpha는 Z.ai 인프라에서 서비스되는 GLM-5.x 계열 멀티모달 모델일 가능성이 높습니다. 공개 단서가 안정적으로 뒷받침하는 결론은 여기까지입니다. 더 구체적인 GLM-5.3 Flash라는 이름은 OpenRouter나 Z.ai가 확인하지 않았습니다.

그래도 모델 자체는 흥미롭습니다. Reddit의 SVG 테스트에서 한 사용자는 용의 다리가 자전거 프레임 뒤에 있고, 자전거가 도로 위에 있으며 체인까지 표현됐다고 짚었습니다. 작은 테스트지만 "강하다"는 말보다 살펴볼 내용이 많습니다.

이 글은 익명 프리뷰 공개부터 GLM 지문 분석까지 따라가고, 표준 GLM-5.3 공식 수치와 Ox Alpha 개인 테스트를 분리합니다. 직접 확인하려면 Tabbit의 GLM-5.3 Flash 페이지에서 텍스트, 이미지, Agent 작업을 실행할 수 있습니다.

핵심 요약

  • OpenRouter는 익명의 제3자 모델, 1,048,576토큰 컨텍스트, 텍스트·이미지·비디오 입력을 확인했습니다. Z.ai나 GLM 이름은 없습니다.

  • Tokenizer, 비디오 토큰 예산, 백엔드 오류는 GLM-5.x 계열과 Z.ai 서비스 스택을 가리키지만 정확한 checkpoint를 식별하지는 못합니다.

  • Z.ai는 공개 GLM-5.3이 GLM-5.2와 같은 base model을 쓰고 post-training으로 개선됐다고 설명합니다. Flash 추정이 맞다면 "GLM-5.2 지능과 네이티브 멀티모달"이라는 설명이 성립합니다.

  • Ox Alpha의 긍정적 결과는 개인 테스트, 부분집합, 단일 과제 중심입니다. 종합 순위가 아닙니다.

  • Tabbit은 GLM-5.3 Flash를 사용할 모델로 표시합니다. 제품 라벨은 공식 신원 발표와 다릅니다.

신원 증거 한눈에 보기

주장증거현재 판단증명하지 못하는 것
Ox Alpha는 익명 프리뷰 모델OpenRouter 모델 기록확인개발사와 운영사
1M 컨텍스트와 멀티모달 입력OpenRouter 공식 발표확인시각 정확도와 장기 제공
GLM-5.x 계열커뮤니티 기술 리뷰강한 추론가중치나 공개 SKU의 일치
GLM-5.3 FlashDi Zhang의 글 같은 커뮤니티 귀속미확인공식 이름, API ID, Z.ai 발표
GLM-5.2 기반을 이어받음표준 5.3과 5.2가 같은 base라는 Z.ai 설명조건부Ox가 정확히 같은 checkpoint라는 사실

짧게 말하면 GLM 계열과 Z.ai 호스팅은 유력하지만 GLM-5.3 Flash라는 이름은 아직 증명되지 않았습니다.

미스터리 모델이 등장한 과정

8월 14일 Z.ai는 GLM-5.3 기술 글을 발표했습니다. 표준 GLM-5.3은 GLM-5.2와 같은 base model을 사용하며 더 많은 환경, 다양한 과제, post-training 연산으로 향상됐다고 설명합니다. 시각 기능을 갖춘 빠른 변형이 같은 추론 기반을 유지한다는 가설은 여기서 출발합니다. Tabbit의 GLM-5.2는 스타일과 지시 준수 비교용 기준이 됩니다.

8월 21일 OpenRouter에 stealth/ox-alpha가 올라왔습니다. 1,048,576토큰 컨텍스트, 최대 131,072토큰 출력, 장시간 코딩과 Agent 작업이 공개 사양입니다. 공식 X 발표는 텍스트, 이미지, 비디오 입력도 명시했습니다.

이 조합은 공개 GLM-5.3의 긴 컨텍스트와 GLM-5V 계열의 시각 능력이 만난 것처럼 보입니다. 그러나 어떤 공개 모델 카드와도 완전히 일치하지 않습니다. OpenRouter는 익명의 제3자가 개발하고 운영한다고만 말하며, 제공자가 prompt와 completion을 보관한다고 알립니다.

TechCrunch의 초기 보도 당시에는 GLM과 Microsoft MAI 등 여러 추정이 경쟁했습니다. 이후 50개 문자열의 토큰 수가 GLM-5.3과 모두 일치하고, 네 개 비디오의 토큰 예산이 GLM-5V-Turbo와 같으며, 일부 서버 오류가 GLM 백엔드와 닮았다는 분석이 나왔습니다.

이 단서들은 서로 보강하지만 tokenizer와 video encoder는 공유할 수 있습니다. Z.ai 서버가 외부 모델을 호스팅할 수도 있습니다. 따라서 "GLM-5.x의 멀티모달 형제 모델"이 책임 있는 결론입니다.

GLM-5.2 지능과 네이티브 멀티모달

이 표현은 두 가지 정보를 합칩니다. 표준 GLM-5.3은 GLM-5.2 기반을 유지하고 장시간 코딩, 도구 사용, 실제 과제에 대해 추가 학습했습니다. 계획하고 행동하고 관찰하는 루프는 Agentic Reasoning 가이드에서 설명합니다.

Ox Alpha는 같은 엔드포인트에서 이미지와 비디오를 받습니다. 제품 경험에서는 네이티브 멀티모달이라 부를 수 있지만 내부 아키텍처는 알 수 없습니다. Flash설이 맞다면 GLM-5.2/5.3 추론 계열에 시각 컨텍스트를 결합한 모델로 해석할 수 있습니다. Flash가 빠른 서비스 등급을 뜻한다는 생각은 이름에 관한 추측입니다.

숫자는 대상별로 분리해야 한다

공식 benchmarkGLM-5.3GLM-5.2대상
Terminal Bench 3.028.34.6공개 표준 GLM
DeepSWE v1.166.946.2공개 표준 GLM
CyberGym84.577.2공개 표준 GLM
AutomationBench48.226.2공개 표준 GLM

위 수치는 Z.ai가 표준 GLM-5.3에 대해 발표한 결과입니다. Ox Alpha 결과로 바꾸어 부를 수 없습니다.

테스트보고 결과읽을 수 있는 내용한계
DeepSWE 부분집합평균 47K 출력에서 약 63%긴 소프트웨어 과제의 긍정적 신호전체 과제, prompt, harness, 코드 없음
Cline 실제 버그Ox와 Fable 모두 수정, Ox 출력은 약 3분의 1간결하고 정확한 단일 사례공개되지 않은 한 과제
Reddit SVG물체 관계에 대한 긍정 평가반복 가능한 시각 smoke test이미지 한 장, blind 평가 아님
사용자 언어 게임10개 레벨 동작, modulo 추가, 레벨 설계는 약함새로운 문서를 읽고 긴 구현을 수행한 사례repository와 test log 없음

무료 기간에는 과부하, 느린 시작, upstream error도 보고됐습니다. 이는 지능보다 서비스 용량 문제지만 장시간 Agent 작업의 성공 여부를 바꿉니다. GPT-5.6 Sol 1M 컨텍스트 글에서도 용량, 제품 제한, 비용, 성공률을 따로 봅니다.

Tabbit에서 직접 검증하기

Tabbit Browser는 출처 탭, 이미지, prompt, 응답을 같은 브라우저에 남길 수 있습니다.

GPT, Claude, Kimi, Qwen, GLM 응답을 나란히 보여 주는 Tabbit Browser
Tabbit에서는 같은 prompt를 여러 모델과 비교할 수 있습니다. 화면의 GLM-5.2는 GLM-5.3 Flash 테스트의 기준이 됩니다.

먼저 성공 조건이 분명한 텍스트 과제를 수행하고, GLM-5.2나 다른 모델로 같은 prompt를 반복하세요. 이미지를 추가했다면 답변이 실제 화면 세부 정보를 사용했는지 확인합니다. 여러 단계의 웹 작업은 Agent Mode에서 공개적이고 되돌릴 수 있는 대상으로 제한하고 도구 호출, 재시도, 시간, 결과물을 기록하세요.

코딩 harness를 연결할 때도 클라이언트 안정성과 모델 품질을 분리해야 합니다. DeepSeek Harness 브라우저 가이드가 같은 원칙을 다룹니다. 조사 작업은 출처 탭을 첨부하고 결론 전에 증거표를 요청하세요. 연구자용 AI 브라우저Tabbit 소개에 구체적인 흐름이 있습니다.

현재 판단

질문이유
코딩과 Agent로 시험할 가치가 있나통제된 과제라면 있다구체적인 사례는 좋지만 수가 적다
GLM과 관련 있나가능성이 높다여러 독립 지문이 같은 방향을 가리킨다
GLM-5.3 Flash로 확정됐나아니다공식 발표, 공개 ID, 가중치 일치가 없다
63%를 종합 점수로 쓸 수 있나없다방법이 완전히 공개되지 않은 부분집합이다
민감한 데이터에 적합한가익명인 동안 피해야 한다운영자와 보관 조건이 충분하지 않다
Tabbit에서 시험하는 것이 합리적인가되돌릴 수 있는 과제라면 그렇다모델, 컨텍스트, 비교가 한곳에 있다

Ox Alpha는 GLM 계열처럼 보이고 Z.ai 서비스 스택을 사용하며 1M 컨텍스트와 멀티모달 입력을 결합합니다. GLM-5.3 Flash는 가장 깔끔한 설명이지만 아직 가설입니다. 자신의 과제로 시험하고 prompt와 결과를 보관하면 공식 checkpoint 이름이 나왔을 때 결론을 쉽게 고칠 수 있습니다.

자주 묻는 질문

Ox Alpha는 어떤 모델인가요?

Ox Alpha는 OpenRouter가 2026년 8월 21일 공개한 익명 프리뷰 모델입니다. 컨텍스트 1,048,576토큰, 최대 출력 131,072토큰을 제공하며 코딩, 지속적인 에이전트 작업, 프로덕션 워크로드를 대상으로 합니다. 개발사와 정확한 checkpoint는 공개되지 않았습니다.

Ox Alpha가 GLM-5.3 Flash로 공식 확인됐나요?

아닙니다. OpenRouter와 Z.ai 어느 쪽도 그 정체를 공식 확인하지 않았습니다. 공개된 기술적 지문은 GLM-5.x 계열과 Z.ai 서비스 스택을 강하게 가리키지만 Flash라는 이름은 아직 커뮤니티의 추정입니다.

왜 Ox Alpha를 GLM 계열로 보나요?

커뮤니티 조사에서 50개 문자열의 토큰 수가 GLM-5.3과 모두 일치했고, 비디오 토큰 예산은 GLM-5V-Turbo와 비슷했으며, 일부 서버 오류도 Z.ai GLM 백엔드와 일치한다고 보고됐습니다. 계열과 호스팅에 관한 단서일 뿐 같은 가중치를 증명하지는 않습니다.

Ox Alpha는 멀티모달인가요?

네. OpenRouter 공식 발표는 텍스트, 이미지, 비디오를 입력하고 텍스트를 출력한다고 명시합니다. 시각 benchmark, 안정적인 비디오 길이 제한, 내부 아키텍처는 공개하지 않았습니다.

Ox Alpha가 GLM-5.2의 지능을 이어받았나요?

Z.ai는 공개 GLM-5.3이 GLM-5.2와 같은 base model을 사용하고 추가 post-training으로 향상됐다고 설명합니다. Ox Alpha가 추정대로 GLM-5.3 Flash라면 자연스러운 설명이지만, 아직 Ox Alpha 자체에 관한 공식 아키텍처 설명은 아닙니다.

Tabbit에서 GLM-5.3 Flash를 어떻게 사용하나요?

Tabbit의 GLM-5.3 Flash 모델 페이지를 열고 텍스트, 이미지 또는 Agent 작업을 입력한 뒤 Tabbit에서 사용을 선택하세요. 프롬프트와 출력을 저장하고 익명 프리뷰에는 비공개 코드, 자격 증명, 고객 데이터를 보내지 마세요.

다음 단계

Tabbit 과 함께 일하세요.

탭 간 조사를 하고, 반복적인 브라우저 작업을 자동화하며, 모든 맥락을 손이 닿는 곳에 두세요.