TabbitBlog

Ox Alpha의 정체는 GLM-5.3-Flash

Ox Alpha는 GLM-5.3-Flash였다. 익명 프리뷰, 모델 지문, 공개 테스트, 네이티브 멀티모달, Tabbit에서 쓰는 방법을 정리했다.

이 글의 목차
  1. 핵심 요약
  2. Ox Alpha 타임라인
  3. GLM을 가리킨 기술 지문
  4. GLM-5.2 지능 계열과 네이티브 멀티모달
  5. 커뮤니티 테스트가 말해 주는 범위
  6. Tabbit에서 사용하기
  7. 작업별 선택

Ox Alpha의 정체는 GLM-5.3-Flash였다. 8월 27일 이름이 공개되기 전 일주일 동안 이 익명 모델은 OpenRouter를 통해 실제 repository, 이미지, 비디오, 긴 Agent 작업을 처리했다.

RandomAI 영상 댓글에는 한 번의 세션으로 버전 업그레이드 전체 workflow를 끝냈다는 개발자 경험이 있다. 개인 경험이지 benchmark는 아니다. 그래도 공개 전부터 사람들이 이 모델을 실제 작업에 썼다는 점은 분명하다. 이제 Tabbit Browser에서도 GLM-5.3-Flash를 선택할 수 있다.

핵심 요약

  • Ox Alpha는 2026년 8월 20일 OpenRouter에 등장한 100만 token context의 익명 프리뷰였다.

  • 텍스트, 이미지, 비디오를 입력받았고 코딩과 장기 Agent 작업을 목표로 했다.

  • tokenizer, 비디오 token 예산, Z.ai 형태의 오류가 공개 전에 GLM 계열을 강하게 지목했다.

  • 초기 테스트는 구체적인 신호지만 완전한 순위표는 아니다.

  • Tabbit에서는 페이지, 이미지, 문서, 브라우저 행동을 섞는 작업에 Flash가 잘 맞는다.

Ox Alpha 타임라인

날짜공개 정보당시 가능한 결론
8월 20일OpenRouter가 Ox Alpha 공개1M context의 실제 모델, 개발사는 미상
8월 21일OpenRouter 공식 X가 텍스트, 이미지, 비디오 입력 명시API는 멀티모달, 연구소는 미상
8월 21일부터 25일지문 분석과 커뮤니티 테스트 등장GLM이 가장 유력한 계열, 제품명은 미확정
8월 25일Di Zhang이 GLM-5.3-Flash라고 적음정확한 이름이 공개 토론에 등장
8월 27일Ox Alpha가 GLM-5.3-Flash로 공개코드명과 제품명이 연결됨

8월 23일 TechCrunch는 GLM과 Microsoft MAI 등 여러 가설을 함께 다뤘다. 나중의 답으로 그때의 불확실성을 지워서는 안 된다.

GLM을 가리킨 기술 지문

Jonathan Turner의 분석은 prompt만으로 흉내 내기 어려운 측정을 모았다.

신호보고된 결과뒷받침한 판단단독으로 증명하지 못한 것
TokenizerOx와 GLM-5.3이 50개 문자열에서 모두 일치GLM-5.x vocabulary정확한 weights
비디오 token4개 영상이 GLM-5V-Turbo와 일치GLM-V형 visual encoder공개 5V-Turbo 자체
서비스 오류Java path와 business code가 Z.ai PaaS v4와 일치Z.ai형 backend모든 post-training 소유권
제품 cardOx는 1M + vision, 공개 5.3은 text only미공개 multimodal GLM-5.x최종 이름

Google 질문도 "누가 만들었나"에서 "GLM-5.3-Flash인가"로 옮겨 갔다. 검색은 논쟁을 보여 줬고, 측정은 범위를 좁혔다. Turner는 GLM 계열과 Z.ai 서비스까지 도달했고, Di Zhang이 이름을 제시했으며, 27일 공개로 마지막 빈칸이 채워졌다.

GLM-5.2 지능 계열과 네이티브 멀티모달

Z.ai GLM-5.3 기술 글에 따르면 표준 GLM-5.3은 GLM-5.2와 같은 base model을 쓴다. 개선은 실행 가능한 환경, 더 긴 작업, 추가 post-training compute에서 나왔다. 이전 세대는 Tabbit의 GLM-5.2GLM-5.1에서 확인할 수 있다.

GLM-5.3-Flash는 이 계열에 네이티브 멀티모달 입력을 더했다. 이미지에서 UI를 읽고 사양, 코드, 문서로 추론을 이어갈 수 있다.

표준 GLM-5.3의 DeepSWE와 Terminal-Bench 수치를 Flash에 그대로 붙이면 안 된다. 비슷한 목적이라도 checkpoint와 harness는 별도로 검증해야 한다.

커뮤니티 테스트가 말해 주는 범위

Wenqi/Kevin은 DeepSWE subset에서 약 63퍼센트, 작업당 평균 47K 출력 token을 보고했다. 전체 작업 목록, 반복 실행, 공식 제출은 공개하지 않았다.

Cline은 실제 repository bug를 Ox Alpha와 Fable로 비교했다. 둘 다 수정했고, Ox는 추론 반복이 적고 출력 token이 약 3분의 1이었다고 밝혔다. 한 건의 bug는 종합 순위를 정할 수 없지만 행동 효율을 보여 주는 단서다.

장기 Agent 평가 방식은 agentic reasoning 가이드를 참고하면 된다. roleplay와 preset은 별도의 GLM-5.3 SillyTavern 가이드가 다룬다.

Tabbit에서 사용하기

  1. Tabbit Browser를 연다. 분석은 Chat, 여러 단계의 웹 작업은 Agent Mode를 쓴다.

  2. 모델 선택기에서 GLM-5.3-Flash를 고른다.

  3. @로 페이지, 탭 그룹, 스크린샷, 파일을 붙인다.

  4. 완료 조건, 검증 항목, 변경 금지 범위를 적는다.

GPT, Claude, Kimi, Qwen, GLM을 나란히 보여 주는 Tabbit 멀티모델 화면
Tabbit은 여러 모델 계열을 나란히 실행한다. 이 이전 화면에는 GLM-5.2가 있고, GLM-5.3-Flash도 같은 선택 흐름을 사용한다.

연구용 브라우저 가이드는 웹, PDF, 차트를 함께 다루는 방법을 설명한다. Tabbit은 IDE coding harness를 대체하지 않고 프리뷰 무료 조건을 보장하지도 않는다. 현재 한도는 Tabbit 가격에서 확인해야 한다.

작업별 선택

작업적합도사용 방법한계
UI 스크린샷과 웹 사양 비교높음둘 다 @로 붙이고 차이를 검증출처와 시각 근거 유지
웹, 차트, PDF 장기 조사높음탭 그룹에 모아 인용 포함 요약출처 없는 장문 피하기
시각 상태가 있는 브라우저 흐름높음별도 탭 그룹에서 Agent 실행변경 검토
대규모 repository patch보통Tabbit은 문서, code harness는 수정과 testgit과 CI를 대체하지 않음
단순 텍스트 질문가능첨부 없이 Chat작은 모델이 더 빠를 수 있음

GLM-5.3-Flash의 핵심은 GLM 계열의 장기 추론이 시각 context를 직접 다룬다는 점이다. 초기 데이터는 실제 Agent 작업에 시험할 이유가 되지만, 표준 GLM-5.3의 모든 점수를 옮기거나 만능 1위라고 부를 근거는 아니다. 다른 100만 context coding model은 GPT-5.6 Sol 가이드에서 비교할 수 있다.

자주 묻는 질문

Ox Alpha가 정말 GLM-5.3-Flash인가요?

그렇다. 2026년 8월 27일 Ox Alpha는 GLM-5.3-Flash로 공개됐다. 그전까지 OpenRouter에는 익명 stealth/ox-alpha로만 표시됐지만 tokenizer, 비디오 token 예산, 서버 오류 분석은 이미 GLM 계열과 Z.ai 스택을 가리키고 있었다.

GLM-5.3-Flash와 GLM-5.3은 같은 모델인가요?

아니다. 표준 GLM-5.3은 코딩과 장기 Agent 작업을 위한 텍스트 모델이다. GLM-5.3-Flash는 이 지능 계열을 이어가면서 텍스트, 이미지, 비디오 네이티브 입력을 더했다. 평가는 별도로 해야 한다.

GLM-5.3-Flash는 GLM-5.2에서 무엇을 물려받았나요?

Z.ai는 표준 GLM-5.3이 GLM-5.2와 같은 base model을 사용하고 확장된 post-training으로 개선됐다고 밝혔다. 주요 대상은 코딩, 도구 사용, 장기 작업이다. Flash는 이 계열과 네이티브 멀티모달을 결합한다.

Ox Alpha 프리뷰는 어떤 입력을 지원했나요?

OpenRouter는 100만 token context와 텍스트, 이미지, 비디오 입력을 안내했다. 출력은 텍스트였고 코딩, 지속적인 Agent 작업, production workload를 대상으로 했다. 무료 프리뷰는 영구 조건이 아니다.

Ox Alpha 초기 테스트 결과는 좋았나요?

유망하지만 불완전했다. Wenqi/Kevin은 DeepSWE subset에서 약 63퍼센트와 평균 47K 출력 token을 보고했다. Cline은 실제 repository bug 한 건에서 Fable보다 출력 token을 약 3분의 1만 쓰고 수정했다고 밝혔다.

Tabbit에서 GLM-5.3-Flash를 어떻게 쓰나요?

Tabbit Browser에서 Chat 또는 Agent 작업을 열고 GLM-5.3-Flash를 선택한다. @로 현재 탭, 탭 그룹, 스크린샷, 로컬 파일을 붙일 수 있다. 최신 제공 여부와 한도는 모델 선택기와 가격 페이지에서 확인해야 한다.

다음 단계

Tabbit 과 함께 일하세요.

탭 간 조사를 하고, 반복적인 브라우저 작업을 자동화하며, 모든 맥락을 손이 닿는 곳에 두세요.