본문으로 건너뛰기
CoderRed Blog

Article

Ox Alpha는 GLM-5.3-Flash였다 - Qwen3.8-Flash-Next까지, 중국 오픈 웨이트 LLM이 프론티어 턱밑에 왔다

지난주에 OpenRouter의 익명 모델 Ox Alpha를 OMP에 붙여 실제 코딩 작업을 돌렸습니다. 생각보다 일을 잘해서 사용 후기를 썼고, 며칠 뒤에는 Ox Alpha 설정 오류를 고쳐 OMP에 첫 기여까지 했어요.

당시 정체는 공개되지 않았습니다. 기술 지문이 GLM 계열을 가리킨다는 분석만 있었고, 저는 글 마지막에 “정체가 공개되면 별도 후속 글로 확인하겠다”고 적었습니다.

이제 답이 나왔습니다.

Ox Alpha는 Z.ai의 GLM-5.3-Flash였습니다. Z.ai가 8월 26일 공식 발표에서 OpenRouter와 OpenCode에 익명으로 올렸던 모델이라고 직접 밝혔어요.

같은 날 Qwen도 125B 모델 Qwen3.8-Flash-Next를 공개했습니다. Qwen4에 들어갈 새 구조를 미리 연 오픈 웨이트 모델입니다.

둘 다 가중치를 공개했습니다. GLM-5.3-Flash는 MIT 라이선스이고 Qwen3.8-Flash-Next는 Qwen Community License 1.0입니다.

“프론티어 모델과 점수를 주고받는 중국 모델 두 개가 같은 날 가중치까지 열었네?”

제가 가장 반가웠던 건 가중치 공개였습니다. GLM-5.3-Flash는 320B, Qwen3.8-Flash-Next의 본체는 125B입니다. 코딩과 장시간 에이전트 작업에서는 Claude Opus급 모델과 점수를 주고받습니다.

Ox Alpha가 2026년 8월 20일부터 25일까지 OpenRouter에서 23.2조 토큰으로 사용량 1위를 기록한 그래프
OpenRouter 사용량 1위였던 Ox Alpha
Z.ai는 GLM-5.3-Flash를 Ox Alpha라는 이름으로 익명 공개했습니다. 6일 동안 23.2조 토큰을 처리해 다음 모델보다 2.3배 많은 사용량을 기록했습니다. 출처: Z.ai 공식 발표

먼저 핵심부터 정리하면

  1. Z.ai는 Ox Alpha가 GLM-5.3-Flash의 익명 프리뷰였다고 공식 확인했습니다. OpenRouter 공개 6일 동안 23.2조 토큰을 처리해 사용량 1위에 올랐습니다.
  2. 두 모델 모두 오픈 웨이트입니다. GLM-5.3-Flash는 MIT, Qwen3.8-Flash-Next는 Qwen Community License 1.0으로 가중치를 공개했습니다.
  3. GLM-5.3-Flash는 320B 네이티브 멀티모달 MoE 모델이며 최대 100만 토큰 컨텍스트를 지원합니다.
  4. Qwen3.8-Flash-Next는 125B 본체에 51B N-gram 임베딩을 더한 Qwen4 아키텍처의 실험용 프리뷰입니다.
  5. 양사 공식 평가에서 두 모델은 여러 코딩·에이전트 벤치마크에서 Claude Opus 계열과 비슷하거나 더 높은 점수를 냈습니다. 일부 종합 추론 평가는 Opus가 앞섭니다.

Ox Alpha의 정체가 드디어 나왔습니다

Z.ai는 GLM-5.3-Flash를 정식 공개하기 전에 ox-alpha라는 이름으로 OpenRouter와 OpenCode에서 시험했습니다. 실제 사용자의 코딩과 에이전트 작업을 익명 상태로 받았고, 일주일 만에 두 서비스에서 가장 많이 쓰인 모델이 됐습니다.

OpenRouter 기준으로 8월 20일부터 25일까지 처리한 토큰은 23.2조 개였습니다. 2위 DeepSeek-V4-Flash의 9.9조 개보다 2.3배 많습니다. OpenCode에서도 43조 토큰을 기록했습니다.

제가 썼던 모델도 바로 이것이었습니다.

Ox Alpha는 다른 모델이 만든 설계를 구현한 뒤 성능 회귀를 확인했고, 자기 아이디어 두 개를 추가로 시험했습니다. 세 시도가 모두 실패하자 NVIDIA 프로파일러로 돌아가 진짜 병목을 찾았어요. 결국 새 커널 대신 기본 청크 값 하나를 바꿔 runNburn의 프리필 시간을 약 8% 줄였습니다.

투두를 작업 직후 갱신하고, 도구 호출 실수도 스스로 복구했습니다. 당시에는 익명 모델치고 꽤 단단하다고 느꼈는데, 이제 GLM-5.3-Flash라는 이름이 붙었습니다.

반대로 OpenRouter에서 하루짜리 레이트 리밋과 응답 중단도 겪었습니다. 그 문제는 Ox Alpha 모델 자체보다 OpenRouter 제공 경로에서 발생했습니다. OpenCode Zen으로 옮긴 뒤에는 계속 작업할 수 있었어요.

프론티어 턱밑 성능을 오픈 웨이트로 풀었습니다

GLM-5.3-Flash 가중치는 Hugging Face에서 받을 수 있습니다. 라이선스는 MIT이고 SGLang, vLLM, TokenSpeed, Transformers, KTransformers, Unsloth용 실행 경로도 함께 안내됐습니다. 자체 서버에 배포하고 양자화와 런타임 최적화를 직접 시도할 수 있습니다.

Qwen3.8-Flash-Next도 Hugging Face와 ModelScope에 가중치를 공개했습니다. Qwen은 기술 보고서와 QSA용 FlashQLA 저장소까지 연결했고, 이번 구조가 다음 Qwen4의 기반이라고 밝혔습니다.

두 공개의 범위는 같지 않습니다. GLM은 MIT이고 Qwen은 별도 커뮤니티 라이선스를 사용합니다. 학습 데이터와 전체 학습 파이프라인까지 재현하는 완전한 오픈소스 프로젝트도 아닙니다.

가중치가 닫힌 API 모델과는 차이가 큽니다. 프론티어 모델과 같은 평가표에 오른 모델을 내려받아 보관하고, 자체 하드웨어에서 실행하고, 런타임을 고칠 수 있습니다. 저는 이 차이 때문에 이번 발표를 따로 글로 남겼습니다.

GLM-5.3-Flash는 320B 오픈 웨이트 모델입니다

GLM-5.3-Flash는 GLM-5 시리즈 최초의 네이티브 멀티모달 모델입니다. 텍스트뿐 아니라 이미지, 영상, 파일을 입력으로 받고 코딩, 브라우저 조작, 컴퓨터 사용, 문서 작업을 한 모델 안에서 처리하도록 설계됐습니다.

항목GLM-5.3-Flash
전체 파라미터320B
활성 파라미터18B
구조MoE, 선형·희소 어텐션 혼합
컨텍스트최대 100만 토큰
입력텍스트, 이미지, 영상, 파일
주요 용도코딩, 도구 호출, 장시간 에이전트, 컴퓨터 사용
오픈 웨이트Hugging Face 공개
라이선스MIT

GLM-5.3-Flash의 전체 크기는 320B이고 레이어 수는 45개입니다. 이전 GLM-4.5 계열은 전체 355B와 92개 레이어로 구성됐습니다.

긴 컨텍스트 비용도 구조에서 줄였습니다. 선형 어텐션은 가까운 문맥을 압축해 기억하고, 희소 어텐션은 전체 문맥에서 필요한 부분을 찾아옵니다. Z.ai는 GLM-5.3과 비교해 어텐션 연산을 3분의 1로, 레이어당 KV 캐시를 약 4.4분의 1로 줄였다고 밝혔습니다.

공식 점수에서는 Opus 4.8과 바로 붙었습니다

Z.ai가 공개한 여섯 개 코딩·에이전트 평가를 추리면 이렇습니다.

벤치마크GLM-5.3-FlashClaude Opus 4.8
Terminal-Bench 2.184.385.0
DeepSWE v1.163.458.0
Agents’ Last Exam26.327.0
AutomationBench48.841.0
HLE with Tools55.357.9
GDPval-AA v217731582

여섯 항목 중 GLM-5.3-Flash가 세 곳에서 앞서고 세 곳에서 뒤졌습니다. Terminal-Bench와 Agents’ Last Exam의 차이는 1점 이내입니다. Z.ai Code Bench의 최대 사고 설정에서도 GLM-5.3-Flash 29.0, Opus 4.8 29.5가 나왔습니다.

GLM-5.3-Flash와 GLM-5.2, DeepSeek-V4-Vision-Exp, Claude Opus 4.8, GPT-5.6 Terra, Gemini 3.7 Flash의 여섯 개 코딩 및 에이전트 평가 비교
GLM-5.3-Flash 공식 성능 비교
GLM-5.3-Flash는 Terminal-Bench와 Agents’ Last Exam에서 Opus 4.8 바로 아래에 있었고 DeepSWE, AutomationBench, GDPval-AA v2에서는 더 높은 점수를 냈습니다. 출처: Z.ai 공식 발표

이 표는 Z.ai가 발표한 평가입니다. 벤치마크마다 하네스, 컨텍스트 길이, 샘플링 조건이 다르고 일부 점수는 각 회사의 공개 수치를 가져왔습니다. 평가 범위 밖의 실제 작업 품질은 이 표로 확인할 수 없습니다.

코딩 에이전트가 실제 셸과 도구를 쓰는 평가에서 320B 모델이 Opus 4.8과 점수를 주고받았습니다. Artificial Analysis Intelligence Index v4.1.1에서는 57점을 기록했고, 할인 가격 기준 과제당 비용은 0.045달러였습니다. Z.ai는 같은 수준의 지능 점수가 기존에는 약 10배 비용 구간에 있었다고 설명합니다.

같은 날 Qwen은 125B 모델을 열었습니다

Qwen3.8-Flash-Next는 Qwen4에 들어갈 구조를 먼저 공개한 실험용 모델입니다. Qwen3-Next가 이후 Qwen3.5부터 Qwen3.8까지의 기반이 된 것처럼, 이번에는 Qwen4를 만들기 전에 커뮤니티가 새 구조를 검토할 수 있게 가중치를 열었습니다.

Qwen3.8-Flash와 Qwen3.8-Flash-Next 오픈 웨이트 공개를 알리는 Qwen 공식 발표 이미지
Qwen3.8-Flash-Next 공식 발표
Qwen은 Qwen3.8-Flash-Next를 Qwen4 아키텍처의 초기 프리뷰로 공개했습니다. 출처: Qwen 공식 블로그
항목Qwen3.8-Flash-Next
본체 파라미터125B
활성 파라미터6B
N-gram 임베딩51B
MTP 레이어4B
구조MoE, GDN·QSA 혼합
기본 컨텍스트262,144토큰
확장 컨텍스트YaRN으로 100만 토큰
라이선스Qwen Community License 1.0

Qwen3.8-Flash-Next의 본체는 125B입니다. 51B N-gram 임베딩은 CPU 메모리에 두고 비동기로 미리 가져올 수 있게 설계했습니다. 로컬 문구 패턴을 큰 조회표에 맡겨 계산량을 거의 늘리지 않고 모델 용량을 확보하는 방식입니다.

어텐션은 Gated DeltaNet과 Qwen Sparse Attention을 섞습니다. 네 레이어 중 세 개는 과거 문맥을 고정 크기 상태로 압축하고, 나머지 한 개가 긴 문맥에서 중요한 마이크로 블록을 골라 읽습니다. 100만 토큰 환경에서 QSA 커널은 Qwen3.7-Plus 대비 프리필 7.6배, 디코드 4.9배의 속도 향상을 기록했습니다. 접두 캐시 적중률 90% 조건의 전체 프리필 처리량은 8.6배였습니다.

학습 비용도 줄었습니다. Qwen은 Qwen3.7-Plus보다 약 9분의 1 비용으로 학습하면서 코딩과 오피스 작업 성능은 더 높였다고 밝혔습니다. Qwen Cloud의 상용 버전 Qwen3.8-Flash 가격은 100만 토큰당 입력 0.16달러, 출력 0.47달러입니다.

Qwen도 Opus 점수를 넘는 항목이 많았습니다

Qwen 공식 표에서 Qwen3.8-Flash-Next와 Claude Opus 4.6 Max가 함께 있는 항목을 보면 이런 결과가 나옵니다.

벤치마크Qwen3.8-Flash-NextClaude Opus 4.6 Max
SWE-bench Pro62.553.4
SWE-bench Multilingual81.077.5
NL2Repo-Bench48.147.6
CoWorkBench73.968.2
GPQA Diamond91.791.3
HLE35.940.0
LiveCodeBench v691.988.8

Qwen은 코딩과 장시간 업무, 과학 추론에서 Opus 4.6 Max와 비슷하거나 더 높은 점수를 냈습니다. HLE에서는 Opus가 4.1점 앞섰습니다.

평가 조건은 항목마다 다릅니다. SWE-bench Pro의 Opus 점수는 Anthropic 공식 수치이고, 나머지 비교 모델은 Qwen이 수정한 과제와 자체 하네스로 다시 평가했습니다. CoWorkBench는 Qwen 내부 평가입니다. 이 숫자는 125B 오픈 웨이트 모델이 도달한 성능 범위를 보여줍니다.

두 모델은 같은 문제를 비슷한 방향으로 풀었습니다

구현은 다르지만 노리는 곳은 비슷합니다.

공통 방향GLM-5.3-FlashQwen3.8-Flash-Next
전체 모델 규모320B본체 125B
긴 문맥선형·희소 어텐션GDN·QSA
컨텍스트100만 토큰기본 26만, 최대 100만 토큰
멀티모달이미지·영상·파일이미지·텍스트
핵심 작업코딩·컴퓨터 사용·에이전트코딩·오피스·에이전트
공개 방식MIT 오픈 웨이트Qwen Community License 오픈 웨이트

두 모델은 서로 다른 방식으로 희소 어텐션과 선형 어텐션을 결합해 긴 문맥 비용을 줄였습니다. GLM-5.3-Flash는 실제 익명 테스트로 수십조 토큰을 처리했고, Qwen3.8-Flash-Next는 다음 세대 Qwen4 구조를 먼저 보여줬습니다.

그래서 M5 Ultra 맥 스튜디오가 눈에 들어옵니다

애플은 8월 25일 M5 Ultra 맥 스튜디오를 발표했습니다. M5 Ultra 맥 스튜디오 글을 쓸 때도 최대 512GB 통합 메모리와 1.2TB/s 대역폭이 가장 눈에 들어왔어요.

그때는 “이 큰 메모리에 어떤 모델을 올릴까?”가 먼저 떠올랐습니다. 하루 뒤 GLM-5.3-Flash와 Qwen3.8-Flash-Next의 가중치가 함께 열렸습니다. 이제 구체적인 모델 이름이 생겼어요.

이번 두 모델은 가중치를 받을 수 있습니다. 덕분에 512GB 통합 메모리를 갖춘 M5 Ultra에도 올려볼 수 있게 됐습니다.

파라미터 수만으로 가중치 크기를 단순 계산하면 이 정도입니다.

모델8비트4비트
GLM-5.3-Flash약 320GB약 160GB
Qwen3.8-Flash-Next약 180GB약 90GB

GLM은 전체 320B, Qwen은 본체 125B와 N-gram 임베딩 51B, MTP 4B를 합친 180B를 기준으로 계산했습니다. 파라미터 한 개를 8비트 1바이트, 4비트 0.5바이트로 잡은 가중치만의 크기입니다. 실제 실행에는 양자화 메타데이터, KV 캐시, 활성값, 런타임, 운영체제 메모리가 더 필요합니다.

가중치만 놓고 보면 두 모델 모두 512GB 안에 들어옵니다. GLM-5.3-Flash의 8비트 가중치는 약 320GB, Qwen3.8-Flash-Next의 8비트 가중치는 N-gram 임베딩과 MTP까지 단순 합산해 약 180GB입니다. RTX 3090 24GB 한 장에서는 시작하기 어려운 규모입니다.

속도는 아직 모릅니다. 두 모델의 새 희소·선형 어텐션 구조를 MLX와 Metal이 얼마나 빨리 지원하는지, GPU Neural Accelerator를 실제 추론 엔진이 활용하는지 확인할 자료가 없습니다. 모델이 메모리에 들어가는 것과 쾌적하게 생성하는 건 다른 문제입니다.

가격도 큽니다. 현재 256GB 풀칩 구성만 1,850만원이고 512GB 옵션 가격은 공개되지 않았습니다. 그런데 프론티어 턱밑까지 온 오픈 웨이트 모델 두 개가 동시에 나오니, 512GB 맥 스튜디오가 갑자기 훨씬 구체적인 로컬 LLM 머신으로 보이기 시작했습니다.

아직 프론티어와 차이가 남은 곳도 있습니다

공식 벤치마크만으로 실제 제품 완성도를 모두 확인할 수는 없습니다.

  • 양사가 직접 고른 평가와 설정이 많습니다.
  • HLE처럼 최상위 종합 추론에서는 Opus가 앞서는 항목이 있습니다.
  • 장기 작업의 연결 안정성, 도구 호출 일관성, 프롬프트 호환성은 제공 서비스마다 달라집니다.
  • Qwen3.8-Flash-Next는 이름 그대로 Qwen4 전의 실험용 프리뷰입니다.

저도 Ox Alpha의 작업 품질에는 만족했지만 OpenRouter 경로의 레이트 리밋과 응답 중단 때문에 제공자를 옮겼습니다. 벤치마크 점수와 매일 쓰는 서비스 경험은 별개의 축이었어요.

정리하면

Ox Alpha는 Z.ai의 GLM-5.3-Flash였습니다. 제가 OMP에서 코드 작업을 맡겼던 익명 모델이 320B 네이티브 멀티모달 모델로 정식 공개됐고, 가중치는 MIT 라이선스로 열렸습니다.

같은 날 나온 Qwen3.8-Flash-Next는 125B 본체로 Opus 4.6 Max를 넘는 코딩 점수를 냈습니다. Qwen은 가중치와 기술 보고서를 함께 공개했습니다.

두 모델 모두 희소·선형 어텐션과 긴 컨텍스트 최적화로 서빙 비용을 줄였습니다.

중국 오픈 웨이트 LLM은 이제 프론티어 모델과 같은 벤치마크 표에서 점수를 주고받습니다. 이번에는 성능표뿐 아니라 가중치까지 함께 나왔습니다.

그래서 M5 Ultra 맥 스튜디오의 512GB 통합 메모리가 더 눈에 들어옵니다. 공개된 거대 모델과 이를 한 대에 올릴 수 있는 하드웨어가 이틀 간격으로 등장했습니다. 이제 남은 건 MLX와 Metal 지원, 실제 메모리 사용량, 출력 속도입니다.

제가 Ox Alpha를 쓰며 느꼈던 “무료 익명 모델치고 이상하게 잘한다”는 인상에도 이름과 구조가 생겼습니다. 다음에는 이 공개 가중치가 M5 Ultra급 로컬 하드웨어에서 실제로 어느 정도 속도를 내는지 확인해 보고 싶습니다.

참고 자료

댓글