Z.ai, Ox Alpha 개발 인정…정체는 GLM-5.3-Flash로 확인
Z.ai가 익명으로 공개됐던 모델 'Ox Alpha'를 자사가 만들었다고 인정했다. 정체는 엔비디아 칩 없이 구동되고 가격은 서구 모델의 일부 수준에 불과한 GLM-5.3-Flash였다.

8월 하순, 아무런 예고 없이 Ox Alpha라는 이름의 미스터리 모델이 OpenRouter와 OpenCode에 등장해 어떤 연구소도 개발 사실을 밝히지 않은 채 순위표와 벤치마크에서 최상위권 모델들과 어깨를 나란히 했다. 이후 며칠간 이 침묵은 AI 업계 최대의 추측 게임으로 번졌다. 본지가 앞서 이 은밀한 출시를 다룬 기사에서는 개발자를 둘러싼 다섯 가지 경쟁 가설을 정리한 바 있다—Z.ai의 GLM 계열, 마이크로소프트, 구글, Cursor, 바이트댄스—이들 가설은 대부분 토크나이저(문장을 단어 단위로 쪼개는 방식)에 남은 흔적에 근거했는데, 거론된 어느 연구소도 확인도 부인도 하지 않았기 때문이다. 토크나이저 테스트는 가장 일관되게 Z.ai를 가리켰다. 11개의 독립적인 테스트에서 GLM 계열 모델은 모두 일치했지만, 다른 어떤 연구소의 모델도 4개 이상 일치하지 못했다. 하지만 Ox Alpha가 흡수한 무료 사용량의 규모가 워낙 커서, 당시 가장 유력했던 이 가설조차 의심을 받았다.
이 미스터리는 이제 풀렸다. TechCrunch가 인용한 블룸버그 보도에 따르면, Z.ai는 Ox Alpha가 자사 GLM 시리즈의 최신 버전이라고 확인했다. 회사 측은 수요일에 Ox Alpha의 가중치를 공개할 계획이라고 밝혔으며, 공개 이후에는 외부 개발자들이 이를 바로 활용해 개발을 이어갈 수 있다. Z.ai는 이 모델을 코딩, 장시간에 걸친 에이전트형 작업, 프로덕션 환경의 부하 처리를 위해 설계됐으며, 장기간에 걸친 소프트웨어 엔지니어링 작업과 텍스트·이미지가 결합된 워크플로에 적합하다고 설명했다.
가면 뒤의 정체: GLM-5.3-Flash
공식 명칭으로 Ox Alpha는 GLM-5.3-Flash다. 독일 매체 the-decoder.de에 따르면 이는 GLM-5 시리즈 중 처음으로 네이티브 멀티모달을 지원하는 모델이다. 이 모델은 총 3200억 개의 매개변수를 갖추고 있지만, 하나의 작업에서 실제로 활성화되는 매개변수는 180억 개에 불과하다. 추론 비용을 낮추기 위한 전문가 혼합(MoE) 구조다. 모델은 MIT 라이선스로 공개되며 가중치는 Hugging Face에 게시돼 있고, 100만 토큰의 컨텍스트 윈도를 지원한다.
Artificial Analysis의 Intelligence Index에서 GLM-5.3-Flash는 최대 추론 강도 기준 57점을 기록했다. 더 큰 모델인 GLM-5.3의 60점에 단 3점 뒤지는 수준으로, GPT-5.6 Terra, Muse Spark 1.2와 거의 동급이다. 정작 중요한 차이는 가격이다. Artificial Analysis는 해당 지수에서 작업당 비용을 0.09달러로 산정했는데, 이는 GLM-5.3의 0.68달러 대비 약 7.5배 저렴한 수준이며, 이 회사는 이를 근거로 이 모델이 지능과 비용 사이의 파레토 프런티어에 위치한다고 밝혔다. Z.ai 자체 API를 통해 이용하면 GLM-5.3-Flash는 입력 토큰 100만 개당 0.15달러, 출력 토큰 100만 개당 0.50달러로, GLM-5.3 가격의 약 10분의 1 수준이다. 에이전트형 벤치마크인 GDPval-AA v2에서는 Elo 약 1770점을 기록해 GLM-5.3, Grok 4.6과 비슷한 수준이며, Claude Opus 5에만 뒤처진다. 그 대가는 효율성에서 나타난다. Artificial Analysis에 따르면 이 모델의 출력 토큰 중 약 90%가 최종 답변이 아닌 추론 과정에 쓰이는데, 이는 토큰당 가격이 낮더라도 응답 속도를 늦출 수 있다.
- 총 매개변수 3200억 개, 작업당 실제 활성화되는 매개변수 180억 개(전문가 혼합 구조)
- Intelligence Index: 57점, GLM-5.3의 60점 대비 작업당 비용은 약 7.5배 저렴(0.09달러 대 0.68달러)
- API 가격: 입력 토큰 100만 개당 0.15달러, 출력 토큰 100만 개당 0.50달러—GLM-5.3 가격의 약 10분의 1
- 에이전트형 GDPval-AA v2 점수: Elo 약 1770, Claude Opus 5에만 뒤처짐
- Z.ai에 따르면 하루 100조 개의 토큰을 처리했으며, 전량 중국산 칩에서 구동
엔비디아 'CUDA 해자'에 대한 시험대
더 눈에 띄는 주장은 모델 자체가 아니라 인프라에 관한 것이다. 정식 이름으로 공개되기 전, Z.ai는 GLM-5.3-Flash를 'ox-alpha'라는 익명으로 OpenCode와 OpenRouter에서 테스트했고, 그 주 가장 많이 쓰인 모델이 됐다. Z.ai에 따르면 당시 모든 트래픽은 엔비디아 하드웨어가 아닌 중국산 AI 칩에서 처리됐다. SemiAnalysis는 이 시스템이 하루 100조 개의 토큰을 처리했다고 전했는데, 이는 그동안 최상위권 연구소만 달성할 수 있다고 여겨졌던 규모다. 또한 Z.ai가 하드웨어 효율성과 토큰당 비용이 주류 엔비디아 GPU와 견줄 만하다고 주장한다고 전했다. SemiAnalysis는 이 결과를 엔비디아의 이른바 'CUDA 해자'에 대한 또 하나의 시험으로 평가했다. CUDA는 엔비디아가 거의 20년에 걸쳐 구축한 독점 소프트웨어 계층으로, AI 프레임워크와 엔비디아 칩 사이에 자리 잡고 있으며 거의 모든 AI 소프트웨어가 여기에 맞춰 최적화돼 있다. 다른 칩으로 전환하려면 통상 연산 처리와 메모리 접근 방식을 처음부터 다시 프로그래밍해야 하는데, 이 작업 때문에 그동안 엔비디아의 경쟁자들은 서류상으로는 빠르지만 실제로는 제대로 활용되지 못하는 칩을 갖게 되는 경우가 많았다. Z.ai는 오픈소스 프레임워크인 SGLang을 기반으로 자체 서빙 소프트웨어를 구축하고, 처리 과정을 독립적으로 확장 가능한 여러 단계로 나눠 이 문제를 우회했다고 밝혔다. 회사에 따르면 이를 통해 같은 하드웨어에서 처리량을 첫 시도 대비 3배로 늘렸으며, 이 최적화 작업에는 GLM-5.3 기반 에이전트가 도움을 줬다.
이런 익명의 '스텔스' 출시는 특히 중국 연구소들 사이에서 일종의 정석으로 자리 잡고 있다. 이름 없이 모델을 공개하면 잘 알려진 브랜드에 따라붙는 선입견—긍정적이든 부정적이든—없이 순전히 순위표 성적과 개발자들의 실제 사용만으로 평가받을 수 있다. 정식 출시를 발표하기 전까지 말이다. 동시에 이는 완전히 새로운 인프라—이번 경우에는 엔비디아를 전혀 쓰지 않는 서빙 파이프라인 전체—를 회사 이름을 걸기 전에 프로덕션 규모에서 시험해보는 방법이기도 하다.
엔비디아에 의존하지 않는다는 이번 주장은 수년간 이어진 미국의 수출 규제라는 배경 속에서 나왔다. 이 규제는 중국 연구소들이 엔비디아의 최신 AI 칩에 접근하는 것을 제한해왔고, 이들을 자국산 대안과 이를 경쟁력 있게 만들기 위한 맞춤형 소프트웨어 쪽으로 밀어붙였다. 만약 Z.ai가 제시한 효율성 수치가 독립적인 검증을 통과한다면, 이는 CUDA 소프트웨어 생태계만으로 엔비디아가 수출 규제를 우회하며 역량을 쌓아가는 연구소들에 대해 장기적인 우위를 보장받을 수 있다는 가정을 약화시킬 수 있다. 이는 엔비디아가 오랫동안 지배해온 시장에서 얼마나 많은 가격 결정력을 유지할 수 있을지에도 실질적인 영향을 미칠 수 있다.
서구의 최상위 모델 대신 더 저렴한 중국산 모델로 프로덕션 워크로드를 옮길지 검토 중인 한국 기업들에게 GLM-5.3-Flash는 구체적인 판단 근거를 제공한다. 플래그십급 모델에 근접한 성능을, API 비용의 약 10분의 1 수준으로 얻을 수 있고, 라이선스상 자체 호스팅도 가능하다. 하지만 그만큼 현실적인 대가도 있다. 추론 토큰 사용량이 많아 응답이 느려질 수 있고, 중국에 본사를 둔 연구소이기 때문에 데이터 처리와 수출 규제 준수 문제가 별도로 따라붙으며, Ox Alpha의 스텔스 출시 자체가 그랬듯 이런 사양들은 Z.ai가 직접 공개하기 전까지 독립적인 검증을 거치지 않았다. 이런 저비용·고성능 모델이 중국 연구소들로부터 계속 나오는 상황에서, 벤치마크 점수만이 아니라 비용 절감과 이러한 데이터 거버넌스 문제를 함께 저울질하는 것이 공급업체 평가의 표준 절차로 자리 잡을 가능성이 크다.
출처
- Surprise: Z.ai is the AI lab behind the mysterious Ox Alpha modelTechCrunch · 2026년 8월 26일
- Chinesisches KI-Modell GLM-5.3-Flash läuft ohne Nvidia und kostet einen Bruchteil der KonkurrenzThe Decoder · 2026년 8월 27일



