Z.ai bevestigt makerschap van Ox Alpha: het is GLM-5.3-Flash
Z.ai heeft bevestigd het anonieme model 'Ox Alpha' te hebben gebouwd: het gaat om GLM-5.3-Flash, dat zonder Nvidia-chips draait en een fractie kost van wat westerse modellen kosten.

Eind augustus dook zonder aankondiging een mysterieus model op, Ox Alpha, op OpenRouter en OpenCode, dat in ranglijsten en benchmarks opklom tegen de beste beschikbare modellen zonder dat enig lab het opeiste. In de dagen erna groeide die stilte uit tot een van de grootste raadspelletjes van de AI-sector: onze eerdere berichtgeving over die stealth-lancering somde vijf rivaliserende theorieën op over de maker — de GLM-familie van Z.ai, Microsoft, Google, Cursor en ByteDance —, vooral gebaseerd op de vingerafdruk van de tokenizer, omdat geen van de genoemde labs iets wilde bevestigen of ontkennen. Tokenizer-tests wezen het meest consistent naar Z.ai, waarvan de GLM-modellen op elf verschillende tests overeenkwamen, terwijl geen enkel ander lab boven de vier overeenkomsten uitkwam — maar de enorme schaal van het gratis gebruik dat Ox Alpha opslokte, zaaide twijfel over zelfs die sterkste theorie.
Dat raadsel is nu opgelost. Volgens een bericht van Bloomberg, geciteerd door TechCrunch, heeft Z.ai bevestigd dat Ox Alpha de nieuwste telg is in zijn GLM-reeks. Het bedrijf kondigde aan de gewichten van Ox Alpha op woensdag vrij te geven, waarna externe ontwikkelaars er direct op kunnen voortbouwen. Z.ai omschrijft het model als gericht op programmeren, langdurig agentisch werk en productiebelasting, geschikt voor langlopende softwareontwikkeltaken en workflows die tekst met beeld combineren.
Achter het masker: GLM-5.3-Flash
Onder zijn officiële naam is Ox Alpha het model GLM-5.3-Flash — volgens de Duitse site the-decoder.de het eerste van nature multimodale model in de GLM-5-reeks. Het model telt in totaal 320 miljard parameters, waarvan er per taak slechts 18 miljard actief zijn, een mixture-of-experts-ontwerp dat de inferentiekosten moet drukken. Het model verschijnt onder een MIT-licentie, met de gewichten beschikbaar op Hugging Face, en ondersteunt een contextvenster van een miljoen tokens.
Op de Intelligence Index van Artificial Analysis scoort GLM-5.3-Flash bij maximale reasoning-inspanning 57 punten — slechts drie punten achter de 60 van het grotere GLM-5.3, en ongeveer gelijk met GPT-5.6 Terra en Muse Spark 1.2. Het verschil dat er echt toe doet, is de prijs: Artificial Analysis rekent de kosten per taak in zijn index op 0,09 dollar, tegen 0,68 dollar voor GLM-5.3, ongeveer 7,5 keer goedkoper — daarmee staat het model volgens het bureau op de Pareto-grens tussen intelligentie en kosten. Via de eigen API van Z.ai kost GLM-5.3-Flash 0,15 dollar per miljoen input-tokens en 0,50 dollar per miljoen output-tokens, ongeveer een tiende van de prijs van GLM-5.3. Op de agentische benchmark GDPval-AA v2 scoort het een Elo van ongeveer 1770, gelijk met GLM-5.3 en Grok 4.6, en alleen voorbijgestreefd door Claude Opus 5. De keerzijde zit in de efficiëntie: volgens Artificial Analysis gaat ongeveer 90 procent van de output-tokens van het model naar redeneren in plaats van naar het uiteindelijke antwoord, wat antwoorden kan vertragen ondanks de lagere prijs per token.
- 320 miljard parameters in totaal, 18 miljard actief per taak (mixture of experts)
- Intelligence Index: 57 punten tegenover 60 voor GLM-5.3, bij ongeveer 7,5 keer lagere kosten per taak (0,09 $ tegenover 0,68 $)
- API-prijs: 0,15 $ per miljoen input-tokens, 0,50 $ per miljoen output-tokens — ongeveer een tiende van de prijs van GLM-5.3
- Agentische GDPval-AA v2-score: Elo ≈ 1770, alleen achter Claude Opus 5
- Volgens Z.ai 100 biljoen tokens per dag geleverd, volledig op Chinese chips
De 'CUDA-slotgracht' van Nvidia op de proef
De opvallendste claim gaat niet over het model, maar over de infrastructuur. Vóór de naamgebonden release testte Z.ai GLM-5.3-Flash anoniem als 'ox-alpha' op OpenCode en OpenRouter, waar het uitgroeide tot het meest gebruikte model van de week. Volgens Z.ai draaide al dat verkeer op Chinese AI-chips in plaats van Nvidia-hardware. SemiAnalysis meldde dat die opzet 100 biljoen tokens per dag leverde, een schaal die eerder alleen haalbaar werd geacht voor frontier-labs, en merkte op dat Z.ai stelt dat de hardware-efficiëntie en de kosten per token vergelijkbaar zijn met gangbare Nvidia-GPU's. SemiAnalysis ziet dit als een nieuwe test van Nvidia's zogeheten 'CUDA-slotgracht' — de eigen softwarelaag, in bijna twintig jaar opgebouwd, die tussen AI-frameworks en Nvidia-chips zit en waarop vrijwel alle AI-software is afgestemd. Overstappen naar een andere chip betekent normaal gesproken rekenbewerkingen en geheugentoegang helemaal opnieuw programmeren, werk waardoor Nvidia's concurrenten historisch gezien chips overhielden die op papier snel waren maar in de praktijk slecht benut werden. Z.ai zegt dit te hebben omzeild door eigen serving-software te bouwen bovenop het opensource-framework SGLang, waarbij de verwerking werd opgeknipt in onafhankelijk schaalbare fasen; het team zegt zo de doorvoer op dezelfde hardware te hebben verdrievoudigd ten opzichte van de eerste poging, met hulp van een agent gebaseerd op GLM-5.3 bij die optimalisatie.
Zo'n anonieme, 'stealth' lancering is vooral bij Chinese labs een soort blauwdruk geworden: door een model zonder naam uit te brengen, wordt het puur beoordeeld op ranglijstresultaten en echt ontwikkelaarsgebruik, vrij van de aannames die bij een bekend merk horen, voordat het lab zich vastlegt op een formele release. Het dient ook om een gloednieuwe infrastructuurstack — in dit geval een volledig Nvidia-vrije serving-pijplijn — op productieschaal te testen voordat de bedrijfsnaam eraan wordt verbonden.
De claim van onafhankelijkheid van Nvidia komt er na jaren van Amerikaanse exportbeperkingen die de toegang van Chinese labs tot de meest geavanceerde Nvidia AI-chips hebben beperkt en hen richting binnenlandse alternatieven en maatwerksoftware hebben geduwd om die concurrerend te maken. Als Z.ai's efficiëntiecijfers standhouden onder onafhankelijk onderzoek, ondermijnen ze de aanname dat Nvidia's CUDA-ecosysteem alleen al een blijvend voordeel garandeert tegenover labs die rond exportbeperkingen heen bouwen in plaats van erdoorheen — met reële gevolgen voor de prijszettingsmacht die Nvidia kan behouden in een markt die het al lang domineert.
Voor Nederlandse en Belgische bedrijven die overwegen productiebelasting naar een goedkoper Chinees model te verplaatsen in plaats van naar een westers topmodel, levert GLM-5.3-Flash een concreet gegeven op: prestaties dicht bij een volwaardig vlaggenschipmodel, voor ongeveer een tiende van de API-prijs, onder een licentie die self-hosting toestaat. De keerzijdes zijn ook reëel: een zwaarder gebruik van reasoning-tokens dat antwoorden kan vertragen, een in China gevestigd lab met eigen kwesties rond gegevensverwerking en exportnaleving — een punt waar bedrijven onder de AVG extra op moeten letten —, en specificaties die, net als de stealth-lancering van Ox Alpha zelf, onafhankelijk ongeverifieerd bleven totdat Z.ai ze zelf onthulde. Kostenbesparing afwegen tegen die vragen over datagovernance, in plaats van alleen tegen benchmarkscores, wordt vermoedelijk een standaardstap bij leveranciersevaluatie naarmate er meer van dit soort goedkope, krachtige releases uit Chinese labs komen.
Bronnen
- Surprise: Z.ai is the AI lab behind the mysterious Ox Alpha modelTechCrunch · 26 augustus 2026
- Chinesisches KI-Modell GLM-5.3-Flash läuft ohne Nvidia und kostet einen Bruchteil der KonkurrenzThe Decoder · 27 augustus 2026



