Z.ai confirme avoir créé Ox Alpha, révélé comme GLM-5.3-Flash
Z.ai a confirmé avoir créé le modèle anonyme « Ox Alpha » : il s'agit de GLM-5.3-Flash, qui fonctionne sans puces Nvidia et coûte une fraction du prix des modèles occidentaux.

Un modèle mystérieux baptisé Ox Alpha est apparu sans prévenir fin août sur OpenRouter et OpenCode, grimpant dans les classements et les benchmarks face aux meilleurs modèles disponibles, sans qu'aucun laboratoire ne le revendique. Dans les jours qui ont suivi, ce silence a alimenté l'un des plus grands jeux de devinettes de l'industrie de l'IA : notre précédent article sur ce lancement furtif recensait cinq théories rivales sur son créateur — la famille GLM de Z.ai, Microsoft, Google, Cursor et ByteDance — fondées surtout sur l'empreinte du tokenizer, aucun des laboratoires cités n'ayant voulu confirmer ni infirmer quoi que ce soit. Les tests de tokenizer pointaient le plus systématiquement vers Z.ai, dont les modèles GLM correspondaient sur onze tests différents, quand aucun autre laboratoire ne dépassait quatre correspondances — mais l'ampleur de l'usage gratuit absorbé par Ox Alpha jetait le doute jusque sur cette théorie pourtant la plus solide.
Ce mystère est désormais résolu. Selon une information de Bloomberg citée par TechCrunch, Z.ai a confirmé qu'Ox Alpha est la dernière itération en date de sa série GLM. L'entreprise a annoncé la publication des poids d'Ox Alpha pour mercredi, après quoi les développeurs pourront construire directement dessus. Z.ai décrit le modèle comme conçu pour la programmation, le travail agentique de longue durée et les charges de production, adapté aux tâches d'ingénierie logicielle étendues et aux flux qui mêlent texte et image.
Derrière le masque : GLM-5.3-Flash
Sous son nom officiel, Ox Alpha est GLM-5.3-Flash — la première publication nativement multimodale de la série GLM-5 selon le média allemand the-decoder.de. Le modèle compte 320 milliards de paramètres au total, dont seulement 18 milliards sont actifs pour une tâche donnée, une architecture à mélange d'experts pensée pour limiter le coût d'inférence. Il est publié sous licence MIT, avec ses poids déposés sur Hugging Face, et prend en charge une fenêtre de contexte d'un million de jetons.
Sur l'Intelligence Index d'Artificial Analysis, GLM-5.3-Flash obtient 57 points à effort de raisonnement maximal — trois points seulement derrière les 60 points du plus grand GLM-5.3, et à peu près au niveau de GPT-5.6 Terra et de Muse Spark 1.2. L'écart qui compte vraiment est celui du prix : Artificial Analysis chiffre le coût par tâche de son index à 0,09 dollar, contre 0,68 dollar pour GLM-5.3, soit environ 7,5 fois moins cher — de quoi placer le modèle, selon le cabinet, sur la frontière de Pareto entre intelligence et coût. Via l'API de Z.ai, GLM-5.3-Flash coûte 0,15 dollar par million de jetons en entrée et 0,50 dollar par million en sortie, soit environ un dixième du prix de GLM-5.3. Sur le benchmark agentique GDPval-AA v2, il obtient un score Elo d'environ 1770, à égalité avec GLM-5.3 et Grok 4.6, et devancé seulement par Claude Opus 5. La contrepartie porte sur l'efficacité : selon Artificial Analysis, environ 90 % des jetons de sortie du modèle sont consacrés au raisonnement plutôt qu'à la réponse finale, ce qui peut ralentir les réponses malgré un prix par jeton plus bas.
- 320 milliards de paramètres au total, 18 milliards actifs par tâche (mélange d'experts)
- Intelligence Index : 57 points contre 60 pour GLM-5.3, pour un coût par tâche environ 7,5 fois inférieur (0,09 $ contre 0,68 $)
- Tarif API : 0,15 $ par million de jetons en entrée, 0,50 $ en sortie — environ un dixième du prix de GLM-5.3
- Score agentique GDPval-AA v2 : Elo ≈ 1770, devancé seulement par Claude Opus 5
- 100 000 milliards de jetons livrés par jour, revendiqués comme entièrement servis sur des puces chinoises
Mettre à l'épreuve le « fossé CUDA » de Nvidia
L'affirmation la plus frappante ne porte pas sur le modèle mais sur l'infrastructure. Avant sa sortie sous son vrai nom, Z.ai a testé GLM-5.3-Flash de façon anonyme sous le nom « ox-alpha » sur OpenCode et OpenRouter, où il est devenu le modèle le plus utilisé de la semaine. Selon Z.ai, tout ce trafic a fonctionné sur des puces d'IA chinoises plutôt que sur du matériel Nvidia. SemiAnalysis rapporte que ce dispositif a livré 100 000 milliards de jetons par jour, une échelle jusque-là considérée comme réservée aux seuls laboratoires de pointe, et note que Z.ai revendique une efficacité matérielle et un coût par jeton comparables à ceux des GPU Nvidia courants. SemiAnalysis y voit une nouvelle mise à l'épreuve du « fossé CUDA » de Nvidia — cette couche logicielle propriétaire, bâtie en près de vingt ans, qui s'interpose entre les frameworks d'IA et les puces Nvidia et à laquelle la quasi-totalité des logiciels d'IA est calée. Basculer vers une autre puce impose en principe de reprogrammer les opérations de calcul et l'accès mémoire depuis zéro, un travail qui a longtemps laissé aux rivaux de Nvidia des puces rapides sur le papier mais mal exploitées en pratique. Z.ai affirme avoir contourné ce problème en construisant son propre logiciel de service au-dessus du framework open source SGLang, en découpant l'inférence en étapes indépendamment adaptables à l'échelle ; l'équipe indique avoir ainsi triplé le débit sur le même matériel par rapport à sa première tentative, avec l'aide d'un agent bâti sur GLM-5.3 pour ce travail d'optimisation.
Ce type de lancement anonyme, ou « furtif », est devenu une tactique récurrente, notamment chez les laboratoires chinois : publier un modèle sans nom attaché permet de le faire juger uniquement sur ses résultats de classement et son usage réel par les développeurs, sans les préjugés — favorables ou non — attachés à une marque connue, avant que le laboratoire ne s'engage sur un lancement officiel. Cela permet aussi de tester à l'échelle de la production une toute nouvelle pile d'infrastructure — ici, une chaîne de service entièrement sans Nvidia — avant d'y associer le nom de l'entreprise.
Cette revendication d'indépendance vis-à-vis de Nvidia s'inscrit dans le contexte de plusieurs années de restrictions américaines à l'exportation, qui ont limité l'accès des laboratoires chinois aux puces d'IA Nvidia les plus avancées et les ont poussés vers des alternatives domestiques et des logiciels sur mesure pour les rendre compétitives. Si les chiffres d'efficacité de Z.ai résistent à un examen indépendant, ils affaiblissent l'idée selon laquelle l'écosystème logiciel CUDA suffirait à lui seul à garantir à Nvidia un avantage durable face à des laboratoires qui construisent autour des restrictions à l'export plutôt qu'au travers d'elles — avec de vraies conséquences sur le pouvoir de fixation des prix que Nvidia peut conserver sur un marché qu'elle domine depuis longtemps.
Pour les entreprises françaises et européennes qui hésitent à confier des charges de production à un modèle chinois moins cher plutôt qu'à un modèle occidental de pointe, GLM-5.3-Flash apporte un élément concret : des performances proches d'un modèle phare à taille réelle, pour environ un dixième du prix de l'API, sous une licence qui autorise l'auto-hébergement. Les contreparties sont réelles aussi : une consommation de jetons de raisonnement plus lourde qui peut ralentir les réponses, un laboratoire basé en Chine avec ses propres questions de traitement des données et de conformité à l'export — un point de vigilance renforcé pour toute entreprise soumise au RGPD —, et des caractéristiques qui, comme le lancement furtif d'Ox Alpha lui-même, sont restées invérifiées par des testeurs indépendants jusqu'à ce que Z.ai choisisse de les révéler. Mettre en balance les économies de coût et ces questions de gouvernance des données, plutôt que les seuls scores de benchmark, devrait devenir une étape standard de l'évaluation des fournisseurs à mesure que ce type de sortie économique et performante se multiplie du côté des laboratoires chinois.
Sources
- Surprise: Z.ai is the AI lab behind the mysterious Ox Alpha modelTechCrunch · 26 août 2026
- Chinesisches KI-Modell GLM-5.3-Flash läuft ohne Nvidia und kostet einen Bruchteil der KonkurrenzThe Decoder · 27 août 2026



