Actualité · Modèles IA

Ox Alpha était GLM-5.3-Flash : comment Z.ai a testé son modèle en secret pendant une semaine

27 août 2026 · 6 min de lecture

Illustration aquarelle d'un petit robot astronaute violet portant un déguisement de détective (petite moustache et chapeau) qui tombe pour révéler son identité, tenant une loupe et un masque, entouré d'indices au sol (un jeton, une empreinte, une lanterne chinoise, un cadenas ouvert), avec un point d'interrogation se transformant en étiquette au-dessus, symbolisant le mystère Ox Alpha résolu

Le 20 août 2026, un modèle d'IA apparaît sur OpenRouter et OpenCode sans nom de créateur, gratuit, avec 1 million de tokens de contexte et un support pour le texte, les images et la vidéo. OpenRouter précise qu'il ne fait que router les requêtes et n'est ni le développeur ni le propriétaire. Pendant six jours, la communauté IA essaie de deviner qui a construit ce modèle. Le 26 août, Z.ai (anciennement Zhipu AI) confirme au Bloomberg : Ox Alpha était GLM-5.3-Flash, une version anticipée de son nouveau modèle, testée en public avant le lancement officiel. Les poids sont ouverts le soir même sous licence MIT.

Pourquoi lancer un modèle en mode stealth

Un stealth release, c'est déposer un modèle sur une plateforme d'API sous une marque anonyme pour collecter du trafic réel avant de mettre son nom dessus. La lab voit comment le modèle se comporte sous charge, quels types de requêtes les utilisateurs envoient, et où ça casse. Les utilisateurs voient un modèle gratuit et performant. Personne ne signe de contrat.

Le pattern est devenu routine sur OpenRouter en 2026. Ox Alpha est le cinquième modèle anonyme en six mois, et les quatre précédents venaient tous de labs chinois :

Modèle anonymeDateIdentité révélée
Pony AlphaFév 2026GLM-5 (Z.ai/Zhipu)
Hunter AlphaPrintemps 2026MiMo-V2-Pro (Xiaomi)
Owl AlphaMi-2026LongCat-2.0 (Meituan)
Elephant AlphaMi-2026Ling-2.6-flash (Ant Group)
Ox Alpha20 août 2026GLM-5.3-Flash (Z.ai/Zhipu)

Le surnom chinois du modèle, "niulai" (approximativement "voilà le bœuf"), est devenu mainstream dans les médias tech chinois avant même la révélation officielle.

Comment la communauté a identifié le modèle en six jours

Avant la confirmation de Z.ai, plusieurs pistes circulaient. Google DeepMind a laissé entendre que le modèle pouvait venir de chez eux ("Gemini" et "trust the process" dans des posts de chercheurs), ce qui a été moqué par la communauté. Une analyse du tokenizer donnait Microsoft comme candidat. Mais les preuves convergeaient vers Z.ai.

Le test le plus convaincant venu d'un chercheur indépendant, Ben Davis : sur 25 prompts variés, le compte de tokens d'Ox Alpha correspond exactement à celui de GLM-5.3, plus un offset constant de 75 tokens. Un offset constant correspond à un system prompt caché identique. Un modèle ne peut pas changer la façon dont il segmente le texte sans réentraînement, donc cette signature est difficile à falsifier.

Deux autres indices : la consommation de tokens vidéo correspondait exactement au format de GLM-5V-Turbo sur quatre tests contrôlés, et les erreurs de la couche de serving correspondaient au dialecte de Z.ai. La communauté avait identifié le modèle avant la confirmation officielle.

Ce qu'est GLM-5.3-Flash

GLM-5.3-Flash est un modèle mixture-of-experts de 320 milliards de paramètres, dont 18 milliards actifs par token. Pour comparer, GLM-4.5 avait 355B dont 32B actifs. Z.ai a délibérément réduit les paramètres actifs et le nombre de couches (45 contre 92) pour faire un modèle bon marché à servir, puis compensé avec un corpus de pré-entraînement de 30 000 milliards de tokens multimodal.

C'est le premier modèle de la série GLM-5 à supporter nativement le texte, les images et la vidéo au niveau architectural, pas comme un module de vision rajouté après coup. La fenêtre de contexte est de 1 million de tokens, avec 131 072 tokens de sortie maximum.

L'architecture combine attention linéaire et attention sparse. L'attention linéaire capture les dépendances locales, l'attention sparse récupère le contexte global via un indexeur léger. Z.ai introduit aussi IndexPool, qui compresse les vecteurs clés de l'indexeur par un facteur 4 pour réduire la latence à plein contexte. Résultat annoncé : 3x moins de calcul d'attention et 4,4x moins de KV cache que GLM-5.3.

Les benchmarks : ce que Z.ai publie

Les chiffres ci-dessous sont publiés par Z.ai. Ils n'ont pas encore été vérifiés de façon indépendante par un tiers.

BenchmarkGLM-5.3-FlashGLM-5.2Claude Opus 4.8GPT-5.6 Terra
DeepSWE v1.163,446,258,069,6
AutomationBench48,826,241,037,2
Terminal-Bench 2.184,381,085,087,4
Toolathlon Verified78,459,976,274,9
Agents' Last Exam26,320,427,028,0
NL2Repo56,3-69,7-

Sur Terminal-Bench 2.1, GLM-5.3-Flash (84,3) colle à Opus 4.8 (85,0). Sur Toolathlon Verified, il le dépasse (78,4 vs 76,2). Sur DeepSWE, il dépasse Opus 4.8 (63,4 vs 58,0) mais reste derrière GPT-5.6 Terra (69,6). Le point faible : NL2Repo, où il a scoré 56,3 contre 69,7 pour Opus 4.8. Construire un dépôt complet à partir d'une description en langage naturel reste le territoire des modèles frontier fermés.

Sur l'Artificial Analysis Intelligence Index v4.1.1, Z.ai annonce un score de 57, à 0,045$ par tâche sur le tier remise. Le positionnement : "frontier intelligence, flash cost".

Le prix : un dixième de GLM-5.2

GLM-5.3-Flash coûte 0,15$ par million de tokens en entrée et 0,50$ en sortie. GLM-5.2 coûtait 1,40$ et 4,40$. L'entrée en cache coûte 0,03$ par million. Les poids sont ouverts sous MIT, donc tu peux aussi le faire tourner en local sans payer de tokens.

Z.ai a roulé le modèle pendant la semaine stealth sur un cluster de chips IA chinois, pas sur du matériel Nvidia. Ils ont construit un moteur d'inférence dédié sur SGLang avec quantification W8A8, cache hybride INT8/FP8/BF16, et une architecture Encode-Prefill-Decode dés-agrégée. Z.ai annonce une amélioration de 3x en performance de serving sur le même matériel entre le début et la fin de la semaine stealth.

Un exemple chez Maisons&Mobilia

Sophie, PM chez Maisons&Mobilia (M&M, enseigne de meubles fictive), utilise un agent IA pour analyser les retours clients. L'agent tourne sur l'API de GLM-5.2. Sur 500 retours par semaine avec 6 appels de modèle chacun, le coût mensuel tourne autour de 80 euros.

Sophie bascule sur GLM-5.3-Flash quand les poids sortent. Le même volume de travail coûte environ 8 euros par mois. L'accuracy sur les retours standards (défaut produit, retard livraison, taille incorrecte) est équivalente : les benchmarks agentiques de Z.ai montrent que Flash est au niveau de GLM-5.2 sur le tool use et le raisonnement multi-étapes.

Les cas complexes (un client qui mélange trois motifs, un retour qui touche à la réglementation) restent le point faible. Sur NL2Repo, l'écart avec Opus 4.8 est de 13 points. Sophie garde un modèle frontier en backup pour les 30 retours par semaine qui sortent du pattern standard.

La limite : Sophie doit héberger le modèle elle-même pour bénéficier du prix local (zéro par token). Si elle passe par l'API, le coût est de 8 euros au lieu de 80, ce qui est déjà un gain de 90%. Et elle doit vérifier que les benchmarks de Z.ai se confirment sur ses données réelles avant de migrer l'intégralité du trafic.

Le détail des chips chinois

Pendant la semaine stealth, Z.ai a servi Ox Alpha sur des chips IA domestiques chinois, pas sur des GPU Nvidia. Les chips chinois sont contraints par la capacité et la bande passante mémoire, surtout à 1 million de tokens de contexte. Z.ai a construit un stack d'inférence optimisé pour contourner ces limites.

Le point que Z.ai veut faire passer : les chips chinois peuvent maintenant supporter l'inférence de modèles frontier-class à un coût comparable aux GPU Nvidia. Si ça se confirme sous scrutiny externe, ça change le calcul géopolitique. Les export controls américains visent à limiter l'accès aux chips haut de gamme. Si les chips domestiques suffisent pour l'inférence, le verrou s'affaiblit.

Z.ai précise qu'un agent basé sur GLM-5.3 a aidé les ingénieurs à accélérer le développement du stack d'optimisation. Le modèle a aidé à debugger et optimiser l'inférence engine qui le sert lui-même. Une boucle circulaire, et un exemple de plus du pattern "les modèles aident à construire l'infrastructure qui sert les modèles".

Ce que ça change si tu apprends l'IA

Cette annonce illustre trois notions concrètes pour l'audience de saisir.ai :

  1. Stealth release : déposer un modèle anonyme pour tester en conditions réelles avant le lancement officiel. C'est devenu une tactique marketing standard chez les labs chinois. Comprendre le pattern, c'est reconnaître la mise en scène derrière le buzz.

  2. Mixture-of-Experts : 320B de paramètres dont seulement 18B actifs par token. Le modèle est gros à l'entraînement mais léger à l'inférence. C'est l'architecture qui rend le frontier-class auto-hébergeable.

  3. Open-source vs fermé : GLM-5.3-Flash est open-source sous MIT, à un dixième du prix du précédent, sur des chips chinois. La dynamique de 2026 continue : l'open rattrape le frontier sur les benchmarks, et le coût est l'avantage net.

La compétence pratique : savoir lire un stealth release. Quand un modèle anonyme apparaît gratuit sur une marketplace, reconnaître le pattern (lab chinois, test de charge, révélation prochaine), regarder les forensiques (tokenizer, signatures vidéo), et attendre les poids pour vérifier les benchmarks avant de migrer du trafic.

Aller plus loin

Pour comprendre l'architecture mixture-of-experts et pourquoi elle rend les modèles moins chers à servir, notre article sur comment fonctionne un agent IA pose les bases du tool use et de l'orchestration. Pour voir les garde-fous à mettre en place quand tu testes un nouveau modèle sur tes données, le guide sur les garde-fous des agents IA détaille le moindre privilège et le human in the loop. Et pour t'entraîner à ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur les modèles, les agents et l'open-source, en français, sans coder.

Sources

Questions fréquentes

C'est quoi Ox Alpha ?
Ox Alpha est un modèle d'IA apparu anonymement sur OpenRouter et OpenCode le 20 août 2026, gratuit, avec 1 million de tokens de contexte et un support multimodal. Pendant six jours, personne n'a revendiqué le modèle. Le 26 août, Z.ai a confirmé qu'il s'agissait de GLM-5.3-Flash, testé en conditions réelles avant son lancement officiel.
Pourquoi Z.ai a-t-il caché l'identité du modèle ?
Z.ai a utilisé le stealth release pour collecter du trafic réel et des retours de développeurs avant le lancement officiel. C'est une méthode déjà employée par plusieurs labs chinois : Pony Alpha en février 2026 était GLM-5, Hunter Alpha était MiMo-V2 de Xiaomi, Owl Alpha était LongCat-2.0 de Meituan. Le pattern est devenu routine sur OpenRouter.
GLM-5.3-Flash est-il open source ?
Oui. Les poids sont disponibles sur Hugging Face sous licence MIT. Le modèle fait 320 milliards de paramètres dont 18 milliards actifs par token, avec une fenêtre de contexte de 1 million de tokens. Il supporte vLLM, SGLang et Ollama pour le déploiement local.
GLM-5.3-Flash est-il aussi performant que les modèles frontier ?
Sur les benchmarks agentiques et de code publiés par Z.ai, GLM-5.3-Flash se rapproche de Claude Opus 4.8. Sur Terminal-Bench 2.1, il score 84,3 contre 85,0 pour Opus 4.8. Sur Toolathlon Verified, il le dépasse (78,4 vs 76,2). Sur NL2Repo, il reste en retard (56,3 vs 69,7). Les chiffres sont fournis par Z.ai et pas encore vérifiés de façon indépendante.
Combien coûte GLM-5.3-Flash ?
Le prix API est de 0,15$ par million de tokens en entrée et 0,50$ en sortie, soit environ un dixième du prix de GLM-5.2 (1,40$/4,40$). L'entrée en cache coûte 0,03$ par million. Les poids étant ouverts sous MIT, tu peux aussi le faire tourner en local sans payer de tokens.

Termes du glossaire