(Essayez l'IA de Yiaho, c'est gratuit !)
Ox Alpha est un modèle d’intelligence artificielle apparu le 20 août 2026 sur OpenRouter, une plateforme qui relie les développeurs à des centaines de modèles. Le modèle est anonyme, gratuit et très puissant : un million de tokens de contexte, entrées texte, image et vidéo, outils intégrés. Personne n’a revendiqué sa création.
- La rumeur : sur 10 tâches du benchmark DeepSWE, il a obtenu environ 80 %, contre 65 % pour Claude Fable 5 et 52 % pour GPT-5.6 Sol.
- La contre-vérification : sur la série complète du même benchmark, le résultat s’est effondré au niveau de GPT-5.6 Sol. Une communauté a même mesuré environ 63 %.
- L’enquête : les indices techniques (tokenizer, encodeur vidéo, codes d’erreur) pointent vers le labo chinois Zhipu et son modèle GLM. Une analyse rivale lit un tokenizer d’OpenAI et vise Microsoft.
- Le précédent : les modèles anonymes précédents d’OpenRouter (Pony Alpha, Hunter Alpha, Elephant Alpha) ont tous fini revendiqués par des laboratoires chinois.
- Pratique : accès gratuit une semaine chez OpenCode, soit jusqu’environ le 27 août. Notre décodeur compare les six suspects et leurs indices.
C’est l’histoire la plus curieuse de la semaine dans le monde de l’IA. Jeudi 20 août 2026, sans conférence, sans communiqué, sans nom de laboratoire, un modèle de raisonnement nommé Ox Alpha apparaît sur le catalogue d’OpenRouter. Son prix affiché : zéro. Sa puissance annoncée : celle d’un modèle « frontière ». Et depuis, la planète IA s’est divisée en deux camps qui se posent la même question : qui a bien pu créer cette machine, et pourquoi se cacher ?
La réponse n’importe pas qu’aux développeurs. Elle dit qui a la capacité de calcul pour offrir 100 000 milliards de tokens gratuits par jour, elle dit à quel point les modèles chinois ont rattrapé les américains, et elle pose une question plus inconfortable : si un modèle anonyme devient la norme, qui répond de ce qu’il fait ? Voici ce que les indices disent réellement, sans prendre les rumeurs pour des preuves.
Ox Alpha, c’est quoi exactement ?
Pour comprendre, il faut d’abord savoir ce qu’est OpenRouter. Imaginez une gare centrale où toutes les lignes de train seraient les modèles d’IA : GPT de OpenAI, Claude d’Anthropic, Gemini de Google, et des dizaines de modèles chinois ou ouverts. Le développeur n’a qu’un seul guichet et un seul mode de paiement. La plateforme annonce aujourd’hui plus de 400 modèles venus d’environ 80 fournisseurs. Quant à OpenCode, c’est un agent de programmation libre qui tourne dans le terminal et qui s’appuie lui aussi sur ces modèles.
Un modèle furtif (stealth model) est un modèle déposé sur une telle plateforme sans marque, sans laboratoire déclaré, en attendant l’annonce officielle. C’est l’équivalent d’une avant-première de film sans générique : chacun peut le voir, personne ne sait qui l’a tourné. OpenRouter a d’ailleurs précisé ne pas être son développeur : la plateforme se contente de router les requêtes.
Ce que dit la fiche officielle
La fiche du modèle, hébergée par OpenRouter, est volontairement courte. Elle confirme néanmoins des éléments précis que nous avons vérifiés sur l’API de la plateforme :
- Un modèle de raisonnement obligatoire, conçu pour « le codage efficace, le travail agentique soutenu et les charges de production ».
- Une fenêtre de contexte de 1 048 576 tokens, l’une des plus grandes du marché, et une sortie plafonnée à 131 072 tokens.
- Des entrées texte, image et vidéo. Les requêtes audio sont rejetées, ce qui écarte une piste technologique.
- La prise en charge des appels d’outils (function calling), du choix d’outil et de la sortie structurée en JSON, un atout pour les agents de programmation.
- Un prix nul sur l’API, même si la gratuité est présentée comme temporaire : la préversion d’OpenCode devait durer une semaine à partir du 20 août.
Pour l’anecdote technique, la fiche en direct affichait le 24 août une latence médiane de 5,08 secondes avant le premier token et un débit de 24 tokens par seconde. Des chiffres de modèle utile, pas de champion de sprint.
Pourquoi ce modèle a mis le feu
Un modèle de ce niveau, gratuit et sans nom, attire immédiatement deux publics : les développeurs qui veulent de la puissance à prix nul, et les chercheurs qui veulent savoir d’où il vient. La combinaison a fait exploser les deux. Le jour de sa sortie, Ox Alpha a pris la première place du classement d’usage d’OpenRouter et battu le record d’appels quotidiens de la plateforme. Sur OpenCode, il a mis fin à 56 jours de règne de DeepSeek en tête du classement d’usage interne. Selon un pointage publié le lendemain, les cinq applications les plus actives, dont Claude Code et l’agent Hermes, cumulaient déjà plus de 4 000 milliards de tokens.

Le classement hebdomadaire de la plateforme, publié le 24 août avec les données jusqu’au 23, confirme le phénomène : Ox Alpha figure en deuxième position avec 11 600 milliards de tokens et son badge « nouveau », juste derrière DeepSeek V4 Flash 0731, devant MiMo-V2.5 de Xiaomi et Hy3 de Tencent, et devant GPT-5.6 Luna. Cinq jours après sa sortie, un modèle sans nom se tient aux portes du trône des géants.
Le chiffre qui a lancé la rumeur : 80 %
Le déclencheur s’appelle DeepSWE, un benchmark qui mesure la capacité d’un modèle à lire un vrai code source, repérer un bug et produire un correctif valide. Un développeur, Ben Davis, a fait passer 10 de ces tâches à plusieurs modèles. Résultat publié le soir même : Ox Alpha obtient plus de 80 %, Claude Fable 5 reste à 65 % et GPT-5.6 Sol à 52 %. Un modèle inconnu qui bat le drapeau d’Anthropic d’une demi-longueur : la rumeur est partie, les mèmes ont suivi, les milliers d’utilisateurs aussi.
| Mesure | Ox Alpha | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|
| DeepSWE, 10 tâches (test Ben Davis) | environ 80 % | 65 % | 52 % | non testé |
| DeepSWE, série complète (retest communautaire) | environ 63 % | non communiqué | non communiqué | non communiqué |
| DeepSWE, palmarès BenchSift (état au 21 août) | absent du classement | 69,7 % | 72,7 % | 73,6 % |
| Classement Kingbench (référence tierce) | 87,5 % | non communiqué | non communiqué | non communiqué |
Sources : test Ben Davis rapporté par la presse spécialisée, tableau BenchSift au 21 août 2026, classement Kingbench cité par des médias chinois. Aucun classement officiel ne référençait Ox Alpha au 24 août 2026.
Les 80 % viennent d’un test de 10 tâches mené par une seule personne. Ben Davis a lui-même prévenu que l’échantillon était « très petit et chargé de variance ». Il a ensuite lancé la série complète de DeepSWE : Ox Alpha est revenu au niveau de GPT-5.6 Sol, sans la domination annoncée. Un retest communautaire plus large a débouché sur environ 63 %. Sur un autre banc d’essai, INDUCTION, plus abstrait, le modèle se place derrière GPT-5.6 Luna et DeepSeek V4 Pro, à peine au-dessus de Gemini 3.7 Flash. Leçon générale : un score publié huit heures après le lancement d’un modèle anonyme est une information, pas une vérité.
Un « modèle frontière » à moitié prouvé
OpenRouter catalogue Ox Alpha comme « frontière », c’est-à-dire dans la meilleure catégorie. C’est un positionnement marketing plus qu’une mesure : la plateforme n’a publié aucun score sur les références classiques que sont SWE-bench ou Terminal-Bench. Le raisonnement reste donc incomplet sur un point central : personne ne peut encore dire si Ox Alpha est un modèle de premier rang ou un modèle intermédiaire très bien optimisé pour les agents. Ce qui est mesuré, en revanche, c’est la qualité de l’expérience : un million de tokens de contexte, des appels d’outils, la vidéo en entrée et un débit suffisant pour travailler en continu.
Sur les autres modèles, hier et aujourd’hui, un petit rappel de contexte : Kimi K3, le modèle chinois à poids ouverts sorti en juillet, a déjà passé les américains sur le code, et GLM-5.2, son prédécesseur chez Zhipu, talonne Claude Opus 4.8 pour six fois moins cher. La guerre du code est ouverte, et elle ne se joue plus seulement chez les géants californiens.
L’enquête : cinq indices qui pointent vers Zhipu
Le mystère a été pris au sérieux par la communauté. En quatre jours, les curieux sont passés de « on dirait une IA chinoise » à des analyses de serveur dignes d’un laboratoire de police technique. Voici, dans l’ordre de solidité, les indices retenus.

1. La signature de l’encodeur vidéo
Un développeur, Chetaslua, a soumis quatre vidéos contrôlées au modèle. La consommation de tokens suivait exactement celle de GLM-5V-Turbo, le modèle multimédia de Zhipu : même échantillonnage indépendant de la fréquence d’images, même échelle temporelle d’environ 147 tokens par seconde, même dégradation par résolution. Deux modèles distincts qui quantifient le monde de la même manière, c’est déjà un indice fort.
2. L’empreinte du tokenizer
Sur 25 textes tests, la découpe en tokens d’Ox Alpha coïncide presque mot pour mot avec celle de GLM-5.3, à un décalage constant de 75 tokens près, correspondant à une couche d’enveloppe. Une analyse à onze sondes croisés a donné 11 correspondances sur 11 avec la famille GLM, quand les autres laboratoires plafonnaient à 4. Le tokenizer est le passeport le plus difficile à falsifier d’un modèle.
3. Les codes d’erreur parlent
Chetaslua a ensuite envoyé une requête volontairement mal formée via OpenCode. Le serveur a renvoyé une pile d’exécution Java exposant la classe com.wd.paas.api.domain.v4.chat.ChatCompletionRequest, une structure qui correspond à l’API publique de Z.ai, le nouveau nom de Zhipu. Les modèles GLM hébergés par Zhipu renvoyaient tous la même erreur 1214 Incorrect role information. Contre-épreuve décisive : les mêmes poids GLM hébergés sur DeepInfra renvoyaient un format différent. Le serveur, lui, ne ment pas.
4. Le comportement ne se déguise pas
Un modèle traîne ses habitudes. Ox Alpha utilise environ 1,3 emoji par mille caractères, un rythme typique de la famille GLM et Qwen, quand Claude, GPT-5.6 ou Grok sont proches de zéro. Sur DeepSWE, il consomme en moyenne 117 étapes d’agent par tâche, contre 124 pour GLM-5.3 et 61 pour GPT-5.6 Sol. La vieille règle du cluedo s’applique : regarder comment il travaille vaut mieux que lui demander qui il est.
5. Les empreintes matérielles du modèle
Le créateur de Crawl4AI, un développeur connu sous le nom d’unclecode, a livré un outil de fingerprinting nommé modelprint qui interroge neuf points d’un endpoint anonyme. Ox Alpha a été associé à GLM-5.3 sur six d’entre eux. L’auteur reste prudent, et c’est important : « des empreintes qui correspondent prouvent une infrastructure partagée, pas une identité ». Un laboratoire peut servir deux modèles différents sur la même pile.
Ben Davis lui-même est arrivé à une probabilité d’environ 99 % pour un modèle de la série GLM-5.x, d’après la presse chinoise. Zhipu a l’habitude : en février, elle avait déjà testé GLM-5 publiquement sous un faux nom, Pony Alpha. La révélation avait eu lieu cinq jours plus tard. Cette fois, rien encore : Zhipu n’a ni confirmé ni infirmé, et OpenRouter affirme ne pas connaître l’identité du fournisseur.
La contre-enquête : pourquoi personne n’est d’accord
Si l’histoire s’arrêtait là, ce serait une belle affaire résolue. Elle ne s’arrête pas là, et c’est ce qui rend ce dossier passionnant.
Le CEO de Stormy, Robert Lukoszko, défend une lecture radicalement différente : la tokenisation d’Ox Alpha correspondrait à cl100k_base, le codec conçu par OpenAI. Dans cette lecture, tous les laboratoires chinois et la plupart des américains sont exclus, et la piste mène à MAI-2, le futur modèle frontière de Microsoft. Une partie des curieux, dont des chercheurs de Google DeepMind sur les réseaux sociaux, évoque plutôt un nouveau Gemini. Sont aussi passés sur la sellette : le géant chinois Xiaomi et sa famille MiMo, la petite société DeepSeek (un modèle V4-Flash), Cursor et son Composer 3, ByteDance, Tencent avec Hunyuan, et même le Grok de xAI. Autrement dit : deux écoles de fingerprinting, deux récits opposés, et une leçon à retenir.
Il y a une différence entre ce que ces indices prouvent et ce qu’ils suggèrent. Le contrôle des erreurs établit qui héberge le modèle, pas forcément qui l’a entraîné. Un laboratoire peut parfaitement louer ses serveurs à un autre ou tester un modèle tiers sur son infrastructure. Et le raisonnement de Ben Davis, pourtant rigoureux, s’appuie sur des mesures publiques dont aucune n’a été auditée par un tiers.
Autre incohérence à creuser : GLM-5.3, sorti le 14 août, est un modèle texte qui n’accepte ni image ni vidéo sur ses endpoints publics, alors qu’Ox Alpha revendique les deux. Si Zhipu est bien le créateur, Ox Alpha serait donc une variante multimodale non publiée, ou une version avancée. La sortie de GLM-5.3 a par ailleurs été accompagnée d’une promesse : la publication des poids ouverts deux semaines plus tard, soit autour du 28 août. Le calendrier colle remarquablement à l’idée d’un laboratoire qui teste son successeur pendant que le marché digère son prédécesseur.
Les anonymes avant lui : une habitude bien rodée
Ox Alpha n’est pas le premier modèle à jouer au fantôme. Voici la liste des précédents, tous vérifiés, qui racontent une tendance de fond.
| Modèle anonyme | Période | Laboratoire annoncé | Délai avant révélation |
|---|---|---|---|
| Pony Alpha | février 2026 | Zhipu, pour le modèle GLM-5 | cinq jours |
| Hunter Alpha | mars 2026 | Xiaomi, pour un MiMo ancien | quelques jours |
| Elephant Alpha | avril 2026 | Ant Group, pour le modèle Ling-2.6-flash | deux semaines |
| Owl Alpha | été 2026 | aucune revendication publiée | aucun |
| Ox Alpha | août 2026 | aucune revendication publiée | à suivre |
Sources : comptes rendus de la presse spécialisée chinoise et internationale cités en fin d’article. Hors OpenRouter, Alibaba avait aussi déposé un modèle « HappyHorse » anonyme sur le banc d’essai vidéo Artificial Analysis en avril et l’avait revendiqué quelques jours plus tard.
La pratique, elle, n’a rien de clandestin : OpenRouter héberge des modèles furtifs depuis avril 2025, et des équipes comme OpenAI, xAI ou NVIDIA les ont utilisés. Ce qui a changé, c’est le rapport de force. Aux dernières données publiées, la part de marché des modèles américains sur la plateforme est tombée d’environ 70 % à 30 % en un an, pendant que Zhipu, DeepSeek et Xiaomi grignotaient le reste. Le moment n’est pas fortuit : Stripe vient d’officialiser le rachat d’OpenRouter pour environ 7,5 milliards de dollars, selon le New York Times, et son patron Patrick Collison a lui-même testé Ox Alpha et tweeté que c’était « très impressionnant ». La même semaine, le géant du paiement et le fantôme de l’IA se sont croisés sur la même plateforme.
Pourquoi publier un modèle anonyme ?
La tentation du complot est grande. La réalité est plus simple, et elle est bien documentée par Alex Atallah, cofondateur d’OpenRouter, qui résumait l’intérêt de ces tests anonymes : voir comment des utilisateurs jugent un modèle sans connaître sa marque, pour éviter le biais de réputation et obtenir des retours plus francs. Quatre objectifs se superposent :

- Un banc d’essai grandeur nature. Un laboratoire ne peut pas simuler des milliers de développeurs qui travaillent sur de vrais projets, avec de vraies connexions, de vraies dépendances et de vraies heures de travail. L’usage qu’il observe pendant une semaine vaut des mois de tests internes.
- Un sondage de prix et de positionnement. Publier un modèle gratuit pendant sept jours, c’est mesurer directement où il se situe face à Claude Fable 5 et GPT-5.6 Sol, ce que les développeurs en font, et ce qu’ils seraient prêts à payer ensuite.
- Une place dans les écosystèmes. La route par défaut de l’agent que le monde entier utilise est une source de revenus durable. Un modèle gratuit, même une semaine, peut être adopté comme valeur par défaut dans Claude Code, OpenCode ou l’agent Hermes. Gagner cette position vaut plus qu’une campagne publicitaire.
- Un coup de communication à coût nul. Personne ne paie pour des gros titres du type « le modèle qui bat Claude » et les plateformes gagnent en notoriété. Le précédent de Pony Alpha, qui avait fait bondir le cours de Zhipu après sa révélation, reste dans toutes les mémoires.
Il faut pourtant rappeler ce que la gratuité coûte : selon la page du modèle, les prompts et les réponses sont conservés par le fournisseur et « ne servent pas à l’entraînement », tandis que les conditions générales des préversions anonymes de la plateforme sont plus permissives et couvrent entraînement, évaluation et amélioration. OpenCode annonce de son côté « zéro conservation » de la part d’un fournisseur qu’il ne nomme pas. Deux promesses qui ne racontent pas la même chose, pour la même machine.
Qui a créé Ox Alpha ? Notre décodeur de suspects
Nous avons rassemblé les six pistes sérieuses, avec pour chacune les indices qui parlent pour elle, ceux qui parlent contre, et l’état réel de la preuve. Cliquez sur un suspect pour dérouler son dossier.
Zhipu et la famille GLM
Le tokenizer colle à GLM-5.3 à 75 tokens près, l’encodeur vidéo est identique à GLM-5V-Turbo, les erreurs serveur portent la signature de l’API de Z.ai, et le rythme de travail est celui de la famille GLM. Surtout, le modèle joue exactement la partition déjà jouée par GLM-5 en février sous le nom de Pony Alpha. Le calendrier est cohérent : GLM-5.3 est sorti le 14 août, sa variante multimodale pouvait être prête huit jours plus tard.
Où c’est écrit : analyses du développeur Chetaslua reprises par IT之家 et BlockBeats, outil modelprint d’unclecode rapporté par SiliconANGLE, synthèse de la presse chinoise.
Microsoft et MAI-2
Le CEO de Stormy, Robert Lukoszko, a identifié une tokenisation de type cl100k_base, un codec issu d’OpenAI dont aucun laboratoire chinois n’adopte la signature. Il en déduit une filiation avec la famille Phi de Microsoft et avec MAI-2, le modèle frontière que l’éditeur n’a pas encore présenté.
Où c’est écrit : analyse de Robert Lukoszko relayée par Wccftech et les médias chinois. Aucune confirmation par Microsoft, qui n’a rien annoncé.
Xiaomi et la famille MiMo
Xiaomi a déjà testé anonymement un modèle, Hunter Alpha, revendiqué en mars, et la famille MiMo sait faire des modèles agents. Mais un indice puissant joue contre elle : les modèles MiMo récents acceptent l’audio en entrée, alors qu’Ox Alpha le rejette.
Où c’est écrit : médias chinois et article de la presse taïwanaise TechOrange. Rien de plus solide n’a été publié.
DeepSeek et V4-Flash
DeepSeek a la culture du lancement agressif et gratuit, mais elle a augmenté récemment les prix de V4-Flash, signe de capacités tendues. Sa tokenisation s’écarte nettement de celle d’Ox Alpha, selon les mesures publiées, et la capacité de 100 000 milliards de tokens par jour dépasse ce qu’elle affirme être en mesure de fournir.
Où c’est écrit : analyse de Wccftech, citée aussi par la presse chinoise. Aucun indice de serveur ne la relie au modèle.
Google et Gemini
Des chercheurs de Google DeepMind ont évoqué sur les réseaux sociaux un lien possible avec un nouveau Gemini, et le modèle se place en effet à peine au-dessus de Gemini 3.7 Flash sur le banc INDUCTION. Mais aucune analyse technique ne relie sa tokenisation, son encodeur ou ses serveurs à Google, et la firme ne s’est jamais prêtée à ce genre de jeu depuis l’époque de ses premiers modèles.
Où c’est écrit : médias chinois citant des contributeurs anonymes. À classer dans la rumeur tant que rien de mesurable n’est publié.
Autre laboratoire ou inconnu
L’auteur de modelprint rappelle lui-même que des empreintes identiques prouvent une infrastructure partagée, pas une identité. Un laboratoire peut héberger le modèle d’un autre, un agrégateur peut encapsuler un modèle tiers derrière une couche de 75 tokens. Entre ByteDance, Tencent, Alibaba, un éventuel nouveau venu ou un simple proxying, la piste reste entière.
Où c’est écrit : documentation publique de modelprint, citée par SiliconANGLE, et commentaires de la communauté OpenRouter.
Aucune de ces pistes n’est une preuve au sens d’un audit indépendant. Les mesures citées datent du 20 au 24 août 2026 et proviennent de tiers non rémunérés.
Ce que ça change, et ce qui reste flou
Ce qui est déjà acquis
- La donne économique a bougé. Un modèle de cette qualité offert pendant une semaine, avec 100 000 milliards de tokens de capacité quotidienne, change la perception du prix dans ce marché.
- Le bon moment pour être chinois. Une semaine avant la fin de la préversion, des laboratoires chinois font vivre la plateforme et dominent ses classements. Kimi K3 a ouvert la voie avec un prix de 3 dollars le million de tokens en entrée, contre 5 dollars pour GPT-5.6 Sol et 10 dollars pour Claude Fable 5, tarifs des fournisseurs rapportés par la presse spécialisée.
- Le geste preuve d’une capacité rare. Selon une estimation de la communauté, tenir 100 000 milliards de tokens par jour avec 80 tokens par seconde et par puce demanderait environ 580 000 accélérateurs. Très peu d’organisations peuvent se l’offrir. Zhipu, qui vient d’activer un data center d’un gigawatt, en a les moyens financiers et techniques.
Ce qui doit encore être réglé
- La question de la responsabilité. Un modèle anonyme qui se trompe, qui compromet des données ou qui génère un contenu dangereux : qui répond ? C’est exactement la question qui bloque déjà les audits d’entreprises, comme le signalent des développeurs sur Reddit, où un modèle non signé ne peut pas entrer dans un processus d’évaluation sérieux.
- Le volet géopolitique. Zhipu figure sur la liste des entités du département du Commerce américain depuis janvier 2025. Si la piste se confirme, du code d’entreprise transiterait par un fournisseur sans visage, ce que Bloomberg, cité par SiliconANGLE, estime à des milliards de tokens déjà routés depuis jeudi.
- La pérennité du modèle. Personne ne connaît la date de sortie officielle, le prix futur, le nom qu’aura le modèle, ni même si sa partie vidéo sera conservée. Pour un guide complet de l’IA, il faut le dire clairement : l’information disponible l’est parce que le modèle est en préversion, et elle peut disparaître avec lui.
Comment essayer Ox Alpha vous-même
La fenêtre est courte : la semaine gratuite ouverte le 20 août se termine autour du 27 août. Si vous êtes curieux, voici comment procéder, étape par étape.

- Ouvrez la fiche du modèle sur OpenRouter et créez un compte gratuit si ce n’est déjà fait (une clé d’API suffit).
- Choisissez le modèle
stealth/ox-alphadans la console d’OpenRouter. - Testez d’abord des questions simples, puis des travaux de programmation réels, plus représentatifs que les benchs.
- Si vous préférez le terminal, installez OpenCode, l’agent libre qui propose le modèle dans son plan gratuit avec des quotas « proches de l’illimité ».
- Gardez en tête ce que vous acceptez : selon la fiche OpenRouter, vos prompts et réponses sont conservés par le fournisseur. Le règlement de la préversion autorise en outre l’usage de vos données pour améliorer le modèle.
Ne collez jamais de secrets d’entreprise, de données personnelles ou de code propriétaire sensible dans un outil de préversion anonyme. Vous ne connaissez pas l’hébergeur, son pays de juridiction, ni les conditions réelles de conservation. Le risque est faible pour un test personnel, il n’est pas nul pour un projet professionnel.
FAQ : Ox Alpha en sept questions
Pourquoi tout le monde parle-t-il d’Ox Alpha ?
Parce qu’un modèle de niveau « frontière », gratuit, multimédia et doté d’un million de tokens de contexte, a été mis en ligne sans que personne ne le revendique. Le jour de son arrivée, il a battu des records d’usage sur OpenRouter. La combinaison « très fort, gratuit, inconnu » est exactement la recette d’une rumeur mondiale.
Ox Alpha surpasse-t-il vraiment Claude Fable 5 ?
En l’état actuel des mesures, on ne peut pas l’affirmer. Un test de 10 tâches l’a donné à environ 80 % contre 65 % pour Claude Fable 5, mais Ben Davis lui-même a précisé, après le passage à la série complète, que les deux modèles se situaient au même niveau, avec un retest communautaire autour de 63 %. Le palmarès officiel BenchSift ne le référence d’ailleurs pas.
Qui a créé Ox Alpha ?
Personne ne l’a officiellement reconnu à ce jour. La piste la plus documentée mène à Zhipu et à sa famille GLM : tokenizer, encodeur vidéo, codes d’erreur et habitudes de travail concordent, et la controverse vient de deux lectures opposées de la même tokenisation, l’une visant Zhipu, l’autre Microsoft.
Pourquoi un laboratoire cacherait-il son propre modèle ?
Pour tester le produit sur de vrais utilisateurs sans le biais de la marque, mesurer ce que le marché accepterait de payer, occuper les routes par défaut des agents de programmation et créer un buzz que plus rien ne coûte. La méthode est documentée depuis des années sur OpenRouter, et les laboratoires chinois la maîtrisent particulièrement bien.
Est-ce vraiment gratuit, et jusqu’à quand ?
Le modèle est gratuit sur l’API, avec entrée et sortie à zéro, pendant une période de préversion. Chez OpenCode, l’accès gratuit devait durer une semaine à partir du 20 août, soit jusqu’environ le 27 août. OpenRouter a indiqué de son côté, par courriel, que la gratuité sur sa route courrait jusqu’au lundi 24 août. Vérifiez la fiche du modèle au moment de votre essai.
Quels sont les risques d’utiliser un modèle anonyme ?
Le principal est l’absence de responsabilité identifiée : pas de contrat, pas de garantie de service, pas d’interlocuteur en cas d’incident. S’ajoutent des conditions de conservation des données variables selon la route, et l’interdiction pratique pour les entreprises d’adopter un tel modèle dans des processus d’audit. Enfin, si la piste chinoise se confirme, la question du droit applicable devient un sujet sérieux.
Comment savoir si cette « IA chinoise » est vraiment bonne ?
Par la comparaison sur vos propres tâches. Les classements publics servent de repère, mais seul un travail réel, sur un vrai projet, avec de vraies contraintes, dit ce qu’un modèle vaut. Pour le code comme pour l’écriture, le mieux reste encore de mesurer sur un exemple représentatif plutôt que de recopier un score.
Notre conclusion
Ox Alpha restera dans l’histoire de l’IA comme l’exemple parfait d’un lancement sans annonce à l’ère des modèles qui circulent plus vite que leurs fabricants. Le modèle a prouvé une chose : la technologie de pointe ne se cache plus seulement dans les locaux sécurisés des géants californiens. Elle passe aussi par les plateformes de routage, servie par des clusters que seuls quelques acteurs mondiaux peuvent financer, sous des noms qui changent de peau.
Il ne nous appartient pas de résoudre le mystère avant son créateur. Ce que nous savons, c’est que les indices convergent vers Zhipu, que des analyses brillantes racontent une autre histoire, et que le seul élément certain reste la prudence : un score viral n’est pas une démonstration, et un modèle anonyme mérite qu’on sache ce qui lui est confié avant de lui confier quoi que ce soit.
Vous voulez juger par vous-même ce que vaut une IA ?
Pas besoin d’attendre la révélation du mystère pour mesurer ce qu’une IA sait faire de vos propres mots. Le chat de Yiaho est gratuit, en français, sans inscription et sans engagement : posez-lui vos questions, demandez-lui d’écrire, de résumer ou de corriger, et jugez le résultat sur votre sujet, pas sur un classement.
Sources principales : fiche Ox Alpha sur OpenRouter (fonctionnalités, prix, historique de création), OpenCode (annonce de la semaine gratuite et de la capacité), SiliconANGLE (retest DeepSWE, modelprint, conditions de conservation, Bloomberg), TechCrunch (réaction de Patrick Collison, comparaison avec la consommation mensuelle de Visa), ZDNet (rachat d’OpenRouter par Stripe). Analyses complémentaires : IT之家, BlockBeats, Wccftech, 36Kr, TechOrange, Sohu. Toutes les mesures citées l’ont été entre le 20 et le 24 août 2026.


