(Essayez l'IA de Yiaho, c'est gratuit !)
L’essentiel en 30 secondes
- Le 13 août 2026, OpenAI a dévoilé Ultrafast, un nouveau mode de son API qui fait tourner GPT-5.6 Sol jusqu’à 750 tokens de sortie par seconde, soit 14 fois la vitesse habituelle, sur des puces Cerebras.
- Ce n’est pas un nouveau modèle : c’est Sol servi autrement, et c’est justement ce qui rend l’annonce intéressante. La bataille des IA change de terrain : elle passe de l’intelligence brute à la vitesse de réponse.
- Deux choses manquent à l’annonce : aucun prix publié, et un accès limité à un petit groupe de clients pour l’instant. Le décodeur intégré plus bas convertit les 750 tokens par seconde en durées concrètes.
OpenAI vient de faire une annonce qui dit moins « nouveau modèle » que « nouvelle façon de servir un modèle ». Le 13 août 2026, l’entreprise a présenté Ultrafast, un mode de son API qui accélère GPT-5.6 Sol d’un facteur 14, en s’appuyant sur les puces de Cerebras plutôt que sur ses fournisseurs habituels. Voici ce que l’annonce dit vraiment, ce qu’elle ne dit pas, et ce que 750 tokens par seconde représentent pour vous.
L’annonce du 13 août : 750 tokens par seconde, 14 fois plus vite
L’annonce officielle tient en une phrase : « Preview Ultrafast, a new OpenAI API service tier that runs GPT-5.6 Sol up to 14× faster. Powered by Cerebras, it delivers up to 750 output tokens per second. » Autrement dit : un nouveau palier de service de l’API, une vitesse multipliée par 14, un débit plafond de 750 tokens générés chaque seconde, et un partenaire matériel nommé explicitement.

Le partenaire matériel, Cerebras, publie de son côté la comparaison qui donne le vertige : sur le benchmark Humanity’s Last Exam (2 500 questions de niveau doctorat), Sol en mode Ultrafast a traité les 2 500 questions en 11 heures et 11 minutes, quand Claude Fable 5 a eu besoin de 78 heures et 27 minutes, soit près de 7 fois plus longtemps, pour arriver aux mêmes conclusions. Cerebras annonce aussi 11 fois le débit de Fable 5 et 5 fois celui d’Opus 4.8 en mode rapide, et un gain de bout en bout de 5,6 fois sur le benchmark GDP-Val, sans dégradation de qualité. Les chiffres annoncés :
| Caractéristique | Valeur annoncée |
|---|---|
| Modèle concerné | GPT-5.6 Sol (le plus puissant de la famille GPT-5.6) |
| Débit de sortie | jusqu’à 750 tokens par seconde |
| Accélération | 14 fois la vitesse de traitement standard |
| Vitesse standard déduite | ≈ 53,6 tokens par seconde (750 divisé par 14) |
| Comparaison annoncée | 11 fois le débit de Claude Fable 5, 5 fois celui d’Opus 4.8 en mode rapide (Artificial Analysis) |
| Benchmark HLE | 2 500 questions en 11 h 11 contre 78 h 27 pour Claude Fable 5 |
| Matériel | puces Cerebras (architecture wafer-scale) |
| Disponibilité | aperçu limité à un petit groupe de clients, élargi « au fur et à mesure que la capacité augmente » |
| Prix | aucun prix publié |
Ce n’est pas un nouveau modèle, et c’est le point important
Ultrafast n’apporte aucune nouvelle version de Sol : ni paramètres supplémentaires, ni fenêtre de contexte élargie, ni meilleur score de benchmark. C’est une autre façon de servir le même modèle, sur un autre matériel. La phrase officielle qui compte est celle-ci :
« Jusqu’ici, obtenir une vitesse en temps réel signifiait généralement choisir un modèle plus petit ou plus spécialisé. Ultrafast pointe vers une nouvelle direction : plus de travail utile par seconde. » OpenAI, billet d’annonce du 13 août 2026 (« Until now, getting real-time speed typically meant choosing a smaller or more specialized model. Ultrafast points to progress in a new direction: more useful work per second. »)
La phrase enterre le vieux compromis de l’IA générative : jusqu’ici, qui voulait une réponse instantanée devait accepter un modèle plus petit, donc moins intelligent. Ultrafast prétend donner les deux à la fois, l’intelligence de pointe et la réponse quasi immédiate. Anthropic a aussi un mode rapide pour Claude, mais il n’atteint pas ce débit : la comparaison des deux annonces est la mesure la plus parlante de l’écart.
Pourquoi la vitesse est devenue un sujet de premier plan
Un agent IA qui réfléchit trente secondes avant chaque étape est une démo. Un agent qui répond au rythme d’une conversation devient un produit. C’est la thèse du mode Ultrafast : la latence, pas seulement l’intelligence, décide de ce qui est réellement utilisable. Les cas visés par OpenAI le disent : réponse aux incidents, support client en temps réel, analyse financière, e-commerce.
750 tokens par seconde, concrètement : le décodeur de durées
Un token est un morceau de texte, environ un mot et demi pour le français courant. À 750 tokens par seconde, générer une réponse devient plus rapide que la lecture. Le décodeur ci-dessous convertit le débit en durées, pour quatre formats de texte, en comparant le mode standard (53,6 tokens par seconde, déduit du facteur 14 annoncé) et le mode Ultrafast.
Combien de temps pour générer ?
Choisissez un format de texte. Les durées sont calculées avec 1,4 token par mot, à 53,6 tokens par seconde en standard et 750 en Ultrafast.
Un e-mail généré en un clin d’oeil
En mode standard, la rédaction complète prend environ 5,2 secondes. En Ultrafast, la même réponse sort en 0,4 seconde : plus vite que le temps de cliquer sur Envoyer.
Un article entier, sans temps mort
En mode standard, comptez environ 52 secondes de génération. En Ultrafast, l’article complet sort en 3,7 secondes : le temps de recharger la page.
Un chapitre de livre en vingt secondes
En mode standard, un chapitre demande environ 4 minutes 21 de génération. En Ultrafast, il sort en 19 secondes : de quoi enchaîner les brouillons dans la foulée.
Un roman, de la demi-heure à la minute
En mode standard, un roman complet demande environ 26 minutes de génération continue. En Ultrafast, il sort en 1 minute 52 : l’écart est le même facteur 14, appliqué à des heures de travail.
Hypothèses : 1,4 token par mot en français courant, débit standard de 53,6 tokens par seconde (750 divisé par le facteur 14 annoncé par OpenAI). Les durées réelles dépendent du modèle, du contexte et de la file d’attente.
Le sous-texte matériel : les puces de Cerebras, pas celles de Nvidia
L’autre information de l’annonce tient en un mot : Cerebras. Le mode le plus rapide d’OpenAI ne tourne pas sur les GPU habituels, mais sur les processeurs wafer-scale de Cerebras, des puces de la taille d’une assiette, découpées dans une galette de silicium entière. Le principe : le modèle entier tient sur une seule puce, au lieu d’être réparti sur des dizaines de serveurs qui doivent échanger des données en permanence. C’est ce trafic interne supprimé qui effondre le délai entre la question et la réponse.

Pour Cerebras, c’est une validation de poids : l’entreprise est entrée en Bourse dans l’une des plus grosses introductions de l’année, mais peine encore à convaincre que son pari matériel se transforme en profits durables. Alimenter le palier le plus rapide d’OpenAI est exactement le genre de preuve qui lui manquait. Pour le reste du secteur, c’est un rappel : les architectures exotiques longtemps moquées comme des projets de laboratoire font désormais tourner les plus grands noms de l’IA.
Ce que l’annonce ne dit pas
Trois absences mesurées dans les canaux officiels, le jour même :
- Aucun prix. Ni l’annonce, ni la documentation, ni la presse ne publient de tarif pour Ultrafast. Le palier est en aperçu, et OpenAI réserve l’accès à un petit groupe de clients.
- Pas de date grand public. L’extension d’accès est annoncée « au fur et à mesure que la capacité augmente », une formule sans calendrier.
- Pas de ChatGPT pour l’instant. L’annonce porte sur l’API, pas sur l’application grand public. Un abonné ChatGPT ne verra pas sa conversation accélérer du jour au lendemain.
Ne confondez pas les deux
Ultrafast accélère le modèle pour les développeurs qui l’appellent via l’API. Cela ne rend pas ChatGPT plus rapide pour vous, et cela ne rend pas le modèle plus intelligent : le même Sol, servi plus vite. Si ChatGPT vous semble lent aujourd’hui, c’est un autre sujet, et nous l’avons traité séparément dans notre guide sur les ralentissements de ChatGPT.
Questions fréquentes
C’est quoi GPT-5.6 Sol ?
Sol est le modèle le plus puissant de la famille GPT-5.6 d’OpenAI, sortie le 9 juillet 2026, aux côtés de Terra et Luna. Notre guide complet sur GPT-5.6 (Sol, Terra, Luna) détaille la famille.
Le mode Ultrafast est-il disponible ?
En aperçu seulement, depuis le 13 août 2026, et réservé à un petit groupe de clients. OpenAI annonce un élargissement « au fur et à mesure que la capacité augmente », sans date. Aucun prix n’a été publié.
ChatGPT va-t-il devenir plus rapide ?
Pas immédiatement : l’annonce concerne l’API, donc les développeurs et les entreprises, pas l’application grand public. Le débit de ChatGPT dépend d’autres facteurs, que notre article sur les ralentissements de ChatGPT détaille.
Pourquoi Cerebras plutôt que Nvidia ?
Les puces wafer-scale de Cerebras tiennent un modèle entier sur une seule puce de la taille d’une assiette, ce qui supprime le trafic de données entre serveurs qui ralentit les architectures classiques. Pour l’inférence, c’est-à-dire générer des réponses, cette architecture se révèle nettement plus rapide.
Qu’est-ce qu’un token ?
C’est le morceau de texte que le modèle génère à chaque étape, environ 1,4 token par mot en français. Un débit de 750 tokens par seconde signifie environ 535 mots par seconde. Les durées du décodeur ci-dessus reposent sur cette équivalence.
Est-ce que ça change quelque chose pour les agents IA ?
Oui, et c’est probablement le vrai enjeu. Un agent qui doit réfléchir trente secondes à chaque étape est inutilisable en conditions réelles ; au rythme d’une conversation, il devient un produit. La course à la vitesse est la suite directe de la course aux agents IA.
En résumé
Ultrafast n’est ni un nouveau modèle ni une nouveauté pour ChatGPT : c’est un nouveau palier de l’API OpenAI qui sert GPT-5.6 Sol à 750 tokens par seconde, 14 fois plus vite, sur les puces wafer-scale de Cerebras. L’annonce dit deux choses : la frontière entre « rapide » et « intelligent » est en train de tomber, et la bataille matérielle de l’IA se joue désormais sur la latence. Ce qu’elle ne dit pas : le prix, la date, et l’accès grand public. Comme toujours avec les annonces de vitesse, le chiffre est spectaculaire, et l’usage réel se mesurera sur les files d’attente.
La vitesse d’un modèle ne se résume jamais à un chiffre unique : notre article sur GPT-5.6 détaille la famille complète, et celui sur les agents d’OpenAI qui ont piraté Hugging Face montre ce que la même entreprise teste en coulisses pendant ce temps.
Pas besoin d’attendre le prochain mode
En attendant qu’Ultrafast s’ouvre, vous pouvez tester une IA générative en français, gratuite et sans inscription, dès maintenant.
Sources. Annonce officielle « Previewing Ultrafast mode : GPT-5.6 Sol at up to 14X the speed », OpenAI, 13 août 2026 (texte relevé via le flux RSS officiel, la page étant inaccessible en lecture automatisée) ; Annonce « Accelerating GPT-5.6 Sol Ultrafast », Cerebras, 13 août 2026 (comparaisons Fable 5 et Opus 4.8, benchmark HLE, GDP-Val) ; Lucas Ropek, « OpenAI introduces Ultrafast, a new mode that makes GPT-5.6 Sol work at 14x the speed », TechCrunch, 13 août 2026 (cas d’usage) ; « OpenAI’s new Ultrafast mode runs GPT-5.6 Sol 14 times faster, on Cerebras chips », The Next Web, 14 août 2026 (testeurs, architecture Cerebras, contexte boursier). Les durées du décodeur sont des calculs : 1,4 token par mot, 53,6 tokens par seconde en standard (750 divisé par le facteur 14 annoncé).


