(Essayez l'IA de Yiaho, c'est gratuit !)
L’essentiel en 30 secondes
- Meta a publié Muse Glimmer, un modèle d’IA de 30 milliards de paramètres, gratuit, sous licence Apache 2.0, conçu pour tourner sur votre ordinateur et non dans le nuage.
- Il faut une grosse machine. Le dépôt officiel pèse 59,58 Go. La version compressée descend à 17 Go, mais Meta vise une enveloppe de 24 à 32 Go de mémoire graphique. Un ordinateur portable ordinaire ne suffit pas.
- Oui, il est téléchargeable depuis la France, sans compte : testé le 11 août 2026 depuis une adresse française, le serveur répond et envoie bien les fichiers.
- Les poids étaient en ligne avant l’annonce. Un partenaire de Meta les avait déjà déposés publiquement le 7 août, avec une fiche qui précisait que ces poids étaient privés et ne devaient pas être rediffusés.
- Vingt et une heures. C’est le temps qu’il a fallu pour qu’apparaisse la première version publique du modèle avec les garde-fous retirés. Il y en a maintenant plus d’une vingtaine.
Le 10 août 2026, Mark Zuckerberg a publié un texte de 6 500 mots sur l’avenir de l’intelligence artificielle, et Meta a mis en ligne un modèle d’IA que n’importe qui peut télécharger et faire tourner chez soi, sans abonnement, sans compte et sans connexion Internet. Il s’appelle Muse Glimmer.
La promesse est séduisante : une IA capable de lire votre écran, d’utiliser des outils et d’enchaîner des tâches, qui vit sur votre disque dur au lieu des serveurs d’une entreprise américaine. La réalité mérite d’être regardée de près. Nous avons ouvert la fiche officielle, la licence, le fichier de configuration, l’historique complet du dépôt et les 100 premiers dépôts dérivés, et nous avons testé le téléchargement depuis Paris. Voici ce que ça donne.
Muse Glimmer, c’est quoi exactement ?
C’est un modèle de langage multimodal : il lit du texte et des images, et il répond en texte. Il a été conçu pour un usage précis, que Meta appelle l’agent local : une IA qui ne se contente pas de répondre, mais qui planifie, appelle des outils, vérifie ses résultats et recommence quand elle se trompe.
| Caractéristique | Valeur officielle | Ce que ça change pour vous |
|---|---|---|
| Éditeur | Meta Superintelligence Lab | La nouvelle division IA de Meta, celle des modèles Muse Spark |
| Taille | Environ 29,6 milliards de paramètres annoncés. Les métadonnées du fichier en comptent exactement 29 776 626 688 | Un « petit » modèle à l’échelle de 2026, mais gros pour un ordinateur personnel |
| Licence | Apache 2.0 | Utilisation commerciale autorisée, modification autorisée, redistribution autorisée |
| Poids du dépôt officiel | 59,58 Go (59 581 826 391 octets) | C’est ce que vous téléchargez en version non compressée |
| Compte obligatoire | Non (gated: false) |
Téléchargement direct, sans inscription |
| Longueur de contexte | 131 072 jetons | Environ 100 000 mots d’un coup, soit un gros dossier |
| Connaissances arrêtées au | 4 janvier 2026 | Il ignore tout ce qui s’est passé depuis |
| Langues | Plus de 100 langues d’entraînement | Le français en fait partie, mais Meta précise ne pas les avoir toutes évaluées |
| Audio | Non pris en charge | Ni entrée ni sortie vocale |
| Âge | Réservé aux 18 ans et plus | C’est écrit noir sur blanc dans la fiche et dans la charte d’usage |
Le détail que personne ne relève
La fiche officielle écrit que le modèle « n’est pas destiné à être téléchargé ni utilisé par des personnes de moins de 18 ans » (The model is not intended to be downloaded by or used by individuals under the age of 18). Aucun contrôle technique ne l’empêche : le téléchargement ne demande ni compte, ni âge, ni case à cocher.
« Ça tourne sur votre ordinateur » : ce que ça veut dire vraiment
C’est la phrase qui a fait le tour des sites d’actualité. Le compte officiel de Meta l’écrit ainsi : le modèle est « conçu pour tourner entièrement sur du matériel grand public comme un Mac ou des PC dotés de cartes graphiques performantes » (designed to run entirely on consumer hardware like a Mac or PCs with performant GPUs). Les trois derniers mots comptent autant que les autres.

Le calcul est simple. Un modèle de 30 milliards de paramètres en pleine précision occupe deux octets par paramètre, soit près de 60 Go. Meta le reconnaît dans son billet technique : en pleine précision, « un modèle de 30 milliards de paramètres exigerait plus de 55 Go de mémoire » (At full precision, a 30-billion parameter model would require over 55 GB of memory). Aucune carte graphique grand public n’en offre autant.
La solution s’appelle la quantification : on réduit la précision de chaque paramètre pour faire maigrir le fichier. Meta publie trois variantes, avec la perte de qualité mesurée pour chacune.
| Variante | Dégradation annoncée | Mémoire graphique visée | Pour qui |
|---|---|---|---|
| Pleine précision (BF16) | Référence | 64 Go | Recherche, personnalisation du modèle |
| K-Quant-Dynamic | 0,2 % | 32 Go | MacBook Pro haut de gamme, RTX 5090 |
| K-Quant-17GB | 1,0 % | 24 Go | Le plancher officiel |
Autrement dit : le plancher annoncé par Meta est de 24 Go de mémoire graphique. Ce n’est pas la configuration d’un ordinateur portable ordinaire, ni celle d’un PC de bureau moyen. C’est celle d’une machine de créatif ou de joueur, ou d’un Mac bien équipé.
Le bon calcul, celui que Meta ne détaille pas
Le poids du modèle n’est pas la seule chose à loger en mémoire. Il faut aussi le cache de contexte, cette mémoire de travail qui grossit à mesure que la conversation s’allonge. Sur beaucoup de modèles, c’est ce cache qui fait exploser la facture mémoire. Ici, non, et c’est la bonne surprise du fichier de configuration officiel.
Ce fichier montre que sur les 52 couches du modèle, 39 ne regardent que les 2 048 derniers jetons et seulement 13 gardent tout l’historique en mémoire. Résultat, à 131 072 jetons de contexte, le cache pèse environ 1,83 Go au lieu des 6,98 Go qu’exigerait un modèle classique de même taille, soit 3,8 fois moins. C’est ce choix d’architecture, plus que la compression, qui rend le contexte long utilisable sur une machine personnelle.
Reste la question que tout le monde se pose vraiment : est-ce que ça tourne chez moi ? L’outil ci-dessous répond pour 24 combinaisons de machines et d’usages, en s’appuyant à chaque fois sur un chiffre publié par Meta ou calculé à partir de son fichier de configuration.
Votre machine peut-elle le faire tourner ?
Choisissez votre ordinateur, puis ce que vous voulez en faire. Chaque réponse s’appuie sur un chiffre publié par Meta ou calculé à partir du fichier de configuration officiel.
Mac Apple Silicon 16 Go de mémoire unifiée (MacBook Air d’entrée de gamme), pour conversation et rédaction, contexte court
La plus petite variante officielle pèse à elle seule 17 Go, et macOS ne laisse jamais toute la mémoire unifiée au modèle. Sur 16 Go, il n’y a pas la place, même pour une conversation courte. Une variante communautaire en 3 bits existe, mais ce n’est plus le modèle que Meta a mesuré.
Où c’est écrit : Fiche du modèle, tableau des quantifications : la variante K-Quant-17GB vise 24 Go de mémoire graphique.
Mac Apple Silicon 16 Go de mémoire unifiée (MacBook Air d’entrée de gamme), pour lui faire lire des captures d’écran, des graphiques, des documents
La lecture d’images ajoute l’encodeur de perception et ses jetons visuels par-dessus les 17 Go du modèle de langage. C’est précisément ce que Meta range dans son enveloppe de 24 Go. Sur 16 Go, non.
Où c’est écrit : Fiche du modèle : l’enveloppe de 24 ou 32 Go couvre le cache, l’encodeur de perception et le brouillon DFlash.
Mac Apple Silicon 16 Go de mémoire unifiée (MacBook Air d’entrée de gamme), pour le laisser travailler seul sur un dossier entier, contexte maximal
Le cache mémoire du contexte maximal est étonnamment léger sur ce modèle, environ 1,8 Go, mais il s’ajoute à 17 Go de poids. Le compte n’y est pas.
Où c’est écrit : Calcul à partir du config.json officiel : 13 couches à attention complète, 39 à fenêtre glissante de 2 048.
Mac Apple Silicon 16 Go de mémoire unifiée (MacBook Air d’entrée de gamme), pour pleine précision BF16, personnalisation, ré-entraînement
La pleine précision, c’est 59,58 Go de fichiers à télécharger et une cible de 64 Go de mémoire graphique annoncée par Meta. Ce n’est pas la catégorie de cette machine.
Où c’est écrit : Somme des tailles de fichiers du dépôt officiel, relevée par l’API Hugging Face le 11 août 2026.
Mac Apple Silicon 24 Go de mémoire unifiée, pour conversation et rédaction, contexte court
Les 17 Go de la plus petite variante tiennent sur le papier, mais macOS garde une part de la mémoire unifiée pour le système et vos applications. Fermez tout, limitez la longueur de conversation, et attendez-vous à des ralentissements dès que le contexte s’allonge.
Où c’est écrit : Fiche du modèle : K-Quant-17GB, dégradation mesurée 1,0 %, cible 24 Go de mémoire graphique.
Mac Apple Silicon 24 Go de mémoire unifiée, pour lui faire lire des captures d’écran, des graphiques, des documents
C’est exactement l’enveloppe basse prévue par Meta : les 17 Go, plus le cache, plus l’encodeur d’images. Ça passe, sans marge, et une grande capture d’écran consomme beaucoup de jetons visuels.
Où c’est écrit : Fiche du modèle : l’enveloppe de 24 Go est censée couvrir le cache, l’encodeur de perception et le brouillon.
Mac Apple Silicon 24 Go de mémoire unifiée, pour le laisser travailler seul sur un dossier entier, contexte maximal
Le contexte maximal ajoute environ 1,8 Go de cache. Sur une machine qui partage déjà sa mémoire avec le système, c’est le Go de trop : la machine se met à échanger sur le disque et l’agent devient inutilisable.
Où c’est écrit : Calcul à partir du config.json officiel, contexte de 131 072 jetons en précision BF16.
Mac Apple Silicon 24 Go de mémoire unifiée, pour pleine précision BF16, personnalisation, ré-entraînement
Meta annonce une cible de 64 Go de mémoire graphique pour la pleine précision. Il faut aussi télécharger 59,58 Go de fichiers.
Où c’est écrit : Fiche du modèle, colonne Full Precision du tableau des quantifications.
Mac Apple Silicon 36 Go et plus (MacBook Pro M4 Max, M5 Max), pour conversation et rédaction, contexte court
C’est la catégorie de machine sur laquelle Meta a fait ses propres mesures. Avec la variante intermédiaire, la dégradation annoncée tombe à 0,2 %, et la vitesse reste confortable pour une conversation.
Où c’est écrit : Fiche du modèle : mesures faites sur MacBook M4-Max et M5-Max, variante K-Quant-Dynamic, cible 32 Go.
Mac Apple Silicon 36 Go et plus (MacBook Pro M4 Max, M5 Max), pour lui faire lire des captures d’écran, des graphiques, des documents
La lecture d’images est prévue dans l’enveloppe de 32 Go, encodeur de perception compris. C’est l’usage pour lequel ce modèle a été conçu : lire ce qui est à l’écran, puis agir.
Où c’est écrit : Fiche du modèle : l’enveloppe laisse la place au cache, à l’encodeur de perception et au brouillon DFlash.
Mac Apple Silicon 36 Go et plus (MacBook Pro M4 Max, M5 Max), pour le laisser travailler seul sur un dossier entier, contexte maximal
Le contexte maximal ne coûte qu’environ 1,8 Go de cache, grâce à une architecture où 39 couches sur 52 ne regardent que les 2 048 derniers jetons. Un modèle classique de même taille en demanderait près de 7 Go.
Où c’est écrit : Calcul à partir du config.json officiel : 2 têtes clé-valeur, dimension 128, fenêtre 2 048.
Mac Apple Silicon 36 Go et plus (MacBook Pro M4 Max, M5 Max), pour pleine précision BF16, personnalisation, ré-entraînement
Meta vise 64 Go de mémoire graphique pour la pleine précision. Un Mac de 36 ou 48 Go ne suffit pas ; à 64 Go et au-delà, oui, après 59,58 Go de téléchargement.
Où c’est écrit : Fiche du modèle, colonne Full Precision ; taille du dépôt relevée par l’API Hugging Face.
PC avec une carte graphique de 8 Go de VRAM, pour conversation et rédaction, contexte court
Une carte de 8 Go ne peut pas accueillir 17 Go de poids. On peut répartir le modèle entre la carte et la mémoire vive du PC, mais la vitesse s’effondre : ce n’est plus la machine fluide décrite par Meta.
Où c’est écrit : Fiche du modèle : la plus petite variante officielle vise 24 Go de mémoire graphique.
PC avec une carte graphique de 8 Go de VRAM, pour lui faire lire des captures d’écran, des graphiques, des documents
L’encodeur d’images s’ajoute aux 17 Go du modèle de langage. Sur 8 Go, le modèle passe déjà en partie hors de la carte avant même la première image.
Où c’est écrit : Fiche du modèle : l’enveloppe de 24 Go couvre le modèle, le cache et l’encodeur de perception.
PC avec une carte graphique de 8 Go de VRAM, pour le laisser travailler seul sur un dossier entier, contexte maximal
Même avec un cache de contexte léger, environ 1,8 Go, le modèle lui-même ne tient pas. Un agent qui travaille des heures sur une machine qui échange en permanence avec le disque n’est pas un agent utilisable.
Où c’est écrit : Calcul à partir du config.json officiel, contexte de 131 072 jetons.
PC avec une carte graphique de 8 Go de VRAM, pour pleine précision BF16, personnalisation, ré-entraînement
64 Go de mémoire graphique visés par Meta contre 8 Go disponibles, et 59,58 Go de fichiers à télécharger avant d’essayer.
Où c’est écrit : Fiche du modèle, colonne Full Precision ; somme des fichiers du dépôt officiel.
PC avec une carte graphique de 12 à 16 Go de VRAM, pour conversation et rédaction, contexte court
Il manque au moins 1 Go pour loger les 17 Go de la plus petite variante entièrement dans la carte. En laissant quelques couches dans la mémoire vive du PC, ça démarre, mais la vitesse chute nettement.
Où c’est écrit : Fiche du modèle : K-Quant-17GB, cible 24 Go de mémoire graphique.
PC avec une carte graphique de 12 à 16 Go de VRAM, pour lui faire lire des captures d’écran, des graphiques, des documents
Il faut ajouter l’encodeur de perception et les jetons visuels à un modèle qui ne tient déjà pas. C’est le premier usage à sauter sur cette catégorie de carte.
Où c’est écrit : Fiche du modèle : l’enveloppe basse annoncée est de 24 Go, encodeur compris.
PC avec une carte graphique de 12 à 16 Go de VRAM, pour le laisser travailler seul sur un dossier entier, contexte maximal
Le cache du contexte maximal reste modéré, environ 1,8 Go, mais il vient par-dessus un modèle déjà à l’étroit. En pratique, l’agent passe son temps à attendre la mémoire vive.
Où c’est écrit : Calcul à partir du config.json officiel : 13 couches complètes, 39 à fenêtre glissante.
PC avec une carte graphique de 12 à 16 Go de VRAM, pour pleine précision BF16, personnalisation, ré-entraînement
Meta vise 64 Go de mémoire graphique pour la pleine précision. Une carte de 12 à 16 Go en est loin.
Où c’est écrit : Fiche du modèle, colonne Full Precision.
PC avec une carte graphique de 24 à 32 Go de VRAM (RTX 4090, RTX 5090), pour conversation et rédaction, contexte court
C’est la configuration de référence de Meta. Sur une RTX 5090, l’éditeur mesure 74,9 jetons par seconde sans accélération et 233,4 avec son brouillon DFlash, soit 3,1 fois plus vite.
Où c’est écrit : Fiche du modèle, tableau de vitesse : mesures en lot de 1, décodage glouton, via llama.cpp.
PC avec une carte graphique de 24 à 32 Go de VRAM (RTX 4090, RTX 5090), pour lui faire lire des captures d’écran, des graphiques, des documents
Avec 24 à 32 Go, l’enveloppe annoncée par Meta est respectée : modèle compressé, cache, encodeur de perception et brouillon tiennent ensemble.
Où c’est écrit : Fiche du modèle : compression à environ 4 bits, modèle de langage sous 20 Go, enveloppe de 24 ou 32 Go.
PC avec une carte graphique de 24 à 32 Go de VRAM (RTX 4090, RTX 5090), pour le laisser travailler seul sur un dossier entier, contexte maximal
Le contexte maximal n’ajoute qu’environ 1,8 Go de cache : c’est l’intérêt de cette architecture, où seules 13 couches sur 52 regardent tout l’historique. Un modèle à attention complète de même taille demanderait près de 7 Go.
Où c’est écrit : Calcul à partir du config.json officiel : 2 têtes clé-valeur, dimension 128, fenêtre 2 048, BF16.
PC avec une carte graphique de 24 à 32 Go de VRAM (RTX 4090, RTX 5090), pour pleine précision BF16, personnalisation, ré-entraînement
Même une RTX 5090 et ses 32 Go restent sous la cible de 64 Go annoncée pour la pleine précision. Il faut deux cartes, une carte professionnelle, ou passer par un serveur.
Où c’est écrit : Fiche du modèle, colonne Full Precision du tableau des quantifications.
24 combinaisons. Les budgets mémoire viennent du tableau des quantifications de la fiche officielle du modèle ; la taille du cache de contexte est calculée à partir du fichier config.json du dépôt. Sur Mac, la mémoire est partagée avec le système : la marge réelle est toujours inférieure à la mémoire installée.
Peut-on le télécharger depuis la France ?
La question n’est pas théorique. Sur la page communautaire du modèle, plusieurs utilisateurs se plaignent d’être bloqués selon leur pays, et l’un des fils ouverts le 10 août au soir s’intitule « merci d’avoir bloqué mon pays pour le téléchargement de ces modèles » (THANKS FOR BLOCKING MY COUNTRY FROM DOWNLOADING THESE MODELS). Les réponses conseillent un réseau privé virtuel ou un miroir chinois.
Nous avons donc mesuré, plutôt que supposé. Le 11 août 2026, depuis une adresse IP française située à Paris, sans compte et sans jeton d’authentification :
- la fiche du modèle, la licence et le fichier de configuration se téléchargent normalement ;
- une demande partielle sur le premier fichier de poids renvoie un code HTTP 206 et livre bien 1 048 576 octets de données réelles ;
- l’en-tête du fichier est valide et déclare 1 348 tenseurs, ce qui prouve que ce sont bien les poids et pas une page d’erreur ;
- l’adresse finale du serveur de distribution porte la mention
user_id=public, donc aucun compte n’est nécessaire.
Verdict pour la France : accessible
Au 11 août 2026, rien ne bloque le téléchargement depuis la France, ni compte, ni restriction géographique, ni acceptation de conditions. Le dépôt est marqué gated: false dans l’interface de programmation de Hugging Face. Les blocages signalés visent d’autres pays.

Est-ce vraiment « open source » ?
Meta emploie le mot sans réserve, et pour une fois la licence suit. Nous avons comparé le fichier LICENSE du dépôt au texte canonique de la licence Apache 2.0 publié par la fondation Apache : les deux font exactement 11 358 octets et sont identiques. Pas de clause maison ajoutée, pas de restriction sur le nombre d’utilisateurs, contrairement aux anciennes licences Llama.
Deux nuances, tout de même.
La première : le dépôt contient un second fichier, une charte d’usage de 5 230 octets qui interdit une longue liste de choses, du harcèlement à la fabrication d’armes en passant par l’exercice non autorisé d’une profession réglementée. Ce document n’est pas dans la licence. Il est à côté. Une licence Apache 2.0 ne permet pas d’ajouter de telles restrictions aux droits qu’elle accorde : la charte relève donc de l’engagement moral, pas du contrat de licence.
La seconde : cette licence est arrivée en retard. L’historique du dépôt officiel est public et daté à la seconde.
- Les poids arrivent en ligne
Premier envoi dans le dépôt officiel
meta-models/Muse-Glimmer-30B. À ce moment, ni fiche de modèle, ni licence. - Première fiche de modèle
Cinq heures plus tard, le premier jet de la documentation est déposé.
- Ajout de la licence et de la charte d’usage
Le fichier de licence Apache 2.0 arrive 14 heures, 23 minutes et 27 secondes après les poids. Pendant tout ce temps, le modèle était téléchargeable sans qu’aucune licence ne soit publiée avec lui.
- Annonce publique
Le compte officiel de Meta publie enfin son fil d’annonce, seize heures et vingt-deux minutes après la mise en ligne des fichiers.
Les poids étaient publics avant l’annonce, et la fiche disait « ne pas rediffuser »
C’est la partie la plus étonnante du dossier, et elle est entièrement vérifiable dans l’historique public de Hugging Face.
Quatre dépôts contenant des versions compressées de Muse Glimmer existaient avant le dépôt officiel de Meta. Ils appartiennent à RadixArk, l’organisation qui développe SGLang, l’un des moteurs d’exécution que Meta cite nommément dans son propre communiqué. Autrement dit, un partenaire de lancement.
| Horodatage (UTC) | Événement | Écart avec le dépôt officiel |
|---|---|---|
| 7 août, 03 h 49 min 25 s | Envoi d’environ 15 Go de poids compressés dans un dépôt RadixArk | 2 jours, 14 h et 2 min avant |
| 9 août, 10 h 57 min 33 s | Fiche complète publiée, portant la mention de poids privés à ne pas rediffuser | 6 h 54 min avant |
| 9 août, 17 h 51 min 35 s | Dépôt officiel de Meta créé | Référence |
| 10 août, 10 h 27 min 40 s | Retrait de la mention par son auteur | 16 h 36 min après |
La version de la fiche datée du 9 août contient, en toutes lettres, cette phrase : « Poids privés, ne pas rediffuser. » (Private weights; do not redistribute.) Elle cite aussi le dépôt source, someorgtoo/onyx_final_hf, qui répond aujourd’hui encore par une erreur d’authentification, signe qu’il est resté privé. Et elle appelle le modèle par un autre nom.
Le nom de code interne était « Onyx »
Dans un autre dépôt du même partenaire, deux modifications déposées le 10 août à 10 h 21 s’intitulent « Renommer Onyx en Muse Glimmer pour correspondre aux points de contrôle publics » (Rename Onyx -> Muse Glimmer to match the public checkpoints). Une troisième, une minute plus tard, retire les dernières traces du nom dans le code livré. Le modèle a donc circulé chez les partenaires sous le nom de code Onyx avant de devenir Muse Glimmer.
Le titre de la modification qui efface la mention est explicite : « Fiche : retrait de la mention de distribution privée avant la publication publique » (Card: remove private-distribution notice ahead of public release).

Ce que nous ne pouvons pas prouver
L’historique d’un dépôt Hugging Face donne la date de chaque modification, mais pas les changements de visibilité. Nous pouvons donc affirmer que les fichiers ont été envoyés le 7 août et que la mention de poids privés figurait dans la fiche du 9 août. Nous ne pouvons pas établir depuis l’extérieur si ces dépôts étaient déjà consultables par le public à ces dates. Aucune archive du site Internet Archive n’existe pour ces adresses avant le 10 août.
Zuckerberg promet « bientôt » ce qui était déjà publié
Le même jour, à 10 h 01 min 23 s, Mark Zuckerberg publie sur le site de Meta un texte de 6 500 mots intitulé « L’avenir est pour tout le monde » (The Future is for Everyone). Il y défend une thèse claire : la sécurité de l’IA ne passe pas par la concentration du pouvoir chez quelques laboratoires, mais par sa diffusion la plus large possible. Il l’écrit ainsi : « Nous proposons une philosophie fondée sur l’autonomisation individuelle comme source de prospérité, l’invention comme finalité première de la superintelligence, et l’équilibre des pouvoirs comme fondement de la sécurité. » (We propose a philosophy based on individual empowerment as the source of prosperity, invention as the primary purpose of superintelligence, and balance of power as the foundation of safety.)
Ce texte de 6 500 mots emploie 54 fois le mot superintelligence et 16 fois l’expression open source. Il ne contient pas une seule fois les mots « Muse » ni « Glimmer ». Et sur le sujet des modèles ouverts, il écrit au futur : « Maintenant que les laboratoires de superintelligence de Meta sont opérationnels, nous allons bientôt reprendre la publication de certains modèles open source. » (Now that Meta Superintelligence Labs are up and running, we will resume releasing some open source models soon.)
Écart calculé entre le premier envoi du dépôt officiel et l’horodatage du texte, tous deux relevés sur les sources primaires
Ce n’est pas une contradiction, c’est un décalage de calendrier entre une tribune écrite à l’avance et une mise en ligne technique. Mais il vaut la peine d’être signalé, parce que la leçon vaut pour toutes les annonces de ce secteur : un même éditeur publie souvent plusieurs textes le même jour, et ils ne disent pas la même chose. Voici tous les canaux officiels de la journée, horodatés.
| Canal officiel de Meta | Horodatage (UTC) | Ce qu’il dit |
|---|---|---|
| Dépôt Hugging Face, premier envoi | 9 août, 17 h 51 min 35 s | Rien. Les fichiers arrivent sans documentation |
| Fiche du modèle | 9 août, 22 h 52 min 16 s | Les chiffres complets : tailles, dégradations, vitesses, risques |
| Licence et charte d’usage | 10 août, 08 h 15 min 02 s | Apache 2.0, plus une charte d’usage séparée |
| Texte de Mark Zuckerberg | 10 août, 10 h 01 min 23 s | La doctrine. Aucune mention du modèle du jour |
| Compte officiel sur X, fil de trois messages | 10 août, de 10 h 13 min 34 s à 10 h 13 min 36 s | L’annonce grand public, avec les liens de téléchargement |
| Billet technique de Meta AI Research | 10 août (date seule dans le code source) | La méthode d’entraînement et les optimisations |
| Vidéo Instagram de Mark Zuckerberg | Non horodatée publiquement | Selon CNBC, il y annonce aussi l’ouverture des poids de Muse Spark 1.2 |
Une promesse encore non tenue au 11 août
CNBC rapporte que Zuckerberg a annoncé, dans une vidéo Instagram du 10 août, l’ouverture des poids de Muse Spark 1.2, le grand modèle de Meta. Nous avons vérifié : au 11 août 2026, l’organisation meta-models sur Hugging Face ne contient que quatre dépôts, tous consacrés à Muse Glimmer, et une recherche sur « Muse-Spark » n’y renvoie aucun modèle. L’ouverture du grand modèle reste donc une annonce, pas un fait.
Vingt et une heures pour retirer les garde-fous
C’est ici que la thèse de Zuckerberg rencontre la réalité de la publication ouverte, et le calendrier est implacable.

Meta décrit dans sa fiche trois familles de protections entraînées directement dans les poids du modèle : un apprentissage supervisé de la sécurité, un apprentissage par renforcement qui pénalise les violations, et des principes de minimisation des données. Le modèle a par ailleurs été évalué sur quatre axes de risque.
Ces protections vivent dans les poids. Or les poids sont publics et modifiables : c’est le principe même d’une licence Apache 2.0. Une technique connue, l’ablitération, consiste à repérer dans le réseau la direction qui déclenche les refus et à l’atténuer. Le résultat est un modèle qui refuse beaucoup moins.
Nous avons recensé, le 11 août 2026 en fin de matinée, 115 dépôts dont le nom contient « Muse-Glimmer » sur Hugging Face. Sur ce total :
- 4 appartiennent à Meta ;
- 4 sont antérieurs au dépôt officiel, tous chez le même partenaire ;
- 49 ont été créés dans les 24 heures qui ont suivi la mise en ligne officielle ;
- 21 annoncent dans leur nom le retrait des garde-fous, avec des mots comme abliterated, uncensored, heretic, refusals ou crack, et ils émanent de 8 comptes distincts ;
- au total, 67 comptes différents autres que Meta ont publié une version de ce modèle, dont 66 après la mise en ligne officielle.
Le tout premier dérivé sans garde-fous est apparu 20 heures et 59 minutes après le dépôt officiel. Sa fiche est très explicite : « Ceci est une version décensurée de meta-models/Muse-Glimmer-30B » (This is a decensored version of meta-models/Muse-Glimmer-30B), et elle publie ses propres mesures.

Ce dérivé pèse lui aussi 59,58 Go, il est publié sous la même licence Apache 2.0, il ne demande aucun compte, et son auteur fournit la recette pour le reproduire. Un autre compte affiche sur sa fiche une pastille annonçant zéro refus nuisible sur 300 essais. Un troisième nomme carrément ses versions d’après le taux de refus obtenu.
À lire sans conclure trop vite
Ce constat ne prouve pas que Meta a été imprudent. L’entreprise l’a anticipé : sa fiche explique que Muse Glimmer ne relève pas de sa catégorie « IA de frontière » (Frontier AI) et que ses capacités en chimie et biologie sont « approximativement en ligne avec les autres modèles de sa catégorie de taille » (approximately in line with other models in its size class), donc qu’il n’ouvre pas de menace nouvelle. À noter tout de même : sur les trois domaines du volet « préparation » (chimie et biologie, cyber, perte de contrôle), un seul a été mesuré directement. La fiche précise que les niveaux cyber et perte de contrôle sont « déduits » (inferred) de ceux d’un modèle plus gros, sans évaluation propre.
Ce que vaut vraiment le modèle
Les reprises d’actualité ont retenu que Muse Glimmer « bat » Gemma4-31B et Qwen3.6-27B. Meta, elle, écrit quelque chose de plus prudent : le modèle « se comporte bien pour sa catégorie de taille sur plusieurs tests répandus » (performs strongly for its size class on several widely used LLM benchmarks). Nous avons recompté les 24 lignes du tableau publié.
| Modèle | Lignes où il arrive en tête | Sur quoi il domine |
|---|---|---|
| Muse Glimmer 30B | 12 sur 24 | Tâches d’agent de bout en bout, maths, suivi d’instructions, contexte long |
| Qwen3.6-27B | 8 sur 24 | Codage vérifié, terminal, usage du bureau, documents et écrans |
| Gemma4-31B | 2 sur 24 | Questions scientifiques de niveau expert |
| Aucun vainqueur unique | 2 sur 24 | Les deux lignes de sécurité et de vie privée, à deux mesures chacune |
Sur le second tableau, celui des risques chimiques et biologiques, le classement s’inverse : Gemma4-31B arrive en tête sur 4 des 6 tests, Muse Glimmer sur 2. Meta présente d’ailleurs ce tableau comme un argument de sécurité, pas de performance.
La vitesse, elle, est le vrai point fort, et Meta publie ses mesures.
| Machine de test | Sans accélération | Avec le brouillon DFlash | Gain |
|---|---|---|---|
| Nvidia RTX 5090 | 74,9 jetons/s | 233,4 jetons/s | 3,1 fois |
| Apple M5 Max | 26,6 jetons/s | 50,2 jetons/s | 1,8 fois |
| Apple M4 Max | 23,7 jetons/s | 37,8 jetons/s | 1,5 fois |
Le procédé, appelé décodage spéculatif, fait deviner seize jetons d’avance par un petit modèle compagnon, que le grand modèle valide en une seule passe. Meta affirme que la sortie reste identique.
Ce qu’en disent les premiers utilisateurs
La page communautaire du modèle comptait 43 discussions ouvertes au 11 août 2026 en fin de matinée, sur 44 fils créés depuis la publication. Les retours sont contrastés, et deux thèmes reviennent : la vitesse impressionne, l’excès de prudence agace.
« Il fonctionne bien, comparable à Qwen 3.6 27B et même un peu mieux […] Il fait plus de choses dans 128 000 jetons de contexte que Qwen, mais la limitation à 128 000 est une déception quand la concurrence utilise maintenant des fenêtres de 256 000. » (Works well, comparable to Qwen 3.6 27B and then some […] Gets more done in 128k context than Qwen, but the limitation to 128k is a disappointment when the competition all now use 256k windows.)
« Le réglage de sécurité est complètement, complètement hors de contrôle. » (The safety tuning is WAY, WAY out of control.) Le même message félicite pourtant Meta pour la licence, et mesure « 70 jetons par seconde » (70 tokens a second) sur une carte RTX 3090.
Ce qu’il faut retenir si vous n’êtes pas développeur
Muse Glimmer ne s’adresse pas au grand public, malgré le vocabulaire employé dans les annonces. Il n’y a pas d’application à installer, pas d’interface, pas de bouton. C’est un fichier de plusieurs dizaines de gigaoctets que l’on charge dans un logiciel spécialisé.
- Si vous voulez simplement utiliser une IA, une IA en ligne gratuite reste plus simple, plus rapide et plus à jour : la connaissance de Muse Glimmer s’arrête au 4 janvier 2026.
- Si vous tenez à la confidentialité, l’argument est réel : un modèle qui tourne chez vous n’envoie rien nulle part. Mais il faut la machine qui va avec.
- Si vous êtes curieux et bien équipé, des logiciels comme LM Studio ou Ollama rendent l’installation accessible, à condition d’avoir les 24 Go de mémoire graphique.
- Si vous suivez la bataille des IA ouvertes, c’est le vrai enjeu de cette sortie. Meta répond ici aux modèles chinois à poids ouverts comme GLM-5.2 ou Kimi K3, que Meta cite d’ailleurs elle-même dans son tableau de sécurité.
Pour situer ce modèle dans le paysage, notre comparatif des meilleures IA gratuites teste les solutions accessibles sans installation, et notre article sur l’utilisation gratuite de GPT-5.6 détaille ce qui est vraiment illimité chez le concurrent d’en face. Si le sujet des modèles à poids ouverts vous intéresse, notre guide complet de l’IA revient sur la différence entre modèle ouvert et modèle fermé.
Questions fréquentes
Muse Glimmer est-il gratuit ?
Oui. Les poids sont publiés sous licence Apache 2.0, sans compte ni paiement, y compris pour un usage commercial. Le coût est ailleurs : il faut un ordinateur capable de le faire tourner, et l’électricité pour l’alimenter.
Faut-il un compte Meta ou Facebook pour le télécharger ?
Non. Le dépôt est marqué gated: false sur Hugging Face, ce que nous avons vérifié en téléchargeant réellement une portion du fichier de poids depuis la France, sans authentification, le 11 août 2026.
Quelle configuration minimale faut-il vraiment ?
Meta annonce une cible de 24 Go de mémoire graphique pour sa plus petite variante, celle qui perd 1 % de qualité. En pratique, cela veut dire une carte graphique haut de gamme récente, ou un Mac Apple Silicon d’au moins 32 Go de mémoire unifiée. En dessous, le modèle déborde sur la mémoire vive et devient trop lent pour un usage réel.
Est-ce qu’il fonctionne sans connexion Internet ?
Oui, une fois les fichiers téléchargés. C’est l’argument central de Meta : le modèle « tourne localement sans nécessiter d’infrastructure en nuage ni d’accès réseau » (runs locally without requiring cloud infrastructure or network access). En revanche, s’il doit faire des recherches sur le Web dans le cadre d’une tâche d’agent, il lui faut évidemment une connexion.
Parle-t-il français ?
Il a été entraîné sur des données de plus de 100 langues, dont le français. Meta prévient toutefois que le modèle « n’a pas été évalué sur toutes les langues contenues dans les données de pré-entraînement » (has not been evaluated on all languages contained in the pre-training data) et que la qualité peut baisser hors des langues bien couvertes.
Que veut dire « version décensurée » et faut-il s’en inquiéter ?
Un modèle publié en poids ouverts peut être modifié par n’importe qui. L’ablitération repère la direction interne qui déclenche les refus et l’atténue, ce qui donne un modèle qui accepte des demandes que l’original refuserait. Ces versions existent pour tous les modèles ouverts, chinois comme américains. Elles font partie du coût du modèle ouvert, un coût que Mark Zuckerberg assume explicitement dans son texte, au motif que la diffusion large protège mieux qu’une concentration entre quelques mains.
Meta va-t-elle ouvrir aussi son grand modèle ?
C’est ce que Mark Zuckerberg a annoncé pour Muse Spark 1.2, selon CNBC qui rapporte une vidéo Instagram du 10 août. Au 11 août 2026, aucun poids de Muse Spark n’est en ligne sur Hugging Face : l’organisation officielle de Meta n’y héberge que les quatre dépôts de Muse Glimmer.
Pourquoi le contexte long coûte-t-il si peu de mémoire ici ?
Parce que 39 des 52 couches du modèle ne regardent que les 2 048 derniers jetons, et que seules 13 gardent tout l’historique. Le cache de contexte tombe ainsi à environ 1,83 Go au maximum, contre près de 7 Go pour un modèle de même taille qui garderait tout partout. C’est un calcul que nous avons refait à partir du fichier de configuration publié dans le dépôt officiel.
Pas la machine pour faire tourner une IA de 60 Go ?
Vous n’avez rien à installer pour discuter avec une intelligence artificielle. Le chat de Yiaho est gratuit, en français, sans inscription, et il répond tout de suite.
Sources primaires consultées le 11 août 2026 : fiche officielle du modèle, fichier de licence, charte d’usage, fichier de configuration et historique complet du dépôt meta-models/Muse-Glimmer-30B sur Hugging Face ; interface de programmation de Hugging Face pour le recensement des dépôts dérivés et leurs horodatages ; billet technique de Meta AI Research du 10 août ; texte de Mark Zuckerberg « The Future is for Everyone » publié sur about.fb.com le 10 août ; fil du compte officiel de Meta sur X du 10 août ; article de CNBC du 10 août pour la vidéo Instagram ; texte canonique de la licence Apache 2.0 publié par la fondation Apache. Les écarts de temps sont calculés à partir des horodatages en temps universel fournis par ces sources. Le recensement des dépôts dérivés porte sur les résultats de la recherche « Muse-Glimmer » sur Hugging Face au 11 août 2026 en fin de matinée, et ne prétend pas à l’exhaustivité.


