Muse Glimmer 30B : que vaut ce modèle IA local pour écrire ?

Meta le présente comme un modèle agentique ouvert, pas comme une plume. Ce que 100 jugements du Baromètre, deux classements Arena et les fichiers officiels permettent réellement de dire.

Publié le Texte par Claude Opus 5 et GPT-5.6 Sol · Analyse et graphiques par le Baromètre de l’écriture IA

Le résultat d’écriture d’abord. Sur les consignes françaises du Baromètre, K-Quant 17GB devance K-Quant Dynamic : Dynamic obtient 40,0 % des points, soit 10 victoires, aucune égalité et 15 défaites sur 25 jugements. Ces 25 jugements couvrent 13 consignes uniques et viennent de deux juges automatiques, 12 de Claude Opus 5 et 13 de GPT 5.6 Sol, sur un instantané de notre base de production arrêté au 12 août 2026.

Le même sens apparaît en allemand et en espagnol, mais il s’inverse en anglais : un signal, pas une conclusion établie. Et rien ici ne fait de Muse Glimmer un modèle d’écriture. Meta Superintelligence Labs l’a publié le 10 août 2026 comme modèle agentique ouvert, sans aucun résultat de prose. Ce qui touche à l’écriture vient d’ailleurs : deux classements Arena encore jeunes et notre comparaison des deux fichiers officiels.

Nos jugements, langue par langue

La paire testée est exacte : Muse Glimmer 30B K-Quant 17GB contre Muse Glimmer 30B K-Quant Dynamic, mêmes consignes, chaque duel tranché en victoire, égalité ou défaite, sur 13 consignes uniques par langue. Les parts de points ci-dessous sont celles du 17GB, où 50 % vaudrait l’équilibre.

  • Français : 40,0 %, soit 10 victoires, 0 égalité et 15 défaites sur 25 jugements.
  • Allemand : 40,0 %, même décompte de 10, 0 et 15.
  • Espagnol : 34,0 %, avec 8 victoires, 1 égalité et 16 défaites.
  • Anglais : 64,0 %, avec 14 victoires, 4 égalités et 7 défaites.

Les deux juges concordent partout : en français, Claude Opus 5 accorde 41,7 % au 17GB sur ses 12 jugements, GPT 5.6 Sol 38,5 % sur ses 13. La mesure est donc cohérente, mais l’échantillon reste petit, et l’absence totale d’égalités en français comme en allemand trahit des juges qui tranchent même sur des écarts fins. L’inversion anglaise reste inexpliquée. Enfin, aucune comparaison avec un voisin local comme Gemma ou Qwen n’atteint notre plancher de publication, fixé à 12 jugements par juge, par langue et par paire exacte : nous ne classons pas Muse Glimmer face à eux. Le détail se consulte dans nos résultats.

Ce que Meta annonce, et ce qu’elle ne dit pas

L’architecture officielle est un transformeur causal dense de 52 couches de texte, doublé d’un encodeur de perception séparé : environ 29,6 milliards de paramètres, dont 1,8 milliard pour la partie visuelle. Entrées texte et images, sortie texte, fenêtre configurée à 131 072 jetons, coupure des connaissances au 4 janvier 2026. Les références sont l’annonce de publication et la fiche du modèle.

Meta évoque des données issues de plus de 100 langues, sans publier la liste ni le moindre résultat d’écriture par langue. Le reste de la divulgation est aussi mince : ni nombre de jetons d’entraînement, ni proportions linguistiques, ni inventaire des jeux de données, rien sur un éventuel corpus littéraire. Pour qui écrit en français, la revendication multilingue reste invérifiable.

Nous ne présentons donc pas Muse Glimmer comme un spécialiste de la prose : le positionnement est agentique, les résultats mis en avant par Meta ne portent pas sur l’écriture, et la plume se juge sur des réponses.

Dynamic face à 17GB dans les duels d’écriture

Part des points obtenue par Dynamic sur les mêmes consignes. La ligne rouge marque l’égalité.

Voir le tableau de données
Dynamic face à 17GB dans les duels d’écriture
ComparaisonValeurDonnées
allemand40,0 %25 jugements: 10 victoires, 0 égalités, 15 défaites
anglais64,0 %25 jugements: 14 victoires, 4 égalités, 7 défaites
espagnol34,0 %25 jugements: 8 victoires, 1 égalités, 16 défaites
français40,0 %25 jugements: 10 victoires, 0 égalités, 15 défaites
Données du Baromètre. Une victoire vaut un point et une égalité un demi-point. Claude Opus 5 et GPT 5.6 Sol ont chacun fourni au moins 12 jugements par langue.

17GB ou Dynamic : trancher selon votre machine

Meta distribue deux fichiers de texte, et l’arbitrage est moins simple qu’il n’y paraît.

  • K-Quant 17GB : 16 756 681 056 octets, soit 16,757 Go décimaux, cible annoncée de 24 Go de mémoire vidéo, dégradation moyenne rapportée de 1,0 %.
  • K-Quant Dynamic : 19 653 957 984 octets, soit 19,654 Go décimaux, cible de 32 Go, dégradation moyenne rapportée de 0,2 %.

Presque trois gigaoctets séparent les deux fichiers, mais surtout un palier matériel entier. Ces pourcentages viennent de Meta, portent sur une moyenne dont la composition n’est pas détaillée, et ne sont pas des notes de prose.

Nos jugements ne reproduisent pas la direction moyenne annoncée par Meta : le 17GB arrive devant dans trois langues, dont le français où Dynamic obtient 40,0 % des points, et le Dynamic seulement en anglais. Sur les quatre langues réunies, 17GB obtient 55,5 % des points et Dynamic 44,5 %. La règle pratique reste donc de tester les deux si votre machine les accepte ; si elle ne l’accepte qu’au prix d’un contexte réduit ou d’un déchargement vers la mémoire système, le 17GB reste défendable, car dix points de part de points sur 25 duels ne valent pas le confort d’usage ni la longueur de contexte perdus.

Ce qui sépare les verdicts d’Opus et de Sol

Part des points de Dynamic en français, séparée par juge. Les deux lignes franchissent le seuil de 12 jugements.

Voir le tableau de données
Ce qui sépare les verdicts d’Opus et de Sol
ComparaisonValeurDonnées
Claude Opus 541,7 %12 jugements: 5 victoires, 0 égalités, 7 défaites
GPT 5.6 Sol38,5 %13 jugements: 5 victoires, 0 égalités, 8 défaites
Données du Baromètre pour le français. Les noms des modèles étaient masqués ; il s’agit de jugements IA, pas de votes humains.

Mémoire réelle, fichiers annexes et vitesse

Deux composants facultatifs s’ajoutent au modèle de texte : l’encodeur de perception mmproj de 1,400 Go et le brouillon spéculatif DFlash de 1,631 Go, soit un ensemble complet de 19,79 Go avec le 17GB et de 22,69 Go avec le Dynamic. Ces tailles d’artefacts précèdent toute surcharge liée au moteur, aux tampons et au cache de contexte : viser une carte dont la mémoire égale le poids du fichier est une erreur de méthode, surtout si vous exploitez les 131 072 jetons. Sur Mac, comptez la mémoire unifiée réellement disponible après le système ; qui ne traite que du texte peut se passer de l’encodeur visuel.

La page officielle des fichiers GGUF précise les moteurs pris en charge et la version de llama.cpp requise : un moteur trop ancien, y compris embarqué dans LM Studio ou Ollama, ne chargera pas ces fichiers.

Côté vitesse, Meta publie 74,9 jetons par seconde sans DFlash contre 233,4 avec sur une RTX 5090, soit un facteur 3,1, puis 23,7 contre 37,8 sur Apple M4 Max et 26,6 contre 50,2 sur M5 Max. L’accélération est spectaculaire sur GPU dédié, bien plus modeste sur puce Apple.

Ces mesures ont été réalisées en lot de taille 1 et en décodage glouton. Elles ne promettent aucun débit pour de la prose produite par échantillonnage.

Le compromis entre les deux quantifications officielles

Taille du fichier du modèle texte. La mémoire d’exécution et le contexte s’ajoutent à ces fichiers.

Voir le tableau de données
Le compromis entre les deux quantifications officielles
ComparaisonValeurDonnées
K-Quant 17GB16,8 GBVRAM visée: 24 GB; dégradation annoncée: 1,0 %
K-Quant Dynamic19,7 GBVRAM visée: 32 GB; dégradation annoncée: 0,2 %
Tailles des fichiers officiels sur Hugging Face. Meta vise 24 Go de VRAM pour 17GB et 32 Go pour Dynamic, avec une dégradation moyenne annoncée de 1,0 % et 0,2 %.

Long contexte, confidentialité et licence

Une fenêtre de 131 072 jetons peut accueillir un manuscrit entier, sans garantir que le modèle tiendra une voix sur la durée ni qu’il retrouvera un détail lointain : au moment de notre contrôle, Muse Glimmer était absent des classements EQ-Bench d’écriture créative et de textes longs. Notre instantané n’isole pas non plus l’intensité de raisonnement, dont le coût en latence et l’effet sur la prose restent inconnus.

L’argument de confidentialité, lui, tient : un modèle exécuté chez vous traite vos manuscrits sans les envoyer à un service distant, ce qui compte pour des textes sous embargo ou des documents clients. L’exécution locale ne protège pourtant rien par elle-même, car une interface connectée, une extension ou un outil de recherche externe peuvent transmettre du contenu, et les journaux ont une destination. Vérifiez ces réglages avant de confier un texte sensible, comme nous le recommandons dans notre dossier IA locale.

Les poids portent l’étiquette Apache 2.0, inhabituellement permissive à cette taille, mais assortie d’une politique d’usage publiée par Meta qui pose ses propres restrictions. Pour un usage professionnel ou une intégration produit, les deux textes se lisent avant de s’engager.

Ce que DFlash change dans le test de vitesse de Meta

Jetons par seconde avec un lot de 1 et un décodage glouton. La prose échantillonnée peut être plus lente.

Voir le tableau de données
Ce que DFlash change dans le test de vitesse de Meta
ComparaisonValeurDonnées
Nvidia RTX 5090 base74,9 tok/sbase
Nvidia RTX 5090 DFlash233,4 tok/sDFlash
Apple M4 Max base23,7 tok/sbase
Apple M4 Max DFlash37,8 tok/sDFlash
Apple M5 Max base26,6 tok/sbase
Apple M5 Max DFlash50,2 tok/sDFlash
Mesures de la fiche modèle Meta. La vitesse de base et le décodage spéculatif DFlash sont séparés pour chaque machine.

Ce que disent les sources indépendantes

Hors de Meta, les seules données d’écriture disponibles sont deux classements de préférences Arena, dans leur état au 11 août 2026. En écriture créative, Muse Glimmer est 135e sur 384 modèles, avec un score corrigé du style de 1372 plus ou moins 23 sur 707 votes et un intervalle de rang de 107 à 155. En écriture, littérature et langue, il est 127e sur 385, avec 1387 plus ou moins 20 sur 926 votes et un intervalle de 97 à 151.

Ces instantanés sont précoces, leurs intervalles larges, et ils n’indiquent ni la quantification ni l’intensité de raisonnement. Lire un rang précis n’aurait aucun sens : retenez un positionnement en milieu de tableau, à une cinquantaine de places près, compatible avec notre prudence mais sans explication de l’inversion entre anglais et français.

Plus utile encore pour qui écrit des textes documentés : dans son relevé du 10 août 2026, Artificial Analysis attribue au modèle un indice d’intelligence de 35, un indice d’ouverture de 44, un Elo GDPval AA v2 de 953 pour une référence humaine à 1000, un score AA Omniscience de moins 33 et un taux d’hallucination de 82 %, en précisant que ces mesures éclairent le risque en écriture factuelle, pas la qualité de la prose. C’est un avertissement sur la fiabilité, pas une note de style.

Les premiers indices externes sur l’écriture restent incertains

Score Arena corrigé du style et intervalle publié. Les deux catégories ont des ensembles de votes distincts.

Voir le tableau de données
Les premiers indices externes sur l’écriture restent incertains
ComparaisonValeurDonnées
Arena Creative Writing leaderboard1372 ± 23707 votes; rang 135 (107 à 155)
Arena Writing, Literature and Language leaderboard1387 ± 20926 votes; rang 127 (97 à 151)
Instantané Arena du 11 août 2026. Creative Writing repose sur 707 votes ; Writing, Literature and Language sur 926. Arena n’indique ni quantification ni intensité de raisonnement.

Notre recommandation pour un auteur francophone

  • Si vous cherchez la meilleure prose, rien ici ne justifie Muse Glimmer : positionnement agentique, aucun résultat d’écriture chez Meta, milieu de tableau Arena avec une large marge.
  • Si la confidentialité est votre critère et que le matériel suit, c’est un candidat sérieux : le K-Quant Dynamic à partir de 32 Go de mémoire vidéo ou unifiée disponibles, le K-Quant 17GB à partir de 24 Go, avec dans les deux cas une marge au delà du poids du fichier pour le moteur et le cache de contexte.
  • Avant de trancher, testez cinq à dix consignes de votre travail réel (imitation de voix, coupe, réécriture, plan, passage long) sur les deux quantifications avec les mêmes réglages, comparez sans regarder leur nom, et relevez la mémoire maximale et le délai obtenus chez vous.
  • Si vous écrivez des textes documentés, la vérification des faits n’est pas négociable et les sources doivent être fournies au modèle : le taux d’hallucination de 82 % est le chiffre le plus actionnable de ce dossier.

Nous continuons à collecter des jugements sur cette paire et ses concurrents directs : les comparaisons avec les Gemma et Qwen de taille voisine seront publiées dès qu’elles atteindront le même plancher de 12 jugements par juge et par langue, même si elles contredisent cette tendance.