La réponse courte
La meilleure IA locale pour écrire en français, selon nos comparaisons en aveugle, est la variante placée en tête du tableau ci-dessus.
Ce nom change quand les données changent : de nouveaux modèles arrivent, de nouveaux duels sont joués, et l'écart entre deux voisins de classement n'est pas toujours significatif. Regardez donc autant l'écart de score et le volume de comparaisons que la position elle-même. Deux variantes séparées par quelques points, avec peu de duels chacune, sont mieux décrites comme « à égalité en l'état » que comme « première » et « deuxième ».
Et si votre machine ne peut pas faire tourner la première ligne, ce n'est pas grave : la question utile n'est pas « quel est le meilleur modèle local en général », mais « quel est le meilleur modèle local qui tient confortablement dans ma mémoire ». Les deux onglets matériel plus bas répondent à celle-là.
D'où viennent ces scores
Le Baromètre compare des textes deux à deux, en aveugle, sur des consignes rédigées nativement en français. Les scores affichés ici sont exactement ceux du classement général français : nous ne recalculons pas un classement isolé entre modèles locaux, nous filtrons le classement existant pour ne garder que les variantes exécutables localement, puis nous renumérotons les rangs.
Cela signifie qu'une variante locale a pu être comparée à des modèles cloud, et que ces duels comptent dans son score. C'est volontaire, pour deux raisons simples : l'échelle reste commune entre toutes les pages du site, et chaque modèle conserve davantage de données derrière son score. Le rang, lui, est bien un rang local : le numéro 1 de cette page est le meilleur modèle exécutable chez vous, pas le meilleur modèle tous accès confondus.
Précision utile : ces scores mesurent la qualité d'écriture en français, jugée sur des textes consultables. Ce n'est pas un classement d'intelligence générale, ni un indicateur de performance en code ou en mathématiques. Un modèle excellent ici peut être médiocre ailleurs, et l'inverse est vrai aussi. Précisons également qu'un modèle conçu en France ou en Europe n'écrit pas mieux en français par principe : cela se mesure, et parfois le résultat surprend.
Comment lire une ligne du tableau
Une variante se lit en trois morceaux.
Le modèle ou le checkpoint. C'est l'identité de base, publiée par son éditeur.
La quantification. C'est le format de compression des poids, expliqué plus bas. Les variantes Q8 et Q4 d'un même modèle sont deux objets différents à l'usage.
Le mode de raisonnement. 💡 signifie que le mode de raisonnement était activé ; ↯ qu'il était désactivé. Certaines variantes portent un état inconnu : nous avons demandé un mode de raisonnement, mais le moteur d'exécution n'a rapporté aucun jeton de réflexion, et les traces disponibles ne permettent pas de trancher. Dans ce cas nous l'écrivons plutôt que de deviner — une requête reasoning_effort=high acceptée par une API ne prouve pas qu'un raisonnement a réellement eu lieu.
Nous ne fusionnons jamais ces variantes sous un score moyen. Une moyenne entre une Q8 en mode 💡 et une Q4 en mode ↯ ne décrirait aucun fichier que vous puissiez télécharger.
Un mot sur les filtres par défaut : Q8 et Q4 QAT sont cochées à l'ouverture, parce que ce sont les deux formats que nous recommandons d'examiner en premier. La Q4 classique reste disponible d'un clic, décochée par défaut. Une entrée Q6 apparaîtra automatiquement dès qu'une variante évaluée existera dans ce format ; tant qu'il n'y a pas de données, nous n'affichons pas de case vide.
Qu'est-ce que la quantification, concrètement
Un modèle est un très grand ensemble de nombres. La quantification consiste à stocker ces nombres avec moins de bits : au lieu de seize bits par poids, huit, six ou quatre. Le fichier rétrécit, l'empreinte mémoire aussi. Sur une inférence limitée par la bande passante mémoire — ce qui est le cas courant en génération de texte sur une machine personnelle — lire moins d'octets à chaque jeton peut également accélérer la génération.
Le compromis est qu'on perd de l'information. Une quantification peut modifier la qualité du texte, et l'ampleur de cet effet dépend du modèle, de la méthode employée, de la tâche, de la langue, de la longueur du contexte et du niveau de compression. C'est pourquoi nous ne reprendrons jamais à notre compte les formules du type « la Q4 conserve 98 % de la qualité » : ce chiffre n'existe pas de façon universelle, et il est particulièrement fragile pour l'écriture dans une langue autre que l'anglais.
Les formats que vous verrez ici :
- Q8 — huit bits. Nous la traitons comme notre référence pratique de haute qualité. Cela ne veut pas dire qu'elle est mathématiquement identique au modèle d'origine en BF16 ou FP16, ni que l'écart est toujours imperceptible : cela se mesure modèle par modèle.
- Q4 QAT — un modèle préparé ou entraîné en tenant compte d'une exécution en quatre bits (quantization-aware training). Ce n'est pas une compression appliquée après coup : c'est un checkpoint distinct, publié comme tel par son éditeur.
- Q4_K_M — une quantification GGUF appliquée après l'entraînement, à quatre bits, avec des précisions mixtes selon les couches. C'est un bon format, mais ce n'est pas du QAT, et il ne faut pas confondre les deux dans un tableau.
- Q6 — un compromis intermédiaire, que nous afficherons quand nous aurons des variantes évaluées.
Et dans nos mesures ?
Nous ne publions une conclusion sur l'effet de la quantification que si elle repose sur des comparaisons appariées : même modèle, même mode de raisonnement, même langue, seule la quantification varie. Quand ces paires existent en nombre suffisant, la comparaison est affichée. Quand elles n'existent pas, nous le disons plutôt que d'extrapoler.
Aucune paire directe répondant à ce protocole n’est encore publiée pour cette langue et cette sélection.
Est-ce compliqué de faire tourner une IA en local ?
Non, plus vraiment — et oui, sur un point précis.
L'installation de base est devenue accessible. Un moteur d'exécution comme Ollama télécharge un modèle par une seule commande ; llama.cpp demande un peu plus de familiarité avec le terminal mais donne un contrôle fin sur chaque paramètre. Dans les deux cas, un premier essai ne demande plus une configuration ésotérique.
Ce qui demande de l'attention, c'est le choix de ce que vous faites tourner. Trois décisions comptent vraiment :
- Quelle variante — le bon compromis entre taille du modèle et quantification pour votre mémoire.
- Quelle longueur de contexte — combien de texte le modèle peut garder en tête, ce qui coûte de la mémoire en plus des poids.
- Où tourne le calcul — entièrement sur le GPU, ou partiellement sur le processeur.
Une marche à suivre raisonnable : repérer votre mémoire disponible, choisir dans le tableau une variante bien classée qui laisse de la marge, la télécharger, fixer un contexte modeste au premier essai, vérifier que la génération est fluide, puis augmenter le contexte jusqu'à trouver votre limite. C'est empirique, et c'est normal.
Mémoire : la question qui décide vraiment
L'erreur la plus fréquente consiste à comparer la taille du fichier du modèle à la capacité mémoire, et à conclure que ça passe. Ça ne suffit pas.
Il faut aussi loger le moteur d'exécution, les tampons de calcul, et surtout le cache KV — la mémoire de travail qui conserve le contexte déjà traité. Ce cache grandit avec la longueur du contexte : un modèle qui tient largement avec 4 000 jetons de contexte peut déborder à 64 000. La taille de batch, l'architecture du modèle et la présence éventuelle d'un composant de vision changent aussi l'empreinte réelle.
Quatre notions à ne pas confondre :
- La VRAM dédiée d'une carte graphique : rapide, mais de capacité fixe.
- La RAM système : abondante, nettement plus lente pour ce type de calcul.
- La mémoire unifiée (Apple Silicon, AMD Ryzen AI Max+, NVIDIA DGX Spark) : un pool partagé entre processeur et accélérateur, souvent très généreux en capacité. Généreux ne veut pas dire équivalent : le débit mémoire d'une plateforme unifiée n'est pas celui d'une VRAM dédiée haut de gamme, et il varie beaucoup d'une machine à l'autre.
- L'offload CPU : la possibilité de laisser une partie des couches en RAM système. Cela permet parfois de charger un modèle qui ne tiendrait pas autrement, au prix d'une pénalité de vitesse qui peut être sévère.
À retenir : « le modèle tient » et « le modèle est utilisable » sont deux affirmations différentes. Nous séparons donc toujours la qualité d'écriture, mesurée par les duels, de la vitesse et de l'encombrement, qui dépendent de votre matériel.
Sur les modèles à mélange d'experts (MoE), un point technique important : la limite de 256 milliards de paramètres de cette page porte sur les paramètres totaux, car ce sont eux qu'il faut charger en mémoire. Les paramètres actifs, qui déterminent surtout la vitesse, sont affichés séparément quand ils sont connus. Utiliser les paramètres actifs pour estimer la mémoire nécessaire mène à des recommandations irréalistes.
Recommandations par machine
Deux onglets, parce que ces deux mondes ne se raisonnent pas de la même façon.
Onglet 1 — GPU dédié
Ici, la capacité de VRAM est le mur : soit la variante y entre avec une marge suffisante pour votre contexte, soit il faut descendre d'un cran. Pour chaque palier — 8, 16 et 32 Go — nous indiquons le meilleur modèle en qualité d'écriture qui tient avec une marge réaliste, et une alternative plus rapide lorsqu'une vitesse a été mesurée sur notre matériel.
8 Go
Aucune variante classée ne tient avec la marge retenue.
16 Go
Meilleure qualité
Gemma 4 12B QAT 💡 🏠
45,1 · rang local 4
Alternative plus rapide mesurée
Gemma 4 12B 💡 🏠
14,5 tok/s · mesure AIWB sur Strix Halo
32 Go
Meilleure qualité
Gemma 4 31B QAT 💡 🏠
55,4 · rang local 1
Alternative plus rapide mesurée
Gemma 4 26B A4B QAT 💡 🏠
61,6 tok/s · mesure AIWB sur Strix Halo
32 Go
Meilleure qualité
Gemma 4 31B QAT 💡 🏠
55,4 · rang local 1
Alternative plus rapide mesurée
Gemma 4 26B A4B QAT 💡 🏠
61,6 tok/s · mesure AIWB sur Strix Halo
64 Go
Meilleure qualité
Gemma 4 31B QAT 💡 🏠
55,4 · rang local 1
Alternative plus rapide mesurée
Gemma 4 26B A4B QAT 💡 🏠
61,6 tok/s · mesure AIWB sur Strix Halo
96 Go
Meilleure qualité
Gemma 4 31B QAT 💡 🏠
55,4 · rang local 1
Alternative plus rapide mesurée
Gemma 4 26B A4B QAT 💡 🏠
61,6 tok/s · mesure AIWB sur Strix Halo
128 Go
Meilleure qualité
Gemma 4 31B QAT 💡 🏠
55,4 · rang local 1
Alternative plus rapide mesurée
Gemma 4 26B A4B QAT 💡 🏠
61,6 tok/s · mesure AIWB sur Strix Halo
Repères de chargement, pas garanties : contexte, cache KV, batch et moteur changent l’empreinte. Les vitesses AIWB ont été mesurées sur la machine Strix Halo décrite dans À propos ; elles ne prédisent pas la vitesse d’une autre plateforme.
Onglet 2 — Mémoire unifiée
Sur Apple Silicon, sur AMD Strix Halo / Ryzen AI Max+ et sur NVIDIA DGX Spark, la capacité disponible est souvent bien supérieure à celle d'une carte graphique grand public, ce qui ouvre la porte à des modèles nettement plus gros. La contrepartie est le débit : la génération peut rester confortable en lecture, tout en étant plus lente qu'on ne l'imagine sur les modèles les plus lourds.
Les vitesses que nous avons nous-mêmes mesurées sur AMD Strix Halo sont signalées comme mesures du Baromètre. Tout autre chiffre est explicitement étiqueté comme source externe ou comme estimation — jamais présenté comme une mesure maison.
Nous n'affichons ni prix ni consommation électrique : ces informations vieillissent vite et dépendent trop du marché local pour être utiles ici.
Pourquoi choisir une IA locale
Les raisons sont moins spectaculaires que les arguments publicitaires, et plus solides.
La confidentialité. Lorsque le moteur et ses intégrations fonctionnent entièrement en local, vos brouillons, vos notes et vos manuscrits n'ont pas à quitter la machine. Pour un texte sous contrat, un document interne ou un travail non publié, c'est déterminant.
Le fonctionnement hors ligne. Pas de connexion requise, pas de coupure de service, pas de file d'attente aux heures de pointe.
Le contrôle. Le modèle que vous avez téléchargé reste celui que vous avez téléchargé. Il n'est pas remplacé sans préavis par une version au comportement différent, et vous pouvez revenir à un checkpoint antérieur si le nouveau vous convient moins.
L'absence de dépendance. Ni quota, ni facturation à l'usage, ni changement de conditions au milieu d'un projet.
En contrepartie, il faut accepter que les meilleurs modèles locaux ne sont pas toujours au niveau des meilleurs modèles cloud, que la vitesse dépend de votre matériel, et qu'il y a un peu de bricolage initial. Le classement général du site vous dira où se situe précisément l'écart en français, sans avoir à nous croire sur parole.
Open source ou open-weight ?
Les deux termes circulent, souvent comme synonymes. Ils ne le sont pas. Poids ouverts signifie que les fichiers du modèle sont téléchargeables et exécutables ; open source décrit un statut de licence plus large, dont l'application exacte aux modèles d'IA reste débattue. Beaucoup de modèles très diffusés sont à poids ouverts sous licence restrictive, sans être open source au sens strict.
Le critère d'admission de cette page est technique : les poids sont disponibles et le modèle tourne réellement hors ligne. C'est ce qui détermine si vous pouvez l'utiliser chez vous. La licence, elle, détermine ce que vous avez le droit d'en faire — vérifiez-la avant tout usage commercial, elle ne dit rien de la qualité d'écriture.
Un point de méthode : un modèle est admissible même si les réponses évaluées ont été générées sur une infrastructure distante. Ce qui compte est la disponibilité des poids et la possibilité d'une exécution locale, pas le lieu où le texte a été produit lors de nos campagnes.
Modèles admissibles mais pas encore évalués
Certains modèles remplissent les critères d'admission sans avoir encore de score : les campagnes de génération et les duels prennent du temps. Ils apparaissent dans une liste courte, sans score et sans rang, pour que vous sachiez ce qui arrive.
Aucune variante admissible sans score n’est actuellement enregistrée dans le corpus de réponses.
Ce que cette page ne dit pas
Par honnêteté, les limites méritent d'être posées clairement.
Ces scores portent sur la qualité d'écriture en français, sur nos consignes, jugée par nos protocoles. Ils ne se transposent pas automatiquement à l'anglais, à l'allemand ou à l'espagnol — chaque langue a son propre classement sur le site, et les positions y diffèrent. Ils ne mesurent ni le raisonnement logique, ni le code, ni la connaissance factuelle. Nous n'utilisons pas non plus les scores de type MMLU, HumanEval ou GPQA comme preuves de qualité rédactionnelle : ils mesurent autre chose.
Enfin, un classement reste une photographie. Les variantes récentes ont moins de duels, donc plus d'incertitude, et le volume de comparaisons est affiché ligne par ligne pour cette raison. Vous pouvez ouvrir les textes et les duels derrière chaque score : c'est la meilleure façon de juger si un modèle correspond à votre style plutôt qu'à une moyenne.
Questions fréquentes
Quelle est la meilleure IA locale pour écrire en français ? Celle qui occupe la première ligne du classement ci-dessus, à l'instant où vous le consultez. Le tableau est mis à jour à mesure que de nouveaux duels sont joués, et le nom en tête peut changer. Si votre matériel est limité, filtrez par quantification et consultez les onglets matériel : la meilleure variante pour vous est la mieux classée qui tient confortablement dans votre mémoire.
Combien de VRAM faut-il pour faire tourner un LLM local ? Cela dépend entièrement de la variante et de la longueur de contexte souhaitée. L'onglet GPU dédié indique, pour 8, 16 et 32 Go, si une variante classée tient avec la marge retenue ; lorsqu'aucune n'y tient, la carte le dit au lieu d'inventer une recommandation.
La quantification dégrade-t-elle la qualité du texte ? Elle peut la modifier, dans une mesure qui dépend du modèle, de la méthode, de la langue et de la tâche. Nous ne publions un écart chiffré que lorsque nous disposons de comparaisons appariées sur le même modèle et le même mode de raisonnement. Méfiez-vous des pourcentages universels annoncés sans protocole.
Quelle différence entre Q4 QAT et Q4_K_M ? La Q4 QAT est un checkpoint préparé ou entraîné en tenant compte d'une exécution en quatre bits. Le Q4_K_M est une quantification GGUF appliquée après l'entraînement, avec des précisions mixtes selon les couches. Même nombre de bits, origines différentes — et c'est pourquoi elles occupent deux lignes distinctes.
Que signifient les icônes 💡 et ↯ ? 💡 indique que le mode de raisonnement était activé, ↯ qu'il était désactivé. Un troisième état, inconnu, signale les cas où le moteur d'exécution n'a rapporté aucun jeton de réflexion malgré la configuration demandée : nous préférons l'indiquer plutôt que de supposer.
Pourquoi les scores incluent-ils des duels contre des modèles cloud ? Pour garder une échelle commune avec le classement général français et davantage de données derrière chaque score. Le rang affiché ici, en revanche, est bien un rang entre modèles locaux uniquement.
Un modèle « européen » écrit-il mieux en français ? Pas par principe. L'origine d'un modèle ne présume pas de sa qualité en français : c'est précisément ce que le classement mesure, et les résultats ne suivent pas toujours l'intuition.
Est-ce que « ça tient en mémoire » veut dire « ça sera rapide » ? Non. Un modèle peut se charger et rester lent, notamment si une partie des couches est déléguée au processeur. L'offload CPU permet d'exécuter des modèles plus gros que la mémoire de l'accélérateur, mais la pénalité de vitesse est réelle et parfois importante.