Quelle IA locale choisir ?
La meilleure IA locale pour écrire en français, selon nos comparaisons en aveugle, est la variante placée en tête du tableau ci-dessus.
D'où viennent ces scores
Le Baromètre compare des textes deux à deux, en aveugle, sur des consignes rédigées nativement en français. Les scores affichés ici sont exactement ceux du classement général français : nous ne recalculons pas un classement isolé entre modèles locaux, nous filtrons le classement existant pour ne garder que les variantes exécutables localement, puis nous renumérotons les rangs.
Cela signifie qu'une variante locale a pu être comparée à des modèles cloud, et que ces duels comptent dans son score. C'est volontaire, pour deux raisons simples : l'échelle reste commune entre toutes les pages du site, et chaque modèle conserve davantage de données derrière son score. Le rang, lui, est bien un rang local : le numéro 1 de cette page est le meilleur modèle exécutable chez vous, pas le meilleur modèle tous accès confondus.
Précision utile : ces scores mesurent la qualité d'écriture en français, jugée sur des textes consultables. Ce n'est pas un classement d'intelligence générale, ni un indicateur de performance en code ou en mathématiques. Un modèle excellent ici peut être médiocre ailleurs, et l'inverse est vrai aussi. Précisons également qu'un modèle conçu en France ou en Europe n'écrit pas mieux en français par principe : cela se mesure, et parfois le résultat surprend.
Qu'est-ce que la quantification, concrètement
Un modèle est un très grand ensemble de nombres. La quantification consiste à stocker ces nombres avec moins de bits : au lieu de seize bits par poids, huit, six ou quatre. Le fichier rétrécit, l'empreinte mémoire aussi. Sur une inférence limitée par la bande passante mémoire — ce qui est le cas courant en génération de texte sur une machine personnelle — lire moins d'octets à chaque jeton peut également accélérer la génération.
Le compromis est qu'on perd de l'information. Une quantification peut modifier la qualité du texte, et l'ampleur de cet effet dépend du modèle, de la méthode employée, de la tâche, de la langue, de la longueur du contexte et du niveau de compression. C'est pourquoi nous ne reprendrons jamais à notre compte les formules du type « la Q4 conserve 98 % de la qualité » : ce chiffre n'existe pas de façon universelle, et il est particulièrement fragile pour l'écriture dans une langue autre que l'anglais.
Les formats que vous verrez ici :
- Q8 — huit bits. Nous la traitons comme notre référence pratique de haute qualité. Cela ne veut pas dire qu'elle est mathématiquement identique au modèle d'origine en BF16 ou FP16, ni que l'écart est toujours imperceptible : cela se mesure modèle par modèle.
- Q4 QAT — un modèle préparé ou entraîné en tenant compte d'une exécution en quatre bits (quantization-aware training). Ce n'est pas une compression appliquée après coup : c'est un checkpoint distinct, publié comme tel par son éditeur.
- Q4_K_M — une quantification GGUF appliquée après l'entraînement, à quatre bits, avec des précisions mixtes selon les couches. C'est un bon format, mais ce n'est pas du QAT, et il ne faut pas confondre les deux dans un tableau.
- Q6 — un compromis intermédiaire, que nous afficherons quand nous aurons des variantes évaluées.
Les deux K-Quant de Muse Glimmer
Meta publie Muse Glimmer 30B dans deux fichiers GGUF inhabituels, à environ quatre bits par poids en moyenne. K-Quant Dynamic conserve certains tenseurs avec une précision supérieure et vise 32 Go de VRAM ; K-Quant 17GB compresse davantage et vise 24 Go. Ce ne sont pas des fichiers Q4_K_M : nous gardons donc leurs noms exacts et les évaluons comme deux variantes distinctes. Les deux figurent sous le filtre large Q4, qui regroupe les téléchargements de la classe quatre bits sans prétendre que leur encodage est identique.
Meta annonce une dégradation moyenne respective de 0,2 % et 1,0 % sur quinze benchmarks courants. Il s'agit de mesures de l'éditeur, et non de scores d'écriture AIWB ni de garanties pour la prose française, anglaise, allemande ou espagnole. Nos classements et notre comparaison directe mesurent séparément les deux fichiers sur des consignes rédigées nativement.
Recommandations par machine
8 Go
Meilleure qualité
Gemma 4 E2B ↯ 🏠
9,9 · rang local 45
Alternative plus rapide mesurée
Gemma 4 E2B 💡 🏠
39,7 tok/s · mesure AIWB sur Strix Halo
16 Go
Meilleure qualité
Gemma 4 12B 💡 🏠
51,2 · rang local 15
Alternative plus rapide mesurée
Gemma 4 E2B 💡 🏠
39,7 tok/s · mesure AIWB sur Strix Halo
32 Go
Meilleure qualité
Qwen3.8 27B 💡 🏠
75,4 · rang local 2
Alternative plus rapide mesurée
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · mesure AIWB sur Strix Halo
32 Go
Meilleure qualité
Qwen3.8 27B 💡 🏠
75,4 · rang local 2
Alternative plus rapide mesurée
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · mesure AIWB sur Strix Halo
64 Go
Meilleure qualité
Qwen3.8 27B 💡 🏠
75,8 · rang local 1
Alternative plus rapide mesurée
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · mesure AIWB sur Strix Halo
96 Go
Meilleure qualité
Qwen3.8 27B 💡 🏠
75,8 · rang local 1
Alternative plus rapide mesurée
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · mesure AIWB sur Strix Halo
128 Go
Meilleure qualité
Qwen3.8 27B 💡 🏠
75,8 · rang local 1
Alternative plus rapide mesurée
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · mesure AIWB sur Strix Halo
Repères de chargement, pas garanties : contexte, cache KV, batch et moteur changent l’empreinte. Les vitesses AIWB ont été mesurées sur la machine Strix Halo décrite dans À propos ; elles ne prédisent pas la vitesse d’une autre plateforme.
Pourquoi choisir une IA locale
Les raisons sont moins spectaculaires que les arguments publicitaires, et plus solides.
La confidentialité. Lorsque le moteur et ses intégrations fonctionnent entièrement en local, vos brouillons, vos notes et vos manuscrits n'ont pas à quitter la machine. Pour un texte sous contrat, un document interne ou un travail non publié, c'est déterminant.
Le fonctionnement hors ligne. Pas de connexion requise, pas de coupure de service, pas de file d'attente aux heures de pointe.
Le contrôle. Le modèle que vous avez téléchargé reste celui que vous avez téléchargé. Il n'est pas remplacé sans préavis par une version au comportement différent, et vous pouvez revenir à un checkpoint antérieur si le nouveau vous convient moins.
L'absence de dépendance. Ni quota, ni facturation à l'usage, ni changement de conditions au milieu d'un projet.
En contrepartie, il faut accepter que les meilleurs modèles locaux ne sont pas toujours au niveau des meilleurs modèles cloud, que la vitesse dépend de votre matériel, et qu'il y a un peu de bricolage initial. Le classement général du site vous dira où se situe précisément l'écart en français, sans avoir à nous croire sur parole.
Open source ou open-weight ?
Les deux termes circulent, souvent comme synonymes. Ils ne le sont pas. Poids ouverts signifie que les fichiers du modèle sont téléchargeables et exécutables ; open source décrit un statut de licence plus large, dont l'application exacte aux modèles d'IA reste débattue. Beaucoup de modèles très diffusés sont à poids ouverts sous licence restrictive, sans être open source au sens strict.
Le critère d'admission de cette page est technique : les poids sont disponibles et le modèle tourne réellement hors ligne. C'est ce qui détermine si vous pouvez l'utiliser chez vous. La licence, elle, détermine ce que vous avez le droit d'en faire — vérifiez-la avant tout usage commercial, elle ne dit rien de la qualité d'écriture.
Un point de méthode : un modèle est admissible même si les réponses évaluées ont été générées sur une infrastructure distante. Ce qui compte est la disponibilité des poids et la possibilité d'une exécution locale, pas le lieu où le texte a été produit lors de nos campagnes.
Questions fréquentes
Quelle est la meilleure IA locale pour écrire en français ? Celle qui occupe la première ligne du classement ci-dessus, à l'instant où vous le consultez. Le tableau est mis à jour à mesure que de nouveaux duels sont joués, et le nom en tête peut changer. Si votre matériel est limité, filtrez par quantification et consultez les onglets matériel : la meilleure variante pour vous est la mieux classée qui tient confortablement dans votre mémoire.
Combien de VRAM faut-il pour faire tourner un LLM local ? Cela dépend entièrement de la variante et de la longueur de contexte souhaitée. L'onglet GPU dédié indique, pour 8, 16 et 32 Go, si une variante classée tient avec la marge retenue ; lorsqu'aucune n'y tient, la carte le dit au lieu d'inventer une recommandation.
La quantification dégrade-t-elle la qualité du texte ? Elle peut la modifier, dans une mesure qui dépend du modèle, de la méthode, de la langue et de la tâche. Nous ne publions un écart chiffré que lorsque nous disposons de comparaisons appariées sur le même modèle et le même mode de raisonnement. Méfiez-vous des pourcentages universels annoncés sans protocole.
Quelle différence entre Q4 QAT et Q4_K_M ? La Q4 QAT est un checkpoint préparé ou entraîné en tenant compte d'une exécution en quatre bits. Le Q4_K_M est une quantification GGUF appliquée après l'entraînement, avec des précisions mixtes selon les couches. Même nombre de bits, origines différentes — et c'est pourquoi elles occupent deux lignes distinctes.
Que signifient les icônes 💡 et ↯ ? 💡 indique que le mode de raisonnement était activé, ↯ qu'il était désactivé. Un troisième état, inconnu, signale les cas où le moteur d'exécution n'a rapporté aucun jeton de réflexion malgré la configuration demandée : nous préférons l'indiquer plutôt que de supposer.
Pourquoi les scores incluent-ils des duels contre des modèles cloud ? Pour garder une échelle commune avec le classement général français et davantage de données derrière chaque score. Le rang affiché ici, en revanche, est bien un rang entre modèles locaux uniquement.
Un modèle « européen » écrit-il mieux en français ? Pas par principe. L'origine d'un modèle ne présume pas de sa qualité en français : c'est précisément ce que le classement mesure, et les résultats ne suivent pas toujours l'intuition.
Est-ce que « ça tient en mémoire » veut dire « ça sera rapide » ? Non. Un modèle peut se charger et rester lent, notamment si une partie des couches est déléguée au processeur. L'offload CPU permet d'exécuter des modèles plus gros que la mémoire de l'accélérateur, mais la pénalité de vitesse est réelle et parfois importante.