Les modèles qui écrivent le mieux en français

Le Baromètre mesure la qualité d’écriture des principaux modèles d’IA à partir d’un corpus de consignes conçu directement en français. Les réponses à une même consigne sont comparées à l’aveugle, sans le nom des modèles, puis les verdicts sont agrégés dans un classement propre au français.

En tête, toutes catégories confondues

Les 10 meilleurs modèles

Les dix meilleurs modèles pour écrire en français
#ModèleScore
1Claude Opus 5 💡99,6
2Claude Fable 5 High 💡98,5
3Kimi K3 💡97,4
4Claude Opus 4.8 💡97,3
5GPT-5.6 Sol 💡93,8
6Claude Sonnet 5 💡92,7
7GLM 5.3 💡92,6
8Muse Spark 1.2 💡89,4
9GPT-5.6 Luna 💡84,7
10GPT-5.6 Terra 💡82,6

Ce score n’est pas une note en pourcentage : 50 correspond à une chance estimée sur deux de battre le modèle moyen en français.

Dernière actualisation :

Voir le classement complet

Les 10 meilleures variantes locales

La VRAM indiquée est une estimation arrondie de la mémoire graphique nécessaire pour charger le modèle entier.

Les dix meilleures variantes exécutées localement
#ModèleScoreVRAM estimée
1Qwen3.8 27B Q4_K_M 💡 🏠81,0≈ 24 Go
2Qwen3.8 27B Q8_0 💡 🏠79,5≈ 48 Go
3Muse Glimmer 30B K-Quant 17GB 💡 🏠76,3≈ 24 Go
4Muse Glimmer 30B K-Quant Dynamic 💡 🏠72,3≈ 32 Go
5Gemma 4 31B Q6_K 💡 🏠70,0≈ 32 Go
6Gemma 4 26B A4B Q8_0 ↯ 🏠68,3≈ 32 Go
7Qwen3.8 27B Q6_K 💡 🏠66,8≈ 32 Go
8Qwen3.6 27B Q8_0 💡 🏠63,2≈ 32 Go
9Gemma 4 31B QAT-Q4_0 💡 🏠62,6≈ 24 Go
10Gemma 4 26B A4B Q6_K 💡 🏠62,4≈ 32 Go

Selon le logiciel utilisé, une partie du modèle peut être conservée dans la mémoire vive de l’ordinateur. Cette configuration réduit les besoins en VRAM, mais ralentit généralement l’exécution.

85modèles comparés
38679verdicts IA publiés

Le classement porte uniquement sur la qualité d’écriture. Les consignes sont conçues dans la langue évaluée et les noms des modèles restent masqués jusqu’au verdict, afin que leur réputation n’influence pas l’évaluation. Ce site est un projet personnel. Je ne suis payé par aucun éditeur de modèles et je n’ai aucun intérêt à en favoriser un.

Pour aller plus loin

Muse Glimmer 30B à l'écrit : comparatif avec les IA locales

Les deux quantifications de Muse Glimmer ne racontent pas tout à fait la même histoire en français. Nos duels, désormais complétés par quatre comparaisons locales provisoires, aident à choisir sans transformer un premier signal en verdict.

L’IA écrit-elle mieux en français avec ou sans raisonnement ?

Dans l’échantillon direct actuel du Baromètre, le mode avec raisonnement obtient 72,1 % des points sur les duels français. Mais l’échantillon est petit, l’écart change de sens selon le modèle, et aucun vote humain ne compare encore directement les deux réglages.