Les deux quantifications de Muse Glimmer ne racontent pas tout à fait la même histoire en français. Nos duels, désormais complétés par quatre comparaisons locales provisoires, aident à choisir sans transformer un premier signal en verdict.
Les modèles qui écrivent le mieux en français
Le Baromètre mesure la qualité d’écriture des principaux modèles d’IA à partir d’un corpus de consignes conçu directement en français. Les réponses à une même consigne sont comparées à l’aveugle, sans le nom des modèles, puis les verdicts sont agrégés dans un classement propre au français.
En tête, toutes catégories confondues
Les 10 meilleurs modèles
| # | Modèle | Score |
|---|---|---|
| 1 | 99,6 | |
| 2 | 98,5 | |
| 3 | 97,4 | |
| 4 | 97,3 | |
| 5 | 93,8 | |
| 6 | 92,7 | |
| 7 | 92,6 | |
| 8 | 89,4 | |
| 9 | 84,7 | |
| 10 | 82,6 |
Ce score n’est pas une note en pourcentage : 50 correspond à une chance estimée sur deux de battre le modèle moyen en français.
Dernière actualisation :
Voir le classement completLes 10 meilleures variantes locales
La VRAM indiquée est une estimation arrondie de la mémoire graphique nécessaire pour charger le modèle entier.
| # | Modèle | Score | VRAM estimée |
|---|---|---|---|
| 1 | 81,0 | ≈ 24 Go | |
| 2 | 79,5 | ≈ 48 Go | |
| 3 | 76,3 | ≈ 24 Go | |
| 4 | 72,3 | ≈ 32 Go | |
| 5 | 70,0 | ≈ 32 Go | |
| 6 | 68,3 | ≈ 32 Go | |
| 7 | 66,8 | ≈ 32 Go | |
| 8 | 63,2 | ≈ 32 Go | |
| 9 | 62,6 | ≈ 24 Go | |
| 10 | 62,4 | ≈ 32 Go |
Selon le logiciel utilisé, une partie du modèle peut être conservée dans la mémoire vive de l’ordinateur. Cette configuration réduit les besoins en VRAM, mais ralentit généralement l’exécution.
Le classement porte uniquement sur la qualité d’écriture. Les consignes sont conçues dans la langue évaluée et les noms des modèles restent masqués jusqu’au verdict, afin que leur réputation n’influence pas l’évaluation. Ce site est un projet personnel. Je ne suis payé par aucun éditeur de modèles et je n’ai aucun intérêt à en favoriser un.
Pour aller plus loin
Dans l’échantillon direct actuel du Baromètre, le mode avec raisonnement obtient 72,1 % des points sur les duels français. Mais l’échantillon est petit, l’écart change de sens selon le modèle, et aucun vote humain ne compare encore directement les deux réglages.