Analyses
L’IA écrit-elle mieux en français avec ou sans raisonnement ?
Dans l’échantillon direct actuel du Baromètre, le mode avec raisonnement obtient 72,1 % des points sur les duels français. Mais l’échantillon est petit, l’écart change de sens selon le modèle, et aucun vote humain ne compare encore directement les deux réglages.
Sur les duels français du Baromètre, le mode avec raisonnement obtient 72,1 % des points : 24 victoires, 1 égalité, 9 défaites, réparties sur 34 jugements IA. La rumeur veut que les modèles écrivent mieux quand on coupe le raisonnement. Sur cet échantillon, elle ne tient pas.
Le chiffre repose sur 17 confrontations et 6 consignes. L’intervalle exploratoire à 95 %, obtenu en rééchantillonnant les confrontations, va de 55,9 % à 87,1 %. Il reste au-dessus de 50 %, ce qui mérite d’être signalé, mais sa largeur dit l’essentiel : c’est une tendance mesurée, pas une constante établie. Instantané du 29 juillet 2026 à 07:12 UTC.
Pourquoi la question est plus piégeuse que la rumeur
Activer le raisonnement ne revient pas à changer de modèle. Le réglage autorise une phase de réflexion interne avant la réponse finale. Le lecteur, lui, ne voit que cette réponse finale, et c’est elle seule qui est notée. Un modèle « avec raisonnement » n’est donc pas un modèle plus intelligent : c’est le même modèle à qui on a laissé un brouillon.
La rumeur repose sur une intuition défendable. Une phase de planification peut rigidifier un texte, produire des plans apparents, des transitions mécaniques, une prose qui laisse voir son ossature. Elle peut aussi consommer du budget de sortie et raccourcir le résultat. Rien de tout cela n’est absurde. Il fallait compter.
Au moment de l’instantané, le Baromètre comptait 28 041 jugements IA publiés et classables. Cette analyse n’en utilise qu’une petite fraction : celle où la comparaison est propre.
Comment se construit un duel comparable
Un duel n’est retenu ici que si trois conditions sont réunies : même variante de modèle, même consigne, et deux réponses qui ne diffèrent que par le réglage du raisonnement. Tout le reste est écarté. Opposer un gros modèle avec raisonnement à un petit modèle sans raisonnement ne dirait rien sur le réglage lui-même.
Sur les quatre langues, cet ensemble direct contient 138 jugements IA, portant sur 75 confrontations et 26 couples langue et consigne. Une victoire vaut 1 point, une égalité 0,5, une défaite 0. Le mode avec raisonnement y récolte 85 victoires, 5 égalités et 48 défaites, soit 63,4 % des points, avec un intervalle exploratoire à 95 % de 53,9 % à 72,3 %.
Quatre juges IA interviennent : Claude Fable 5, Claude Opus 4.8, Claude Opus 5 et GPT 5.6 Sol. Plusieurs d’entre eux peuvent noter la même confrontation. C’est pourquoi les 34 jugements français ne représentent pas 34 textes indépendants, et pourquoi l’intervalle est calculé en rééchantillonnant les confrontations plutôt que les jugements.
Le cas français, dans le détail
Les 34 jugements français couvrent 17 confrontations et 6 consignes distinctes, réparties sur deux catégories : communication personnelle et rédaction professionnelle ou administrative. Ni fiction, ni poésie. Le domaine est étroit, et il faut le garder en tête avant de parler d’« écriture » en général.
Un point mérite l’attention : le camp qui gagne est aussi le plus bref. Les réponses avec raisonnement font 332 mots en moyenne et 227 mots en médiane ; celles sans raisonnement, 418 mots en moyenne et 349 en médiane. L’écart entre moyenne et médiane signale quelques textes longs qui tirent les moyennes vers le haut. Si les juges avaient simplement récompensé le volume, le classement serait allé dans l’autre sens.
Une autre asymétrie est moins confortable. Le mode avec raisonnement occupait la position A dans 10 jugements et la position B dans 24. Sa part de points s’élève à 60,0 % en A et à 77,1 % en B. Ce déséquilibre n’a pas été corrigé statistiquement ici. Il reste une limite ouverte du chiffre français, pas une objection déjà traitée.
L’écart change de sens selon le modèle
Le chiffre global français recouvre quatre histoires distinctes :
- Qwen 3.6 27B Q8 : 10 victoires avec raisonnement, aucune sans
- Gemma 4 12B Q8 : 7 victoires avec raisonnement, 3 sans
- Gemma 4 31B QAT Q4 : 3 victoires avec raisonnement, 1 égalité, aucune défaite
- Qwen 3.6 35B A3B Q8 : 4 victoires avec raisonnement, 6 sans
La dernière ligne s’inverse. Et l’élargissement aux quatre langues brouille encore le tableau : sur l’ensemble du corpus direct, Gemma 4 12B Q8 tombe à 47,5 % des points pour le mode avec raisonnement (40 jugements) et Gemma 4 31B QAT Q4 à 43,8 % (16 jugements), tandis que les deux Qwen restent au-dessus, à 79,8 % pour le 27B Q8 (42 jugements) et 70,0 % pour le 35B A3B Q8 (40 jugements). Les deux familles ne réagissent pas de la même façon au même réglage.
Par langue, la hiérarchie est moins nette qu’il n’y paraît : allemand 54,3 % (35 jugements), espagnol 61,4 % (35), anglais 66,2 % (34), français 72,1 % (34). Les intervalles allemand et espagnol englobent largement 50 %. L’intervalle anglais s’étend approximativement de 48,6 % à 80,6 %. Seul l’intervalle exploratoire français se tient ici entièrement au-dessus de 50 %, sur 17 confrontations. Ajoutons que ces modèles sont des variantes quantifiées exécutées localement, et non un échantillon des grands modèles commerciaux.
Trois travaux publiés, trois réponses
WritingBench, de Yuning Wu et ses collègues (NeurIPS 2025), couvre 1 000 consignes réparties sur 6 domaines et 100 sous-domaines. Dans la catégorie « Literature & Art », des architectures avec raisonnement y devancent leurs homologues sans raisonnement. Une ablation sur Qwen 2.5 32B donne 7,58 contre 7,54 sur WritingBench D4, et 82,48 contre 79,43 sur EQBench, en faveur de la variante avec chaîne de pensée. Le résultat va dans le sens du raisonnement, dans ce protocole précis ; l’écart sur D4 reste par ailleurs minime.
L’étude AI Writers and Critics, de Shraddha Vijay Pawar et ses collègues (atelier CREAI 2024), compare 11 modèles et plusieurs stratégies sur des poèmes, des blogs, des publicités, des scénarios et des articles. Pour les billets de blog, la chaîne de pensée obtient de mauvais résultats dans leur configuration : la planification consomme des jetons et débouche sur des textes plus courts et moins complets. Le mécanisme dépend donc du budget de sortie disponible, ce qui n’est pas une propriété du raisonnement en soi.
Les deux travaux ne se contredisent pas vraiment : ils portent sur des tâches, des longueurs attendues et des barèmes différents. Dans notre échantillon français, le raccourcissement observé du côté du raisonnement n’a pas coïncidé avec une perte, contrairement à ce que décrit le second. C’est une observation, pas une explication. À notre connaissance, aucun travail primaire francophone n’aborde aussi directement l’opposition raisonnement activé ou désactivé en écriture.
Les limites, en toutes lettres
Aucun vote humain publié ne compare encore la même variante avec et sans raisonnement. Les 72,1 % français proviennent uniquement de juges IA.
Cette dépendance aux juges automatiques n’est pas neutre. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, de Lianmin Zheng et ses collègues (NeurIPS 2023), montre que les juges LLM peuvent s’accorder correctement avec les préférences humaines tout en présentant des biais de position et de verbosité. Le déséquilibre A/B de notre échantillon français touche exactement ce point, et c’est aussi pour cela que nous publions les longueurs produites.
LitBench, de Daniel Fein et ses collègues (Stanford, 2025), porte surtout sur l’évaluation de l’écriture créative plutôt que sur sa production. Le travail montre que des traces de chaîne de pensée distillées peuvent dégrader un modèle chargé de juger. Le raisonnement du rédacteur et celui du juge sont deux réglages distincts : ce qui aide l’un peut nuire à l’autre. L’évaluation d’un texte reste une tâche subjective et difficile.
Enfin, le Baromètre en est à ses débuts. Plusieurs semaines de jugements supplémentaires, davantage de consignes, davantage de modèles et des votes humains sur ces mêmes duels donneront une réponse plus solide que 17 confrontations françaises. Nous n’annonçons pas de date.
Ce qu’on peut en faire dès maintenant
Le conseil provisoire tient en une phrase : testez, modèle par modèle et type de texte par type de texte, au lieu d’activer ou de couper le raisonnement par principe. Nos données montrent un réglage dont l’effet s’inverse d’une famille de modèles à l’autre, et dont l’ampleur varie selon la langue.
Les documentations des fournisseurs vont dans le même sens sans trancher la question rédactionnelle. Le guide d’OpenAI sur les modèles de raisonnement les présente comme adaptés aux problèmes complexes, à la planification et aux tâches en plusieurs étapes, et recommande d’ajuster l’effort selon le cas d’usage. La documentation d’Anthropic sur la réflexion étendue décrit le contrôle du budget et l’arbitrage entre réflexion, coût et latence. Ce sont des modes d’emploi, pas des comparaisons de qualité d’écriture.
En pratique : gardez deux versions de votre consigne, faites-les lire à quelqu’un qui ignore laquelle est laquelle, alternez l’ordre de présentation, et regardez aussi la longueur produite. C’est plus lent qu’une règle générale. C’est surtout ce que nos chiffres autorisent aujourd’hui.