Retour au blog

Comment l'IA écrit différemment en japonais, en français et en espagnol

Nos données issues de 320 échantillons dans 4 langues révèlent des différences stylométriques spectaculaires. La concision française tombe à 32 ; l'expressivité espagnole à 59. Inclut une correction : notre chiffre d'expressivité japonaise était une erreur de mesure.

By Emmanuel

ResearchMultilingualAI Writing
Partager:

La plupart des recherches sur l'écriture IA se concentrent sur l'anglais. La plupart des produits d'écriture IA sont conçus pour l'anglais. La plupart des comparaisons, benchmarks et guides de style partent du principe que le texte est en anglais.

C'est un problème, parce que l'IA écrit très différemment dans d'autres langues.

Pas seulement des mots différents. Un style différent. Des structures de phrases différentes, des schémas d'expressivité différents, des niveaux de formalité par défaut différents. Le même modèle, recevant le même prompt en japonais et en anglais, produit des textes avec un ADN stylistique mesurément différent.

Nous le savons parce que nous l'avons mesuré.


Les données

Notre étude comparative a généré 320 échantillons d'écriture à travers cinq modèles d'IA (Claude Opus 4.6, Claude Sonnet 4.5, Claude Haiku 4.5, GPT-5.2, Gemini 3 Pro) dans quatre langues : anglais, français, espagnol et japonais. Huit types de prompts. Deux variantes par combinaison. Pour découvrir comment ces modèles se comparent directement, voir Les styles d'écriture des modèles d'IA comparés.

Chaque échantillon a été analysé avec le même cadre de stylométrie computationnelle — le système à six axes derrière les Snapshots d'ADN d'Écriture. Les formules sont adaptées aux langues : le texte japonais utilise la tokenisation morphologique via Intl.Segmenter, et la référence de chaque langue est mesurée indépendamment.

Pour la méthodologie complète : Comment nous mesurons l'« IA moyenne ».

Voici les références IA par langue :

AxeAnglaisFrançaisEspagnolJaponais
Complexité des phrases65757162
Richesse du vocabulaire48494437
Expressivité767459retiré — voir la correction
Formalité58424659
Cohérence53525553
Concision42323645

Chaque chiffre dans ce tableau raconte une histoire sur la façon dont la structure linguistique façonne les productions de l'IA. Décortiquons les principales différences.


Correction : notre chiffre d'expressivité japonaise était erroné

Cette section indiquait auparavant que l'expressivité japonaise atteignait 100 sur 100 et la qualifiait de « chiffre le plus frappant du tableau ». Elle expliquait que ce score n'était pas un bug mais une conséquence du fonctionnement de la communication professionnelle japonaise : les marqueurs de politesse (丁寧語), les formes interrogatives et des expressions comme « いかがでしょうか » ou « よろしくお願いいたします » seraient détectés par la formule d'expressivité.

C'était faux sur tous les points. Nous retirons le chiffre et l'explication, et nous préférons expliquer l'erreur plutôt que la supprimer silencieusement.

En retournant au code de notation, rien ne tenait. La formule d'expressivité ne compte que les caractères ASCII ?, ! et . — elle ne compte jamais ni , donc les formes interrogatives japonaises ne contribuent en rien au score. Les expressions de politesse que nous avions citées n'apparaissent dans aucune de nos listes de mots. Et le seul composant qui détecte réellement les marqueurs d'attitude japonais ne fait varier le score que d'environ 4 points, pas 100.

La cause réelle est un défaut de notre côté. Une fonction de notre pipeline de notation ne reçoit jamais le paramètre de langue, si bien qu'elle mesure le texte japonais avec un compteur de mots qui ne reconnaît que les caractères latins. Une page entière de japonais est comptée comme une poignée de « mots », chaque taux de ponctuation « pour 1 000 mots » gonfle d'un ordre de grandeur, et le score d'expressivité dépasse le haut de l'échelle 0-100 et se retrouve plafonné à 100. La formule ne mesure pas l'expressivité japonaise. Elle mesure une erreur de division.

Le signal que nous aurions dû remarquer se trouvait dans nos propres données par modèle : quatre des cinq modèles obtiennent un score identique et parfait de 100 en japonais. Quatre modèles de deux laboratoires différents atterrissant précisément sur le plafond, ce n'est pas une découverte sur le japonais, c'est un instrument défaillant.

Ce que cela signifie si vous écrivez en japonais. Votre score d'expressivité japonaise, et son écart par rapport à la référence japonaise, ne sont actuellement pas fiables. Nous devons aussi retirer l'argument rassurant que cet article utilisait auparavant — à savoir que la comparaison restait valide parce que le texte IA et le texte humain passaient par la même formule. Ce raisonnement échoue lorsque la référence est plafonnée : une référence bloquée en haut de l'échelle fait paraître presque tous les rédacteurs moins expressifs que « l'IA moyenne », et l'écart que vous liriez sur le graphique ne mesure pas votre style.

Les cinq autres axes ne sont pas affectés. La complexité des phrases, la richesse du vocabulaire, la formalité, la cohérence et la concision passent tous par le chemin adapté à la langue, et les chiffres japonais de ces axes dans le tableau ci-dessus restent valables. Il en va de même pour les six axes en anglais, en français et en espagnol. Nous corrigeons le défaut sous-jacent et nous remesurerons la référence japonaise avant de republier un chiffre d'expressivité pour cette langue.

Un point de la section originale survit, et il mérite d'être conservé : on ne peut pas comparer l'expressivité entre langues directement. Les formules mesurent des schémas internes à chaque langue, donc l'anglais à 76 et l'espagnol à 59 reflètent des caractéristiques linguistiques différentes, pas des niveaux d'émotion différents.

L'IA japonaise affiche la richesse du vocabulaire la plus faible (37) — nettement en dessous des trois autres langues. Cela reflète la nature de l'analyse morphologique japonaise : avec moins de tokens uniques par segment après tokenisation, le ratio Type-Token est plus bas. L'IA japonaise obtient aussi le score de concision le plus élevé (45) de toutes les langues — le japonais permet naturellement une expression plus compacte grâce à sa grammaire agglutinante et l'omission contextuelle des sujets.


Le français : complexe, expansif et informel

Les productions IA en français racontent une histoire complètement différente.

Complexité des phrases : 75. La plus élevée de toutes les langues, avec 10 points d'avance. L'IA française construit des phrases plus longues et plus denses structurellement que l'IA anglaise, espagnole ou japonaise. Cela reflète les traditions de la prose française — propositions subordonnées, constructions relatives et structures temporelles complexes qui sont standard en français écrit mais sembleraient baroques en anglais.

Concision : 32. La plus basse de toutes les langues. L'IA française écrit long. Là où l'IA anglaise produit des phrases avec un score de concision de 42, l'IA française produit des phrases qui obtiennent 32. Combiné à une complexité élevée, cela signifie que les productions IA françaises sont denses et expansives — le type de prose qu'on attendrait dans un rapport d'entreprise bien rédigé, mais qui poserait problème dans un message Slack.

Formalité : 42. Étonnamment, la plus basse de toutes les langues. L'IA française produit par défaut un registre moins formel que l'anglais ou le japonais, malgré la complexité structurelle. Cela peut sembler contradictoire, mais c'est logique : la communication professionnelle française combine souvent des structures de phrases élaborées avec un ton relativement chaleureux et personnel. La formule de formalité détecte ce paradoxe — la densité de mots fonctionnels est plus faible en français qu'en anglais, et les schémas de précaution stylistique diffèrent.

L'implication pratique : un professionnel français utilisant l'IA sans calibrage de style obtiendra des productions structurellement complexes mais d'un ton décontracté. S'il a besoin d'une prose formelle et concise — une exigence courante dans les contextes professionnels français — chaque dimension nécessite un ajustement. Comprendre le fonctionnement de l'extraction de style est la première étape pour corriger cela.


L'espagnol : l'exception modérée

Les productions IA en espagnol occupent un terrain intermédiaire intéressant, avec une exception notable.

Expressivité : 59. C'est nettement inférieur à l'anglais (76) et au français (74). L'IA espagnole est la moins expressive des trois langues que nous pouvons actuellement noter de façon fiable sur cet axe. Elle utilise moins de questions rhétoriques, moins de points d'exclamation et moins de marqueurs d'attitude que les productions IA dans toute autre langue.

C'est l'une de nos découvertes les plus surprenantes. La communication hispanophone est souvent associée à la chaleur et à l'expressivité dans les contextes informels. Mais les types de prompts de notre étude — emails professionnels, rapports, présentations — peuvent susciter un registre plus formel dans l'IA espagnole, qui supprime les marqueurs expressifs mesurés par la formule.

Cohérence : 55. La plus élevée de toutes les langues, bien que marginalement. L'IA espagnole produit les longueurs de phrases les plus uniformes — un rythme régulier qui donne aux productions un aspect mesuré et prévisible.

Richesse du vocabulaire : 44. La plus basse après le japonais. L'IA espagnole réutilise les mots plus fréquemment que l'IA anglaise ou française, produisant des textes à diversité lexicale plus faible. Cela pourrait refléter la façon dont les modèles d'IA traitent la morphologie espagnole — la conjugaison verbale espagnole crée de nombreuses formes de surface pour un même mot, et selon la manière dont la tokenisation les gère, le ratio Type-Token peut être affecté.


L'anglais : le « défaut » n'est pas un défaut

Les références anglaises sont traitées comme la norme dans la plupart des recherches IA. Mais nos données montrent que les productions IA en anglais ont leur propre profil distinct — ce n'est pas neutre.

Expressivité : 76. La plus élevée des trois langues que nous pouvons actuellement noter de façon fiable sur cet axe, juste devant le français (74) et loin devant l'espagnol (59). Le processus d'entraînement RLHF est principalement anglophone, et les évaluateurs RLHF anglophones semblent préférer une prose énergique et engagée. Ce biais se transmet dans les productions anglaises du modèle plus fortement que dans les autres langues.

Formalité : 58. La deuxième plus élevée après le japonais (59). L'IA anglaise produit par défaut un registre modérément formel qui reflète le contexte de communication professionnelle de la plupart des données d'entraînement RLHF.

Concision : 42. Au milieu du peloton. L'IA anglaise produit des phrases plus courtes que l'IA française ou espagnole mais plus longues que l'IA japonaise.

L'enseignement clé : les références IA anglaises sont spécifiques à l'anglais, pas universelles. Si vous avez comparé votre écriture en français ou en japonais aux références IA anglaises (comme la plupart des concurrents vous y obligent), votre graphique radar vous mentait. Les différences que vous voyiez reflétaient la structure linguistique, pas votre style personnel.

C'est pourquoi My Writing Twin mesure des références par locale. Votre écriture japonaise est comparée à l'IA japonaise. Votre écriture française est comparée à l'IA française. Les écarts sur votre graphique radar représentent vos véritables déviations stylistiques, pas des artefacts de traduction.


Schémas translinguistiques

Malgré les différences, quelques schémas se retrouvent dans les quatre langues :

Toutes les langues écrivent long

La concision est inférieure à 50 dans chaque langue. Le score le plus élevé (japonais à 45) reste en dessous du point médian. Les modèles d'IA sont universellement verbeux — une conséquence de l'entraînement RLHF qui récompense l'exhaustivité. Ce biais transcende les langues.

La cohérence est universelle

Les scores de cohérence se regroupent entre 52 et 55 dans les quatre langues — le regroupement le plus serré de tous les axes. Quelle que soit la langue, les modèles d'IA produisent une variation modérée de la longueur des phrases. C'est peut-être la preuve la plus forte de l'effet homogénéisant du RLHF : le processus d'entraînement ne standardise pas seulement les productions anglaises. Il standardise les schémas rythmiques dans toutes les langues.

La richesse du vocabulaire varie selon la morphologie

La richesse du vocabulaire montre l'écart le plus large lié à la structure linguistique. Le français et l'anglais (langues analytiques à morphologie relativement simple) obtiennent les scores les plus élevés (48-49). Le japonais (agglutinant) et l'espagnol (à morphologie verbale complexe) obtiennent des scores plus bas (37-44). Ce n'est pas une question de modèles — c'est une question d'interaction entre le ratio Type-Token et les différents systèmes morphologiques.


Pourquoi cela compte pour les professionnels multilingues

Si vous écrivez dans plus d'une langue — et beaucoup de professionnels le font — ces données ont des implications pratiques :

1. Votre style change selon les langues, et celui de l'IA aussi. Un professionnel bilingue français-anglais écrit probablement différemment dans chaque langue. Des phrases plus longues et plus complexes en français. Plus concises, plus directes en anglais. L'IA fait la même chose. Une comparaison d'écriture valide doit prendre en compte ces deux changements.

2. Le choix du modèle compte différemment selon la langue. Un modèle qui correspond à votre style en anglais pourrait manquer votre style en français. Les forces relatives de GPT, Claude et Gemini changent selon les langues. Pour l'analyse modèle par langue, voir Quel modèle d'IA écrit le mieux dans chaque langue.

3. Un seul profil de style ne suffit pas pour les rédacteurs multilingues. Un profil de style calibré pour votre écriture en anglais ne fonctionnera pas pour votre écriture en japonais. Les références IA sont différentes, vos schémas sont différents, et les deltas de calibrage sont différents. C'est pourquoi My Writing Twin prend en charge l'extraction de style par langue.


L'avantage bilingue

Nous avons déjà écrit sur les professionnels bilingues et l'écriture IA. Les données de références translinguistiques ajoutent une nouvelle dimension à cette histoire.

Les rédacteurs bilingues ont un avantage mesurable dans un monde de références IA par locale. Ils savent déjà — intuitivement sinon quantitativement — que leur style de communication change entre les langues. Ils alternent naturellement les registres. Un profil de style qui capture les deux registres, calibré par rapport aux références IA correctes par langue, produit des textes IA qui alternent les registres avec eux.

Les produits IA monolingues ne peuvent pas faire cela. Ils appliquent les références anglaises au texte non anglais et appellent cela de la personnalisation. Nos données montrent pourquoi l'écriture IA sonne générique — et pourquoi c'est pire entre les langues : un rédacteur français comparé aux références anglaises semble artificiellement élevé en complexité et bas en concision. Ce ne sont pas des caractéristiques de style. Ce sont des caractéristiques linguistiques.


Découvrez votre ADN d'Écriture dans votre langue

Curieux de savoir comment votre écriture se compare à l'IA dans votre langue — pas la référence anglaise par défaut ? Essayez votre Snapshot d'ADN d'Écriture gratuit. Soumettez des échantillons d'écriture dans l'une de nos langues prises en charge (anglais, français, espagnol, japonais), et voyez votre graphique radar par rapport à la référence IA correcte pour votre locale.

Les écarts que vous verrez concerneront votre style, pas votre langue.

Obtenez votre Snapshot d'ADN d'Écriture gratuit

Faites écrire l'IA comme vous, pas comme un robot

Vous venez de lire comment ajuster l'IA à la main. MyWritingTwin le fait à partir de vos vrais textes : collez quelques échantillons et obtenez un profil de voix qui fonctionne dans ChatGPT, Claude et Gemini.

Créer votre profil d'écriture gratuit

Pas encore prêt ? Recevez plutôt notre guide des profils de voix IA par e-mail.

Partager:

Commentaires

Chargement des commentaires...

Laisser un commentaire

Votre e-mail ne sera pas affiché publiquement.

Prêt à passer à la pratique ?

Créer votre profil d'écriture gratuit