ブログに戻る

AIの文章が画一的に聞こえる理由 — データが示す問題の本質

5モデル・6次元・320サンプルの分析データが、すべてのAIが同じように聞こえる正確な理由を明らかにします。原因はあなたのプロンプトではありません。

By Emmanuel

ResearchStyle ProfilesWriting DNAAI Models
共有:

AIの文章が画一的に聞こえることは、すでにご存知でしょう。書き直す羽目になったメールの下書き、テンプレートのようなLinkedIn投稿、誰が書いても同じような——あるいは何が書いても同じような——レポート。そのたびに感じてきたはずです。

しかし「画一的」は感覚です。感覚は修正しにくい。数値は修正しやすい。

私たちはそれを測定しました。データが実際に示す内容をご紹介します。


実験の概要

5つのAIモデル——Claude Opus 4.6、Claude Sonnet 4.5、Claude Haiku 4.5、GPT-5.2、Gemini 3 Pro——で、8種類のプロンプトを4言語で、各組み合わせ2パターンずつ使い、320のライティングサンプルを生成しました。そしてすべてのサンプルを計算文体論で分析し、ライティングスタイルの6つの独立した次元を測定しました。

方法論の詳細:「平均的なAI」の測定方法

問いは、AIが画一的に書くかどうかではありません。問いは、画一性をどれだけ正確に定量化できるか、そしてその画一性はどこに存在するかでした。

はい。定量化できます。


収束の問題

中心的な発見は次の通りです。5つのAIモデルすべてが同じ文体的中心に収束しています。

最低モデルスコア最高モデルスコアばらつき
文の複雑さ約60約72約12ポイント
語彙の幅約44約52約8ポイント
表現力約68約82約14ポイント
フォーマリティ約48約64約16ポイント
一貫性約49約57約8ポイント
簡潔さ約36約48約12ポイント

6軸の平均ばらつきは100点中おおよそ12ポイント。5つの異なるモデル、3つの異なる企業によって構築され、異なるデータセットで訓練され、異なるアーキテクチャを使用しているのに、大半の次元で12ポイントの帯域内に収まるライティングを生成しています。

これを人間のライターと比較してください。私たちのユーザーデータでは、個々の人間はどの軸でも60ポイント以上の幅でスコアが分布しています。ある人の文の複雑さは25かもしれません。別の人は88かもしれません。彼らのライティングは、数十年の読書習慣、職業的文脈、個性、言語的直感によって形づけられています。

AIのライティングはRLHF——画一的な評価者の好みに最適化する訓練プロセス——によって形づけられています。その結果、5つのモデルが同じ人物のわずかに異なるバージョンのように聞こえるのです。


すべてのモデルが一致する点(しかし一致すべきでない点)

収束の最も決定的な証拠は3つの軸に現れます。

一貫性:横一線

5つのモデルすべてが一貫性で49から57のスコア。わずか8ポイントのばらつきです。すべてのモデルがほぼ同じ文長バリエーションパターンを生み出しています。中程度。単調でもなく、混沌でもない。安全な中間地帯。

人間のライターはこうはなりません。法律文書のライターは一貫性80以上で、文が隊列を組んで行進します。小説家やエッセイストは30以下で、4語のパンチと50語の展開を交互に繰り出します。バリエーションこそがスタイルなのです。

AIの一貫性の集中は特徴ではありません。信号の喪失です。すべてのモデルが同じリズムパターンで書くなら、モデルを切り替えてもテキストの読み心地は変わりません。

語彙の幅:狭い帯域

5つのモデルすべてが語彙の幅で44から52のスコア。8ポイントの差。すべてが同程度の比率でユニークな単語を使っています。中程度の多様性。エキゾチックすぎず、反復的すぎず。

これは専門的な語彙を持つプロフェッショナルにとって特に問題です。メールで常に正確な医学用語を使う外科医は、語彙の幅で52を大幅に超えるスコアになるでしょう。特定の業界用語に頼る建設マネージャーは30を下回るかもしれません。どちらも本物のスタイルです。どちらも「中程度」ではありません。

しかしどのAIに代筆を頼んでも、毎回同じ44-52の範囲になります。外科医の正確さは薄められ、マネージャーの直接さは水増しされます。

表現力:高エネルギーのデフォルト

すべてのモデルが最も強く一致するのは表現力です。英語での5モデル平均は100点中76。すべてのモデルが高エネルギーをデフォルトとしています。修辞的疑問、強調的な言語、態度マーカー、感嘆符が並びます。

なぜでしょうか。RLHF評価者が積極的に感じるテキストを好むからです。平板な応答とエネルギッシュな応答を比較すると、エネルギッシュな方が選ばれます。この好みを数百万回の比較と数十億のパラメータにかけると、本質的に抑制が不可能なモデルが生まれます。

問題は、ほとんどのプロフェッショナルなライティングは表現力76ではないということです。CFOの四半期報告に修辞的疑問は不要です。法的通知にエムダッシュは不要です。プロジェクト進捗報告が熱心に聞こえるべきではありません。しかしAIは熱意をデフォルトとします。熱意が好まれると訓練されているからです。


メディアンユーザー問題を数値で見る

メディアンユーザー問題について概念的に書いてきました。ここでは生データでどう見えるかをご紹介します。

英語での全モデルAI平均:

AI平均意味
文の複雑さ65中程度の複雑さ——シンプルでも密でもない
語彙の幅48中程度の多様性——無難な語彙選択
表現力76高エネルギー——疑問文、感嘆符、強調
フォーマリティ58やや形式的——プロフェッショナルだが親しみやすい
一貫性53中程度の変動——安定すぎず、ダイナミックすぎず
簡潔さ42中間点未満——文が長くなる

Sample Writing DNA Radar Chart

How one writer's style compares to Average AI on all six axes

このプロファイルには研究文献での名前があります。平均への回帰です。すべての次元が安全な中心に引っ張られています。ただし表現力(評価者が好むため高くなる)と簡潔さ(AIモデルがデフォルトで長い出力を生成するため低くなる)を除いて。

では、人間のライターを個性的にしているのは何でしょうか。

  • スタートアップ創業者のスコア例:複雑さ40、語彙55、表現力85、フォーマリティ30、一貫性35、簡潔さ70。パンチの効いた、エネルギッシュで、インフォーマル、変化に富む。
  • 企業弁護士のスコア例:複雑さ82、語彙65、表現力20、フォーマリティ90、一貫性85、簡潔さ15。密で、正確で、抑制的、均一。
  • ジャーナリストのスコア例:複雑さ55、語彙60、表現力50、フォーマリティ45、一貫性40、簡潔さ65。明快で、変化に富み、直接的。

これらのプロファイルはどれもAI平均とは似ていません。それこそがポイントです。AI平均は実在の人間がいる場所ではありません。 RLHFがすべての人の好みを平均化して作り出した統計的構築物なのです。


モデルを切り替えても解決しない理由

画一的なAI出力への一般的な反応は、別のモデルを試すことです。Claudeが落ち着きすぎる? ChatGPTを試す。ChatGPTが熱心すぎる? Geminiを試す。

データはこれがなぜ効かないかを示しています。

いずれの軸でもモデル間の最大ばらつきは約16ポイント(フォーマリティ)。大半の軸では8-12ポイント。AI平均と個性的な人間のライターとのギャップは、複数の軸で日常的に30-50ポイントです。

モデルを切り替えると、1つか2つの次元で8-16ポイント動きます。3つか4つの次元で30-50ポイントの移動が必要なのに。モデルの切り替えは甲板の椅子を並べ替えているに過ぎません。

詳細な直接比較はChatGPT vs Claude vs Geminiをご覧ください。比較は有用ですが、結論は同じ。どのモデル単独でもゴールには届きません。


簡潔さの危機

1つの次元に特別な注意が必要です。簡潔さです。

英語のAI平均は42。フランス語では32に低下。スペイン語は36。すべてのモデル、すべての言語で、AIは長く書きます。

これはスタイルの好みではありません。構造的なバイアスです。AIモデルは有用であるよう訓練されており、RLHFにおける「有用」は徹底的であることを意味します。徹底的とは、より多くの言葉。より多くの説明。より多くの修飾。より多くの文脈。より多くのヘッジ。

その結果、すべてのAIモデルが、同じコミュニケーション文脈で大半のプロフェッショナルが書くよりも長い出力を生成します。3文のSlackメッセージが3段落の説明になります。1行のメール返信が箇条書き付きの構造化された応答になります。

簡潔さのギャップは、Writing DNAとAIベースラインを比較したとき、ユーザーが最初に気づくことが多いです。そして測定さえあれば、スタイルプロファイルで最も簡単に修正できるもの の1つでもあります。


表現力のインフレーション

簡潔さの危機の裏返しが表現力のインフレーションです。

76というAIのデフォルト表現力は、ほとんどのプロフェッショナルな文脈が求めるレベルを超えています。モデルは修辞的疑問(「しかし、これは本当に何を意味するのでしょうか」)、態度マーカー(「重要なことに」「決定的に」「興味深いことに」)、そして強調的な句読点を、人間のビジネスコミュニケーションでは不自然に感じるほどの頻度で使います。

これが、読者がますます認識するようになった「AI口調」の源です。AIが間違った言葉を使っているのではありません。表現マーカーの分布が人間と異なるのです。より頻繁に、より均一に、より文脈に依存せずに。

人間のライターは文脈によって表現力を変えます。LinkedIn投稿ではエネルギッシュに、取締役会メモでは抑制的に。AIはプロンプトの種類に関係なく、ほぼ同じ表現力レベルを維持します。私たちのデータは、各モデル内で8種類のプロンプトすべてにわたり表現力スコアがタイトにクラスタリングしていることを示しています。モデルにはセットポイントがあり、それに回帰するのです。


画一的なAIライティングを実際に修正するもの

問題が収束——すべてのモデルが同じ統計的中心に引き寄せられること——であるなら、解決策はその中心から離れて、各軸上のあなたの具体的な座標に向かって出力を引っ張るものでなければなりません。

それがスタイルプロファイルの役割です。「もっと簡潔に」のような曖昧な指示ではありません(モデルは独自のキャリブレーションを通じて解釈し、実際に簡潔ではなく「やや短い」出力を生成します)。代わりに、測定された目標値です。

「あなたの簡潔さ目標値は68。モデルのデフォルトは42。平均文長を約40%削減してください。」

「あなたの表現力目標値は35。モデルのデフォルトは76。修辞的疑問を排除。態度マーカーを削除。感嘆符は本当の強調時のみ使用。」

「あなたの一貫性目標値は78。モデルのデフォルトは53。文長を狭い範囲内に保つ。極端に短い文と長い文の交互を避ける。」

これらは、あなたの実際のライティングから導出され、経験的なAIベースラインに対して測定された定量的なデルタです。推測ではありません。雰囲気でもありません。データです。


あなたのギャップを測定する

あなたの文章がAI平均からどれだけ離れているか、正確に知りたいですか? 無料のWriting DNA スナップショットをお試しください。いくつかのライティングサンプルを送信し、平均的なAIとの比較であなたのスタイルをマッピングする6軸レーダーチャートを取得してください。

チャート上のギャップは具体的です。どの次元で最も修正が必要か、どのモデルのデフォルトがあなたのスタイルから最も遠いか、スタイルプロファイルが何をキャリブレーションすべきかを教えてくれます。

画一的なAI出力は謎ではありません。測定可能な現象であり、測定可能な解決策があります。

無料のWriting DNA スナップショットを取得

AIにあなたらしい文章を書かせる

手作業でAIの出力を調整する方法を読んだところで、MyWritingTwinなら実際の文章から自動で行えます。サンプルをいくつか貼り付けるだけで、ChatGPT・Claude・Geminiで使えるボイスプロファイルが完成します。

無料でプロファイルを作成

まだ早い?AIボイスプロファイルのガイドをメールでお届けします。

共有:

コメント

コメントを読み込み中...

コメントを残す

メールアドレスは公開されません。

実践してみませんか?

無料でプロファイルを作成