「平均的なAI」の測定方法 — Writing DNAレーダーチャートの裏側にある方法論
Writing DNAレーダーチャートの「平均的なAI」はどう測定されているのか。320サンプル、5モデル、4言語、計算文体論に基づく各軸の仕組みを詳しく解説します。
By Emmanuel
Writing DNA スナップショットにはレーダーチャートが含まれています。6つの軸。2つの形が重ねて表示され、1つはあなたのもの、もう1つは「平均的なAI」と表示されています。その形の差が、あなたのライティングが人間としていかに独自であるかを物語ります。
しかし「平均的なAI」とは具体的に何を意味するのでしょうか。そのベースラインはどこから来ているのでしょうか。なぜ信頼できるのでしょうか。
多くのAIライティングツールはこの点を曖昧にします。私たちはプロセスを開示します。
6つの軸:何をどう測定しているか
レーダーチャートの各軸は、ライティングスタイルの特定の次元を捉えています。これらは恣意的なカテゴリーではありません。数十年の研究実績を持つ計算文体論に基づいています。数式は決定論的です。同じテキストを入力すれば、毎回同じスコアが出ます。
各軸が測定する内容をご紹介します。
1. 文の複雑さ
この軸は、文がどれだけ構造的に密度が高いかを捉えます。平均文長と標準偏差にシグモイド曲線を適用しており、極端な値でもスコアが上限に張り付くことを防いでいます。
平均22語で高いバリエーション(短い力強い文と長い説明文を混在させる)のライターは、一貫して15語で書くライターとは異なるスコアになります。どちらのパターンも有効です。スコアは判定ではなく、測定です。
反映するもの:文の構造的設計。長く入り組んだ文はスコアを上げ、短く直接的な文はスコアを下げます。
2. 語彙の幅
タイプ・トークン比(TTR)で計算します。ユニークな単語数を総単語数で割った値です。TTRが0.60なら60%の単語がユニーク、0.30なら語彙の繰り返しが多いことを意味します。
日本語テキストの場合、これは興味深い課題になります。日本語は単語間にスペースを使わないため、標準的なトークン化では失敗します。私たちはIntl.Segmenterによる形態素解析を使用し、日本語テキストを適切な単語境界で分割してからカウントしています。日本語ユーザーの語彙スコアは概念的には同じ方法で計算されますが、言語に適した仕組みが使われています。
反映するもの:語彙の多様性。幅広い語彙を持つライターは高スコア、馴染みのある少数の語彙に頼るライターは低スコアになります。どちらが良いということではありません。最も効果的なビジネスコミュニケーションの中には、意図的に制限された語彙を使うものもあります。
3. 表現力
この軸は、テキストにおける感情的・修辞的なエネルギーを測定します。5つのシグナルを組み合わせた数式です:
- 感嘆符比率:文末全体に対する感嘆符の割合
- 疑問符比率:疑問文の使用頻度
- 態度マーカー:個人的な意見や感情を示す語句(1,000語あたり)
- エムダッシュ使用率:強調や挿入的な表現に使われる句読点(1,000語あたり)
- 省略記号使用率:リズムや含みを持たせる表現(1,000語あたり)
感嘆符や修辞的疑問を避ける技術レポートのライターは低スコアになります。パンチの効いた疑問文やエムダッシュを多用するマーケティングコピーライターは高スコアになります。
反映するもの:ライティングの感情的テクスチャー。感情的かどうかではなく、表現的なマーカーを含んでいるかどうかです。
4. フォーマリティ
フォーマリティは3つの指標の加重組み合わせで測定されます:
- 機能語密度:テキスト中の機能語(冠詞、前置詞、接続詞)の割合。密度が高いほど、より形式的で構造化された文章に相関します。
- ヘッジ表現の頻度:曖昧な表現(「かもしれません」「おそらく」「可能性があります」)の1,000語あたりの出現数。ヘッジが多いほど、より形式的で慎重なライティングを示します。
- セミコロン使用率:1,000語あたりのセミコロン数。小さいながらも信頼性の高いフォーマリティの指標です。カジュアルなライティングではほとんど使われません。
数式は感嘆符比率もネガティブシグナルとして考慮します。感嘆符の多用はフォーマリティスコアを下げます。
反映するもの:ライティングがフォーマルからカジュアルのスペクトラム上のどこに位置するか。品質の問題ではありません。インフォーマルなスコアは、あなたのライティングが会話的に読めることを意味し、それがまさに読者に必要な場合もあります。
5. 一貫性
テキスト全体における文長の均一性を測定します。文長の変動係数(標準偏差を平均で割った値)を計算し、それを反転して連続的な0-100のスケールにします。
5語の文と40語の文を交互に使うライターは一貫性が低くなります。文が12語から18語の間に集まるライターは高スコアになります。ここでもどちらが良いということではありません。文学的な散文はバースト的になる傾向があり、法律文書は一貫している傾向があります。
反映するもの:ライティングのリズムの予測可能性。高い一貫性は安定したテンポを意味し、低い一貫性は動的なバリエーションを意味します。
6. 簡潔さ
最もシンプルな数式です。平均文長の逆数。平均文長が短いほどスコアは上がり、長いほど下がります。
平均8語のSlackメッセージライターは簡潔さで高スコアになり、平均28語の学術ライターは低スコアになります。
反映するもの:まさにそのまま — コミュニケーションがどれだけコンパクトかです。
「平均的なAI」ベースラインの構築方法
ここで多くの競合は止まるでしょう。チャートを見せ、比較は「AI平均」だと主張し、疑問を持たれないことを期待します。
私たちは実験を行いました。
コーパス:320サンプル
以下の条件で320のテキストサンプルを生成しました:
- 5つのAIモデル:Claude Opus 4.6、Claude Sonnet 4.5、Claude Haiku 4.5、GPT-5.2、Gemini 3 Pro
- 4つの言語:英語、フランス語、スペイン語、日本語
- 8つのプロンプトタイプ:フォーマルメール、カジュアルメール、ビジネスレポート、ソーシャルメディア投稿、ブログ導入部、Slackメッセージ、プレゼンテーション、会議フォローアップ
- 各組み合わせ2バリアント:レスポンスのばらつきを考慮
つまり、5モデル × 4言語 × 8プロンプトタイプ × 2バリアント。すべてのサンプルは同じ指示で生成され、公平な比較を保証しています。コーパス総量は約100,800語です。
なぜこれらのモデルか
プロフェッショナルが実際に使用するモデルを選びました。Claude Opus 4.6とGPT-5.2は現在利用可能な最も高性能な汎用モデルです。Claude Sonnet 4.5とHaiku 4.5は中級・軽量カテゴリーです。Gemini 3 ProはGoogleのエコシステムをカバーしています。
1つのモデルだけを測定していたら、ベースラインは偏ったものになります。5つのモデルで平均を取ることで、特定のモデルの特徴ではなく、「AIライティング」が実際にどのようなものかを捉えています。
なぜこれらのプロンプトタイプか
8つのプロンプトタイプは、プロフェッショナルが実際にAIに書かせる内容に対応しています。創作小説、詩、学術論文は含めていません。My Writing Twinを使う方々の典型的なユースケースではないからです。
フォーマルメールとレポートは構造的でプロフェッショナルな出力をテストします。カジュアルメールとSlackメッセージは会話的なトーンをテストします。ソーシャル投稿とブログ導入部はマーケティング寄りのライティングをテストします。会議フォローアップとプレゼンテーションはハイブリッドなコンテキストをテストします。これらを合わせることで、日常的なAI支援ライティングの代表的な姿を描いています。
言語別ベースライン:言語を超えた公平な比較
多くのプラットフォームが間違えるポイントですが、私たちはこれが重要だと考えています。
あなたのライティングを「平均的なAI」と比較する際、同じ言語内で比較します。日本語のWriting DNAは日本語のAI出力と比較されます。フランス語のライティングはフランス語のAI出力と比較されます。英語は英語、スペイン語はスペイン語です。
なぜでしょうか。AIは言語によって異なる書き方をするからです。フランス語のAI出力は英語よりも長く複雑な文を生成する傾向があります。日本語のAIテキストは、ビジネス日本語で一般的な敬語表現や疑問形により、異なる表現力パターンを示します。スペイン語はその中間に位置します。
日本語のライティングを英語のAIベースラインと比較したら、その比較は無意味になります。レーダーチャートで見える差異は、あなたの個人的なスタイルではなく、言語構造を反映してしまいます。
言語別ベースラインの実際の値を示します:
| 軸 | 英語 | フランス語 | スペイン語 | 日本語 |
|---|---|---|---|---|
| 文の複雑さ | 65 | 75 | 71 | 62 |
| 語彙の幅 | 48 | 49 | 44 | 37 |
| 表現力 | 76 | 74 | 59 | 100 |
| フォーマリティ | 58 | 42 | 46 | 59 |
| 一貫性 | 53 | 52 | 55 | 53 |
| 簡潔さ | 42 | 32 | 36 | 45 |
日本語AIの表現力が100であることに注目してください。これはバグではありません。日本語のビジネスライティングでは、表現力の計算式が検出する疑問形や丁寧表現が多用されます。AIベースラインとユーザースコアは同じ計算式を使用しているため、比較は公平です。あなたの日本語ライティングが表現力85のスコアであれば、これらの指標において典型的な日本語AI出力よりも控えめであることを意味します — そしてこれはあなたのスタイルに関する有意義なデータポイントです。
フランス語AIの簡潔さスコアが最も低い(32)のは、フランス語が英語よりも自然に長い文を生成するためです。英語のみのベースラインでは、フランス語ライターをスタイルではなく言語の特性で不当に評価してしまいます。
計算式の背後にある科学
これらの測定は恣意的なものではありません。計算文体論、法言語学、自然言語処理における数十年の研究に基づいています。
著者識別マーカーとしての機能語
文体論における最も直感に反する発見:あなたのアイデンティティを明らかにする語は、印象的な語ではありません。退屈な語です。「the」「of」「and」「to」— 文法的な役割を担いながら内容を持たない機能語。これらの語の使用頻度は文脈や時間を超えて驚くほど安定しており、信頼性の高いスタイルマーカーとなります。
フォーマリティ軸が機能語密度を主要なシグナルとして使用しているのは、この研究が機能語パターンが著者帰属において最も識別力の高い特徴の一つであることを示しているからです。
Biberの多次元分析
Douglas Biberによるテキストを複数の独立した次元で分析するフレームワーク — 元々67の言語特徴 — は、ライティングスタイルが一次元的ではないことを確立しました。フォーマルでありながら表現豊かであることも可能です。簡潔でありながら複雑であることもできます。一貫性がありながら語彙が多様であることもあります。
6軸のレーダーチャートは、この原則の実用的な集約です。各軸は他の軸に影響を与えることなく変動できる独立した次元を測定します。結果は単一の「スタイルスコア」ではなく、多次元のフィンガープリントになります。
語彙多様性のためのタイプ・トークン比
TTRは1940年代から言語学で語彙の多様性を測定するために使われています。生のTTRはテキスト長に敏感ですが(長いテキストは自然にTTRが低くなります)、私たちのアプローチでは標準化されたコーパスサイズ内で比較し、ユーザーとAIサンプルの両方に同じ測定ウィンドウを使用することでこれを緩和しています。
自然なスケーリングのためのシグモイド曲線
生の文長は知覚される複雑さと線形に対応しません。1文あたり10語と15語の差は顕著に感じられます。35語と40語の差はほとんど無視できます。シグモイド曲線はこの収穫逓減の関係を捉え、「複雑な」ライティングとは実際にどう感じるかという人間の直感に合致するスコアを生成します。
透明性が重要な理由
レーダーチャートであなたの表現力スコアが45、平均的なAIが76と表示された場合、その差には具体的な意味があります。320の実際のサンプルで測定した結果、AIテキストはあなたよりも感嘆符、修辞的疑問、態度マーカー、エムダッシュを多く使用しているということです。
これは価値判断ではありません。多くの優れたライターはAIのデフォルトよりも控えめです。句読点ではなくアイデアに語らせるのです。しかし、このギャップの存在を知ることは、AI生成テキストがあなたの自然なスタイルとどう異なるか、そしてスタイルプロフィールが何を補正する必要があるかを理解するのに役立ちます。
これは「あなたはユニークです」(嬉しいけれど役に立たない)と言うツールと、どのようにユニークかを教えてくれるツール(具体的で実用的)の違いです。レーダーチャートは気分を良くするためにあるのではありません。マスタープロンプト — そしてそれを読むAI — に正確なキャリブレーションターゲットを与えるためにあります。
方法論を示さない競合は、信頼を盲目的に求めています。私たちはエビデンスで信頼を獲得したいと考えています。
スタイルプロフィールにとっての意味
ベースラインデータは、スタイルプロフィールの動作に直接反映されます。ChatGPTやClaudeに「この人のフォーマリティレベル72をAIデフォルトの58に対して合わせて」と指示する際、AIは具体的で定量化されたターゲットを持ちます。「もう少しフォーマルに」ではなく、適用すべき具体的な差分です。
これがスタイルプロフィールがカスタムインストラクションを上回る理由です。カスタムインストラクションはAIに解釈的なガイダンスを与えます。スタイルプロフィールは、実際のライティングから導き出され、経験的に測定されたAIデフォルトに対してキャリブレーションされたパラメータをAIに与えます。
計算はバックグラウンドで行われます。あなたにはレーダーチャートが見えます。AIにはルールが見えます。
あなたのWriting DNAを見てみませんか?
各軸でどこに位置するか気になりますか? 無料のWriting DNA スナップショットをお試しください — クレジットカード不要、コミットメント不要。ライティングサンプルをいくつか提出するだけで、6つの次元すべてで平均的なAIとの比較を確認できます。
あなたのライティングにはフィンガープリントがあります。私たちはそれを測定します。My Writing Twin は、その測定結果をChatGPT、Claude、GeminiなどあらゆるAIがあなたのように書くための指示に変えます。
AIにあなたらしい文章を書かせる
手作業でAIの出力を調整する方法を読んだところで、MyWritingTwinなら実際の文章から自動で行えます。サンプルをいくつか貼り付けるだけで、ChatGPT・Claude・Geminiで使えるボイスプロファイルが完成します。
無料でプロファイルを作成まだ早い?AIボイスプロファイルのガイドをメールでお届けします。