← ブログ一覧へ戻る

計測と指標

表記ゆれがAI計測を狂わせる:ブランド言及を正しく数える方法

表記ゆれとは、「キヤノン」「キャノン」「Canon」のように、同じ対象を複数の表記で書き分けることです。日本語の言及を正しく数えるには、表記ゆれの登録、言語別の正規化、kuromojiによるトークンを考慮した照合、境界を設けたリテラル検索を組み合わせます。形態素解析だけで判定するわけではありません。

グルチェンコヴ マクシム(株式会社アプリ調味 代表取締役)

なぜ日本語ブランドは表記が割れるのか

日本語には同じ名前を書き表す方法が複数あります。カタカナと英字(スーパーランク/Suparanku)、大文字小文字(Canon/CANON)、正式表記と慣用表記(キヤノンの「ヤ」は正式には大きい「ヤ」ですが、発音どおり「キャノン」と書く人が多数います)、さらに略称や旧社名。どれも同じ会社を指しますが、文字列としては別物です。

AIアシスタントは、文脈によって異なる表記を使います。同じ質問を9回実行したとき、英字が3回、正式なカタカナ表記が4回、慣用表記が2回という結果になることも考えられます。SparkToroの調査が確認したのは、回答に含まれるブランド一覧と掲載順の揺らぎです。回答全文が一字一句同じかどうかを測った調査ではありません。

単純な文字列マッチで何が起きるか

「Suparanku」という1つの表記だけで言及を検索すると、カタカナで言及された回答はすべて「言及なし」と判定されます。結果として可視性は実際より低く見え、最悪の場合「このトピックでは存在感ゼロ」という誤った結論から、不要な施策に予算が流れます。

逆のエラーもあります。短い略称をそのまま検索語にすると、無関係な一般語にヒットして可視性が過大評価されます。どちらの方向でも、計測が狂えばそこから先の意思決定がすべて狂います。

正しく数えるための設計

  1. 表記ゆれを登録します。正式名称、カタカナ、英字、略称、必要な旧称をブランドごとに管理します。
  2. 比較する文字列を同じ規則で正規化します。日本語ではNFKC正規化、ひらがなのカタカナ化、小文字化、区切り文字や法人格の処理を行い、登録表記と回答側を同じキーにそろえます。
  3. トークンを考慮して照合します。kuromojiで日本語を分割し、名詞トークンの連続範囲を正規化したうえで、登録したキーと比較します。単純な部分一致による誤検出を減らすための処理です。
  4. リテラル検索を補助経路として残します。複数語の英字ブランド、句読点を含む名称など、トークン照合で拾えない表記は、文字境界を考慮した正規表現で補います。
  5. 一般語と重なる表記は文脈で確認します。ブランド名にも一般語にもなる短い表記は、文脈確認の結果と照合して誤検出を抑えます。曖昧でない表記は、決定的な照合結果を優先します。

まとめ

表記ゆれへの対応は、エイリアス、正規化、トークン照合、リテラル検索、曖昧表記の文脈確認から成る処理です。韓国語やロシア語などにも、それぞれ異なる表記変化があります。正しい言及照合ができても、それだけで可視性の推定が確定するわけではありません。同じ質問を繰り返しサンプリングし、単発結果を固定値として扱わないことも必要です。

関連用語:表記ゆれ可視性スコアセンチメント分析

参考・出典

  1. Wikipedia「表記揺れ」
  2. kuromoji(日本語形態素解析器)
  3. SparkToro(Rand Fishkin)「AIs are highly inconsistent when recommending brands/products」
無料診断をはじめる 営業に相談