研究:主要チャットボットはGoogle検索より知識が狭く均質的
コペンハーゲン大学の分析によると、27の大規模言語モデルを155テーマで比較した結果、最先端のGPT‑5ですらGoogle検索より少なくとも18.7%の知的多様性が欠けていることが明らかになった。

コペンハーゲン大学の研究者らは、これまでで最大規模の大規模言語モデル(LLM)比較テストを完了した。27の主要LLMを155の異なるテーマで評価し、各テーマにつき200通りの質問文を生成した。実験は約7000万件の個別ステートメントを生み出し、各モデルが人類の知識プールからどれだけ広く情報を引き出すかを定量化できた。
核心的な発見は明白だ。調査対象となったすべてのLLMは、従来のGoogle検索に比べて知的多様性が低い。最も性能が高いとされたGPT‑5でさえ、情報のバラエティにおいて最低でも18.7%Googleに劣っている。
過去3年間の多様性の成長
知識の幅が必然的に縮小するという一般的な見方に反し、研究は過去3年間でLLMの知的多様性が大幅に増加したことを示した。ただし、この上昇傾向は検索エンジンとのギャップを埋めるには至っておらず、検索エンジンは依然として全体的に優位である。
改善は均一ではない。外部文書検索と組み合わせたリトリーバル強化生成(RAG)システムは多様性が測定可能に向上した。一方、パラメータ数が最も多い大型モデルは、むしろ小型モデルよりも多様性が低いという逆説的な結果が見られた。
言語バイアスと知識崩壊のリスク
分析から浮かび上がった二つ目の微妙な問題は、パラメトリック知識における英語の支配である。質問が非英語圏のトピックに関するものであっても、すべてのモデルは内部表現で英語が優位に立つ。この言語的偏りはローカルな情報源や文化的視点の可視性を低下させる。
著者らはこの偏りを、LLMが膨大な学習コーパスを圧縮する方法に起因すると指摘する。最も頻出するパターンを優先することで、モデルは稀な情報を自然に除外してしまう。将来的に学習パイプラインが他のAIが生成したテキストを取り込むようになると、「知識崩壊」と呼ばれる現象が加速し、知識ベースがさらに均質化する恐れがある。
提案された対策と測定ツール
これらのリスクを緩和するため、研究者はチャットボット応答の知的多様性を評価する定量的指標を導入した。モデル評価の標準ベンチマークとしてこの測定を採用するよう、AI開発者に呼び掛けている。
同時に、エンドユーザーには単一のチャットボット要約に依存せず、複数の情報源を参照することを推奨する。この習慣は対象トピックの視野を広く保つ助けになる。
- 新しい知的多様性指標をモデルテストに採用する
- 多言語・多様なデータを学習に組み込む
- 学習データ中のAI生成テキスト比率を制限する
- リトリーバル強化アーキテクチャを推奨しカバレッジを向上させる
本研究は現行世代のチャットボットに具体的な「知識崩壊」はまだ観測されていないと結論付けているが、今後の学習手法次第でその方向性が決まると警告している。言語間やモデル種別での進捗が不均一であることから、意図的な介入がなければ検索エンジンとのギャップは維持あるいは拡大する可能性がある。
日本の組織にとっての実務的示唆は明確だ。チャットボットは日常的な情報取得を迅速化できる一方で、包括的な検索戦略の代替にはならない。意思決定者はチャットボットの出力を従来の検索結果と照合し、特に多言語対応や地域特化の文脈では多様な知識源を維持することが求められる。



