研究顯示領先聊天機器人提供的知識較 Google 更狹窄且同質化
哥本哈根大學對 27 種大型語言模型在 155 個主題上的分析發現,即使是最先進的 GPT‑5,也比標準的 Google 搜尋少至少 18.7% 的知識多樣性。

哥本哈根大學的研究團隊完成了迄今為止規模最大的大型語言模型(LLM)比較測試,這項測試涵蓋了 27 種在學術界與產業界皆具高度知名度的模型,並在 155 個跨領域主題上進行系統性評估。研究人員為每一個主題設計了 200 種不同的提問方式,總計產生約 7,000 萬條個別敘述,藉此量化每個模型在整體人類知識池中的抽取範圍與深度。
測試結果顯示,所有受測的 LLM 在知識多樣性指標上均不及傳統的 Google 搜尋引擎。即使是目前表現最優的 GPT‑5,也至少比 Google 少 18.7% 的資訊變化度,意味著其回應所覆蓋的知識面向較為狹窄且更趨同質化。
過去三年多樣性成長情形
與普遍認為隨著模型規模擴大知識廣度必然下降的觀點相反,研究發現過去三年內 LLM 的知識多樣性呈顯著提升趨勢。模型在訓練資料的多樣性與語言覆蓋上都有所擴展,使得其在某些領域的資訊變化度提升了近 12%。
然而,這一上升趨勢仍不足以彌合與搜尋引擎之間的差距。Google 搜尋在所有測試指標上持續領先,尤其在即時資訊與多來源交叉驗證方面表現尤為突出。
提升並非均衡分佈。結合外部文件檢索的檢索增強生成(RAG)系統在多樣性上取得可觀的提升,平均提升幅度約為 9%。相對地,僅依賴模型內部參數的超大規模模型(參數超過千億)反而在多樣性上落後於參數較少的模型,顯示規模並非唯一決定因素。
語言偏見與知識崩解的風險
在對參數化知識的深入分析中,研究人員發現英語在所有測試模型的內部表徵中占據主導地位。即便問題涉及非英語國家的在地議題,模型仍傾向以英語資訊為主要來源,削弱了本土語言與文化觀點的能見度。
作者將此偏見歸因於 LLM 壓縮龐大訓練語料的方式:模型在學習過程中優先保留出現頻率最高的模式,天然過濾掉較少出現的資訊。若未來的訓練管線大量納入其他 AI 生成的文本,已被稱為「知識崩解」的現象可能加速,使知識庫更加同質化,進一步削弱多元視角。
建議的對策與測量工具
為降低上述風險,研究團隊提出一項全新量化指標,專門用以評估聊天機器人回應的知識多樣性。該指標結合資訊變化度、語言分佈與來源多樣性三個子指標,旨在為模型評估提供可比的基準。
研究人員同時呼籲 AI 開發者在模型開發與測試階段將此指標納入標準評估流程,並將結果公開,以促進產業內部的透明度與競爭。
- 在模型測試中採用新的知識多樣性指標
- 訓練時納入多元、多語言的資料
- 限制 AI 生成文本在訓練集中的比例
- 鼓勵使用檢索增強架構以提升覆蓋範圍
此外,研究團隊建議最終使用者在查詢時應參考多個資訊來源,而非僅依賴單一聊天機器人的摘要。透過交叉比對不同平台的回應,可維持對議題的更廣闊視野,降低資訊偏誤的風險。
研究尚未在現有一代聊天機器人中觀測到具體的「知識崩解」現象,但警示未來走向將高度取決於訓練實務的選擇。若缺乏刻意介入,語言與模型類型之間的進展不均,與搜尋引擎的差距可能持續或進一步擴大。
對於使用中文或多語言環境的台灣企業而言,實務意涵相當明確:雖然聊天機器人能加速例行資訊檢索,但不應取代完整的搜尋策略。決策者應將機器人輸出與傳統搜尋結果交叉驗證,並保持多元知識來源,特別是在處理在地或區域性議題時。
最後,研究強調,隨著 AI 技術持續演進,學術界與產業界需要共同建立長期監測機制,持續追蹤大型語言模型的知識多樣性變化,確保未來的 AI 系統能真正提供廣泛且多元的資訊,避免陷入單一視角的資訊茧房。



