湯森路透自建法律AI大模型,砸下4000萬美元
湯森路透投入約4000萬美元,以阿里巴巴開源模型Qwen為基礎,打造出自家首款專有大語言模型「Thomson」,並利用來自Westlaw數十年的法律資料進行訓練。

湯森路透正式發表「Thomson」,這是該公司首款專有的大型語言模型(LLM)。此模型以中國阿里巴巴集團的開源模型Qwen為基礎打造——據公司表示,目前使用的版本是Qwen3.5-397B。根據科技媒體The Decoder報導,湯森路透表示,這項計畫在兩年內於人力與運算力方面的投入約為4000萬美元。
目前這個版本光是最後一次正式訓練(training run)的花費,據稱就高達約45萬美元——這個數字雖然較常被媒體提及,卻只佔真實總成本的一小部分。就連4000萬美元這個數字,也未涵蓋真正的核心價值:來自Westlaw、Practical Law、Checkpoint與路透社(Reuters)數十年累積的內容,以及數百位法律領域專家多年投入此計畫的工作時間。
開源模型如何變成法律模型
湯森路透與倫敦帝國理工學院(Imperial College London)合作,先針對安全性、倫理與政治中立性,重新調整這個中國開源模型。這個中間步驟的內部代號為「Snowdon」,取自威爾斯的一座山。之後依序進行:以公司專有內容進行預訓練、與法律領域專家一同進行後訓練,以及在公司自有的工具環境(例如Westlaw)中進行代理式強化學習。據公司表示,迄今用於訓練的內容還不到全部可用內容的10%。
湯森路透技術長喬爾.赫倫(Joel Hron)向The Decoder透露,這項計畫最初的方向「大概改變了六次左右」。研究負責人喬納森.施瓦茨(Jonathan Schwartz)則補充,真正的成就並非單一模型本身,而是一套可重複使用的「模型工廠」。
Thomson必須為法律領域界定智慧的前沿。這與我認為許多前沿實驗室正在做的事截然不同。
如果只是拿開源模型,卻不做這些額外的步驟,它懂的東西就不會那麼多。它不見得會符合你自己的價值觀,表現也不會像你之後自行打造的工具那麼出色。
應謹慎看待的跑分結果
在公司自行進行的測試中,Thomson在史丹佛LegalBench基準測試中拿下0.823分,落後於Gemini 3.1 Pro與GPT-5.5。在Harvey Legal Agent Benchmark測試中,成績僅次於Claude Opus 4.8。Thomson在指令遵循能力,以及高難度的PrBench Legal測試中領先,但在推理能力、尤其是程式撰寫能力上明顯落後。這項比較被認為在方法論上有所偏頗:Thomson在測試時採用了測試時擴展(test-time scaling)技術,而GPT-5.5的測試則未啟用其推理模式。
在公司內部的深度研究(Deep Research)基準測試中,僅靠網路存取時,Thomson的事實準確度得分為0.53,GPT-5.4則為0.65。但一旦取得公司專有內容的存取權限,Thomson的分數躍升至0.83,略微超過GPT-5.4的0.82。負責這項評估的安德魯.賓恩(Andrew Bean)坦言,僅靠網路存取,這款模型「當然還算不上」業界領先。值得留意的是,GPT-5.4同樣從專有內容存取中大幅受益——資料存取權限的重要性,幾乎與專門化訓練本身不相上下。SiliconANGLE指出,這些內部結果尚未獲得廣泛的獨立驗證;一份納入更多基準測試結果的技術報告,預計稍後發布。湯森路透已開始將此模型提供給法律專家與學術機構進行測試。
為何選擇自建,而非微調前沿模型
為何不直接微調OpenAI或Anthropic現有的前沿模型,而要自行建構專有模型?公司提出三個理由:
- 經濟性:標準的微調常會削弱模型的通用能力,並使公司依賴推理成本與供應商的產品藍圖;較小型的自有模型,對於文件審查這類高交易量任務而言更具成本效益。
- 資料:在Westlaw等公司專有工具環境中進行訓練,正是帶來上述效能躍升的關鍵——而這樣的存取權限,公司並不願開放給任何第三方。
- 累積效應:產品每次更新時的專家評估,都會轉化為訓練資料,在自有模型架構下不斷累積,如同自有資產般沉澱,而非讓外部供應商從中獲益。
公司也坦承這種做法有其侷限:僅適用於同時具備三項稀有條件的企業——獨家資料庫、內部聘僱的數百位領域專家,以及品質可被客觀衡量的工作流程。對具備這些條件的公司而言,開源社群只會讓追上前沿實驗室的時程延後數月,4000萬美元或許就足以打造出一款具競爭力的專用模型。但對於既無專有資料、也無評估基礎架構的公司來說,自建模型的主要成本將體現在持續不斷的維護上。
首個應用場景:導入CoCounsel
Thomson首先被整合進湯森路透法律AI助理CoCounsel Legal的「表格分析」(Tabular Analysis)功能中,用於處理大量文件審查工作——這正是一個較小、較便宜的模型在經濟上更為合理的應用情境。CoCounsel仍維持多模型架構:管理員依然可以選擇其他模型。Thomson並非要主導整個系統,而是負責處理諸如引註核實之類的子任務。公司表示,客戶資料不會被用於訓練。
此模型的較小版本,未來將以開放權重形式在Hugging Face上發布,採用非商業授權條款,並將附上技術報告與開發者入口網站。此外,公司也已與多家律師事務所展開初步、且不具約束力的直接授權洽談。
湯森路透強調了背後的產業脈絡:公司的旗艦平台Westlaw擁有超過4萬個獨立資料庫,以及超過150年的法律出版與編輯累積。公司表示,掌控自有模型能讓公司在部署、治理與未來發展方向上擁有更大的自主權——這是一種「AI主權」的論述。目前公司已與多家大型律師事務所及企業就直接存取該模型展開洽談,其中也包括讓客戶未來能依據自身知識體系與工作流程,對Thomson進行客製化的可能性。
對台灣的律師事務所與企業法務部門而言,這個案例清楚說明了一款自建語言模型真正具備經濟價值所需的前提:唯有擁有數十年累積的獨家資料庫、內部聘僱的領域專家,以及能客觀衡量品質的工作流程的組織,才能以相對有限的預算,打造出足以與前沿實驗室匹敵的專用模型。對多數台灣企業而言,透過代理式系統整合既有模型,尤其是用於自動化處理重複性的法律與行政事務,可能仍是較為務實的路徑。
資料來源
- Warum Thomson Reuters 40 Millionen Dollar in ein eigenes Sprachmodell investiertThe Decoder · 2026年8月24日
- Thomson Reuters launches proprietary AI model for legal workSiliconANGLE · 2026年8月24日



