跳至主要內容

4000萬美元自建AI模型,評測分數卻不是第一?你拿AI問健康問題前,先看懂這則新聞

從湯森路透花4,000萬美元基於阿裏千問自建AI模型的新聞出發,看懂AI生成答案與評測數字的限制,整理用AI查健康資訊的查證習慣與該求助的時機。

健康頻道 ·
4000萬美元自建AI模型,評測分數卻不是第一?你拿AI問健康問題前,先看懂這則新聞

8月24日,路透社母公司湯森路透公布旗下第一款大語言模型 Thomson,研發總成本約4,000萬美元。一則科技新聞,跟你我的健康有什麼關係?關係比想像中直接:一家以資訊精確為業的集團,選擇花大錢從頭訓練模型、替輸出內容層層把關,沒有直接把現成AI端上桌。這個決定本身,就值得每一個會拿AI查健康資訊的人停下來想一想。

事件重點:4,000萬美元、45萬美元,和幾組沒有滿分的成績

先把事實整理清楚。據IT之家報導,Thomson 以阿裏巴巴的千問(Qwen)為基礎打造,目前使用的版本是 Qwen3.5-397B。研發總成本約4,000萬美元,換算人民幣約2.69億元;先前在網路上廣泛流傳的45萬美元,其實只是最後一次訓練的費用,兩個數字涵蓋的範圍差了近百倍。

訓練過程分好幾個階段。湯森路透先與帝國理工學院合作,重新訓練基礎模型,讓它符合安全、倫理與政治中立的要求;接著用自家內容做預訓練與後訓練,再於內部環境進行強化學習。

成績單方面,湯森路透稱 Thomson 已躋身全球最佳AI模型之列,但數字有幾處值得細看。在 Stanford LegalBench 測試中,Thomson 拿下0.823,落後 Gemini 3.1 Pro 與 GPT-5.5;在 Harvey Legal Agent Benchmark 中,略低於 Opus 4.8;深度搜尋測試得0.53,GPT 5.4 則是0.65。報導還特別註明一個細節:Thomson 測試時使用了推理階段擴展,GPT-5.5 是在沒開推理模式的情況下應試。換句話說,兩邊作答條件不同,名次高低的參考價值也跟著打折。

圖卡以對比方式呈現湯森路透 Thomson 模型的研發總成本約4,000萬美元,並標註網路流傳的45萬美元其實只是最後一次訓練的花費

背後的健康訊號:一家資訊公司為什麼不敢直接用現成AI

明明市面上有現成的強力模型可以租用,湯森路透卻選擇先跟帝國理工學院合作,讓基礎模型符合安全、倫理與政治中立要求,再餵入自家內容訓練。它給出的理由相當務實,也牽涉長期成本與調整彈性。

圖卡呈現湯森路透說明自建模型的三個理由:外部閉源模型長期成本較高、無法進行高自由度調整、小規模自研模型更適合文件審查等場景,出處為IT之家報導

把這件事對照你我的日常,訊號就浮出來了。專業機構對現成AI的態度是:先重新訓練、先把關,再投入使用。而許多人查健康問題時,拿到AI的回答就直接相信,甚至照著調整飲食或保健品。兩邊的謹慎程度差了一大截。要知道,AI的回答屬於「生成」出來的內容,它依機率組合文字,多數時候流暢通順,但流暢和正確之間,沒有必然的保證。

評測數字還教了另一課。Thomson 測試時開了推理階段擴展,可以想成讓模型「慢慢想」再作答;GPT-5.5 卻是在沒開推理模式的狀態下應試。條件不同,分數的意義就打了折扣。同一個模型,換個版本、換個設定、換個問法,表現都會浮動。所以下次有AI跟你說「根據研究」「醫師建議」,記得那個答案也只是某個版本、某種設定下的產物之一。

還有45萬美元這個數字值得一提。一個被砍掉前後文的訓練費用,傳到後來,多數人以為就是全部成本。這種「部分事實跑得比完整事實快」的傳播方式,跟長輩羣組裡斷章取義的養生謠言,走的是同一條路。這也呼應我們先前在真實農村影片被外國網友懷疑是AI的那波熱議裡提過的現象:當AI生成的內容越來越多,每個人的查證習慣都需要重新校正。

你可以怎麼做:用AI查健康資訊,四個今天就能上手的習慣

看懂新聞之後,把它變成自己的日常流程。以下四個習慣都不難,今天就能開始。

第一,多問一句「請附上資料來源」,然後真的去點開。來源不存在、連結內容對不上、期刊名稱拼錯,都是AI常見的生成錯誤。花三十秒核對,比事後修正一個錯誤的健康觀念便宜得多。

第二,用官方管道交叉比對。在臺灣,衛福部、疾管署、食藥署與國民健康署的網站都有淺白的衛教資料。當AI的說法與官方資料出現落差,以官方和你的醫療團隊為準。至於那些包著健康糖衣的促銷話術,可以參考我們整理過的網購水果騙局與健康促銷話術拆解,練習分辨的思路是相通的。

第三,個資先刪再問。想請AI幫忙解讀檢驗報告或整理症狀描述,先把姓名、身分證字號、就醫號碼拿掉。便利和隱私之間,留一點界線比較安全。

第四,陪長輩練「先查再傳」。AI生成的語音和影片越來越難憑直覺分辨,與其一味禁止長輩轉傳,不如一起演練:看到聳動的健康說法,先到官方網站查證,再決定要不要相信。

圖卡列出使用AI查詢健康資訊的四個習慣:要求附來源並親自查證、與官方衛教資料交叉比對、提問前先刪除個資、陪長輩先查再傳

何時該求助:把這些問題從AI搬回真人面前

AI可以幫你起頭,有些情況卻該直接找專業人員。

當AI的建議和你正在使用的藥物、檢驗報告對不上時,帶著藥袋和報告,直接請教藥師或你的主治醫師,別自行調整劑量或停藥。

當症狀持續或加劇時,例如發燒多天不退、胸悶胸痛、呼吸困難、意識混亂,該做的是就醫,情況緊急就撥119。查AI這件事,可以等病況穩定後再說。

當你發現自己越查越焦慜、查到影響睡眠時,這本身就是值得留意的訊號。替自己設一個查證時間上限,例如三十分鐘;若焦慮持續影響生活,可以找身心科或心理師談談,也可以撥1925安心專線。

當長輩照著AI給的偏方調整用藥、延誤回診時,請盡快陪同就醫,並把偏方的來源畫面一併帶給醫師看,讓專業判斷接手。

結語:一堂4,000萬美元的查證課

湯森路透花4,000萬美元,換到的是對自家AI輸出的掌控權。你我大概不會自建模型,但可以用很低的成本,把「查證」這一段補回自己的流程:讓AI幫你起頭,用官方資料核對,最後的判斷留給專業人員和你自己。一則科技新聞,其實已經替所有人示範過一次了。

這篇文章對你有幫助嗎?

照顧身心是一段持續的旅程。想閱讀更多溫柔實用的健康內容,歡迎回到 所有文章