先前我們已經聊過一些關於 AI 在醫療領域輔助應用的新聞。回想去年我們討論生成式 AI 時,常會提到「一本正經地胡說八道」這個詞。但到了今年 7 月,AI 模型的能力進展神速,尤其在寫程式或基礎代理(Agentic workflow)工作上已經相當成熟,相對來說近期這個敘述少見了一些。
不過,看到阿育王大學(Ashoka University)CRASH 實驗室發布的「放射科最後的考試 2.0」(RadLE 2.0)技術報告,讓我再意識到在醫療這類專業領域,AI 可能依然存在著「高信心錯誤」的風險。
新聞重點:什麼是 RadLE 2.0?
這份報告介紹了一個具備「不確定性意識」(uncertainty-aware)的基準測試,旨在評估 AI 代理在放射科進行自主診斷的準備程度。研究團隊認為,單純看「準確度」不足以判斷 AI 是否能勝任診斷工作,更重要的是評估 AI 的「信心」是否可靠,以及它是否知道何時該將病例移交給人類專家。
RadLE 2.0 的核心指標與發現:
1. 信心加權指數(RadLE-C): 這是最核心的指標。AI 在診斷時需提供 0 到 4 分的信心評分,或回答「我不知道」。正確診斷會依信心給予正分,但如果 AI 非常有信心卻診斷錯誤,則會受到嚴厲懲罰;回答「我不知道」則不計分。
2. 高信心錯誤的風險: 研究發現,目前的尖端模型(Frontier Models)常出現「高信心錯誤」,即模型非常確定自己的答案,結果卻是錯的。相較之下,人類專家雖然也會犯錯,但在正確與錯誤之間的信心平衡做得更好。
3. 模型表現落差: 雖然 Gemini 3.0 Pro 等尖端模型在準確度上進步很快,但開源模型與醫療專用視覺語言模型(VLM)的表現普遍較差,且經常在不確定的情況下仍嘗試診斷。
4. 監管的必要性: 報告呼籲,隨著患者與實習醫生開始依賴 AI,醫療領域迫切需要獨立且中立的基準測試,並建立強制性披露機制,防止因盲目信任 AI 而導致健康風險。
我的觀察
就這份放射科的測試結果來看,顯示 AI 雖然在訓練後準確度能媲美人類,但在詢問其信心水準時,往往表現出過度自信。
我在想這會不會可能是因為模型是利用既有資料訓練出來的,導致它在產出結果時,會傾向認為自己的產出具有高機率的正確性,進而產生文中提到的「高信心錯誤」。這種現象其實就是人們所擔心的,對於不具備醫療背景的一般大眾來說,很容易盲目相信 AI 給出的肯定答案。
而更令人應該要注意的可能是「去技能化」的風險。如果實習醫生或資淺醫事人員在沒有專業人士引導下過度依賴 AI,會不會對特定診斷結果產生錯誤的既定印象?
此外,報告中提到一個有趣的現象:現行的專業領域模型其實在模型能力上,很多部分可能比不上目前最前沿的通用模型。這或許意味著透過某些開源模型專案將專業領域模型進行強化,是一個可以加強的部分。
還有,如討論的特定領域使用的模型,也顯示未來我們要將 AI 導入百工百業時,除了單靠通用模型本身是不夠的。我們可能需要透過已受訓的專業人員進行模型微調(Fine-tuning)或持續的人為回饋,經過時間累積以及試誤,才能找出一個較好的「人與 AI協作」模式。

這件事值得繼續觀察什麼
1. 信心校準技術: AI 模型未來能否學會區分「我猜的」跟「我確定的」?這將是醫療 AI 能否落地的關鍵。
2. 醫療 AI 的監管門檻: 獨立基準測試(如 RadLE 2.0)的方式是否會成為未來醫療 AI 產品上市的強制性標準。
3. 通用 vs. 專用模型: 醫療專用模型是否能透過開源微調趕上尖端通用模型的邏輯與判斷能力。
4. 人機協作模式: 在專業流程中,人類介入找出 AI 錯誤的機制該如何建立,以防止醫事或特定領域人員的判斷力退化。
原文連結:https://crashlab.in/radle-technicalreport



