AI Articles

AI 領域精選文章翻譯

View the Project on GitHub Kumazan/ai-articles

20 April 2026

AI 算法上線後,真正的考驗才開始

by Lisa C. Adams, MD, PhD

AI News · 2026-04-20

原文連結: What Happens After the Algorithm Goes Live?

摘要

· · ·

過去幾年,大家把很多注意力放在 AI 演算法進入閱片室之前會發生什麼。我們寫過報告標準、看過公平性與偏誤、討論可解釋性,也評估過模型在不同族群與機構之間的泛化能力。這些都很重要,而且還遠遠沒做完。但有一個同樣關鍵的問題,卻一直沒被好好檢視,算法部署之後會發生什麼事?

這個領域已經成熟到,這問題不再只是理論。現在臨床放射科已經有數百款 FDA 核准的 AI 產品可用,越來越多醫療機構也已經不再停留在試點,而是進入持續運作階段。成熟帶來的現實是,某個時間點在精選資料集上驗證過的算法,不會永遠保持那個狀態。它所在的臨床環境不是靜止的。掃描器會換新,影像採集流程會改,病患族群會變,轉診模式也會變。算法在六個月、一年、甚至三年後遇到的資料,可能和訓練與測試時的資料差很多。

這種現象,在更廣泛的機器學習領域裡通常被稱為資料漂移(data drift)或分佈轉移(distribution shift)。但它在放射科臨床實務中的影響,遠遠沒有被講清楚。當某台掃描器升級後,胸部 X 光的雜訊紋理悄悄改變,原本用來偵測氣胸的算法,還能維持原本的驗證表現嗎?當醫院體系整併、病患結構改變時,分流工具裡預設的盛行率假設還準嗎?這些都不是邊緣案例,而是臨床日常。

忽視這件事的後果,往往不會立刻顯現。算法若直接當機,大家馬上就會注意到。但如果一個算法的敏感度在 18 個月內慢慢掉了 5 個百分點,卻沒有人在監控,很可能就完全不會被發現。使用 AI 工具的放射科醫師可能會逐漸失去信任,卻說不出原因;也可能繼續依賴它,卻沒察覺它正在無聲退化,最後影響病患照護。

監測缺口

想想今天大多數放射科 AI 部署的典型生命週期。先選一個產品,通常會拿它和本地驗證資料集做比較。接著把它整合進臨床工作流,通常透過 DICOM 路由方案,或是廠商中立的 AI 編排平台。最初幾週或幾個月,表現也許會被非正式地追蹤一下。然後,大多數情況下,正式評估就結束了。算法持續運作,報告持續產出,生活照常。

這和其他醫療技術的對待方式形成強烈對比。當新的 MRI 序列上線時,物理師會做持續的品質保證。當新顯影劑進入臨床時,上市後監測會追蹤不良事件。相較之下,放射科 AI 明明有可能大規模影響臨床決策,卻常常沒有對應的持續監控框架。

監管環境正在慢慢補課。FDA 的預先變更管制計畫(predetermined change control plan)架構已經承認,AI 產品在核准後可能還需要演化;歐盟 AI 法案對高風險系統的上市後監測要求,也要求系統性地追蹤表現。但光有法規還不夠。醫療機構還需要基礎設施、專業能力,以及真正把監測當一回事的組織承諾。

監測需要什麼

有效的部署後監測,不只是確認算法還在跑而已。至少要追蹤輸入資料的特徵,偵測分佈是否變了;要監控算法輸出的分佈是否隨時間改變;還要定期把算法表現和臨床真值做比較。

這三件事各有難度。輸入監控需要先知道算法原本是用什麼資料驗證的,不只是影像本身,還包括掃描器廠牌與型號、採集參數、病患人口統計,以及臨床適應症。輸出監控則需要定義「正常」應該長什麼樣,並替偏離正常的情況設計警報閾值。至於和真值比對,這是最有資訊量、也最吃資源的一環,得把算法預測和後續臨床結果、病理結果,或專家判讀串起來。

其實,很多放射科資訊基礎設施,正好就是這件事的底層工具。標準化術語與結構化報告,提供了追蹤算法輸出的共同語言。ontology 與資訊模型,則提供正式框架來描述影像檢查、臨床發現與病患結果之間的關係。管理影像採集中繼資料的 DICOM 標準,就是偵測資料漂移的原材料。這些不是 AI 時代之前的遺物,反而可以說是 AI 大規模責任部署的前提。

朝向持續驗證的文化

技術上的監測元件雖然不簡單,但可能還不是最大難題。真正更難的,是文化。學術放射科很擅長開發與驗證新算法,卻幾乎沒有相同強度的誘因去監測它們上線後的表現。論文獎勵的是新穎性,經費通常流向創新。那種無聊、樸素、天天盯著昨天那個新東西還準不準的工作,得到的認可少得多。

這件事需要改變。部署後監測應該被視為一種科學義務,而不是行政負擔。算法初次部署時的驗證研究,其實等於提出一個假說,這個算法在這個臨床情境裡,會維持這個表現水準。和所有假說一樣,它需要持續驗證。

有些機構已經開始走在前面。只要系統架好,臨床環境本來就會不斷產生可用來做持續測試的資料。資料基礎設施成熟的大型醫療體系,已經開始建立儀表板,把算法表現指標和傳統品質指標一起追蹤。研究團隊也提出了各種持續監測框架,借用製造業與實驗室醫學裡早就成熟的統計製程管制方法。連廠商也逐漸意識到,上市後的表現數據不只是監管義務,也是一種競爭優勢,能證明產品提供的是持續價值,而不是一次性的漂亮驗證結果。

展望未來

這個領域過去的注意力,很合理地都放在放射科 AI 的戲劇性問題上。算法會不會取代放射科醫師?黑箱能不能信?怎麼確保公平?這些都很重要。但那個低調的問題,算法上線後到底發生什麼事,最後可能比其他問題更能決定放射科 AI 是兌現承諾,還是變成一個「熱度跑得比紀律快」的警世故事。

其實,持續驗證所需要的工具和標準,大多已經存在,或者已經離我們不遠。現在只差醫療機構是否願意把它當成優先事項。

Lisa C. Adams, MD, PhD,是一位經認證的放射科醫師,也是慕尼黑工業大學診斷與介入放射科的資深主治醫師。她領導多項跨領域影像 AI 專案,聚焦於體組成、腫瘤表型與多模態病患表徵。她的研究目標,是透過驗證與開放科學,把可信的 AI 系統帶進臨床放射科。她同時也是 Radiology Advances 的副主編,以及 Radiology: Artificial Intelligence 的副編輯。

· · ·

延伸評論:真正的問題不是模型,而是部署後的責任

這篇最值得被記住的地方,不是「AI 會不會失敗」,而是「失敗通常不是瞬間發生,而是慢慢發生」。這對所有做 agent、做工作流、做企業導入的人都很殘酷,因為上線那一刻只是開始,後面才是最貴的部分。

更尖銳一點說,現在很多 AI 產品把驗證當成終點,把監測當成選配。但只要環境會變,模型就沒有真正完成驗證。沒有持續追蹤的系統,頂多只是一次漂亮的 demo。

對真的在做 AI 落地的人來說,這篇很適合拿來當內部討論的底線:先問誰負責監測漂移、誰看警報、誰能下架模型,再談要不要上線。