健檢報告上的「十年心血管風險 12%」準不準?看懂鑑別度與校準度,才知道那個數字能不能信
- 鑑別度管排序,校準度管數字:鑑別度看模型能不能把高風險與低風險的人分開,用 C 統計量衡量(0.70 至 0.79 良好、0.80 以上優異);校準度看預測的百分比跟實際發生率合不合,用校準圖與 O:E 比值衡量[1][2][4][6][7]。
- 兩者互相獨立,都要及格:MAGGIC 心衰竭評分的 C 統計量有 0.77,卻在高風險區把一年死亡率從實際的接近 50% 低估成 30%,可能讓該轉介移植的病人被延後[1]。
- 模型換一群人用就要重新驗證:西方模型套到亞洲族群通常還能維持鑑別度,校準度卻系統性高估,需要用本地資料重新校準;看報告上的風險分數時,把心力放在血壓、血脂、抽菸這些可以改變的因子,比糾結數字本身更有價值[1][4]。

風險預測模型好不好用,取決於兩個各自獨立的性質:鑑別度負責「排順序」——能不能把高風險的人和低風險的人分開;校準度負責「對數字」——算出來的百分比跟實際發生率合不合。 兩者都要及格,這個模型才能拿來做臨床決定[1][2]。一個模型可以排序排得很好,絕對風險卻算得離譜[1],這正是為什麼西方模型直接搬到亞洲族群常出問題。
健檢報告最後那一頁,常常會附一個未來風險的百分比。十年心血管疾病風險 12%、五年骨折風險 8%、某某分數落在中度風險區間。
看到這種數字,很多人心裡冒出的問題其實很直接:這是怎麼算出來的?12% 到底算高還是低?更關鍵的——這個數字準嗎?
追問得很好,因為醫學界評估一個預測模型好不好用時,問的正是同樣的問題,而且拆成兩個角度來問。
第一個角度叫鑑別度,問的是:這個模型能不能把「以後真的會出事的人」和「不會出事的人」分開來[1][2]。
第二個角度叫校準度,問的是:它算出來的那個百分比,跟真實世界的發生率對不對得上[1][2][6]。
這兩件事互相獨立,都必須夠好,模型才能拿來指導臨床決策[1][2]。一個模型可能排序排得很準,絕對數字卻整個偏掉;也可能整體平均算得很對,卻分不出來誰該擔心[1]。
風險預測模型到底在算什麼?

風險預測模型的工作,是把你的年齡、血壓、血脂、抽菸與否這些資料丟進一條公式,吐出一個未來發生某件事的機率。
聽起來很科學,問題在於:公式是用某一群人的資料建出來的,套到另一群人身上未必成立。
比喻一:兩個人賽跑,誰會先到?
想像一位醫師面前站著兩位隨機挑出來的病人,其中一位未來會發生心肌梗塞。模型如果通常能正確指出這兩人裡哪一位風險比較高,就代表它的鑑別度好[2][3]。
這就像看兩位跑者暖身,你要猜誰會跑贏。你不需要說出他們各自跑幾分幾秒,只要順序猜對就算成功。
鑑別度衡量的正是這種「排序能力」。它不管你算出來的絕對數字對不對,只在乎高風險的人有沒有被排在前面[1][2]。
比喻二:磅秤準不準是另一回事
換個場景。你家的磅秤每次量體重都比實際輕五公斤,但只要一個人變胖,它的讀數就跟著上升。
這台磅秤的排序能力是完美的——誰重誰輕它從來沒排錯。可是它報出來的每一個數字都是錯的。
校準度講的就是這件事:模型預測的絕對風險,跟實際觀察到的風險有多接近[1][2][6]。舉例來說,一個模型把病人分成三組,預測十年心血管疾病風險分別是 5%、10%、15%。追蹤下去如果實際發生率就在 5%、10%、15% 附近,這個模型校準得好[2]。
要是實際發生率變成 2%、4%、6%,代表模型系統性高估了風險。反過來,實際是 10%、20%、30%,就是系統性低估[6]。
磅秤那個比喻的重點在這裡:排序對,不代表數字對。
鑑別度與校準度,研究怎麼說?

鑑別度怎麼量:C 統計量
衡量鑑別度最常用的指標是 C-statistic(concordance statistic,一致性統計量),對二元結果來說,它等於 ROC 曲線(受試者操作特徵曲線)底下的面積,也就是常聽到的 AUC[2][4][5]。
這個數字的白話定義是:隨機抓一位「後來真的發生事件」的病人,和一位「後來沒發生」的病人,模型給前者的預測風險比後者高的機率[1][2][4]。
解讀方式大致如下:0.5 代表跟丟銅板一樣,完全沒有鑑別力。0.60 到 0.75 之間算是可能有幫助。0.70 到 0.79 屬於良好。0.80 以上是優異。1.0 是完美,實務上從來沒有達到過[1][4]。
所以看到一個模型的 C 統計量是 0.77,意思是隨機抓一對病人,它有 77% 的機會把真正會出事的那位排在前面。聽起來不算驚人,卻已經是臨床上相當好的表現。
C 統計量的一個大限制
同一個模型,換一群人測,C 統計量會變。
原因在於它取決於研究族群裡病人特徵的分布。一個涵蓋 20 到 90 歲的異質族群,跟一個只有 50 到 60 歲的同質族群相比,同一個模型在前者身上會得到比較高的 C 統計量,即使模型本身一個字都沒改[1][4]。
道理不難懂:族群裡的人差異越大,要排出誰先誰後越容易。全班同學年齡從小學生到老人都有,猜誰跑得快很簡單;全班都是同齡運動員,猜起來就難得多。
這代表看到某個模型宣稱「C 統計量高達 0.85」時,還要問一句:這是在哪一群人身上量出來的?
校準度怎麼量:校準圖與 O:E 比值
校準圖是把「預測風險」和「實際觀察到的風險」在不同風險分組上畫出來對照,用眼睛就能看出模型在哪一段偏掉。
觀察對預期比值(O:E ratio)則是把實際發生的事件數除以模型預測的事件數。比值等於 1.0 代表完美校準;小於 1.0 代表模型高估(預測的事件比實際發生的多);大於 1.0 代表模型低估(實際發生的比預測的多)[6][7]。
還有校準斜率,用來看模型有沒有把風險適當地分散在整個風險光譜上。
一個真實的例子:排序很好,數字卻低估了
心臟衰竭領域有一個叫 MAGGIC 的風險評分,被用來評估病人適不適合排入心臟移植。
這個模型的鑑別度不錯,C 統計量 0.77。可是在高風險病人身上,它的校準度很差:在最高的風險分數區間,模型預測一年死亡率是 30%,實際觀察到的死亡率接近 50%[1]。
系統性低估的後果不只是數字難看。醫師如果照著模型的 30% 做判斷,可能會不恰當地延後轉介那些其實會從移植獲益的病人[1]。
同一個模型、同一群病人,鑑別度給它打了高分,校準度卻踩了地雷。這正是為什麼兩件事要分開評估。
為什麼兩者都要好
一個模型可以鑑別度極佳、校準度很差,也可以反過來[1]。
先看第一種。模型可能正確地把病人排序——A 的風險高於 B,B 又高於 C——鑑別度因此很好。但它預測的絕對風險是 1%、2%、3%,真實風險其實是 10%、20%、30%,這就是排序對、數字錯[1]。
這件事之所以在臨床上要命,是因為治療決策往往綁在絕對風險的門檻上。舉例來說,十年心血管疾病風險超過 7.5% 就開始使用 statin 類降膽固醇藥[1]。校準度差的模型即使排序正確,仍然會讓病人相對於這個門檻被錯誤分類[1]。
第二種情況也麻煩。模型可能準確預測出「這個族群裡有 10% 的人會出事」,整體校準度看起來很好,可是它分不出族群內部誰的風險比較高、誰比較低。鑑別度差到這個程度,臨床上就沒有使用價值[1]。
西方模型搬到亞洲,為什麼會失準
把西方發展出來的模型(例如 Framingham、PREVENT)套用到亞洲族群時,通常還能維持合理的鑑別度,因為風險因子的相對排序在不同族群間大致相似,這份實證提到的 C 統計量落在 0.73 到 0.81 之間。
問題出在校準度。基礎事件發生率與風險因子的分布在不同族群之間本來就有差異,導致這些模型在亞洲族群出現系統性高估,必須用本地資料重新校準,才能給出準確的絕對風險估計。
臨床應用上的一般原則是:模型在它被開發出來的那群人身上,通常鑑別度與校準度都不錯,但套到不同族群時表現可能大幅下滑[1]。
我的風險分數該怎麼看?
下表把 C 統計量的解讀整理出來,方便你對照報告或衛教資料上提到的數字[1][4]。
| C 統計量 | 鑑別度等級 | 白話意思 | 你該怎麼看待 |
|---|---|---|---|
| 0.5 | 無 | 跟丟銅板一樣 | 沒有參考價值 |
| 0.60–0.75 | 可能有幫助 | 排序能力普通 | 當作參考之一,不宜單獨決定治療 |
| 0.70–0.79 | 良好 | 大約七成多的機會排對 | 臨床上常見的好模型,仍要看校準度 |
| ≥0.80 | 優異 | 排序能力很強 | 表現優秀,校準度仍需另外確認 |
| 1.0 | 完美 | 每一對都排對 | 實務上從未達到,看到要存疑 |
模型評估的順序也有講究:先看鑑別度,鑑別度太差的模型連排序都做不到,後面免談。鑑別度過關之後再評估校準度,因為治療決策是綁在絕對風險門檻上的,模型必須給出準確的絕對風險估計才有指導價值[1][2]。
最後一步是問族群。這個模型是在誰身上開發的、有沒有用本地資料重新校準過[1]。
分數不準,會造成什麼後果

風險分數是決策的參考工具,不是判決書。臨床醫師使用它的時候,會同時看你的完整病史、家族史、當下的身體狀況。
校準度出問題的後果,通常表現在「該做的沒做」或「不該做的做了」。
系統性低估的情境,MAGGIC 那個例子已經演過一次——模型說一年死亡率 30%,實際接近 50%,可能導致該轉介移植的病人被延後[1]。
系統性高估則是另一個方向。西方模型套到亞洲族群常出現這種情況,結果是一群其實風險沒那麼高的人,被歸類到需要積極用藥的區間。過度治療同樣有代價,藥物副作用、不必要的檢查、長期的心理負擔都算在內。
哪些狀況要主動找醫師談,不能只看報告上的百分比?家族裡有早發心血管疾病史但風險分數算出來偏低的時候、已經有胸悶胸痛或運動時喘不過氣等症狀卻拿到低風險分數的時候、風險分數落在治療門檻邊緣需要決定要不要用藥的時候——這些都是分數本身給不出答案的場合,需要臨床判斷補上。
真正該立刻就醫的是症狀,不是分數:持續胸痛、冒冷汗、呼吸困難、暈厥,這些不管風險分數寫幾趴,都要馬上處理。
醫師建議你這樣使用風險分數

風險分數的價值在於把你放進一個「大概的區間」,讓你和醫師有共同的討論起點。用得好,它能省下很多爭辯;用得不好,它會製造虛假的安心或不必要的焦慮。
問清楚這個分數是誰的模型
拿到風險分數時,值得問一句:這是用哪一套模型算的、有沒有針對台灣或亞洲族群校準過。
西方模型在亞洲族群往往維持得住鑑別度、卻在校準度上系統性高估,需要用本地資料重新校準才能給出準確的絕對風險。醫師會知道手上這套工具的來歷。
把注意力放在可以改變的因子上
風險模型的輸入項裡,年齡和性別沒辦法動,但血壓、血脂、血糖、抽菸、體重、運動習慣都可以。
與其糾結 12% 這個數字準不準,把心力放在「這幾個可改變的因子我能動哪一個」更划算。分數會隨著這些因子改善而下降,而且這個下降是真實的健康改善,不只是報表上的數字變動。
戒菸、規律有氧運動、減重、把血壓與血脂控制在醫師設定的目標,這些做法對絕大多數模型都是同一個方向。
用連續的追蹤取代單次的數字
單一次的風險分數像一張快照,連續幾年的分數才看得出趨勢。
保留每年的健檢報告,讓醫師可以對照同一套模型下你的分數變化。一個從 8% 慢慢爬到 14% 的人,跟一個穩定停在 12% 的人,臨床意義並不一樣。
追蹤的頻率、下次該複查哪些項目,這些交給醫師依你的狀況決定,會比自己上網查來得可靠。
常見誤解澄清
風險分數 12%,是不是代表我一定會生病?
真相:那是一個群體層級的機率估計,意思是「和你條件相似的一百個人裡,大約有 12 個人在這段期間會發生事件」。它沒有辦法告訴你,你本人是不是那 12 個裡的一個。校準度好的模型,這 12% 才會貼近實際發生率[2][6]。
C 統計量越高的模型,是不是就一定越好用?
真相:不一定。C 統計量取決於研究族群裡病人特徵的分布,一個涵蓋 20 到 90 歲的族群,會讓同一個模型拿到比 50 到 60 歲族群更高的分數,模型本身完全沒變[1][4]。而且鑑別度再好,校準度不行的話,絕對風險還是錯的[1]。
國外大型研究驗證過的模型,直接拿來用應該沒問題吧?
真相:模型在開發它的族群身上通常表現良好,換到不同族群可能就不行了[1]。Framingham 與 PREVENT 用在亞洲族群就是典型例子——鑑別度還撐得住,校準度卻系統性高估,需要用本地資料重新校準[1]。
模型整體算得很準,是不是代表對我個人也準?
真相:整體校準好而鑑別度差的模型,能正確說出「這個族群有 10% 的人會出事」,卻分不出族群內誰的風險高、誰低,對個別病人沒有臨床價值[1]。這兩件事必須分開看。
分數低就不用管了嗎?
真相:分數低代表統計上的機率低,不代表零風險。症狀永遠優先於分數——出現胸痛、呼吸困難、暈厥這類警訊,不管分數多低都要就醫。
重點整理
- 鑑別度管排序,校準度管數字:鑑別度看模型能不能把高風險與低風險的人分開,用 C 統計量衡量(0.70 至 0.79 良好、0.80 以上優異);校準度看預測的百分比跟實際發生率合不合,用校準圖與 O:E 比值衡量[1][2][4][6][7]。
- 兩者互相獨立,都要及格:MAGGIC 心衰竭評分的 C 統計量有 0.77,卻在高風險區把一年死亡率從實際的接近 50% 低估成 30%,可能讓該轉介移植的病人被延後[1]。
- 模型換一群人用就要重新驗證:西方模型套到亞洲族群通常還能維持鑑別度,校準度卻系統性高估,需要用本地資料重新校準;看報告上的風險分數時,把心力放在血壓、血脂、抽菸這些可以改變的因子,比糾結數字本身更有價值[1][4]。
參考文獻
- Alba AC, Agoritsas T, Walsh M, et al. Discrimination and Calibration of Clinical Prediction Models. JAMA. 2017;318(14):1377-1384. DOI: 10.1001/jama.2017.12126
- Greenland P, Alpert JS, Beller GA, et al. 2010 ACCF/AHA Guideline for Assessment of Cardiovascular Risk in Asymptomatic Adults: A Report of the American College of Cardiology Foundation/American Heart Association Task Force on Practice Guidelines. Journal of the American College of Cardiology. 2010;56(25):e50-103. DOI: 10.1016/j.jacc.2010.09.001
- Greenland P, Alpert JS, Beller GA, et al. 2010 ACCF/AHA Guideline for Assessment of Cardiovascular Risk in Asymptomatic Adults: A Report of the American College of Cardiology Foundation/American Heart Association Task Force on Practice Guidelines. Journal of the American College of Cardiology. 2010;56(25):e50-103. DOI: 10.1016/j.jacc.2010.09.001
- Khan SS, Greenland P, Hayman LL, et al. Criteria to Assess the Predictive and Clinical Utility of Novel Models, Biomarkers, and Tools for Risk of Cardiovascular Disease: A Scientific Statement From the American Heart Association. Circulation. 2026. DOI: 10.1161/CIR.0000000000001401
- Takada T, Tambas M, Clementel E, et al. Prognostic Models for Radiation-Induced Complications After Radiotherapy in Head and Neck Cancer Patients. The Cochrane Database of Systematic Reviews. 2025;9:CD014745. DOI: 10.1002/14651858.CD014745.pub2
- Kreuzberger N, Damen JA, Trivella M, et al. Prognostic Models for Newly-Diagnosed Chronic Lymphocytic Leukaemia in Adults: A Systematic Review and Meta-Analysis. The Cochrane Database of Systematic Reviews. 2020;7:CD012022. DOI: 10.1002/14651858.CD012022.pub2
- Reeve K, On BI, Havla J, et al. Prognostic Models for Predicting Clinical Disease Progression, Worsening and Activity in People With Multiple Sclerosis. The Cochrane Database of Systematic Reviews. 2023;9:CD013606. DOI: 10.1002/14651858.CD013606.pub2
醫療免責聲明
本文內容僅供衛教參考,不構成個人醫療建議、診斷或治療方案。任何健康問題請諮詢您的主治醫師或合格醫療專業人員。博田國際健康管理中心對依據本文內容所做之決定不承擔任何責任。
最後審閱日期:・作者:黃柏誠醫師

