返回上一頁

健檢報告上的「十年心血管風險 12%」準不準?看懂鑑別度與校準度,才知道那個數字能不能信

  • 鑑別度管排序,校準度管數字:鑑別度看模型能不能把高風險與低風險的人分開,用 C 統計量衡量(0.70 至 0.79 良好、0.80 以上優異);校準度看預測的百分比跟實際發生率合不合,用校準圖與 O:E 比值衡量[1][2][4][6][7]
  • 兩者互相獨立,都要及格:MAGGIC 心衰竭評分的 C 統計量有 0.77,卻在高風險區把一年死亡率從實際的接近 50% 低估成 30%,可能讓該轉介移植的病人被延後[1]
  • 模型換一群人用就要重新驗證:西方模型套到亞洲族群通常還能維持鑑別度,校準度卻系統性高估,需要用本地資料重新校準;看報告上的風險分數時,把心力放在血壓、血脂、抽菸這些可以改變的因子,比糾結數字本身更有價值[1][4]
風險預測模型準不準的三個檢查點:鑑別度負責排序、校準度負責對數字、換一個族群要重新驗證

風險預測模型好不好用,取決於兩個各自獨立的性質:鑑別度負責「排順序」——能不能把高風險的人和低風險的人分開;校準度負責「對數字」——算出來的百分比跟實際發生率合不合。 兩者都要及格,這個模型才能拿來做臨床決定[1][2]。一個模型可以排序排得很好,絕對風險卻算得離譜[1],這正是為什麼西方模型直接搬到亞洲族群常出問題。

健檢報告最後那一頁,常常會附一個未來風險的百分比。十年心血管疾病風險 12%、五年骨折風險 8%、某某分數落在中度風險區間。

看到這種數字,很多人心裡冒出的問題其實很直接:這是怎麼算出來的?12% 到底算高還是低?更關鍵的——這個數字準嗎?

追問得很好,因為醫學界評估一個預測模型好不好用時,問的正是同樣的問題,而且拆成兩個角度來問。

第一個角度叫鑑別度,問的是:這個模型能不能把「以後真的會出事的人」和「不會出事的人」分開來[1][2]

第二個角度叫校準度,問的是:它算出來的那個百分比,跟真實世界的發生率對不對得上[1][2][6]

這兩件事互相獨立,都必須夠好,模型才能拿來指導臨床決策[1][2]。一個模型可能排序排得很準,絕對數字卻整個偏掉;也可能整體平均算得很對,卻分不出來誰該擔心[1]

風險預測模型到底在算什麼?

磅秤比喻:每次讀數都少五公斤,排序永遠正確但數字全錯,說明鑑別度好不等於校準度好

風險預測模型的工作,是把你的年齡、血壓、血脂、抽菸與否這些資料丟進一條公式,吐出一個未來發生某件事的機率。

聽起來很科學,問題在於:公式是用某一群人的資料建出來的,套到另一群人身上未必成立。

比喻一:兩個人賽跑,誰會先到?

想像一位醫師面前站著兩位隨機挑出來的病人,其中一位未來會發生心肌梗塞。模型如果通常能正確指出這兩人裡哪一位風險比較高,就代表它的鑑別度好[2][3]

這就像看兩位跑者暖身,你要猜誰會跑贏。你不需要說出他們各自跑幾分幾秒,只要順序猜對就算成功。

鑑別度衡量的正是這種「排序能力」。它不管你算出來的絕對數字對不對,只在乎高風險的人有沒有被排在前面[1][2]

比喻二:磅秤準不準是另一回事

換個場景。你家的磅秤每次量體重都比實際輕五公斤,但只要一個人變胖,它的讀數就跟著上升。

這台磅秤的排序能力是完美的——誰重誰輕它從來沒排錯。可是它報出來的每一個數字都是錯的。

校準度講的就是這件事:模型預測的絕對風險,跟實際觀察到的風險有多接近[1][2][6]。舉例來說,一個模型把病人分成三組,預測十年心血管疾病風險分別是 5%、10%、15%。追蹤下去如果實際發生率就在 5%、10%、15% 附近,這個模型校準得好[2]

要是實際發生率變成 2%、4%、6%,代表模型系統性高估了風險。反過來,實際是 10%、20%、30%,就是系統性低估[6]

磅秤那個比喻的重點在這裡:排序對,不代表數字對。

鑑別度與校準度,研究怎麼說?

MAGGIC 心衰竭評分在高風險族群系統性低估:模型預測一年死亡率 30%,實際觀察接近 50%

鑑別度怎麼量:C 統計量

衡量鑑別度最常用的指標是 C-statistic(concordance statistic,一致性統計量),對二元結果來說,它等於 ROC 曲線(受試者操作特徵曲線)底下的面積,也就是常聽到的 AUC[2][4][5]

這個數字的白話定義是:隨機抓一位「後來真的發生事件」的病人,和一位「後來沒發生」的病人,模型給前者的預測風險比後者高的機率[1][2][4]

解讀方式大致如下:0.5 代表跟丟銅板一樣,完全沒有鑑別力。0.60 到 0.75 之間算是可能有幫助。0.70 到 0.79 屬於良好。0.80 以上是優異。1.0 是完美,實務上從來沒有達到過[1][4]

所以看到一個模型的 C 統計量是 0.77,意思是隨機抓一對病人,它有 77% 的機會把真正會出事的那位排在前面。聽起來不算驚人,卻已經是臨床上相當好的表現。

C 統計量的一個大限制

同一個模型,換一群人測,C 統計量會變。

原因在於它取決於研究族群裡病人特徵的分布。一個涵蓋 20 到 90 歲的異質族群,跟一個只有 50 到 60 歲的同質族群相比,同一個模型在前者身上會得到比較高的 C 統計量,即使模型本身一個字都沒改[1][4]

道理不難懂:族群裡的人差異越大,要排出誰先誰後越容易。全班同學年齡從小學生到老人都有,猜誰跑得快很簡單;全班都是同齡運動員,猜起來就難得多。

這代表看到某個模型宣稱「C 統計量高達 0.85」時,還要問一句:這是在哪一群人身上量出來的?

校準度怎麼量:校準圖與 O:E 比值

校準度的評估有幾種方法[6][7]

校準圖是把「預測風險」和「實際觀察到的風險」在不同風險分組上畫出來對照,用眼睛就能看出模型在哪一段偏掉。

觀察對預期比值(O:E ratio)則是把實際發生的事件數除以模型預測的事件數。比值等於 1.0 代表完美校準;小於 1.0 代表模型高估(預測的事件比實際發生的多);大於 1.0 代表模型低估(實際發生的比預測的多)[6][7]

還有校準斜率,用來看模型有沒有把風險適當地分散在整個風險光譜上。

一個真實的例子:排序很好,數字卻低估了

心臟衰竭領域有一個叫 MAGGIC 的風險評分,被用來評估病人適不適合排入心臟移植。

這個模型的鑑別度不錯,C 統計量 0.77。可是在高風險病人身上,它的校準度很差:在最高的風險分數區間,模型預測一年死亡率是 30%,實際觀察到的死亡率接近 50%[1]

系統性低估的後果不只是數字難看。醫師如果照著模型的 30% 做判斷,可能會不恰當地延後轉介那些其實會從移植獲益的病人[1]

同一個模型、同一群病人,鑑別度給它打了高分,校準度卻踩了地雷。這正是為什麼兩件事要分開評估。

為什麼兩者都要好

一個模型可以鑑別度極佳、校準度很差,也可以反過來[1]

先看第一種。模型可能正確地把病人排序——A 的風險高於 B,B 又高於 C——鑑別度因此很好。但它預測的絕對風險是 1%、2%、3%,真實風險其實是 10%、20%、30%,這就是排序對、數字錯[1]

這件事之所以在臨床上要命,是因為治療決策往往綁在絕對風險的門檻上。舉例來說,十年心血管疾病風險超過 7.5% 就開始使用 statin 類降膽固醇藥[1]。校準度差的模型即使排序正確,仍然會讓病人相對於這個門檻被錯誤分類[1]

第二種情況也麻煩。模型可能準確預測出「這個族群裡有 10% 的人會出事」,整體校準度看起來很好,可是它分不出族群內部誰的風險比較高、誰比較低。鑑別度差到這個程度,臨床上就沒有使用價值[1]

西方模型搬到亞洲,為什麼會失準

把西方發展出來的模型(例如 Framingham、PREVENT)套用到亞洲族群時,通常還能維持合理的鑑別度,因為風險因子的相對排序在不同族群間大致相似,這份實證提到的 C 統計量落在 0.73 到 0.81 之間。

問題出在校準度。基礎事件發生率與風險因子的分布在不同族群之間本來就有差異,導致這些模型在亞洲族群出現系統性高估,必須用本地資料重新校準,才能給出準確的絕對風險估計。

臨床應用上的一般原則是:模型在它被開發出來的那群人身上,通常鑑別度與校準度都不錯,但套到不同族群時表現可能大幅下滑[1]

我的風險分數該怎麼看?

下表把 C 統計量的解讀整理出來,方便你對照報告或衛教資料上提到的數字[1][4]

C 統計量鑑別度等級白話意思你該怎麼看待
0.5跟丟銅板一樣沒有參考價值
0.60–0.75可能有幫助排序能力普通當作參考之一,不宜單獨決定治療
0.70–0.79良好大約七成多的機會排對臨床上常見的好模型,仍要看校準度
≥0.80優異排序能力很強表現優秀,校準度仍需另外確認
1.0完美每一對都排對實務上從未達到,看到要存疑

模型評估的順序也有講究:先看鑑別度,鑑別度太差的模型連排序都做不到,後面免談。鑑別度過關之後再評估校準度,因為治療決策是綁在絕對風險門檻上的,模型必須給出準確的絕對風險估計才有指導價值[1][2]

最後一步是問族群。這個模型是在誰身上開發的、有沒有用本地資料重新校準過[1]

分數不準,會造成什麼後果

校準度偏掉的兩個方向:系統性低估導致該轉介的被延後,系統性高估導致不必要的過度治療

風險分數是決策的參考工具,不是判決書。臨床醫師使用它的時候,會同時看你的完整病史、家族史、當下的身體狀況。

校準度出問題的後果,通常表現在「該做的沒做」或「不該做的做了」。

系統性低估的情境,MAGGIC 那個例子已經演過一次——模型說一年死亡率 30%,實際接近 50%,可能導致該轉介移植的病人被延後[1]

系統性高估則是另一個方向。西方模型套到亞洲族群常出現這種情況,結果是一群其實風險沒那麼高的人,被歸類到需要積極用藥的區間。過度治療同樣有代價,藥物副作用、不必要的檢查、長期的心理負擔都算在內。

哪些狀況要主動找醫師談,不能只看報告上的百分比?家族裡有早發心血管疾病史但風險分數算出來偏低的時候、已經有胸悶胸痛或運動時喘不過氣等症狀卻拿到低風險分數的時候、風險分數落在治療門檻邊緣需要決定要不要用藥的時候——這些都是分數本身給不出答案的場合,需要臨床判斷補上。

真正該立刻就醫的是症狀,不是分數:持續胸痛、冒冷汗、呼吸困難、暈厥,這些不管風險分數寫幾趴,都要馬上處理。

醫師建議你這樣使用風險分數

風險因子分兩類:年齡與性別不能改,血壓、血脂、血糖、抽菸、體重、運動可以改

風險分數的價值在於把你放進一個「大概的區間」,讓你和醫師有共同的討論起點。用得好,它能省下很多爭辯;用得不好,它會製造虛假的安心或不必要的焦慮。

問清楚這個分數是誰的模型

拿到風險分數時,值得問一句:這是用哪一套模型算的、有沒有針對台灣或亞洲族群校準過。

西方模型在亞洲族群往往維持得住鑑別度、卻在校準度上系統性高估,需要用本地資料重新校準才能給出準確的絕對風險。醫師會知道手上這套工具的來歷。

把注意力放在可以改變的因子上

風險模型的輸入項裡,年齡和性別沒辦法動,但血壓、血脂、血糖、抽菸、體重、運動習慣都可以。

與其糾結 12% 這個數字準不準,把心力放在「這幾個可改變的因子我能動哪一個」更划算。分數會隨著這些因子改善而下降,而且這個下降是真實的健康改善,不只是報表上的數字變動。

戒菸、規律有氧運動、減重、把血壓與血脂控制在醫師設定的目標,這些做法對絕大多數模型都是同一個方向。

用連續的追蹤取代單次的數字

單一次的風險分數像一張快照,連續幾年的分數才看得出趨勢。

保留每年的健檢報告,讓醫師可以對照同一套模型下你的分數變化。一個從 8% 慢慢爬到 14% 的人,跟一個穩定停在 12% 的人,臨床意義並不一樣。

追蹤的頻率、下次該複查哪些項目,這些交給醫師依你的狀況決定,會比自己上網查來得可靠。

常見誤解澄清

風險分數 12%,是不是代表我一定會生病?

真相:那是一個群體層級的機率估計,意思是「和你條件相似的一百個人裡,大約有 12 個人在這段期間會發生事件」。它沒有辦法告訴你,你本人是不是那 12 個裡的一個。校準度好的模型,這 12% 才會貼近實際發生率[2][6]

C 統計量越高的模型,是不是就一定越好用?

真相:不一定。C 統計量取決於研究族群裡病人特徵的分布,一個涵蓋 20 到 90 歲的族群,會讓同一個模型拿到比 50 到 60 歲族群更高的分數,模型本身完全沒變[1][4]。而且鑑別度再好,校準度不行的話,絕對風險還是錯的[1]

國外大型研究驗證過的模型,直接拿來用應該沒問題吧?

真相:模型在開發它的族群身上通常表現良好,換到不同族群可能就不行了[1]。Framingham 與 PREVENT 用在亞洲族群就是典型例子——鑑別度還撐得住,校準度卻系統性高估,需要用本地資料重新校準[1]

模型整體算得很準,是不是代表對我個人也準?

真相:整體校準好而鑑別度差的模型,能正確說出「這個族群有 10% 的人會出事」,卻分不出族群內誰的風險高、誰低,對個別病人沒有臨床價值[1]。這兩件事必須分開看。

分數低就不用管了嗎?

真相:分數低代表統計上的機率低,不代表零風險。症狀永遠優先於分數——出現胸痛、呼吸困難、暈厥這類警訊,不管分數多低都要就醫。

重點整理

  • 鑑別度管排序,校準度管數字:鑑別度看模型能不能把高風險與低風險的人分開,用 C 統計量衡量(0.70 至 0.79 良好、0.80 以上優異);校準度看預測的百分比跟實際發生率合不合,用校準圖與 O:E 比值衡量[1][2][4][6][7]
  • 兩者互相獨立,都要及格:MAGGIC 心衰竭評分的 C 統計量有 0.77,卻在高風險區把一年死亡率從實際的接近 50% 低估成 30%,可能讓該轉介移植的病人被延後[1]
  • 模型換一群人用就要重新驗證:西方模型套到亞洲族群通常還能維持鑑別度,校準度卻系統性高估,需要用本地資料重新校準;看報告上的風險分數時,把心力放在血壓、血脂、抽菸這些可以改變的因子,比糾結數字本身更有價值[1][4]

美好人生,健康為本

A better life begins with health

想了解最適合您的健檢方案?
歡迎線上預約,由專人為您量身安排。

立即線上預約

參考文獻

  1. Alba AC, Agoritsas T, Walsh M, et al. Discrimination and Calibration of Clinical Prediction Models. JAMA. 2017;318(14):1377-1384. DOI: 10.1001/jama.2017.12126
  2. Greenland P, Alpert JS, Beller GA, et al. 2010 ACCF/AHA Guideline for Assessment of Cardiovascular Risk in Asymptomatic Adults: A Report of the American College of Cardiology Foundation/American Heart Association Task Force on Practice Guidelines. Journal of the American College of Cardiology. 2010;56(25):e50-103. DOI: 10.1016/j.jacc.2010.09.001
  3. Greenland P, Alpert JS, Beller GA, et al. 2010 ACCF/AHA Guideline for Assessment of Cardiovascular Risk in Asymptomatic Adults: A Report of the American College of Cardiology Foundation/American Heart Association Task Force on Practice Guidelines. Journal of the American College of Cardiology. 2010;56(25):e50-103. DOI: 10.1016/j.jacc.2010.09.001
  4. Khan SS, Greenland P, Hayman LL, et al. Criteria to Assess the Predictive and Clinical Utility of Novel Models, Biomarkers, and Tools for Risk of Cardiovascular Disease: A Scientific Statement From the American Heart Association. Circulation. 2026. DOI: 10.1161/CIR.0000000000001401
  5. Takada T, Tambas M, Clementel E, et al. Prognostic Models for Radiation-Induced Complications After Radiotherapy in Head and Neck Cancer Patients. The Cochrane Database of Systematic Reviews. 2025;9:CD014745. DOI: 10.1002/14651858.CD014745.pub2
  6. Kreuzberger N, Damen JA, Trivella M, et al. Prognostic Models for Newly-Diagnosed Chronic Lymphocytic Leukaemia in Adults: A Systematic Review and Meta-Analysis. The Cochrane Database of Systematic Reviews. 2020;7:CD012022. DOI: 10.1002/14651858.CD012022.pub2
  7. Reeve K, On BI, Havla J, et al. Prognostic Models for Predicting Clinical Disease Progression, Worsening and Activity in People With Multiple Sclerosis. The Cochrane Database of Systematic Reviews. 2023;9:CD013606. DOI: 10.1002/14651858.CD013606.pub2
健檢脖子有結節免驚慌!搞懂 TI-RADS 分級,這 3 種情況才需要做穿刺檢查 - Bch 500

✓ 認證作者衛福部醫事人員

博田國際健康管理中心醫療主任、家庭醫學專科醫師。國立臺灣大學醫學系醫學士、高雄醫學大學藥學碩士、美國哈佛 BIDMC 老年醫學科訪問醫師、體適能健身 C 級指導員認證。專長預防醫學與減重醫學,擅長以資訊工具優化臨床流程。

醫療免責聲明

本文內容僅供衛教參考,不構成個人醫療建議、診斷或治療方案。任何健康問題請諮詢您的主治醫師或合格醫療專業人員。博田國際健康管理中心對依據本文內容所做之決定不承擔任何責任。

最後審閱日期:・作者:

返回頂端