匯東華統計顧問有限公司
一份投稿到 Scientific Reports 的稿件,收到審稿人一項具體的質疑。
審稿人一方面認可,本研究確認了若干公認的預後因子在台灣族群中同樣具有預後價值;另一方面則質疑,研究認定接受前哨淋巴結切片具有統計顯著的良好預後意義,這項結論可疑,因為關鍵的預後因子並未納入計算。
審稿人抓到的問題很具體。
接受前哨淋巴結切片(sentinel lymph node biopsy, SLNB)的病人,會不會本來就有比較好的預後條件?例如 Breslow 厚度比較薄、腫瘤分期比較早,或組織亞型、潰瘍、淋巴血管侵犯、有絲分裂率原本就不同?
如果是,那麼觀察到的存活差異,就不一定來自 SLNB 本身。
問題是,這是一項使用台灣全民健康保險研究資料庫(NHIRD)的世代研究,共納入 3,284 名黑色素瘤病人。資料庫裡沒有 Breslow 厚度、腫瘤分期與組織亞型等資訊。
不是研究者忘了調整。
是資料來源從一開始就沒有這些變數。
這類審稿意見真正困難的地方就在這裡:問題成立,但照字面做不到。
審稿人的工作是指出研究證據哪裡可能站不穩,不一定會替作者指定解法。接下來變成統計端自己的問題:
當關鍵干擾因子確定測不到,還能做什麼,讓讀者知道這個結論究竟有多依賴那些看不見的變數?
值得注意的是,整份審稿意見並沒有出現「敏感性分析」(sensitivity analysis)這個詞。
這個方法,是在回覆審稿意見時由研究團隊主動提出的。
這正好說明了一件事:
敏感性分析不是審稿人指定你按哪個按鈕,而是研究者把質疑轉譯成可以分析的問題。
審稿人的核心質疑,用一句話重述就是:
你沒有控制幾個重要的預後因子,所以現在看到的關聯,可能不是 SLNB 本身造成的。
這句話無法靠一句「我們已經調整很多變數」反駁。
比較好的做法,是把它拆開:
廣義來說,敏感性分析可以改變很多東西:納入條件、資料處理方式、暴露或結果定義、共變項策略、統計模型、統計假設,以及對未測量干擾的假設。
但不是七種全部跑一遍就比較完整。
敏感性分析真正的設計原則,是每一個替代分析都要對得上一個具體質疑。
如果換了合理的分析條件之後,結論仍大致維持,才能說研究結果對這些分析選擇具有一定程度的穩健性(robustness)。
第一個調整不是模型,而是研究族群。
主分析使用 1997–2013 年的資料;敏感性分析另外限制收案時間,最後由 3,284 人縮減為 2,823 人。
這裡有一個統計細節必須講清楚。
不是因為「沒有完整追蹤三年的人不能做生存分析」。
Kaplan–Meier 與 Cox regression 本來就能處理右設限(right censoring),不需要每一名研究對象都完整追蹤三年。
這次分析真正做的,是依內部分析紀錄將收案截止日提前至 2010 年 12 月 31 日,而資料追蹤仍截止於 2013 年 12 月 31 日。
如此一來,每一名納入敏感性分析的研究對象,在資料庫的日曆時間上都有至少三年的潛在觀察窗。
這和「把三年內死亡的人排除」完全是兩件事。
後者會依研究結果本身決定誰能進入分析,反而可能造成嚴重的選擇偏誤;前者則是在研究設計層次重新限制 index date。
因此,這一步最精確的說法不是:
排除追蹤不足三年的病人。
而是:
限制收案期間,使每一名納入者在資料庫結束前均具有至少三年的潛在追蹤時間。
代價是少了 461 人。
3,284 → 2,823。
但換來的是另一套定義更明確的分析族群,可以檢查主分析結果是否高度依賴原本的收案時間範圍。
第二個問題是時間。
主分析評估整體存活(overall survival);敏感性分析則分別觀察 1 年與 3 年追蹤時間窗。
這不是單純「多做兩個時間點」。
真正想問的是:
如果 SLNB 與存活之間的關聯很大程度來自病人原本的差異,改變追蹤時間之後,估計結果會不會明顯改變?
結果確實出現了一個值得注意的模式。
在四種分析策略下:
也就是說,較短追蹤時間的估計值距離虛無值 1 較遠;隨著追蹤時間拉長,關聯幅度朝 1 靠近。
這個現象可以描述為:
觀察到的關聯隨追蹤時間增加而減弱。
但讀法只能到這裡。
不能再往前跳成:
因為效果會隨時間減弱,所以證明 SLNB 真正改善了存活。
這組分析不是因果證明。
不同追蹤時間得到不同 HR,也可能受到風險集合改變、非比例風險(non-proportional hazards)或其他時間相關因素影響。
因此,這項敏感性分析真正提供的是時間面向的穩健性資訊:關聯並非只存在於單一追蹤設定,但其幅度會隨觀察時間改變。
如果研究問題本身要進一步主張「效果隨時間遞減」,那就應另外檢查 proportional hazards assumption,甚至考慮 time-varying effect,而不能只靠兩組 HR 下結論。
這一步最直接回應審稿人的問題:
如果兩組病人本來就不一樣,換不同方式控制這些差異之後,結果還在嗎?
研究團隊使用四種分析策略,下表列出各方法的危險比與 95% 信賴區間(confidence interval, CI):
| 分析方法 | 1 年整體存活 HR (95% CI) | E-value | 3 年整體存活 HR (95% CI) | E-value |
|---|---|---|---|---|
| 未調整(crude) | 0.34 (0.28–0.42) | 3.60 | 0.59 (0.52–0.67) | 2.24 |
| 多變量 Cox 調整 | 0.45 (0.36–0.57) | 2.86 | 0.71 (0.62–0.82) | 1.85 |
| 傾向分數反機率加權(IPTW) | 0.41 (0.30–0.54) | 3.09 | 0.81 (0.65–0.99) | 1.58 |
| 傾向分數配對(PSM) | 0.40 (0.31–0.50) | 3.16 | 0.70 (0.60–0.81) | 1.88 |
表格可左右滑動檢視。
最值得看的不是哪一格最好看,而是整體圖形。
四種方法得到的 HR 全部小於 1,而且同一追蹤時間下估計值的幅度沒有出現方向相反或極端分歧。
這表示:
SLNB 與較佳存活之間的觀察關聯,並不完全依賴某一種特定的調整方法。
但這句話後面一定要補一句。
多變量 Cox、IPTW 與 propensity score matching 雖然採用不同的調整策略,仍然使用同一批測得到的共變項。
所以它們可以回答:
換不同方式處理「已測量的干擾」,答案會不會改變?
卻不能回答:
那些資料庫根本沒有測到的 Breslow thickness、stage、histologic subtype 是否已經被解決?
這一點屬於資料庫本身的限制,已在研究限制與敏感性分析的前提中說明。
因此,多方法一致性主要提供的是在不同合理統計調整策略下結果是否穩定的資訊,用以支持結果的穩健性評估。
這裡真正值得報告的是:
估計方向一致,而且效應估計沒有因合理的調整策略改變而發生根本翻轉。
傾向分數配對後共有 2,049 人:
但 propensity score matching 做完並不等於工作結束。
真正要看的,是配對後兩組的共變項到底平不平衡。
這項研究使用標準化平均差(standardized mean difference, SMD)評估平衡。
常見做法會把絕對 SMD < 0.1 當成「差異很小」的經驗標準,但這個數字不是統計學上的硬門檻。
Austin (2009) 就明確指出,對於多少 standardized difference 才算重要的殘餘不平衡,並沒有一致共識;0.1 是部分研究者提出並廣泛沿用的經驗準則。Austin (2011) 進一步引用 Normand 等人的工作說明這項慣例。
本研究配對後,大部分共變項確實改善。
例如年齡連續值的 SMD:
0.3411 → 0.0511
多數共病與社經地位層級也降至 0.05 以下。
但不是全部。
仍有五個類別的 SMD > 0.1:
| 共變項 | 配對前 SMD | 配對後 SMD |
|---|---|---|
| 下肢 | 0.5698 | 0.4559 |
| 部位未明 | 0.4679 | 0.5070 |
| 頭頸部 | 0.4368 | 0.3047 |
| 上肢 | 0.1194 | 0.1410 |
| 年齡 ≥80 歲 | 0.3648 | 0.1558 |
其中「部位未明」甚至在配對後增加。
這才是平衡診斷真正該寫出來的東西。
不是一句:
配對後兩組特徵均達平衡。
而是:
大部分共變項的平衡明顯改善,但部分年齡與腫瘤部位類別仍存在殘餘不平衡。
接下來才討論這些不平衡有沒有實質影響。
例如,在原始多變量模型中,「部位未明」與死亡風險增加有關(校正後危險比 aHR 1.27),80 歲以上的 aHR 則為 2.15。這兩項同時具有明顯殘餘不平衡與預後關聯,因此值得特別注意。
另一個檢查方式是分層分析(stratified analysis)。
3,284 人的分層分析中,多數子群體的估計方向相同,但有些 95% 信賴區間跨過 1,例如:
這些結果應該照實列。
但「信賴區間跨 1」不能直接翻譯成:
這個子群體沒有作用。
它只表示這組資料與「無關聯」仍然相容,估計精確度不足以排除虛無值。
同樣地,如果真正想回答:
SLNB 的關聯是不是在不同年齡、性別或社經地位族群中不一樣?
那需要檢驗 interaction,不能比較「這組 P < 0.05、另一組 P > 0.05」就宣布存在 subgroup difference。
分層分析在這裡最有價值的用途,是讓讀者看到:
整體結果在哪些族群比較穩定,哪些地方估計不夠精確。
這比只報顯著的子群體更有資訊。
前三個方向處理的主要仍是「看得到的資料」。
但審稿人真正難回答的問題是:
Breslow thickness、stage、histologic subtype 根本不存在於 NHIRD,你怎麼知道它們不會把結果全部推翻?
這就是 E-value 要回答的問題。
E-value 的概念並不複雜。
它問的是:
在已經調整測得到的共變項之後,一個未測量的干擾結構,至少要和暴露及結果分別具有多強的關聯,才足以把目前觀察到的關聯完全解釋掉?
強度用 risk-ratio scale 表達。
所以 E-value:
它是一個敏感度門檻。
以 propensity score matching 後的 1 年分析為例:
HR = 0.40
95% CI = 0.31–0.50
E-value = 3.16
在 E-value 的架構下,3.16 的解讀是:
在已測量共變項之外,未測量干擾必須與是否接受 SLNB,以及與死亡結果,分別具有至少約 3.16 的 risk-ratio scale 關聯強度,才有可能完全解釋掉目前的點估計關聯。
兩邊都要足夠強。
只有「很能預測誰接受 SLNB」,但和死亡關係很弱,不夠。
只有「很能預測死亡」,但和誰接受 SLNB 幾乎無關,也不夠。
而且即使達到這個強度,也不是說:
一定可以把結果推翻。
而是這種程度的未測量干擾才開始具有完全解釋觀察關聯的可能性。
這也是 E-value 最難回答的地方。
E-value 的原作者刻意沒有設定:
大於多少叫 robust。
因為同一個 3,在不同研究領域可能代表完全不同的事情。
拿本研究已測量的預後因子作量級參考:
就 outcome association 的量級而言,本研究中幾個已測量的強預後因子經轉換後約為風險比(risk ratio, RR)1.7,明顯低於 E-value 3.16,因此 3.16 並不是一個弱的敏感度門檻。即要完全解釋掉目前的觀察關聯,需要相當強的未測量干擾結構。
做完這四個方向之後,仍然有幾條界線不能跨。
Propensity score methods 處理的是已測量的干擾。
它們可以改善兩組在 observed covariates 上的可比性,但不能自動處理資料庫裡不存在的 Breslow thickness、stage 或 histologic subtype。
E-value 處理的是未測量干擾的敏感度。
它不能告訴你未測量干擾到底存不存在,也不能處理所有其他偏誤。
例如:
各有不同的分析問題。
所以不能因為:
propensity score + E-value 都做了
就寫成:
所有可能偏誤都已排除。
這正是敏感性分析最重要的使用邊界:
每一招只能回答它被設計來回答的那一種不確定性。
這四個方向不是為了證明:
「我們的結論一定是對的。」
觀察性研究做不到這件事。
它真正要做的是把一句模糊的:
「也許是其他因素造成的。」
往前推成幾個可以檢查的問題:
換研究族群,結果會不會變?
換追蹤時間,結果會不會變?
換調整方法,結果會不會變?
還有哪些共變項沒有配平?
如果真的存在沒測到的干擾,它至少要多強才能把現在的關聯推翻?
做到這裡,研究者並沒有完全消除不確定性。
而是把不確定性放到桌面上,而且給了它尺度。
這才是敏感性分析真正有價值的地方。
本文由匯東華統計顧問有限公司 陳秀敏 博士撰稿,Claude Opus 5 協助資料整理、文獻查證、圖表製作與網頁排版,最終內容已由作者審閱定稿。日期:2026 年 8 月 7 日。
![]()
服務價目表 (未含5%營業稅)
透過嚴謹的數據整理,提供有價值的資訊,形塑知識,提高決策品質。包括信達雅三執行原則。
信:確保資料品質可信賴
達:確保統計方法適切性
雅:確保圖文表格正規化
協助代執行統計分析與進一步加值服務。
在匯東華與夥伴的專業背景知識配合下,能有效地處理面對的問題。
統計分析成果
![]()
數據是礦藏,數據清洗是挖出鑽石的第一步,尤其是巨量知識。數據清洗或串接執行過程需要細心與專注,且有可能會消耗許多時間和精力,就由我們來替各位處理掉這個大麻煩。
全民健保研究資料庫、國外大型資料庫資料非常齊全,種類多,需要串接與清洗,進行正規化後才能更進一步進行資料探勘與統計分析。

Fig1.同一個Project資料散落在不同tables,無法使用

Fig2.整併與清理為可分析的table

Fig.3整理和分析後形成有意義的知識
概念與流程示意圖
![]()




為了讓匯東華的顧客與學員有更好的合作和消費體驗,故匯東華特別依據營業項目開發周邊產品,提供使用、購買。目前已有針對公共衛生師的題庫以及模擬試題,未來將針對醫學研究領域發展產品。
統計不是終點,決策才是。
研究方法、統計實務技巧與數據決策思維,每期送到你的信箱。
我們僅將你的 Email 用於寄送匯東華電子報,你可隨時一鍵退訂。
訂閱成功!感謝訂閱匯東華電子報,請至信箱查收確認信。
(若沒看到,請檢查「廣告信/垃圾郵件匣」,並將我們加入聯絡人,以後才不會漏信。)