匯東華統計顧問有限公司
一份跑了整年的研究,主要結果的 p 值落在 0.06。指導教授看了一眼,說「應該是樣本不夠大」,接著建議:「回頭算一下檢定力,寫進討論裡跟審稿人交代。」學生照做,跑出「回溯性檢定力(retrospective power)」約 47%,會議室裡鬆了一口氣,好像終於找到解釋。但這個數字其實沒有告訴他們任何新東西,因為答案早就寫在那個 0.06 裡了。
檢定力(statistical power)的定義不難:若母群體中真的存在某個大小的效果,這次檢定能正確拒絕虛無假設的機率。問題不在定義,而在「拿什麼數字去算」。樣本數規劃軟體 G*Power(Faul, Erdfelder, Lang, & Buchner, 2007)的官方手冊,把檢定力分析分成五種類型,其中最基本的兩種互為表裡:事前分析(a priori)是在蒐集資料之前,依照顯著水準 α、希望達到的檢定力,以及事先設定的母群體效果量,反推需要多少樣本數;事後分析(post hoc)則是拿既定的 α、母群體效果量與已經收集好的樣本數,回頭算出檢定力(G*Power 3.1 manual, 2023, 第3-4頁)。
這裡要特別說清楚一件容易混淆的事:G*Power 定義的事後分析,投入的仍然是「母群體效果量」,也就是研究者根據文獻、前驅研究,或臨床上認定有意義的大小,事先設定的一個數字,跟這批資料本身無關,是完全合法的分析方式。例如事後回頭確認「以當初這個樣本數,若母群體真的存在某個大小的效果,能偵測到的機率有多高」,這種用法沒有問題。真正出問題的操作是另一件事:把這批資料自己觀察到的效果量,當成母群體效果量代入公式去算檢定力。這樣算出來的數字,稱為「回溯性檢定力(retrospective power)」(Hoenig 與 Heisey 原文稱之為觀察檢定力,observed power),這才是本文要談的謬誤,跟 G*Power 官方定義的事後分析並不是同一件事,不該混為一談。
問題就出在這裡。當投入的效果量就是這次檢定觀察到的效果量,在樣本數與顯著水準固定的情況下,回溯性檢定力和 p 值之間會形成一對一的函數關係。Hoenig 與 Heisey 在《The American Statistician》一篇專文中直接點名這個現象:對任何檢定而言,觀察檢定力(observed power)都是 p 值的 1:1 函數,計算檢定力所依據的顯著水準(也就是 p 值)本身就已經決定了觀察檢定力(Hoenig & Heisey, 2001, pp. 19-20)。他們也給出一個容易驗證的例子:單尾 Z 檢定中,若檢定統計量剛好落在顯著臨界值上(Z = 1.645,對應 α = .05),這時算出的觀察檢定力恰好是 50%(Hoenig & Heisey, 2001, pp. 19-20)。這個單尾框架跟本文開場計算 47% 所用的雙尾檢定不同,但不影響論證:換算成雙尾也一樣,p 值只要大於顯著水準,回溯性檢定力就會低於五成,不會恰好等於五成。換句話說,p 值越接近臨界值,回溯性檢定力就穩定地卡在五成上下;p 值越大,回溯性檢定力就越低,兩者一步都不會脫鉤。這不是獨立算出來的新證據,而是同一份資料、同一個 p 值,換了一種單位重新報一次。
那該怎麼辦?正確的順序,是把「算檢定力」搬到蒐集資料之前。在規劃階段先根據臨床或實務上有意義的最小效果量,決定顯著水準與希望達到的檢定力,再反推所需樣本數,這正是事前分析的用途。以迴歸分析為例,文獻上也提供過簡單可用的經驗法則:若檢定的是整體模型解釋力(R²),樣本數約需 50+8m(m 為預測變項個數),這個法則在中度效果量、預測變項不多時較準確,預測變項一多就會偏保守;若檢定的是個別預測變項的係數(偏相關),則約需 104+m,但這裡的「中度效果量」是作者重新定義過的數值(偏相關 .07,而非 Cohen 原本建議的 .13),若沿用 Cohen 的 .13,所需樣本數則是 52+m。作者提醒這類經驗法則不該當成萬用公式,效果量的大小仍應納入考量(Green, 1991, 第499、504、507-508頁)。這類公式或 G*Power 這類軟體,做的都是同一件事:把「先想清楚要偵測多大的效果、需要多少人才夠」這個步驟,安排在蒐集資料之前,而不是事後。
如果研究已經做完、結果不顯著,誠實的作法不是回頭生一個回溯性檢定力數字,而是報告效果量與 95% 信賴區間,讓讀者自己判斷這個區間有沒有排除掉具有臨床或實務意義的效果。Hoenig 與 Heisey 也指出,一旦信賴區間已經建構出來,檢定力計算不會再提供任何額外的資訊(Hoenig & Heisey, 2001, p. 21)。若樣本數確實受限於預算、個案罕見或招募困難,這是研究設計上真實存在的限制,應該在方法或討論中直接寫清楚,而不是用一個注定偏低的數字,包裝成「證據不足以說明有沒有效果」的假象。
下次看到「回溯性檢定力」出現在討論段落裡,不妨先問一句:這個數字是拿哪裡的效果量算出來的。如果答案是「這批資料自己觀察到的效果量」,那麼它能告訴你的,其實你早就從 p 值裡知道了。
本文撰寫過程中,感謝匯東華統計顧問有限公司智慧體部協助進行內容整理與 HTML 結構化。最終內容已由作者審閱並修訂定稿。日期:2026 年 7 月 24 日。
![]()
服務價目表 (未含5%營業稅)
透過嚴謹的數據整理,提供有價值的資訊,形塑知識,提高決策品質。包括信達雅三執行原則。
信:確保資料品質可信賴
達:確保統計方法適切性
雅:確保圖文表格正規化
協助代執行統計分析與進一步加值服務。
在匯東華與夥伴的專業背景知識配合下,能有效地處理面對的問題。
統計分析成果
![]()
數據是礦藏,數據清洗是挖出鑽石的第一步,尤其是巨量知識。數據清洗或串接執行過程需要細心與專注,且有可能會消耗許多時間和精力,就由我們來替各位處理掉這個大麻煩。
全民健保研究資料庫、國外大型資料庫資料非常齊全,種類多,需要串接與清洗,進行正規化後才能更進一步進行資料探勘與統計分析。

Fig1.同一個Project資料散落在不同tables,無法使用

Fig2.整併與清理為可分析的table

Fig.3整理和分析後形成有意義的知識
概念與流程示意圖
![]()




為了讓匯東華的顧客與學員有更好的合作和消費體驗,故匯東華特別依據營業項目開發周邊產品,提供使用、購買。目前已有針對公共衛生師的題庫以及模擬試題,未來將針對醫學研究領域發展產品。
統計不是終點,決策才是。
研究方法、統計實務技巧與數據決策思維,每期送到你的信箱。
我們僅將你的 Email 用於寄送匯東華電子報,你可隨時一鍵退訂。
訂閱成功!感謝訂閱匯東華電子報,請至信箱查收確認信。
(若沒看到,請檢查「廣告信/垃圾郵件匣」,並將我們加入聯絡人,以後才不會漏信。)