曇月靈
匯東華
本期重點|統合分析撤稿

一篇統合分析被撤下來,通常是哪裡出了問題?

匯東華統計顧問 · 陳秀敏 博士 · 2026/8/21

第 3 期 匯東華電子報 第 3 期|2026.08.21 看本期網頁版 →

會讓一篇統合分析被撤下來的方法學問題,其實就那幾種。它們不抽象,也不需要額外的統計專業才看得懂,而且大多可以在投稿前自己查一次。

這不是我們歸納的心得。有一份研究把 2021 年 6 月以前所有查得到的「被撤稿的統合分析」找出來,一則一則讀它們的撤稿通知並分類,其中 187 則有明確交代理由。下面三個子類,就是那份研究從真實撤稿通知裡舉出的例子,連原話都附上了。

先講一件事,因為這個題目太容易被讀成壞消息:因方法學缺陷而撤稿的比例近年確實在上升,但這不代表統合分析變得不可信。一篇統合分析要因為「方法用錯了」而被撤下來,前提是有人看得出來它哪裡用錯了。倫理造假是靠調查揭發的,方法學缺陷是靠同行讀出來的。方法學缺陷的撤稿變多,合理的解讀是這個領域讀者的方法學眼力變好了。

所以下面這份清單的用途很直接:拿它對照自己手上還沒投出去的那份稿子。

一、方法學缺陷具體長什麼樣

研究團隊在補充資料中,為每一類問題各舉了三個真實案例,直接引用撤稿通知的原話,並附上他們給的問題標籤。

以下三個子類,就是「方法學缺陷」在真實撤稿通知裡的樣子。

子類一:分析執行錯誤(faulty analysis)

撤稿通知原話:

"…parameters in the meta-analysis software were set incorrectly, leading to misleading data plots and erroneous conclusions regarding group differences."

(統合分析軟體的參數設定錯誤,導致資料圖形誤導,以及關於組間差異的錯誤結論。)

注意這句話的因果鏈:參數設錯 → 圖畫錯 → 結論錯

這是最令人不安的一類,因為它不需要任何惡意,也不需要任何學術不端。你可能每一篇原始文獻都讀得很仔細、每一格數字都抄對了,但在軟體裡選錯了效應量類型、把對數尺度與原始尺度搞混、或是把效應方向設反,整條分析線就從那一格開始歪掉。

更麻煩的是,這種錯誤不會報錯。軟體照樣跑出一張漂亮的森林圖,只是那張圖說的不是你以為的那件事。

對照到自己的稿子,該問的是:森林圖上每一條線的方向,和你在正文裡寫的結論方向一致嗎?如果某篇研究的結果對介入組有利,它在圖上的點是不是落在你預期的那一側?

子類二:不當合併(inappropriate pooling)

撤稿通知原話:

"The article states in the Methods section that the analysis was done on adult in-hospital patients. However, the studies analyzed used outpatient cohorts."

(本文的方法一節聲明分析對象為成人住院病人。然而被納入分析的研究使用的是門診世代。)

原研究給這個案例的標籤是「不當合併」,並補充說明是「同時涉及住院病人與門診病人」。

這一則值得逐字讀兩遍。它揭露的問題出在族群定義:你宣告的族群和你實際合併的族群不是同一群人

住院病人與門診病人的疾病嚴重度、共病負擔、照護強度、基礎風險都不一樣。把兩者的效應量丟進同一個模型合併,得到的那個「平均效果」在臨床上不對應到任何一群真實的病人。

這類問題的根源通常不在統計,而在納入排除條件寫得不夠具體,或是條件寫了但執行時沒有真的照著做。

子類三:方法學缺陷與證據選取問題

撤稿通知原話:

"After publication of this article…, concerns were raised about aspects of the methods applied and whether the included studies adhered to the reported inclusion and exclusion criteria..."

(本文發表後,關於所採用方法的若干面向,以及納入的研究是否符合所報告的納入與排除條件,出現了疑慮。)

這一則講的是宣告與執行之間的落差

你在 Methods 裡寫下了一組納入排除條件。這組條件是讀者判斷你這篇統合分析可不可信的基礎,因為它決定了「哪些證據算數」。如果實際納入的研究裡,有幾篇其實不符合你自己寫下的條件,那麼整份合併結果的證據基礎就鬆動了。

這種落差常常不是故意的。篩選過程拖了好幾個月,中途遇到邊界個案,臨時做了判斷,卻沒有回頭把新的判斷準則寫進稿件。等到論文發表、有讀者拿著你的條件去核對納入清單,落差就浮出來了。

二、還有一種情況:你什麼都沒做錯,但仍然被撤下來

這份研究裡有一個容易被忽略的細節。

被找出來的 198 篇撤稿統合分析中,有 11 篇沒有進入理由分析。其中 6 篇是撤稿通知沒有給出明確理由,另外 5 篇屬於特殊情況

原研究對這 5 篇的說明是:這些統合分析本身沒有問題,問題出在它們所引用的原始研究,在統合分析發表之後被撤稿了。補充資料的註腳寫得更清楚:這些統合分析納入的原始隨機對照試驗後來被撤稿,而作者在做統合分析時,並不知道那些試驗的資料完整性存在疑慮。

這是一種你無法靠自己的方法學功力完全避免的風險:你的統合分析可以完全正確,卻仍然因為它引用的原始研究出事而被撤下來。

能做的預防有限,但不是沒有:在投稿前、以及在校稿階段,重新確認一次納入清單裡每一篇原始研究的撤稿狀態與是否有 expression of concern。這是一件五分鐘的事,但沒有人做的時候,它就會變成第 5 篇。

三、這些例子全部來自 187 則撤稿通知

前面兩節的內容,全部來自一份 2021 年發表在《Systematic Reviews》的研究,作者群是台灣團隊:Cochrane Taiwan 與臺北醫學大學,另有臺大公共衛生學院健康政策與管理研究所、臺大醫院骨科,以及澳洲 Bond University 實證醫療研究所的 Paul Glasziou 教授。

研究設計很單純,但做得很細:檢索 Embase、PubMed、Web of Science 三個資料庫(時間截至 2021 年 6 月以前),去重後 329 筆進入篩選,逐層排除後找到 198 篇被撤稿的統合分析,其中 187 篇的撤稿通知有明確交代理由,構成分析對象;納入資格、資料萃取與理由分類都由兩位作者獨立重複檢核。

分類方式值得提一句:他們沒有預設分類框架,而是把撤稿通知讀完之後,讓類別從內容裡長出來(內容分析),最後歸納出三類。而且因為一則撤稿通知可能同時涉及兩類以上的問題,他們為每一類各記一個「有沒有提到」的二元變項,讓同一篇稿子可以同時落在多個類別。

187 篇之中:

撤稿通知提及的問題篇數
學術倫理違反(假造同儕審查、抄襲、代寫等)118 篇
方法學缺陷72 篇
書寫或報告問題19 篇
三類撤稿理由的篇數:學術/倫理違反 118 篇、方法學缺陷 72 篇、書寫或報告問題 19 篇;一則通知可同時提及多類,三者不可相加。

圖 1|187 則有明確理由的撤稿通知,提及了哪幾類問題。資料來源:Chen et al. Syst Rev 2021;10:267(CC BY 4.0)。
(點擊圖片可開啟原圖放大檢視)

118 加 72 加 19 等於 209,比 187 還多。這不是算錯,正是上面那個設定的結果:一則撤稿通知可以同時被歸到兩類甚至三類。實際上 187 篇裡有 21 篇跨了不只一類(倫理加方法學 8 篇,方法學加書寫 11 篇,倫理加書寫 1 篇,三類全中 1 篇)。這組跨類別的組合分佈原文未列,是我們自補充資料的逐篇特徵表統計出來的

所以這三個數字要讀成提及率,不能讀成把一個圓餅切三塊。正確的說法是「每 100 則有明確理由的撤稿通知裡,大約有 39 則提到方法學缺陷」,而不是「方法學缺陷是第二大類,佔了三成八」。後者會讓人誤以為三類互斥、加起來剛好 100%。

要引用這份研究的話,建議引用篇數,不要引用百分比。

原文除了篇數,還標示了三個百分比:69.82%、42.60%、11.24%。這三個數字無法從 187 這個分母算出來(118/187 是 63.10%,不是 69.82%)。連同圖中另外三個百分比在內,六個數值都對應到分母 169,而「169」並未以分母或樣本數的形式出現在該文任何一處,因此無從確認它指的是什麼。

這件事對你的影響很具體:若你拿 69.82% 乘以 187,會得到一個原文從未出現過的篇數。 篇數(118、72、19)則可直接核對,也與該文補充資料的逐篇紀錄相符。

三類理由的頻率差異,原研究以統計檢定確認過,三組兩兩比較的差異均達統計顯著(p < 0.01 至 p < 0.001)。也就是說,倫理違反確實顯著多於方法學缺陷,方法學缺陷也確實顯著多於書寫問題。

四、近年的變化:方法學問題正在浮現

真正有意思的是時間趨勢。

原研究以撤稿年份做多項式邏輯斯迴歸,以「學術倫理違反」為參照組,發現撤稿年份與方法學缺陷的比例呈顯著正相關。該圖以分格方式並排呈現各類理由,不是把曲線疊在同一組座標軸上:倫理違反的預測比例從約 0.8 一路下滑,方法學缺陷從接近 0 一路上升,兩者在觀察期末(約 2021 年)收斂到 0.4 上下。

我們另外從該文的補充資料(逐篇特徵表)重新整理了逐年分佈。以下數字原文未列,為我們自補充資料統計。表格只列 2015 年起,且「該年篇數」是有明確理由的 187 篇分析集(2006 至 2014 年另有 10 篇未列入表中,故表格相加為 177):

撤稿年該年篇數其中提及方法學缺陷
2015463
2016236
2017264
20181510
20192112
20202819
2021(僅至 5 月)1812
方法學缺陷佔各年撤稿的比例:2015 年 7%,2018 至 2021 年為 57% 至 68%;2006 至 2014 年各年僅 1 至 3 篇,比例不穩定。

圖 2|方法學缺陷佔各年撤稿的比例,2018 年起升到六成上下。資料來源:Chen et al. Syst Rev 2021;10:267(CC BY 4.0)。
(點擊圖片可開啟原圖放大檢視)

2015 年是撤稿量最高的一年,46 篇裡有 43 篇的撤稿通知提及學術倫理違反,提及方法學缺陷的只有 3 篇。到了 2018 年之後,情況整個翻過來:2018 到 2021 這四年,方法學缺陷在該年撤稿中的出現比例落在六成上下

同樣原文未列、由我們自補充資料統計的還有兩個數字:全部 198 篇裡(此處分母為 198,與上表的 187 不同),有 183 篇(約九成二)的撤稿發生在 2015 年起(含 2015 年當年);期刊分佈上,單一期刊 Tumor Biology 就佔了 22 篇,是最多的一家,其次是 Medicine(16 篇)、Molecular Biology Reports(14 篇)、Molecular Neurobiology(10 篇)。

這個轉折怎麼解釋?原研究的說法是:統合分析的方法學在這十幾年間快速成熟,PRISMA 聲明(2009)與新版《Cochrane Handbook》讓整個學術社群對「正確的做法應該長什麼樣」有了共同標準。標準一旦普及,近年的讀者與審稿人就比從前更容易辨識出方法學上的問題。

換句話說,不是統合分析變差了,是看得懂的人變多了。

原研究也在這一點上給了一個實務建議:邀請沒有利害關係的統合分析方法學專家加入研究團隊,或請他們參與同儕審查,因為方法學專家可能有助於提升統合分析的品質控制。

五、這份研究本身的限制

把限制講清楚,讀者才知道這些數字能推到多遠。

這是一篇 Letter,不是大型系統性回顧:全文只有三頁、六篇參考文獻,篇幅限制了它能做的深度分析。官方撤稿通知的措辭也無法還原完整脈絡,這一點是原研究團隊自己講的:撤稿聲明雖然客觀,但要從那幾行字理解背後的複雜脈絡並不容易,官方說法背後的真正原因在這份研究中可能無法呈現,他們因此建議後續以質性或混合方法研究補足。

數字本身有兩個邊界要注意。2021 年是不完整年度,檢索截止於該年 6 月以前,只涵蓋約前五個月,不能拿來和完整年度比較。早年的年份樣本極小,原文說方法學缺陷的比例「自 2006 年起上升」,但在分析集中 2006 年只有 1 篇(2007 年與 2011 年也各只有 1 篇),趨勢的實質支撐主要來自 2018 年以後。

最根本的一點是:撤稿數只是下限。 這份研究統計的是「已經被抓到、而且已經走完撤稿程序」的案例。有多少方法學缺陷的統合分析仍然掛在期刊上、被引用、被寫進指引,這份研究回答不了,任何一份研究都回答不了。

六、投稿前可以先做的事

第一,方法學缺陷的撤稿變多是好消息,但只對讀者是好消息。 對作者來說,它意味著審稿與讀者的方法學眼力提高了,從前混得過去的做法現在混不過去。

第二,原研究舉出的這三類方法學缺陷,多數可以在投稿前自行檢查。 軟體參數設定、族群一致性、納入排除條件的執行落差,這幾件事多半不需要額外的統計知識,只需要有人願意在投稿前逐項核對一次。但「合併是否恰當」這類判斷仍可能需要領域專業協助,不是每一項都能靠自查解決。(原研究為每一類各舉三個案例,並未提供各子類的出現次數,因此無法據以判斷哪一類最常見。)

第三,找一個和你沒有利害關係的方法學專家看一次。 這是原研究團隊在文章裡給的建議:邀請沒有利害關係的統合分析專家加入團隊,或請他們參與同儕審查,因為方法學專家可能有助於提升統合分析的品質控制。

為了讓第二點可以實際執行,我們依照這份研究揭露的缺陷類型,整理了一份《統合分析投稿前方法學自我檢核表》,共五節、每一條都對應一個真實出現過的撤稿理由類別,可單獨列印或截圖使用。

相關課程資訊

發刊隔天有兩場統合分析課程:8 月 22 日(六)為「零程式碼!AI 助力統合分析 基礎班」(F26-06),從零開始建立統合分析的操作流程;8 月 23 日(日)為「零程式碼!AI 助力統合分析 實戰班」(F26-07),以實際資料完成一次完整分析。

另有 9 月 11 日(五)線上直播「p < 0.05 就有效?統計與臨床意義的距離」(Live26-09),談統計顯著與臨床意義的落差。

本文重點

在 187 則有明確理由的統合分析撤稿通知中,118 則提及學術倫理違反、72 則提及方法學缺陷、19 則提及書寫或報告問題(一則通知可跨類別,故篇數合計大於 187)。以撤稿年份分析,方法學缺陷的比例逐年顯著上升,倫理違反則逐年下降。原研究推測此一轉變可能與 PRISMA 及《Cochrane Handbook》普及後、學術社群辨識方法學問題的能力提升有關。合理的解讀是方法學把關的價值正在被證據支持,而非統合分析本身不可信。

匯東華統計顧問 · www.medatatw.com

參考文獻

資料來源:本文引用的所有數字與撤稿通知原話,均出自下列第 1 項研究及其六份補充資料。該文為開放取用,可自行下載核對。

  1. Chen, Chia-Yun, Yi-No Kang, Ken N. Kuo, Paul Glasziou, and Kee-Hsin Chen. “Increasing Retractions of Meta-Analyses Publications for Methodological Flaw.” Systematic Reviews, vol. 10, no. 1, 2021, article 267. doi:10.1186/s13643-021-01822-2.(含其六份補充資料。該文為 CC BY 4.0 開放取用)
  2. Ioannidis, John P. A. “The Mass Production of Redundant, Misleading, and Conflicted Systematic Reviews and Meta-analyses.” The Milbank Quarterly, vol. 94, no. 3, 2016, pp. 485–514. doi:10.1111/1468-0009.12210.
  3. Niforatos, Joshua D., Matt Weaver, and Michael E. Johansen. “Assessment of Publication Trends of Systematic Reviews and Randomized Clinical Trials, 1995 to 2017.” JAMA Internal Medicine, vol. 179, no. 11, 2019, pp. 1593–1594. doi:10.1001/jamainternmed.2019.3013.
  4. Wallach, Joshua D. “Meta-analysis Metastasis.” JAMA Internal Medicine, vol. 179, no. 11, 2019, pp. 1594–1595. doi:10.1001/jamainternmed.2019.2999.
  5. Chalmers, Iain, Michael B. Bracken, Ben Djulbegovic, et al. “How to Increase Value and Reduce Waste When Research Priorities Are Set.” The Lancet, vol. 383, no. 9912, 2014, pp. 156–165. doi:10.1016/S0140-6736(13)62229-1.
  6. Moher, David, Alessandro Liberati, Jennifer Tetzlaff, and Douglas G. Altman. “Preferred Reporting Items for Systematic Reviews and Meta-Analyses: The PRISMA Statement.” PLoS Medicine, vol. 6, no. 7, 2009, article e1000097. doi:10.1371/journal.pmed.1000097.
  7. Higgins, Julian P. T., James Thomas, Jacqueline Chandler, Miranda Cumpston, Tianjing Li, Matthew J. Page, and Vivian A. Welch, editors. Cochrane Handbook for Systematic Reviews of Interventions. 2nd ed., Wiley, 2019. doi:10.1002/9781119536604.

第 2 至 7 項為本文主要依據該文所引用的文獻。文中提及的 PRISMA 為 2009 年 PLoS Medicine 版本(該聲明另有數個並行刊登版本,DOI 各不相同);《Cochrane Handbook》為 2019 年第 2 版。

本文由匯東華統計顧問有限公司 陳秀敏 博士撰稿,Claude Opus 5 協助資料整理、文獻查證、圖表製作與網頁排版,最終內容已由作者審閱定稿。日期:2026 年 8 月 21 日。

同期其他單元

聯絡我們

 統計分析

服務價目表 (未含5%營業稅)
透過嚴謹的數據整理,提供有價值的資訊,形塑知識,提高決策品質。包括信達雅三執行原則。

 信:確保資料品質可信賴
 達:確保統計方法適切性
 雅:確保圖文表格正規化
協助代執行統計分析與進一步加值服務。

在匯東華與夥伴的專業背景知識配合下,能有效地處理面對的問題。
統計分析成果

 數據串接與清洗

數據是礦藏,數據清洗是挖出鑽石的第一步,尤其是巨量知識。數據清洗或串接執行過程需要細心與專注,且有可能會消耗許多時間和精力,就由我們來替各位處理掉這個大麻煩。

全民健保研究資料庫、國外大型資料庫資料非常齊全,種類多,需要串接與清洗,進行正規化後才能更進一步進行資料探勘與統計分析。




Fig1.同一個Project資料散落在不同tables,無法使用




Fig2.整併與清理為可分析的table




Fig.3整理和分析後形成有意義的知識


概念與流程示意圖

 計畫撰寫與統計諮詢





為了讓匯東華的顧客與學員有更好的合作和消費體驗,故匯東華特別依據營業項目開發周邊產品,提供使用、購買。目前已有針對公共衛生師的題庫以及模擬試題,未來將針對醫學研究領域發展產品。

私訊我們 💬
曇月靈客服吉祥物頭部特寫(臉、眼睛與頭頂角/月相環),點擊可用 Messenger 聯絡匯東華統計顧問