← All posts

Pooling 95% CI และ Effect Sizes: เมื่อไรควรใช้ Fixed-effect, Random-effects, Bootstrap และ Rubin's Rules

Clinical Epidemiology ResearchMethodology and Research Design TH
Pooling 95% CI และ Effect Sizes: เมื่อไรควรใช้ Fixed-effect, Random-effects, Bootstrap และ Rubin's Rules
On this page

Read the English version

บทคัดย่อ

บทความนี้อธิบายว่าเมื่อมี effect estimate พร้อม 95% CI หลายค่า คำถามแรกไม่ใช่ว่าจะรวมช่วงเหล่านั้นอย่างไร แต่เป็นว่า estimates มาจากไหน เพราะ confidence interval เป็นผลลัพธ์ที่คำนวณหลังจากมี estimate และ variance แล้ว สิ่งที่ถูกนำมารวมจึงเป็นสิ่งที่ใช้สร้างช่วงนั้น ไม่ใช่ขอบของช่วง บทความแยกที่มาออกเป็นสามแบบ และแบบแรกยังแยกย่อยตาม estimand คือปริมาณที่การวิเคราะห์ต้องการประมาณ ได้แก่ independent studies ที่สมมติว่ามี common effect เดียวซึ่งใช้ fixed-effect meta-analysis, independent studies ที่ true effect ต่างกันได้ซึ่งใช้ random-effects meta-analysis ที่เพิ่ม between-study variance เข้าไป, การ resample จาก dataset ชุดเดียวซึ่งใช้ distribution ของ bootstrap replicates และ imputed datasets จากการเติมข้อมูลที่ขาดซึ่งใช้ Rubin's rules จึงได้สี่วิธีจากสามที่มา บทความยังอธิบายว่าทำไมจึงควรเลือกโมเดลจาก estimand ก่อนเห็นค่า heterogeneity รวมถึงวิธีกู้ standard error กลับมาจากช่วงที่ตีพิมพ์ พร้อมผังการตัดสินใจ ตัวอย่างคำนวณสองชุดที่ทำตามได้ทีละขั้น และวิดเจ็ตที่ให้เพิ่ม between-study variance ขึ้นจากศูนย์ เพื่อดูว่าน้ำหนักของแต่ละ study เปลี่ยนไปอย่างไร


วิธี pooling ถูกกำหนดด้วยที่มาของ estimates ไม่ใช่ด้วยจำนวนของ estimates

จริง ๆ แล้ว pooling รวมอะไรเข้าด้วยกัน

สมมติว่าคุณถือ effect estimate พร้อม confidence interval มาหลายค่าจากหลายแหล่ง สิ่งที่ทำได้ง่ายที่สุดคือเฉลี่ยขอบล่างทุกค่าเข้าด้วยกัน แล้วเฉลี่ยขอบบนทุกค่าเข้าด้วยกัน

\[ \bar{L} = \frac{L_1 + L_2 + \cdots + L_k}{k} \quad \bar{U} = \frac{U_1 + U_2 + \cdots + U_k}{k} \]

การคำนวณนี้ให้ตัวเลขออกมาสองตัวเสมอ แต่ตัวเลขคู่นั้นไม่ได้เป็น 95% CI ของอะไรเลย เหตุผลอยู่ที่น้ำหนัก แต่ละ estimate มี precision ไม่เท่ากัน ค่าที่มี standard error เล็กควรมีอิทธิพลต่อค่ารวมมากกว่าค่าที่มี standard error ใหญ่

การเฉลี่ยขอบ CI ให้ทุกค่ามีน้ำหนักเท่ากันโดยอัตโนมัติ ความแม่นยำที่ต่างกันจึงหายไปตั้งแต่ขั้นแรก จุดกึ่งกลางของคู่ตัวเลขนั้นคือค่าเฉลี่ยแบบไม่ถ่วงน้ำหนักของ estimates ซึ่งทิ้ง precision ไปทั้งหมด ส่วนครึ่งความกว้างของมันคือครึ่งความกว้างทั่วไปของ study เพียงชิ้นเดียว และไม่แคบลงเลยแม้จะเพิ่มจำนวน studies เมื่อมี studies ขนาดใกล้เคียงกัน k ชิ้น คู่ตัวเลขนี้จะกว้างเกินจริงราวรากที่สองของ k เท่า จึงกลบ effect ที่มีอยู่จริงแทนที่จะสร้าง effect ขึ้นมาใหม่

วิธีที่ถูกต้องต้องย้อนกลับไปหาวัตถุดิบก่อน คือ effect estimate ของแต่ละค่า และ variance หรือ standard error ของมัน จากนั้นจึงเลือก pooling model ที่ตรงกับที่มาของค่าเหล่านั้น โมเดลจะคืน pooled estimate กับ pooled standard error ออกมา แล้ว CI ช่วงใหม่จึงถูกคำนวณจากสองค่านี้ในขั้นสุดท้าย

ที่มาของ estimates แบ่งได้เป็นสามแบบ คือ independent studies ของคำถามเดียวกัน การ resample ซ้ำจาก dataset ชุดเดียว และ imputed datasets ที่สร้างขึ้นจาก dataset ชุดเดียวที่มีข้อมูลขาด แบบแรกยังแยกต่อได้อีกหนึ่งครั้ง ไม่ใช่ด้วยที่มาแต่ด้วย estimand คือ fixed-effect กับ random-effects นี่จึงเป็นเหตุผลที่สี่วิธีออกมาจากสามที่มา และส่วนที่เหลือของบทความเดินตามทีละแบบ

ยังมีอีกหนึ่งสถานการณ์ที่ต้องเตือนไว้ต่างหาก เพราะมันไม่ได้อยู่ในรายการนั้นเลย คือ estimates หลายค่าที่มาจากผู้ป่วยกลุ่มเดียวกัน subgroups ของ cohort ชุดเดียว ผลรายศูนย์จาก trial เดียว และ outcomes หลายตัวที่วัดจากคนกลุ่มเดิม ล้วนดูเหมือน estimates อิสระหลายค่า แต่มันไม่อิสระต่อกัน inverse-variance pooling จึงนับผู้ป่วยกลุ่มเดิมซ้ำ และให้ช่วงที่แคบเกินจริง ทางออกคือใช้โมเดลเดียวบนข้อมูลรายบุคคลที่รวมกันแล้ว หรือใช้วิธีที่รองรับ correlation

คำถามเดียวด้านบน สามที่มา และวิธีที่แต่ละที่มาบังคับให้ใช้

estimates เหล่านี้มาจากไหน

สี่เส้นทางสู่ pooled CI และอีกหนึ่งสถานการณ์ที่การ pool เป็นทางที่ผิด แถวที่คุณอยู่ถูกกำหนดตั้งแต่ก่อนจะ fit โมเดลใด ๆ
estimates มาจากไหนสิ่งที่มีของแต่ละค่าวิธีที่ตรงกันความหมายของ pooled CI
หลาย independent studies ที่สมมติว่ามี common effect เดียวeffect estimate และ SEFixed-effect meta-analysisความไม่แน่นอนของ common effect ค่าเดียว
หลาย independent studies ที่ true effect ต่างกันได้effect estimate และ SE ของแต่ละ study พร้อม between-study variance หนึ่งค่าที่ประมาณจากทั้งชุดRandom-effects meta-analysisความไม่แน่นอนของค่าเฉลี่ยของ distribution ของ effects
การ resample จาก dataset เดียวbootstrap replicate estimatesPercentile, BCa หรือวิธี bootstrap อื่นความไม่แน่นอนที่อ่านจาก distribution ของ replicates
imputed datasets ที่สร้างจาก dataset เดียวที่มีข้อมูลขาดestimate และ variance ของแต่ละ imputationRubin's rulesความไม่แน่นอนที่รวมราคาของ missing data ไว้แล้ว
estimates หลายค่าที่มาจากผู้ป่วยกลุ่มเดียวกันestimates ที่ใช้คนกลุ่มเดียวกัน เช่น subgroups ของ cohort ชุดเดียวไม่ใช้ inverse-variance pooling แต่ใช้โมเดลเดียวบนข้อมูลรายบุคคลที่รวมกันแล้วไม่มี pooled CI ให้อ่าน เพราะการรวมชิ้นส่วนเป็นการนับผู้ป่วยกลุ่มเดิมซ้ำ

Fixed-effect: common effect เดียว ถ่วงน้ำหนักด้วย precision

fixed-effect meta-analysis มี estimand เพียงค่าเดียว ซึ่ง estimand คือปริมาณที่การวิเคราะห์ตั้งใจจะประมาณ ในที่นี้ปริมาณนั้นคือ underlying effect ค่าเดียวที่ทุก study ถูกถือว่ากำลังวัดอยู่ ความต่างของตัวเลขที่เห็นระหว่าง studies จึงถูกอธิบายด้วย sampling error เพียงอย่างเดียว ซึ่งคือความแปรปรวนแบบสุ่มที่เกิดจากการที่แต่ละ study สุ่มผู้ป่วยมาได้จำนวนจำกัด

ผู้เขียนบางกลุ่มเรียกโมเดลนี้ว่า common-effect model และสงวนคำพหูพจน์ fixed-effects ไว้สำหรับค่าเฉลี่ยถ่วงน้ำหนักด้วย precision ของ effects ที่อาจต่างกันจริง น้ำหนักที่ใช้เหมือนกัน แต่ estimand ไม่เหมือนกัน

เมื่อ estimand เป็นแบบนี้ สิ่งที่ยุติธรรมคือให้ study ที่แม่นกว่ามีเสียงดังกว่า วิธีมาตรฐานคือ inverse-variance weighting ซึ่งให้น้ำหนักแต่ละ study เท่ากับส่วนกลับของ variance ของมัน สำหรับ binary outcome ที่มีจำนวน event น้อย น้ำหนักชุดนี้ทำงานได้ไม่ดี และควรใช้วิธี Mantel-Haenszel ซึ่งให้น้ำหนักแต่ละ study จากจำนวน event ดิบแทน หลักการไม่เปลี่ยน เปลี่ยนเฉพาะน้ำหนักเท่านั้น

\[ w_i = \frac{1}{SE_i^{2}} \]

pooled effect ก็คือค่าเฉลี่ยถ่วงน้ำหนักของ estimates ทั้งหมด ด้วยน้ำหนักชุดนี้

\[ \hat{\theta}_{FE} = \frac{\sum_i w_i \hat{\theta}_i}{\sum_i w_i} \]

ผลในทางปฏิบัติอ่านได้จากความกว้างของ CI โดยตรง study ที่มี CI แคบคือ study ที่มี standard error เล็ก จึงได้น้ำหนักมาก ส่วน study ที่มี CI กว้างได้น้ำหนักน้อย นี่คือข้อมูลที่การเฉลี่ยขอบ CI ทำหายไป

สำหรับ ratio measures เช่น odds ratio, risk ratio และ hazard ratio การแจกแจงของค่าดิบมีความเบ้ ทุกขั้นตอนจึงต้องทำบน log scale ตั้งแต่การหาน้ำหนักไปจนถึงการสร้างช่วง แล้วจึง exponentiate ทั้ง pooled estimate และขอบทั้งสองข้างกลับมาเป็นมาตราเดิมในขั้นสุดท้าย

สิ่งที่การวิเคราะห์ต้องการจากแต่ละ study จึงมีสองอย่างเท่านั้น คือ effect estimate และ standard error ของมัน ไม่ใช่ขอบล่างกับขอบบนเพียงอย่างเดียว Cochrane Handbook บทที่ 10 อธิบาย fixed-effect meta-analysis บนสมมติฐานนี้ และระบุข้อมูลพื้นฐานชุดเดียวกันนี้ ตัวอย่างที่ 1 ข้างล่างเดินครบทุกขั้นด้วย risk ratio สมมติสามค่า

Random-effects: ความแปรปรวนแหล่งที่สอง

ในงานวิจัยทางคลินิก สมมติฐานว่ามี true effect เพียงค่าเดียวมักไม่สมจริง ผลของยาตัวเดียวกันอาจต่างกันไปตามประเทศและโรงพยาบาล กลุ่มอายุ disease severity dose หรือ treatment protocol ระยะเวลา follow-up และ clinical setting

random-effects model จึงยอมให้แต่ละ study มี underlying effect ของตัวเอง โดยมองว่า effects เหล่านั้นถูกสุ่มมาจาก distribution เดียวกัน ความไม่แน่นอนจึงมาจากสองแหล่ง คือความแปรปรวนภายใน study และความแปรปรวนระหว่าง studies

\[ w_i^{*} = \frac{1}{SE_i^{2} + \tau^{2}} \]

ค่า $\tau^{2}$ คือ between-study variance ซึ่งวัดว่า true effect ต่างกันเองมากแค่ไหน เมื่อ $\tau^{2}$ มากกว่าศูนย์ ผลที่ตามมามีสามอย่างที่คาดเดาได้

การใช้ random-effects ไม่ได้แปลว่า heterogeneity ถูกแก้แล้ว สาเหตุทาง clinical และ methodological ที่อยู่เบื้องหลังความต่างนั้นยังต้องตรวจสอบแยกต่างหากอยู่ดี

ข้อควรระวังคือ CI รอบ pooled random-effects estimate บอกความไม่แน่นอนของค่าเฉลี่ยเท่านั้น ไม่ได้บอกว่าผลจริงในแต่ละ setting กระจายกว้างแค่ไหน

เมื่อ heterogeneity มีความหมายทางคลินิก การรายงาน prediction interval จะตอบคำถามนั้นได้ตรงกว่า เพราะมันบอกช่วงที่ true effect ของ study หรือ setting ใหม่ที่คล้ายกันน่าจะตกอยู่ ช่วงนี้จึงกว้างกว่า CI ของค่าเฉลี่ยเสมอ

prediction interval ต้องมีจำนวน studies มากพอสมควรจึงจะเชื่อถือได้ เพราะมันแบกความไม่แน่นอนของ between-study variance มาด้วย นอกเหนือจากความไม่แน่นอนของค่าเฉลี่ย เมื่อมี studies เพียงไม่กี่ชิ้น ช่วงนี้อาจออกมากว้างเกินจริงหรือแคบเกินจริงได้ จึงต้องรายงานพร้อมข้อควรระวังนี้ หรือไม่รายงานเลย

ยังมีข้อควรระวังอีกข้อหนึ่งตรงนี้ เมื่อจำนวน studies น้อยและ between-study variance มากกว่าศูนย์ ช่วงรอบค่าเฉลี่ยแบบ random-effects ที่สร้างจาก normal distribution จะแคบเกินไป ปัจจุบัน Cochrane Handbook แนะนำให้ผู้เขียนไปใช้ช่วงแบบ Hartung-Knapp-Sidik-Jonkman ในสถานการณ์นั้น ซึ่งเปลี่ยนตัวคูณจาก normal distribution ไปใช้ค่า t จึงได้ช่วงที่กว้างกว่า

ส่วนวิธีประมาณ $\tau^{2}$ นั้นมีให้เลือกหลายวิธี DerSimonian-Laird เป็นวิธีคลาสสิกที่ยังถูกใช้แพร่หลาย แต่ไม่ควรเขียนว่าเป็นมาตรฐานเพียงหนึ่งเดียว Cochrane Handbook บทที่ 10 หัวข้อ 10.10.4 ระบุว่ามีวิธีที่มี statistical properties ดีกว่าในหลายสถานการณ์

ปัจจุบัน RevMan ใช้ restricted maximum likelihood หรือ REML เป็น default ของการประมาณ between-study variance สำหรับ random-effects analysis แบบ inverse variance โดยยังคง DerSimonian-Laird ไว้เป็นตัวเลือก หากเปลี่ยน statistical method ไปเป็น Mantel-Haenszel ตัวประมาณจะย้อนกลับไปเป็น DerSimonian-Laird

เลือกโมเดลจาก estimand ไม่ใช่จาก I-squared

ข้อผิดพลาดที่พบบ่อยคือปล่อยให้ค่า I-squared เป็นคนเลือกโมเดลแทนเรา I-squared คือสัดส่วนของความแปรปรวนที่มาจากความต่างจริงระหว่าง studies ไม่ใช่จาก sampling error กฎง่าย ๆ ที่ได้ยินกันคือตั้ง threshold ของ I-squared ไว้ที่ค่าหนึ่ง แล้วใช้ fixed-effect เมื่อ I-squared ต่ำกว่า threshold และใช้ random-effects เมื่อสูงกว่า

กฎแบบนี้ง่ายเกินไป เพราะ threshold ไม่ได้ตอบคำถามทางวิทยาศาสตร์ข้อใดเลย คำถามที่ต้องตอบก่อนคือ เราเชื่อว่า studies เหล่านี้กำลังประมาณ effect เดียวกัน หรือเราสนใจค่าเฉลี่ยของ effects ที่ต่างกันได้ระหว่าง settings

คำตอบของคำถามนั้นคือ estimand และ estimand ต้องถูกเขียนลงใน analysis plan ตั้งแต่ก่อนเห็นผล heterogeneity การเลือกโมเดลหลังเห็นตัวเลขแล้ว ทำให้การเลือกขึ้นกับข้อมูลชุดนั้นโดยไม่ตั้งใจ

ยังมีเหตุผลทางสถิติเสริมอีกข้อ Cochrane Handbook บทที่ 10 เตือนว่า I-squared และ tau-squared มี uncertainty สูงมากเมื่อจำนวน studies น้อย การใช้ threshold แข็ง ๆ กับค่าที่ประมาณมาไม่แม่น จึงเป็นการตัดสินใจบนตัวเลขที่ตัวมันเองยังไม่แน่นอน

และบางครั้งคำตอบที่ถูกคือไม่ต้อง pool เลย หาก populations, interventions หรือ outcomes ต่างกันมากจนการรวมไม่มีความหมายทางคลินิก การนำเสนอผลทีละ study พร้อมคำอธิบายจะซื่อสัตย์กว่า

random-effects model ไม่สามารถเปลี่ยน studies ที่ไม่ควรถูกรวม ให้กลายเป็น studies ที่ควรรวมได้ มันเพียงเปลี่ยนคำถามที่ค่ารวมกำลังตอบ ไม่ได้ซ่อมความต่างทางคลินิกที่อยู่เบื้องหลัง

การตัดสินแบบเดียวกันนี้ใช้กับกรณีที่ไม่มีโมเดลใดซ่อมได้ คือ estimates ที่ใช้ผู้ป่วยกลุ่มเดียวกัน subgroups หลายกลุ่มของ cohort ชุดเดียว หรือ outcomes หลายตัวที่วัดจากคนกลุ่มเดิม ไม่ใช่หลักฐานที่เป็นอิสระต่อกัน การรวมค่าเหล่านั้นคือการนับผู้ป่วยกลุ่มเดิมซ้ำ และไม่ว่าจะเลือก fixed-effect หรือ random-effects ก็ไม่ได้แก้ปัญหานี้

Bootstrap: replicates จำนวนมาก แต่ CI ช่วงเดียว

bootstrap อยู่คนละโลกกับ meta-analysis ตรงที่เรามี dataset เพียงชุดเดียว ไม่ได้มีหลาย studies สิ่งที่ต้องการรู้คือความไม่แน่นอนของ statistic ตัวหนึ่งที่คำนวณจาก dataset ชุดนั้น

วิธีการคือ resample observations จากข้อมูลเดิมแบบใส่คืน คือ observation ตัวเดิมถูกหยิบซ้ำได้มากกว่าหนึ่งครั้ง แล้ว fit การวิเคราะห์เดิมซ้ำทุกรอบ ทำแบบนี้เช่น 10,000 รอบ จะได้ค่าประมาณชุดใหญ่ชุดหนึ่ง ซึ่งเรียกว่า bootstrap replicates หรือค่าประมาณที่ได้จากการ resample หนึ่งรอบ

percentile bootstrap CI อ่านค่าจาก distribution ของ replicates โดยตรง คือเรียง replicates ทั้งหมดแล้วหยิบ quantile ที่ 2.5 มาเป็นขอบล่าง และ quantile ที่ 97.5 มาเป็นขอบบน ช่วงเดียวจบ

จุดที่มักเข้าใจผิดคือ เราไม่เคยถือ CI 10,000 ช่วงแล้วเอามาเฉลี่ยกัน เราถือ replicated estimates จำนวนเท่านั้น แล้วใช้ distribution ของมันสร้าง CI เพียงช่วงเดียว นี่คือหัวใจของ percentile bootstrap

สมมติว่าด้วยข้อจำกัดของเครื่อง เรารัน bootstrap เป็นห้า batch batch ละ 2,000 replicates หากทุก batch มาจาก dataset เดิมชุดเดียวกัน ใช้ resampling scheme เดียวกัน คำนวณ statistic ตัวเดียวกัน และสุ่มด้วย random seed คนละค่า เราสามารถนำ replicates ทั้งหมดมากองรวมกันได้ seed ที่ต่างกันคือสิ่งที่ทำให้แต่ละ batch เป็นอิสระต่อกัน เพราะการรันห้าครั้งด้วย seed เดียวกันจะได้ replicates ชุดเดิมซ้ำกันห้าชุด จากนั้นจึงคำนวณ quantiles ใหม่เพียงครั้งเดียวจากกองที่รวมแล้ว

แต่สิ่งที่ทำอยู่นั้นควรเรียกว่าการรวม bootstrap replicates ไม่ใช่การ pool bootstrap CI หลายช่วง ชื่อที่เรียกสำคัญ เพราะมันบอกว่าวัตถุที่ถูกรวมคือ replicates ไม่ใช่ขอบของช่วง

สุดท้าย percentile ไม่ใช่วิธีสร้าง bootstrap CI เพียงวิธีเดียว ยังมี basic bootstrap CI, studentized CI, bias-corrected CI และ BCa interval ซึ่งเป็นช่วงที่แก้ทั้ง bias และการที่ variance เปลี่ยนไปตามค่าประมาณ ชื่อของแต่ละวิธีบอกว่ามันเพิ่มการแก้แบบใดเข้าไปในขอบแบบ percentile คือการสะท้อน replicates กลับรอบค่าประมาณ การหารด้วย standard error ของ replicate แต่ละตัว หรือการเลื่อนขอบเพื่อแก้ bias

ในหลายสถานการณ์ BCa ให้ coverage ที่ดีกว่า คือช่วงของมันครอบคลุมค่าจริงได้บ่อยตามสัดส่วนที่อ้างไว้ การเลือก percentile จึงเป็นการเลือก ไม่ใช่ค่า default สากล แต่ BCa ก็ไม่ใช่ตัวเลือกที่ปลอดภัยกว่าโดยอัตโนมัติ เพราะมันต้องใช้ replicates จำนวนมาก และต้องการ statistic ที่ค่อนข้างเรียบ

Multiple imputation: Rubin's rules

multiple imputation คือการเติมค่าที่ขาดหายด้วยค่าที่สุ่มจากโมเดลการเติม แล้วทำซ้ำหลายครั้งจนได้ imputed datasets จำนวน m ชุด แต่ละชุดสมบูรณ์ในตัวเอง แต่ต่างกันตรงค่าที่ถูกเติมเข้าไป สูตรที่ตามมาใช้ได้ก็ต่อเมื่อโมเดลการเติมนั้นสมเหตุสมผล และข้อมูลถือเป็น missing at random (คือ การที่ค่าหนึ่งจะหายไปหรือไม่ ขึ้นกับค่าอื่นที่เราสังเกตได้เท่านั้น ไม่ได้ขึ้นกับค่าที่หายไปเอง) เมื่อกำหนดตัวแปรที่อยู่ในโมเดลนั้น

จากนั้น fit โมเดลวิเคราะห์เดิมในทุกชุด จะได้ estimate กับ variance ชุดละหนึ่งคู่ Rubin's rules คือชุดสูตรที่รวมคู่เหล่านั้นให้เหลือคำตอบเดียว

ขั้นแรกคือ pooled estimate ซึ่งเป็นค่าเฉลี่ยธรรมดาของ estimates ทั้ง m ค่า ไม่มีการถ่วงน้ำหนัก เพราะทุก imputation มาจาก dataset เดียวกันและมีสถานะเท่ากัน

ขั้นที่สองคือ within-imputation variance ซึ่งเป็นค่าเฉลี่ยของ variance ทั้ง m ค่า ส่วนนี้แทน sampling error ตามปกติ คือความไม่แน่นอนที่จะมีอยู่แล้วแม้ข้อมูลจะครบ

ขั้นที่สามคือ between-imputation variance ซึ่งวัดว่า estimate ขยับไปมาแค่ไหนระหว่างชุด ค่านี้คือราคาของการที่ข้อมูลบางส่วนไม่ได้ถูกสังเกตจริง total variance จึงเป็นผลบวกของสองส่วนนี้ พร้อมตัวปรับสำหรับการมี imputations จำนวนจำกัด

\[ T = \bar{U} + \left(1 + \frac{1}{m}\right) B \]

โมเดลการเติมยังต้องเป็น proper คือค่าที่เติมแต่ละค่าต้องมี random noise เพิ่มเข้ามาสะท้อนความไม่แน่นอนจริง ไม่ใช่แค่ค่าที่ดูสมเหตุสมผลค่าเดียว และต้องเข้ากันได้กับโมเดลวิเคราะห์ด้วย โมเดลการเติมที่ตัดตัวแปร outcome ออกไป หรือที่ไม่มี interaction ซึ่งโมเดลวิเคราะห์มีอยู่ จะให้ pooled variance ที่ลำเอียง เราจึงต้องสร้างโมเดลการเติมโดยมีโมเดลวิเคราะห์อยู่ในมือแล้ว และหากการขาดหายขึ้นกับค่าที่ไม่ได้ถูกสังเกตเอง ไม่มีสูตร pooling ใดแก้ได้

pooled standard error คือรากที่สองของ T แล้วจึงสร้าง CI จาก pooled estimate กับ pooled standard error ชุดนี้ inference ของ multiple imputation ยังต้องใช้ degrees of freedom ที่เหมาะสมด้วย ซึ่งเป็นตัวเลขที่กำหนดว่าตัวคูณ t ต้องกว้างแค่ไหน Barnard และ Rubin เสนอรูปแบบสำหรับ sample ขนาดเล็ก ซึ่งจะสำคัญเมื่อ m น้อยหรือสัดส่วนข้อมูลที่ขาดสูง

เมื่อผลลัพธ์ที่ต้องการเป็น odds ratio ให้ pool ที่ระดับ regression coefficient บน log odds scale ก่อนเสมอ log odds scale ก็คือ natural logarithm ของ odds ซึ่งเป็นค่าที่ coefficient ของ logistic regression รายงานออกมาอยู่แล้ว แล้วจึง exponentiate ค่าที่รวมแล้วและขอบทั้งสองข้างกลับมาเป็น odds ratio

สิ่งที่ห้ามทำมีสองอย่าง คือรายงานผลจาก imputed dataset เพียงชุดเดียว เพราะมันซ่อนความไม่แน่นอนที่การ impute สร้างขึ้น และการเฉลี่ยขอบ CI จากหลายชุด ตัวอย่างที่ 2 เดินครบทุกขั้นด้วยตัวเลข

เมื่อมีแค่ effect estimate กับ CI ที่ตีพิมพ์

ในหลายบทความเราไม่มี raw data และไม่มี standard error รายงานไว้ มีเพียง effect estimate กับขอบล่างและขอบบนของ confidence interval เท่านั้น กรณีนี้ยังทำ meta-analysis ได้ ถ้ายอมสมมติเพิ่มอีกหนึ่งข้อ

ข้อสมมตินั้นคือ normal approximation ใช้ได้ กล่าวคือช่วงที่ตีพิมพ์ถูกสร้างแบบสมมาตรรอบ estimate บนมาตราที่ใช้วิเคราะห์ ด้วย critical value จาก normal distribution critical value คือตัวคูณที่เอาไปคูณกับ standard error เพื่อให้ได้ขอบของช่วง

เมื่อสมมติฐานนั้นใช้ได้ standard error จะถูกคำนวณกลับมาจากความกว้างของช่วงได้โดยตรง สำหรับ additive effect measures เช่น mean difference หรือ risk difference สูตรคือความกว้างของช่วงหารด้วยสองเท่าของ critical value จาก normal distribution นั่นคือหารด้วย 3.92

\[ SE \approx \frac{U - L}{3.92} \]

สำหรับ ratio measures เช่น risk ratio, odds ratio และ hazard ratio ต้องย้ายไปทำบน log scale ก่อน คือแทน $U$ และ $L$ ด้วย $\ln(U)$ และ $\ln(L)$ ในสูตรเดียวกัน ขั้นที่ 2 ของตัวอย่างข้างล่างใช้สูตรนี้กับ studies ทั้งสาม

เมื่อได้ standard error กลับมาแล้ว ทุกอย่างก็กลับเข้าสู่เส้นทางปกติ คือ inverse-variance weighting แล้วเลือกโมเดลตาม estimand ขอบ CI ที่ตีพิมพ์ไว้จึงพา standard error มาด้วยอยู่แล้ว เพียงแต่ต้องอ่านมันออกมาให้ถูกมาตรา

ข้อควรระวังคือสูตรนี้เป็นการประมาณ และมันพลาดได้สองทาง ทางแรกคือช่วงอาจไม่สมมาตรบนมาตราที่ใช้ เช่นมาจาก exact method ซึ่งคำนวณขอบจากความน่าจะเป็นที่แน่นอน ไม่ใช่จากโค้ง normal ทางที่สองคือช่วงอาจสมมาตรแต่ถูกสร้างด้วย critical value จาก t distribution แทนที่จะเป็น 1.96 ซึ่งเป็นสิ่งที่ trial ขนาดเล็กทำ การหารด้วย 3.92 ในกรณีนั้นจะให้ standard error ที่เล็กเกินจริง และทำให้ study นั้นได้น้ำหนักมากเกินไป

ตัวหารนี้ยังเป็นของระดับ 95% เท่านั้น ช่วงระดับ 90% จึงต้องหารด้วย 3.29 แทน เมื่อเจอปัญหาข้อใดข้อหนึ่ง ควรกลับไปขอ standard error หรือ raw data จากผู้เขียนต้นทาง

ห้าทางที่ pooled CI จะผิด

  • เฉลี่ยขอบล่างและขอบบนของ CI

    ค่าเฉลี่ยของขอบล่างหลายค่าไม่ได้เป็นขอบล่างของอะไรเลย เพราะแต่ละ study มี variance ไม่เท่ากัน

    วิธีแก้: คำนวณ standard error ของแต่ละค่ากลับมาก่อน แล้วจึงถ่วงน้ำหนักด้วย inverse variance

  • รวม ratio measures บน original scale

    การแจกแจงของตัวประมาณแบบ ratio มีความเบ้ น้ำหนักและ CI ที่สร้างบนค่า ratio ดิบจึงไม่ถูกต้อง

    วิธีแก้: pool บน log scale แล้วจึง exponentiate ทั้ง pooled estimate และขอบทั้งสองข้าง

  • ปล่อยให้ I-squared เป็นคนเลือกโมเดล

    การตั้ง threshold ของ I-squared ไม่ได้ตอบคำถามทางวิทยาศาสตร์ใด และ I-squared ยังมีความแม่นต่ำเมื่อมี studies น้อย

    วิธีแก้: เลือกโมเดลจาก estimand ตั้งแต่ก่อนเห็นค่า heterogeneity

  • รวม bootstrap CI ห้าช่วงเข้าด้วยกัน

    replicates ห้า batch ให้ distribution เดียว ไม่ใช่ CI ห้าช่วงที่เอามาเฉลี่ยกัน

    วิธีแก้: นำ replicates มากองรวมกัน แล้วคำนวณ quantiles เพียงครั้งเดียว

  • รายงานผลจาก imputed dataset เดียว

    imputed dataset เดียวซ่อนความไม่แน่นอนที่เกิดจากการ impute เอาไว้

    วิธีแก้: fit โมเดลในทุก imputed dataset แล้วจึงรวมผลด้วย Rubin's rules

ตัวอย่างที่ 1: สาม studies แบบ fixed-effect และ random-effects

ตัวอย่างนี้ใช้สาม studies สมมติจากต้นฉบับ ทุกค่ารายงานเป็น risk ratio พร้อม 95% CI และไม่มีค่าใดมาจากการศึกษาจริง

  • Study A: RR 0.80 (0.70 ถึง 0.91)
  • Study B: RR 0.92 (0.71 ถึง 1.19)
  • Study C: RR 0.77 (0.72 ถึง 0.83)

Study C มีช่วงแคบที่สุด จึงมี precision สูงที่สุด และจะได้น้ำหนักมากที่สุดภายใต้ fixed-effect model ส่วน Study B มีช่วงกว้างที่สุดและจะได้น้ำหนักน้อยที่สุด

ขั้นตอนข้างล่างเดินจาก risk ratio ที่ตีพิมพ์ ไปจนถึง pooled estimate ทั้งแบบ fixed-effect และ random-effects ทุกบรรทัดคำนวณซ้ำได้ด้วยเครื่องคิดเลข ค่าระหว่างทางถูกปัดที่ทศนิยมสี่ตำแหน่ง และปัดที่สองตำแหน่งเมื่อแปลงกลับเป็น risk ratio

  1. ขั้นที่ 1 ย้ายไปทำงานบน log scale

    \[ \ln(0.80) = -0.2231, \; \ln(0.92) = -0.0834, \; \ln(0.77) = -0.2614 \]

    risk ratio มีการแจกแจงเบ้ ทุกขั้นตอนจึงทำบน log scale แล้วค่อยแปลงกลับตอนท้าย

  2. ขั้นที่ 2 คำนวณ standard error ของแต่ละ study กลับมาจาก CI

    \[ SE_{\log} = \frac{\ln(U) - \ln(L)}{3.92} \Rightarrow 0.0669, \; 0.1317, \; 0.0363 \]

    ช่วงที่รายงานไว้พา standard error มาด้วยอยู่แล้ว เมื่ออ่านบน log scale

  3. ขั้นที่ 3 สร้าง inverse-variance weights

    \[ w_i = \frac{1}{SE_i^2} \Rightarrow w_A = 223.43, \; w_B = 57.65, \; w_C = 758.90, \; \sum w_i = 1039.98 \]

    study C ถือน้ำหนัก 72.97 เปอร์เซ็นต์ ส่วน study B มีเพียง 5.54 เปอร์เซ็นต์ น้ำหนักแต่ละค่าคำนวณจาก standard error ที่ปัดเป็นทศนิยมสี่ตำแหน่งตามที่พิมพ์ไว้ข้างบน หากใช้ความละเอียดเต็ม น้ำหนักจะขยับที่หลักที่สาม แต่ pooled risk ratio และช่วงของมันไม่เปลี่ยน

  4. ขั้นที่ 4 รวมค่า log risk ratio

    \[ \hat{\theta}_{FE} = \frac{-253.0317}{1039.98} = -0.2433 \]

    ค่าเฉลี่ยถ่วงน้ำหนักของ log risk ratio ทั้งสามค่าคือ pooled estimate แบบ fixed-effect

  5. ขั้นที่ 5 หา standard error และ CI ของ pooled estimate

    \[ SE = \frac{1}{\sqrt{1039.98}} = 0.0310, \; -0.2433 \pm 1.96 \times 0.0310 = (-0.3041, \; -0.1825) \]

    standard error ของ pooled estimate มาจากผลรวมของน้ำหนัก ไม่ได้มาจาก study ใด study หนึ่ง

  6. ขั้นที่ 6 แปลงผลแบบ fixed-effect กลับ

    \[ e^{-0.2433} = 0.78, \; e^{-0.3041} = 0.74, \; e^{-0.1825} = 0.83 \]

    ผลแบบ fixed-effect: RR 0.78, 95% CI 0.74 ถึง 0.83

  7. ขั้นที่ 7 ถามว่า studies ต่างกันจริงแค่ไหน

    \[ Q = 1.8138, \; df = 2 \Rightarrow \hat{\tau}^2_{DL} = 0 \]

    Q คือ Cochran's heterogeneity statistic ซึ่งเทียบความกระจายที่เห็นจริงระหว่าง studies กับความกระจายที่เกิดจาก sampling error เพียงอย่างเดียว ในที่นี้ค่า Q ต่ำกว่า degrees of freedom ของมัน ตัวประมาณแบบคลาสสิกจึงถูกตัดลงมาเหลือ between-study variance เท่ากับ 0 นี่คือค่าที่ขอบ ไม่ใช่หลักฐานว่า true effect เท่ากันจริง เมื่อมี studies เพียงสามชิ้น ค่าประมาณที่เป็นศูนย์ยังเข้ากันได้กับ heterogeneity ที่มีอยู่จริง และโมเดลถูกเลือกจาก estimand ตั้งแต่ก่อนเห็นตัวเลขนี้

  8. ขั้นที่ 8 กำหนด between-study variance เพื่อดูผล

    \[ w_i^{*} = \frac{1}{SE_i^2 + 0.01} \Rightarrow 69.08, \; 36.57, \; 88.36, \; \sum w_i^{*} = 194.01 \]

    ลองกำหนด tau-squared เท่ากับ 0.01 ด้วยมือ เพื่อดูว่า heterogeneity จริงจะทำอะไรกับน้ำหนัก

  9. ขั้นที่ 9 รวมค่าใหม่แบบ random-effects

    \[ \hat{\theta}_{RE} = \frac{-41.5590}{194.01} = -0.2142, \; SE = 0.0718, \; -0.2142 \pm 1.96 \times 0.0718 = (-0.3549, \; -0.0735) \]

    น้ำหนักกระจายไปยัง studies ที่เล็กกว่า study C ลดจาก 72.97 เหลือ 45.54 เปอร์เซ็นต์

  10. ขั้นที่ 10 แปลงผลแบบ random-effects กลับ

    \[ e^{-0.2142} = 0.81, \; e^{-0.3549} = 0.70, \; e^{-0.0735} = 0.93 \]

    ผลแบบ random-effects ด้วยค่าที่สมมติขึ้น: RR 0.81, 95% CI 0.70 ถึง 0.93

  11. ขั้นที่ 11 ช่วงที่ปลอดภัยกว่าเมื่อมี studies น้อย

    \[ SE_{HK} = \sqrt{\frac{1}{k-1} \cdot \frac{\sum_i w_i^{*} (\hat{\theta}_i - \hat{\theta}_{RE})^{2}}{\sum_i w_i^{*}}} = 0.0462, \; -0.2142 \pm 4.3027 \times 0.0462 = (-0.4130, \; -0.0154) \]

    เมื่อมี studies เพียงสามชิ้น การใช้ critical value จาก normal distribution ทำให้ช่วง random-effects แคบเกินไป ช่วงแบบ Hartung-Knapp-Sidik-Jonkman ใช้ค่า t ที่ degrees of freedom เท่ากับ k ลบ 1 แทน เมื่อแปลงกลับจะได้ RR 0.81, 95% CI 0.66 ถึง 0.98 ซึ่งเป็นค่าที่ควรรายงานมากกว่าในกรณีนี้

ผลลัพธ์: Fixed-effect ให้ RR 0.78, 95% CI 0.74 ถึง 0.83 เมื่อกำหนด tau-squared เท่ากับ 0.01 แบบ random-effects จะได้ RR 0.81, 95% CI 0.70 ถึง 0.93 และช่วงแบบ Hartung-Knapp-Sidik-Jonkman จากตัวเลขชุดเดียวกันคือ RR 0.81, 95% CI 0.66 ถึง 0.98

risk ratio ทั้งสามค่าเป็น studies ตัวอย่างจากต้นฉบับ และค่า 0.01 เป็นค่าที่กำหนดขึ้นเอง ไม่ได้ประมาณจากข้อมูลจริง ค่าของ Hartung-Knapp คำนวณจากน้ำหนักที่ปัดแล้วชุดเดียวกับขั้นตอนข้างบน

ตัวอย่างที่ 2: Rubin's rules กับ imputed datasets ห้าชุด (ข้อมูลสังเคราะห์)

ตัวเลขในตัวอย่างนี้เป็นข้อมูลสังเคราะห์ ถูกแต่งขึ้นสำหรับบทความนี้โดยเฉพาะ ไม่ได้มาจากชุดข้อมูลหรือการศึกษาใดจริง

โจทย์คือ dataset หนึ่งชุดที่มีข้อมูลขาด ถูกเติมด้วย multiple imputation จนได้ imputed datasets จำนวน m เท่ากับ 5 ชุด แล้ว fit logistic regression ตัวเดียวกันในทุกชุด ผลที่ได้จึงเป็น regression coefficient บน log odds scale ชุดละหนึ่งค่า พร้อม standard error ของมัน

ขั้นตอนข้างล่างเดินจาก coefficient ทั้งห้าค่า ไปจนถึง odds ratio ที่รวมแล้วและช่วงของมัน ทุกบรรทัดคำนวณซ้ำได้ด้วยเครื่องคิดเลข และค่าที่แสดงถูกปัดตามจำนวนตำแหน่งที่เขียนไว้ในแต่ละขั้น

  1. ขั้นที่ 1 เก็บค่าประมาณจากแต่ละ imputation

    \[ \beta_j = 0.42, \; 0.51, \; 0.38, \; 0.47, \; 0.44 \]

    imputed datasets ห้าชุดให้ค่า log odds ห้าค่าจากโมเดล logistic เดียวกัน

  2. ขั้นที่ 2 ยกกำลังสองของ standard error แต่ละค่า

    \[ SE_j = 0.18, \; 0.19, \; 0.17, \; 0.20, \; 0.18 \Rightarrow U_j = 0.0324, \; 0.0361, \; 0.0289, \; 0.0400, \; 0.0324 \]

    แต่ละ imputation รายงาน standard error ของตัวเอง และค่ายกกำลังสองคือ variance ของ imputation นั้น

  3. ขั้นที่ 3 เฉลี่ยค่าประมาณ

    \[ \bar{Q} = \frac{0.42 + 0.51 + 0.38 + 0.47 + 0.44}{5} = 0.444 \]

    pooled log odds คือค่าเฉลี่ยธรรมดาของค่าประมาณทั้งห้าค่า

  4. ขั้นที่ 4 within-imputation variance

    \[ \bar{U} = \frac{0.1698}{5} = 0.03396 \]

    within-imputation variance คือค่าเฉลี่ยของ variance ทั้งห้าค่า ซึ่งเป็น sampling error ตามปกติ

  5. ขั้นที่ 5 between-imputation variance

    \[ B = \frac{0.00972}{5 - 1} = 0.00243 \]

    between-imputation variance วัดว่าคำตอบขยับไปเท่าไรเพราะข้อมูลถูก impute ขึ้นมา

  6. ขั้นที่ 6 total variance

    \[ T = 0.03396 + \left(1 + \frac{1}{5}\right) \times 0.00243 = 0.036876 \]

    ตัวปรับ 1 บวก 1 ส่วน 5 คือราคาของการมี imputations จำนวนจำกัด

  7. ขั้นที่ 7 standard error ของ pooled estimate

    \[ SE_{pooled} = \sqrt{0.036876} = 0.1920 \]

    standard error ของ pooled estimate ใหญ่กว่า standard error ของ imputation ชุดใดชุดหนึ่ง

  8. ขั้นที่ 8 relative increase in variance

    \[ r = \frac{\left(1 + \frac{1}{5}\right) \times 0.00243}{0.03396} = \frac{0.002916}{0.03396} = 0.0859 \]

    relative increase in variance เขียนแทนด้วย r บอกว่า imputations ทำให้ variance ใหญ่ขึ้นเท่าไร ค่านี้คือ between-imputation variance ที่คูณตัวปรับสำหรับ m จำกัดแล้ว หารด้วย within-imputation variance เมื่อปัดเป็นสามตำแหน่ง ค่านี้ก็คือ 0.086 ที่อ้างถึงในหมายเหตุท้ายตัวอย่าง

  9. ขั้นที่ 9 degrees of freedom สำหรับค่า t

    \[ \mathrm{df} = (5 - 1)\left(1 + \frac{1}{0.0859}\right)^2 \approx 639 \]

    สูตรคลาสสิกของ Rubin สำหรับ degrees of freedom ใช้เพียง r และจำนวน imputations เท่านั้น degrees of freedom 639 ถือว่ามากพอ ค่า t จึงปัดได้เป็น 1.96 สูตรนี้ถือว่า complete-data degrees of freedom มีค่ามาก และตัวอย่างสังเคราะห์นี้ไม่ได้กำหนดขนาดของ sample ไว้ รูปแบบของ Barnard และ Rubin ถูกจำกัดด้วยตัวเลขชุดนั้น จึงให้ค่าน้อยกว่าและช่วงที่กว้างขึ้นเล็กน้อย

  10. ขั้นที่ 10 สร้าง CI บน log odds scale

    \[ 0.444 \pm 1.96 \times 0.1920 = (0.0677, \; 0.8203) \]

    ช่วงนี้คือ pooled log odds บวกลบ 1.96 เท่าของ pooled standard error

  11. ขั้นที่ 11 แปลงกลับเป็น odds ratio

    \[ OR = e^{0.444} = 1.56, \; 95\% \text{ CI} = (e^{0.0677}, \; e^{0.8203}) = (1.07, \; 2.27) \]

    exponentiate ค่า pooled log odds และขอบทั้งสองข้าง ไม่ใช่แปลง odds ratio ทั้งห้าค่าแยกกัน

ผลลัพธ์: Pooled OR 1.56, 95% CI 1.07 ถึง 2.27 จาก within-imputation variance 0.03396 และ between-imputation variance 0.00243

ค่าทั้งห้านี้เป็นข้อมูลสังเคราะห์ที่เขียนขึ้นสำหรับบทความนี้ เพื่อให้ตรวจสอบทุกขั้นตอนด้วยมือได้ relative increase in variance ในตัวอย่างนี้เท่ากับ 0.086 fraction of missing information จึงอยู่ราว 8 เปอร์เซ็นต์ และ imputations ห้าชุดก็เพียงพอ สัดส่วนนี้คือส่วนแบ่งของความไม่แน่นอนในคำตอบที่เกิดจากข้อมูลที่ขาดหายไป แต่เมื่อสัดส่วนนั้นขึ้นไปถึง 30 หรือ 40 เปอร์เซ็นต์ ห้าชุดจะน้อยเกินไปมาก กฎที่ใช้กันคือกำหนด m อย่างน้อยหนึ่งร้อยเท่าของสัดส่วนนั้น

เลื่อน tau-squared ขึ้นจาก 0 study C จะคืนน้ำหนักให้ studies ที่เล็กกว่า และ pooled CI จะกว้างขึ้น

ศัพท์ที่ใช้ข้างบน

estimand (ปริมาณเป้าหมายที่ต้องการประมาณ)
ปริมาณที่การวิเคราะห์ตั้งใจจะประมาณ ซึ่งต้องระบุก่อนจะ fit โมเดลใด ๆ
sampling error (ความคลาดเคลื่อนจากการสุ่มตัวอย่าง)
ความแปรปรวนแบบสุ่มของค่าประมาณ ซึ่งเกิดจากการที่เราสุ่มผู้ป่วยมาได้จำนวนจำกัดเท่านั้น
inverse-variance weighting (การถ่วงน้ำหนักด้วยส่วนกลับของความแปรปรวน)
การให้น้ำหนักแต่ละ study ด้วย 1 หารด้วย standard error ยกกำลังสอง study ที่แม่นกว่าจึงมีน้ำหนักมากกว่า
tau-squared (ความแปรปรวนระหว่างการศึกษา)
between-study variance คือความแปรปรวนของ true effect ระหว่าง studies
I-squared (สัดส่วนความแปรปรวนที่มาจาก heterogeneity)
สัดส่วนของความแปรปรวนทั้งหมดที่มาจากความต่างระหว่าง studies ไม่ใช่จาก sampling error
REML (วิธีประมาณความแปรปรวนแบบ restricted maximum likelihood)
Restricted maximum likelihood วิธีประมาณ between-study variance และเป็นค่า default ปัจจุบันของ RevMan สำหรับ random-effects analysis แบบ inverse variance
bootstrap replicate (ค่าประมาณจากการ resample หนึ่งรอบ)
ค่าประมาณหนึ่งค่าที่ได้จากการ resample ข้อมูลเดิมหนึ่งรอบ ทำซ้ำหลายพันรอบ
BCa interval (ช่วงความเชื่อมั่นแบบ bias-corrected and accelerated)
ช่วงความเชื่อมั่นแบบ bootstrap ที่แก้ทั้ง bias และการเปลี่ยนแปลงของ variance ตามค่าประมาณ
missing at random (ข้อมูลหายแบบสุ่มเมื่อกำหนดค่าที่สังเกตได้แล้ว)
การที่ค่าหนึ่งจะหายไปหรือไม่ ขึ้นกับค่าอื่นที่ถูกสังเกตไว้แล้วเท่านั้น ไม่ได้ขึ้นกับค่าที่หายไปเอง
Rubin's rules (กฎของ Rubin สำหรับรวมผลจาก multiple imputation)
ชุดสูตรที่รวม estimates จาก imputed datasets โดยบวกทั้ง within-imputation และ between-imputation variance
fraction of missing information (สัดส่วนของสารสนเทศที่สูญไปกับข้อมูลที่ขาดหาย)
ส่วนแบ่งของความไม่แน่นอนในคำตอบที่รวมแล้ว ซึ่งเกิดจากข้อมูลที่ขาดหายไป และเป็นตัวเลขที่ใช้ตัดสินว่าต้องทำ imputations กี่ชุดจึงจะพอ
prediction interval (ช่วงทำนายสำหรับการศึกษาใหม่)
ช่วงที่คาดว่า true effect ของ study ใหม่ที่คล้ายกันจะตกอยู่ กว้างกว่า confidence interval และเชื่อถือได้ก็ต่อเมื่อจำนวน studies ไม่น้อยเกินไป

เอกสารอ้างอิง

  1. Higgins JPT, Thomas J, Chandler J, Cumpston M, Li T, Page MJ, Welch VA, editors. Cochrane Handbook for Systematic Reviews of Interventions version 6.5, chapter 10: analysing data and undertaking meta-analyses. Cochrane, 2024. https://www.cochrane.org/authors/handbooks-and-manuals/handbook/current/chapter-10
  2. Cochrane. Pre-define analyses. RevMan Knowledge Base. https://documentation.cochrane.org/revman-kb/pre-define-analyses-260702251.html
  3. DerSimonian R, Laird N. Meta-analysis in clinical trials. Controlled Clinical Trials 1986;7:177 to 188. https://doi.org/10.1016/0197-2456(86)90046-2
  4. Veroniki AA, Jackson D, Viechtbauer W, et al. Methods to estimate the between-study variance and its uncertainty in meta-analysis. Research Synthesis Methods 2016;7:55 to 79. https://doi.org/10.1002/jrsm.1164
  5. IntHout J, Ioannidis JPA, Borm GF. The Hartung-Knapp-Sidik-Jonkman method for random effects meta-analysis is straightforward and considerably outperforms the standard DerSimonian-Laird method. BMC Medical Research Methodology 2014;14:25. https://doi.org/10.1186/1471-2288-14-25
  6. Efron B. Better bootstrap confidence intervals. Journal of the American Statistical Association 1987;82:171 to 185. https://doi.org/10.1080/01621459.1987.10478410
  7. Rubin DB. Multiple Imputation for Nonresponse in Surveys. New York: Wiley, 1987. https://doi.org/10.1002/9780470316696
  8. Barnard J, Rubin DB. Small-sample degrees of freedom with multiple imputation. Biometrika 1999;86:948 to 955. https://doi.org/10.1093/biomet/86.4.948

ประเด็นสำคัญ

  • pool ตัว effect estimates พร้อม variance ไม่ใช่เอาขอบล่างและขอบบนของ confidence interval มาเฉลี่ยกัน
  • ระบุ estimand ก่อน: fixed-effect ถามถึง common effect ค่าเดียว ส่วน random-effects ถามถึงค่าเฉลี่ยของ effects ข้าม studies
  • random-effects model ไม่ได้ซ่อม heterogeneity จึงต้องตรวจ clinical และ methodological heterogeneity แยกต่างหาก
  • Bootstrap สร้าง CI เพียงช่วงเดียวจาก distribution ของ replicates การรวมหลาย batch จึงเป็นการรวม replicates ไม่ใช่รวม CI
  • หลังทำ multiple imputation ต้องรวมทั้ง within-imputation และ between-imputation variance ด้วย Rubin's rules ก่อนจึงสร้าง CI

อ่านต่อในวิกิ: [[multiple-imputation-clinical-research]] [[robust-meta-analysis-methods]] [[standard-deviation-sd-standard-error-se-and-confidence-intervals-ci-in-clinical-research]] [[classic-mape-mean-absolute-prediction-error-and-bootstrap-internal-validation]]

0
ถึงนักอ่านชาวไทยและต่างชาติทำความเข้าใจบริบททางการแพทย์ของผมอ่านต่อ →ถึงนักอ่านชาวไทยและต่างชาติทำความเข้าใจเนื้อหาของผมที่นอกเหนือจากการแพทย์อ่านต่อ →

ความคิดเห็น

ยังไม่มีความคิดเห็น มาเป็นคนแรกกันเลย

เข้าสู่ระบบเพื่อแสดงความคิดเห็น