ไวยากรณ์สำหรับเลือกแบบจำลอง: ห้าคำถามก่อนพิมพ์คำสั่งใด ๆ

Clinical Epidemiology ResearchMethodology and Research Design THUniqcret doctor knowledges TH
ไวยากรณ์สำหรับเลือกแบบจำลอง: ห้าคำถามก่อนพิมพ์คำสั่งใด ๆ
On this page

Read the English version

บทคัดย่อ

ผู้วิจัยมักเลือกแบบจำลองถดถอยจากชื่อ แต่ลักษณะห้าอย่างของการศึกษาช่วยจำกัดทางเลือกได้ก่อนพิมพ์คำสั่งใด ๆ ไวยากรณ์นี้อ่านได้ว่า ผลลัพธ์ (outcome) + ตัวหารหรือเวลา (denominator/time) + ความไม่เป็นอิสระ (dependence) + ปริมาณเป้าหมายของการประมาณ (estimand) + โครงสร้างพิเศษ (special structure) = การวิเคราะห์ ผลลัพธ์อาจเป็นค่าต่อเนื่อง ค่าสองกลุ่ม ค่าเรียงลำดับ จำนวนนับ หรือเวลาจนเกิดเหตุการณ์ ตัวหารกำหนดว่านับเหตุการณ์ต่อผู้ป่วยหนึ่งคน ณ ขอบเขตเวลาคงที่ ต่อหนึ่งหน่วยเวลาติดตามสะสม (person-time) หรือนับเป็นเวลาจนเกิดเหตุการณ์ ความไม่เป็นอิสระถามว่าแถวข้อมูลเป็นอิสระต่อกัน หรืออยู่ในกลุ่มย่อย (cluster) การวัดซ้ำ หรือชุดที่จับคู่ ปริมาณเป้าหมายระบุการเปรียบเทียบ มาตรวัดผล และประชากร โครงสร้างพิเศษครอบคลุมการเซ็นเซอร์ เหตุการณ์แข่งขัน ความแปรปรวนเกิน ศูนย์ส่วนเกิน ความไม่เป็นเส้นตรง และการปรับผล ในตัวอย่างคำนวณด้วยมือ การนอนโรงพยาบาล 24 ครั้งใน 1,200 คน-ปี (person-years) เทียบกับ 40 ครั้งใน 1,000 คน-ปี ให้อัตราส่วนอัตราอุบัติการณ์ (rate ratio) เท่ากับ 0.50 ส่วนการเทียบจำนวนนับดิบให้ 0.60 บทความนี้สรุปว่าไวยากรณ์ช่วยจำกัดทางเลือกให้เหลือแบบจำลองที่ตอบคำถามได้ ส่วนการเลือกตัวแปรร่วมและการตรวจข้อสมมติยังเป็นหน้าที่ของผู้วิเคราะห์


ภาพสรุป ข้อมูลจำลอง

ที่ประชุมร่างโปรโตคอลที่เริ่มด้วยชื่อแบบจำลอง

ทีมวิจัยกำลังร่างโปรโตคอลของการศึกษาการกลับเข้านอนโรงพยาบาลในผู้ป่วยหัวใจล้มเหลว ก่อนที่ใครจะระบุว่าจะวัดอะไร แพทย์ประจำบ้านคนหนึ่งเสนอ logistic regression ผู้เชี่ยวชาญด้านระเบียบวิธีขอให้ตกลงห้าเรื่องก่อน

ผลลัพธ์คือจำนวนครั้งที่นอนโรงพยาบาลต่อผู้ป่วยหนึ่งคน โดยระยะเวลาติดตามต่างกันในแต่ละคน ผู้ป่วยมาจากหลายโรงพยาบาล ทีมต้องการอัตราส่วนของอัตราการนอนโรงพยาบาล (rate ratio) และการติดตามสิ้นสุดเมื่อผู้ป่วยเสียชีวิต

คำตอบเหล่านี้ชี้ไปที่แบบจำลองสำหรับข้อมูลนับที่ใช้เวลาติดตามสะสม (person-time) คือเวลาติดตามของผู้ป่วยทุกคนรวมกัน เป็นตัวหาร และต้องคำนึงถึงผู้ป่วยที่มาจากโรงพยาบาลเดียวกัน การเสียชีวิตทำให้เวลาติดตามของผู้ป่วยสิ้นสุด และโปรแกรมที่เปลี่ยนการรอดชีวิตอาจเปลี่ยนว่าใครยังเสี่ยงต่อการนอนโรงพยาบาล จึงมักรายงานจำนวนผู้เสียชีวิตควบคู่กับ rate ratio ส่วน logistic regression จะตอบคำถามอีกแบบ คือออดส์ของการนอนโรงพยาบาลอย่างน้อยหนึ่งครั้งภายในวันที่กำหนด

ไวยากรณ์ในบรรทัดเดียว

เมื่อเขียนเป็นบรรทัดเดียว ประเด็นทั้งห้ากลายเป็นไวยากรณ์ที่ช่วยจำกัดทางเลือกของแบบจำลอง

หนึ่งตระกูลแบบจำลองเบื้องหลังทางเลือกมากมาย

แบบจำลองจำนวนมากที่เติมช่องเหล่านี้ได้เป็นแบบจำลองเชิงเส้นวางนัยทั่วไป (generalized linear model, GLM) หรือส่วนขยายของมัน [1] ตระกูล GLM รวมการถดถอยเชิงเส้น (linear regression) logistic regression และPoisson regression ซึ่งเป็นแบบจำลองสำหรับข้อมูลนับ GLM แต่ละแบบจับคู่การแจกแจงของผลลัพธ์ เรียกว่า family กับสเกลที่ตัวแปรร่วมออกฤทธิ์ เรียกว่า link (ฟังก์ชันเชื่อมโยง) การที่สองสิ่งนี้กำหนดมาตรวัดผลและค่าคลาดเคลื่อนมาตรฐานอย่างไรเป็นเรื่องของตอนที่ 2

ผลลัพธ์: ชนิดของการวัด

คลินิกหัวใจล้มเหลวแห่งหนึ่งบันทึกผลลัพธ์ได้ห้าชนิด NT-proBNP ซึ่งเป็นสารในเลือดที่บอกว่าหัวใจรับภาระมากเพียงใด เป็นค่าต่อเนื่อง การนอนโรงพยาบาลภายในช่วงเวลาคงที่หลังจำหน่ายเป็นค่าสองกลุ่ม ส่วนระดับ NYHA (New York Heart Association) ซึ่งแบ่งความเหนื่อยหอบเป็นระดับ I ถึง IV เป็นค่าเรียงลำดับ จำนวนครั้งที่นอนโรงพยาบาลตลอดการติดตามเป็นจำนวนนับ และเวลาจนนอนโรงพยาบาลครั้งแรกเป็นเวลาจนเกิดเหตุการณ์

ผลลัพธ์กำหนดตระกูลของแบบจำลอง ไม่ได้กำหนดแบบจำลอง สำหรับผลลัพธ์แบบสองค่า estimand เป็นตัวตัดสินระหว่างมาตรวัดผลทั้งสามแบบ

ตัวหารหรือเวลา: นับเหตุการณ์เทียบกับอะไร

บริการดูแลผู้ป่วยหัวใจล้มเหลวแห่งหนึ่งเปรียบเทียบโปรแกรมติดตามที่นำโดยพยาบาลกับการดูแลตามปกติ โปรแกรมเริ่มก่อน ผู้ป่วยในโปรแกรมจึงถูกติดตามนานกว่า

คำตอบที่พบบ่อยมีสามแบบ ความเสี่ยง (risk) คือสัดส่วนของผู้ป่วยที่เกิดเหตุการณ์ ณ ขอบเขตเวลาคงที่ เช่นการนอนโรงพยาบาลภายใน 7 วันหลังจำหน่าย อัตรา (rate) นับเหตุการณ์ต่อหนึ่งหน่วยเวลาติดตามสะสม และเหมาะกับข้อมูลนับเมื่อระยะเวลาติดตามต่างกัน โดยมีเงื่อนไขว่าอัตราต้องคงที่โดยประมาณตลอดการติดตาม ส่วนผลลัพธ์แบบเวลาจนเกิดเหตุการณ์ใช้เวลาจนถึงเหตุการณ์ และเก็บผู้ป่วยที่การติดตามสิ้นสุดก่อนไว้ในการวิเคราะห์

ตัวอย่างคำนวณด้วยมือ: สองกลุ่มที่ติดตามนานไม่เท่ากัน

ตัวอย่างคำนวณด้วยมือ ด้วยตัวเลขที่สมมติขึ้น กลุ่มโปรแกรมมีการนอนโรงพยาบาล 24 ครั้งใน 1,200 คน-ปี (person-years) และกลุ่มดูแลตามปกติมี 40 ครั้งใน 1,000 คน-ปี ชุดข้อมูลชื่อ hand มีหนึ่งแถวต่อกลุ่ม และมีคอลัมน์ arm (1 คือโปรแกรม 0 คือดูแลตามปกติ) admissions (จำนวนครั้งที่นอนโรงพยาบาล) และ pyears (คน-ปี)

  1. อัตราในกลุ่มโปรแกรม

    \[ \frac{24}{1200} = 0.020 \text{ per person-year} = 20 \text{ per } 1000 \text{ person-years} \]

    จำนวนครั้งที่นอนโรงพยาบาลหารด้วยคน-ปีได้อัตรา

  2. อัตราในกลุ่มดูแลตามปกติ

    \[ \frac{40}{1000} = 0.040 \text{ per person-year} = 40 \text{ per } 1000 \text{ person-years} \]

    อัตราของกลุ่มดูแลตามปกติเป็นสองเท่าของอัตราของกลุ่มโปรแกรม

  3. Rate ratio

    \[ \frac{20}{40} = 0.50 \]

    กลุ่มโปรแกรมมีอัตราการนอนโรงพยาบาลเป็นครึ่งหนึ่ง

  4. ผลต่างของอัตรา (rate difference)

    \[ 20 - 40 = -20 \text{ per } 1000 \text{ person-years} \]

    ผลต่างเป็นลบเพราะกลุ่มโปรแกรมมีอัตราต่ำกว่า

  5. อัตราส่วนของจำนวนนับดิบ

    \[ \frac{24}{40} = 0.60 \]

    จำนวนนับไม่คำนึงถึงคน-ปีที่เพิ่มขึ้นของกลุ่มโปรแกรม อัตราส่วนนี้จึงอยู่ใกล้ 1 มากกว่า

ผลลัพธ์: Rate ratio เท่ากับ 0.50 และผลต่างของอัตราเท่ากับ -20 ต่อ 1,000 คน-ปี ส่วนอัตราส่วนของจำนวนนับดิบคือ 0.60 ซึ่งไม่คำนึงว่าแต่ละกลุ่มถูกติดตามนานเท่าใด

ออฟเซต (offset): อัตราภายในแบบจำลองข้อมูลนับ

Poisson regression จัดการกับระยะเวลาติดตามที่ไม่เท่ากันด้วยออฟเซต (offset) ซึ่งเป็นพจน์ที่ตรึงสัมประสิทธิ์ไว้ที่ 1 [4] เมื่อใช้ลอการิทึมของคน-ปีเป็นออฟเซต แบบจำลองคือ

$$\log \mathrm{E}(\text{admissions}) = \log(\text{person-years}) + \beta_0 + \beta_1\,\text{arm}$$

ในที่นี้ $\mathrm{E}(\text{admissions})$ คือจำนวนครั้งที่นอนโรงพยาบาลที่คาดไว้ arm เป็น 1 สำหรับโปรแกรมและ 0 สำหรับการดูแลตามปกติ และ $\beta_0$ กับ $\beta_1$ คือสัมประสิทธิ์ การย้ายออฟเซตไปทางซ้ายจะได้ลอการิทึมของอัตรา ดังนั้น $\exp(\beta_1)$ คือ rate ratio เมื่อมี arm เป็นตัวแปรร่วมเพียงตัวเดียว อัตราที่แบบจำลองพอดีในแต่ละกลุ่มเท่ากับอัตราที่สังเกตได้ แบบจำลองจึงให้ 0.50 พอดี ไม่ว่าข้อมูลจะเป็นแถวสรุปสองแถวหรือหนึ่งแถวต่อผู้ป่วยหนึ่งคน

การตรึงสัมประสิทธิ์ของออฟเซตไว้ที่ 1 สมมติว่าอัตราคงที่โดยประมาณตลอดการติดตาม หากการนอนโรงพยาบาลกระจุกตัวหลังจำหน่ายไม่นาน กลุ่มที่ถูกติดตามนานกว่าจะได้คน-ปีช่วงท้ายที่มีอัตราต่ำเพิ่มเข้ามา และอาจดูดีกว่าเพียงเพราะเหตุนี้ การเปรียบเทียบอัตราภายในช่วงเวลาเดียวกันหลังจำหน่าย หรือวิธีวิเคราะห์เวลาจนเกิดเหตุการณ์ อาจเหมาะกว่า กลุ่มที่เริ่มก่อนยังต่างกันที่เวลาตามปฏิทินด้วย

คำสั่ง Stata และ R ของแบบจำลองนี้อยู่ในตารางสถานการณ์วิจัยด้านล่าง และมีบทความแยกเรื่องPoisson regression สำหรับอัตรา

ความไม่เป็นอิสระ: แถวไหนอยู่ด้วยกัน

การทดลองหนึ่งสุ่มโรงพยาบาล ไม่ใช่ผู้ป่วย ให้ใช้รายการตรวจสอบก่อนจำหน่ายแบบใหม่ ผู้ป่วยในโรงพยาบาลเดียวกันใช้บุคลากรและขั้นตอนร่วมกัน ผลลัพธ์ของพวกเขาจึงคล้ายกันมากกว่าผลลัพธ์จากต่างโรงพยาบาล

แถวข้อมูลอาจเป็นอิสระต่อกัน หรือรวมเป็นกลุ่มย่อย (cluster) เช่นผู้ป่วยภายในโรงพยาบาลเดียวกัน การวัดซ้ำ (repeated measures) ของผู้ป่วยคนเดียวตามเวลา หรือชุดที่จับคู่ (matched sets) ของผู้ป่วยกลุ่ม case และ control ที่จัดกลุ่มโดยการออกแบบตามอายุและเพศ

การปฏิบัติต่อแถวที่สัมพันธ์กันเสมือนเป็นอิสระมักทำให้ค่าคลาดเคลื่อนมาตรฐานเล็กเกินจริง โดยเฉพาะการเปรียบเทียบระหว่างกลุ่มย่อย [2] แบบจำลองผสม (mixed model) เพิ่มผลสุ่ม (random effects) ซึ่งคือส่วนเบี่ยงเบนระดับกลุ่มย่อยจากค่าเฉลี่ย สมการประมาณค่าวางนัยทั่วไป (generalized estimating equations, GEE) จำลองผลลัพธ์เฉลี่ยระดับประชากรและยอมให้มีสหสัมพันธ์ภายในกลุ่มย่อย ทางเลือกที่สามคงแบบจำลองไว้ แล้วใช้ค่าคลาดเคลื่อนมาตรฐานแบบ cluster-robust หรือแบบแซนด์วิช (sandwich) ซึ่งประมาณจากความแปรผันที่สังเกตได้ระหว่างกลุ่มย่อย ตอนที่ 4อธิบายว่ามันซ่อมอะไรได้และซ่อมอะไรไม่ได้

สำหรับการวัดซ้ำหลายครั้งในการทดลอง ทางเลือกที่พบบ่อยคือแบบจำลองผสมสำหรับการวัดซ้ำ (mixed model for repeated measures, MMRM) [5] แบบจำลองนี้ถือว่าครั้งที่วัดเป็นหมวด และให้แต่ละครั้งที่วัดมีความแปรปรวนของตัวเอง และแต่ละคู่ของครั้งที่วัดมีสหสัมพันธ์ของตัวเอง สำหรับชุดที่จับคู่ conditional logistic regression (การถดถอยลอจิสติกแบบมีเงื่อนไข) เปรียบเทียบการสัมผัสภายในแต่ละชุด ปัจจัยที่ใช้จับคู่จึงหลุดออกไป ส่วน logistic regression ธรรมดาที่ใส่ตัวบ่งชี้หนึ่งตัวต่อหนึ่งชุดให้ odds ratio ที่เอนเอียงเมื่อชุดมีขนาดเล็ก เช่นชุดที่เป็นคู่

Estimand: ปริมาณที่การศึกษาสัญญาไว้

ในที่ประชุมกำกับการทดลอง สมาชิกคนหนึ่งขอให้บอกผลของโปรแกรมต่อการนอนโรงพยาบาล นักสถิติตอบว่าสิ่งนี้ยังไม่ใช่ estimand เพราะยังไม่ระบุสเกล การเปรียบเทียบ หรือประชากร

แนวทาง ICH (International Council for Harmonisation) E9(R1) สำหรับการทดลองทางคลินิกอธิบายestimand (ปริมาณเป้าหมายของการประมาณ) ซึ่งคือปริมาณที่แน่ชัดที่การศึกษาตั้งใจประมาณ ด้วยองค์ประกอบห้าประการ ได้แก่ การรักษา ประชากร ตัวแปร (ผลลัพธ์ที่วัด) การจัดการกับเหตุการณ์ระหว่างการศึกษา (intercurrent events) และมาตรวัดสรุประดับประชากร (population-level summary) [6] เหตุการณ์ระหว่างการศึกษา เช่นการหยุดการรักษาหรือการเสียชีวิต เกิดหลังเริ่มการรักษา และมีผลต่อว่าจะวัดผลลัพธ์ได้หรือไม่ หรือต่อวิธีอ่านผลลัพธ์

สำหรับการเลือกแบบจำลอง ช่องนี้กำหนดว่าจะใช้ผลต่างหรืออัตราส่วน ใช้ความเสี่ยง อัตรา ออดส์ หรือฮาซาร์ด ใช้คอนทราสต์ (contrast) ระดับประชากรหรือแบบมีเงื่อนไข และประชากรใด คอนทราสต์ระดับประชากร (marginal) เปรียบเทียบประชากรทั้งหมดภายใต้การรักษาหนึ่งกับประชากรทั้งหมดภายใต้อีกการรักษาหนึ่ง คอนทราสต์แบบมีเงื่อนไข (conditional) เปรียบเทียบผู้ป่วยที่มีค่าตัวแปรร่วมในแบบจำลองเหมือนกัน

ไม่อาจอ่าน risk ratio จากสัมประสิทธิ์ของ logistic regression ซึ่งเป็นลอการิทึมของ odds ratio สำหรับผลลัพธ์ที่พบบ่อย แบบจำลอง log-binomial ซึ่งเป็น binomial regression บนสเกลลอการิทึมอาจไม่เกิดการลู่เข้า (convergence) หมายความว่าการค้นหาทีละขั้นของซอฟต์แวร์ไม่สามารถลงตัวที่สัมประสิทธิ์ชุดที่ทำให้ความเสี่ยงที่ทำนายได้ของผู้ป่วยทุกคนต่ำกว่า 1 จึงหยุดโดยไม่ให้ผลที่ใช้ได้ ตอนที่ 3เสนอลำดับทางเลือกที่ใช้ได้ ความสัมพันธ์ระหว่าง odds ratio แบบมีเงื่อนไขกับแบบระดับประชากรจากผู้ป่วยกลุ่มเดียวกันเป็นเรื่องของตอนที่ 5

โครงสร้างพิเศษ: ลักษณะที่ทำให้แบบจำลองมาตรฐานใช้ไม่ได้

ผู้ประเมินต้นฉบับอ่านบทความที่จำลองจำนวนครั้งที่มารับบริการฉุกเฉินด้วย Poisson regression จำนวนนับกระจายกว้างกว่าค่าเฉลี่ยมาก มีผู้ป่วยที่ไม่มารับบริการเลยมากกว่าที่ Poisson คาดไว้ บางคนเสียชีวิตและบางคนย้ายออก แต่ละอย่างเป็นโครงสร้างพิเศษที่แบบจำลองมาตรฐานไม่จัดการให้โดยอัตโนมัติ

ช่องนี้มักเพิ่มส่วนประกอบมากกว่าเปลี่ยนตระกูลแบบจำลอง เช่นแบบจำลองความแปรปรวน เส้นโค้งสไปลน์ หรือพจน์ปฏิกิริยาสัมพันธ์ ส่วนเหตุการณ์แข่งขันและศูนย์ส่วนเกินอาจเปลี่ยนวิธีวิเคราะห์เอง

ห้าสถานการณ์วิจัยที่อ่านผ่านไวยากรณ์

ตารางนี้แยกห้าสถานการณ์วิจัยออกเป็นห้าช่องของไวยากรณ์

ไม่มีคำสั่งใดในที่นี้ที่ได้รันจริง และไม่มีคำสั่งใดแสดงผลลัพธ์ ชื่อตัวแปรเป็นชื่อสมมติ แถวการนอนโรงพยาบาลใช้ชื่อจากตัวอย่างคำนวณด้วยมือ (hand: arm, admissions, pyears) ตัวแปรร่วมถูกละไว้ เพราะในการเปรียบเทียบที่ไม่ได้สุ่ม ตัวแปรร่วมมาจากคำถามเชิงสาเหตุ (ดูหัวข้อ 'ขอบเขตของไวยากรณ์') ในแถวเหตุการณ์แข่งขัน status เป็น 1 สำหรับการนอนโรงพยาบาล 2 สำหรับการเสียชีวิต และ 0 สำหรับการเซ็นเซอร์ ส่วน stcompet เป็นคำสั่งที่ผู้ใช้เขียนเอง (ssc install stcompet)
สถานการณ์วิจัยผลลัพธ์ตัวหารหรือเวลาความไม่เป็นอิสระEstimandโครงสร้างพิเศษตระกูลแบบจำลองคำสั่ง Stataฟังก์ชัน R
ภาวะสับสนเฉียบพลัน (delirium) ภายใน 7 วันหลังผ่าตัดกระดูกสะโพกหัก เปรียบเทียบการผ่าตัดเร็วกับการผ่าตัดช้ากว่าสองค่า (binary)ต่อผู้ป่วยหนึ่งคน ณ ขอบเขตเวลาคงที่ผู้ป่วยเป็นอิสระต่อกันRisk ratio ในผู้ป่วยที่ได้รับการผ่าตัดทุกคนผลลัพธ์พบบ่อย การประมาณอาจไม่ลู่เข้า (ทางเลือกอยู่ในตอนที่ 3)Log-binomial regressionglm delirium i.early, family(binomial) link(log) eformglm(delirium ~ early, family = binomial(link = "log"), data = d)
การนอนโรงพยาบาลภายใต้โปรแกรมที่นำโดยพยาบาลเทียบกับการดูแลตามปกติจำนวนนับ (count)เวลาติดตามสะสม ต่างกันตามผู้ป่วยผู้ป่วยเป็นอิสระต่อกันRate ratio ในผู้ป่วยที่ลงทะเบียนทุกคนต้องตรวจความแปรปรวนเกินPoisson regression ที่มีออฟเซตเป็นลอการิทึมของเวลาติดตามสะสมpoisson admissions i.arm, exposure(pyears) irrglm(admissions ~ arm + offset(log(pyears)), family = poisson, data = hand)
คะแนนอาการที่สี่ครั้งที่วัดในการทดลองแบบสุ่มต่อเนื่อง (continuous)ครั้งที่วัดคงที่การวัดซ้ำผลต่างของค่าเฉลี่ยที่ครั้งที่วัดสุดท้าย ในผู้ถูกสุ่มทุกคนครั้งที่วัดขาดหาย สมมติว่าขาดหายแบบสุ่มเมื่อกำหนดครั้งที่วัดที่สังเกตได้MMRMmixed score i.arm##i.visit || id:, noconstant residuals(unstructured, t(visit)) remlmmrm::mmrm(score ~ arm * visit + us(visit | id), data = d)
เวลาจนนอนโรงพยาบาลครั้งแรกหลังจำหน่าย โดยการเสียชีวิตเป็นเหตุการณ์แข่งขันเวลาจนเกิดเหตุการณ์เวลาจนนอนโรงพยาบาล เสียชีวิต หรือถูกเซ็นเซอร์ผู้ป่วยเป็นอิสระต่อกันอุบัติการณ์สะสม ณ เวลาที่กำหนด แยกตามกลุ่มการเซ็นเซอร์ และการเสียชีวิตเป็นเหตุการณ์แข่งขันตัวประมาณ Aalen-Johansen ของอุบัติการณ์สะสม (Fine-Gray regression ถ้าต้องการตัวแปรร่วม)stset time, failure(status == 1) แล้วตามด้วย stcompet cif = ci, compet1(2) by(arm)cmprsk::cuminc(d$time, d$status, group = d$arm)
การศึกษา case-control ที่จับคู่ ระหว่างกระดูกสะโพกหักกับยาระงับประสาทที่สั่งจ่ายผู้ป่วยกลุ่ม case หรือ controlไม่มี: การสุ่มตัวอย่างอิงตามผลลัพธ์ชุดที่จับคู่ตามอายุและเพศOdds ratio ภายในชุดที่จับคู่ประมาณผลของปัจจัยที่ใช้จับคู่ไม่ได้Conditional logistic regressionclogit case i.exposed, group(set) orsurvival::clogit(case ~ exposed + strata(set), data = d)

อ่านตาราง

มีสองแถวที่เกี่ยวกับการนอนโรงพยาบาล แต่ตกอยู่ในคนละตระกูล คือจำนวนนับเหนือเวลาติดตามสะสม และเวลาจนนอนโรงพยาบาลครั้งแรกโดยมีการเสียชีวิตเป็นเหตุการณ์แข่งขัน คำถาม ไม่ใช่ชื่อตัวแปร เป็นตัวตัดสินว่าอยู่ช่องไหน

กำหนดแต่ละช่องด้วยดรอปดาวน์ แผงจะบอกตระกูลแบบจำลอง มาตรวัดผล คำสั่ง Stata และฟังก์ชัน R และชี้ชุดคำตอบที่ไวยากรณ์ตัดสินเองไม่ได้

ขอบเขตของไวยากรณ์

ไวยากรณ์ช่วยจำกัดทางเลือกให้เหลือแบบจำลองที่ตอบคำถามได้ แต่ไม่ได้เลือกตัวแปรร่วม ซึ่งมาจากคำถามเชิงสาเหตุ ที่มักวาดเป็น DAG หรือมาจากงานพยากรณ์ [3] และไม่ได้ตรวจข้อสมมติ เช่นอัตราที่คงที่โดยประมาณ หรือฮาซาร์ดเป็นสัดส่วน (proportional hazards) คืออัตราส่วนฮาซาร์ดที่คงที่ตลอดการติดตาม และไม่ได้ทดแทนการคิดเรื่องการออกแบบ ทั้งการสุ่ม การวัด และข้อมูลที่ขาดหาย

นักวิเคราะห์สองคนที่เติมช่องเหมือนกันอาจยังประมาณแบบจำลองต่างกันภายในตระกูลเดียวกัน และทั้งสองแบบอาจปกป้องได้เมื่อแต่ละคนระบุ estimand และข้อสมมติของตน

ความเข้าใจผิดที่พบบ่อยและวิธีแก้

  • "ไวยากรณ์เลือกแบบจำลองให้"

    การเติมช่องทั้งห้าตัดแบบจำลองที่ตอบคำถามไม่ได้ออกไป แต่ยังเหลือหลายแบบจำลองที่เป็นไปได้

    วิธีแก้: ไวยากรณ์ช่วยจำกัดทางเลือกให้เหลือแบบจำลองที่ตอบคำถามได้ ผู้วิเคราะห์ยังต้องเลือกตัวแปรร่วม ตรวจข้อสมมติ และให้เหตุผลสนับสนุน estimand

  • "เทียบจำนวนครั้งที่นอนโรงพยาบาลก็พอ"

    ในตัวอย่างคำนวณด้วยมือ จำนวนนับให้ 0.60 แต่ rate ratio คือ 0.50 เพราะกลุ่มโปรแกรมมี 1,200 คน-ปี เทียบกับ 1,000 คน-ปี

    วิธีแก้: ใส่เวลาติดตามสะสมไว้ในตัวหาร เป็นอัตราหรือเป็นออฟเซตลอการิทึมของคน-ปี และตรวจว่าอัตราคงที่โดยประมาณตลอดการติดตาม

  • "ผลลัพธ์แบบสองค่าแปลว่าต้องใช้ logistic regression"

    สัมประสิทธิ์ของ logistic regression คือลอการิทึมของ odds ratio และ odds ratio อยู่ห่างจาก 1 มากกว่า risk ratio โดยเฉพาะเมื่อผลลัพธ์พบบ่อย

    วิธีแก้: ระบุมาตรวัดผลไว้ใน estimand แล้วเลือกแบบจำลองที่ให้มาตรวัดนั้น

  • "ข้อมูลเวลาจนเกิดเหตุการณ์แปลว่าต้องใช้แบบจำลอง Cox"

    อัตราส่วนฮาซาร์ดเปรียบเทียบอัตราการเกิดเหตุการณ์ในผู้ป่วยที่ยังไม่เกิดเหตุการณ์ เมื่อมีเหตุการณ์แข่งขัน ความน่าจะเป็นของการนอนโรงพยาบาลภายในเวลาที่กำหนดมาจากอุบัติการณ์สะสม

    วิธีแก้: ตัดสินว่า estimand เป็นอัตราส่วนฮาซาร์ดหรือเป็นความน่าจะเป็น ณ เวลาที่กำหนด

สิ่งที่ควรทำในการวิเคราะห์ของคุณเอง

อภิธานศัพท์

generalized linear model (แบบจำลองเชิงเส้นวางนัยทั่วไป (generalized linear model, GLM))
ตระกูลของแบบจำลองถดถอย รวมถึงการถดถอยเชิงเส้น logistic regression และ Poisson regression กำหนดด้วย family และ link
person-time (เวลาติดตามสะสม (person-time))
เวลาติดตามที่รวมจากผู้ป่วยทุกคน เช่นคน-ปี
offset (ออฟเซต (offset))
พจน์ที่ตรึงสัมประสิทธิ์ไว้ที่ 1 การใช้ลอการิทึมของเวลาติดตามสะสมเป็นออฟเซตเปลี่ยนแบบจำลองข้อมูลนับให้เป็นแบบจำลองอัตรา
estimand (ปริมาณเป้าหมายของการประมาณ (estimand))
ปริมาณที่แน่ชัดซึ่งการศึกษาตั้งใจประมาณ พร้อมประชากร คอนทราสต์ และมาตรวัดสรุป
mixed model for repeated measures (แบบจำลองผสมสำหรับการวัดซ้ำ (MMRM))
ครั้งที่วัดเป็นหมวด พจน์กลุ่มการรักษาคูณครั้งที่วัด และความแปรปรวนร่วมแบบไม่มีโครงสร้างระหว่างครั้งที่วัด
conditional logistic regression (การถดถอยลอจิสติกแบบมีเงื่อนไข (conditional logistic regression))
logistic regression ที่เปรียบเทียบการสัมผัสภายในชุดที่จับคู่
overdispersion (ความแปรปรวนเกิน (overdispersion))
ความแปรปรวนของจำนวนนับมากกว่าค่าเฉลี่ย ซึ่ง Poisson regression สมมติว่าเท่ากัน
censoring (การเซ็นเซอร์ (censoring))
การติดตามที่สิ้นสุดก่อนเห็นเหตุการณ์
competing event (เหตุการณ์แข่งขัน (competing event))
เหตุการณ์ เช่นการเสียชีวิต ที่ขัดขวางไม่ให้เกิดเหตุการณ์ที่สนใจ
cumulative incidence function (อุบัติการณ์สะสม (cumulative incidence function, CIF))
ความน่าจะเป็นของเหตุการณ์ที่สนใจ ณ เวลาที่กำหนด เมื่อเหตุการณ์แข่งขันเกิดขึ้นได้

เอกสารอ้างอิง

  1. McCullagh P, Nelder JA. Generalized linear models. 2nd ed. London: Chapman and Hall; 1989. doi:10.1007/978-1-4899-3242-6 https://doi.org/10.1007/978-1-4899-3242-6
  2. Vittinghoff E, Glidden DV, Shiboski SC, McCulloch CE. Regression methods in biostatistics: linear, logistic, survival, and repeated measures models. 2nd ed. New York: Springer; 2012. doi:10.1007/978-1-4614-1353-0 https://doi.org/10.1007/978-1-4614-1353-0
  3. Harrell FE Jr. Regression modeling strategies: with applications to linear models, logistic and ordinal regression, and survival analysis. 2nd ed. Cham: Springer; 2015. doi:10.1007/978-3-319-19425-7 https://doi.org/10.1007/978-3-319-19425-7
  4. Gardner W, Mulvey EP, Shaw EC. Regression analyses of counts and rates: Poisson, overdispersed Poisson, and negative binomial models. Psychol Bull. 1995;118(3):392-404. doi:10.1037/0033-2909.118.3.392 https://doi.org/10.1037/0033-2909.118.3.392
  5. Fitzmaurice GM, Laird NM, Ware JH. Applied longitudinal analysis. 2nd ed. Wiley; 2011. doi:10.1002/9781119513469 https://doi.org/10.1002/9781119513469
  6. International Council for Harmonisation (ICH). ICH E9(R1): Addendum on estimands and sensitivity analysis in clinical trials to the guideline on statistical principles for clinical trials. ICH Harmonised Guideline, Step 4; 2019. https://database.ich.org/sites/default/files/E9-R1_Step4_Guideline_2019_1203.pdf

ประเด็นสำคัญ

  • ช่องทั้งห้า ตั้งแต่ผลลัพธ์ถึงโครงสร้างพิเศษ ช่วยจำกัดทางเลือกของแบบจำลองก่อนพิมพ์คำสั่งใด ๆ
  • เมื่อระยะเวลาติดตามต่างกัน ให้นับเหตุการณ์เทียบกับเวลาติดตามสะสมและตรวจว่าอัตราคงที่โดยประมาณ ในตัวอย่างคำนวณด้วยมือ rate ratio คือ 0.50 ขณะที่จำนวนนับดิบให้ 0.60
  • แถวข้อมูลที่อยู่โรงพยาบาลเดียวกัน ผู้ป่วยคนเดียวกัน หรือชุดที่จับคู่เดียวกัน ไม่เป็นอิสระต่อกัน และการวิเคราะห์มักต้องคำนึงถึงสิ่งนี้
  • Estimand เป็นตัวตัดสินว่าแบบจำลองใดในตระกูลเดียวกันให้ตัวเลขที่การศึกษาสัญญาไว้ได้
  • ไวยากรณ์ช่วยจำกัดทางเลือก ผู้วิเคราะห์ยังต้องเลือกตัวแปรร่วม ตรวจข้อสมมติ และให้เหตุผลสนับสนุน estimand

อ่านต่อในวิกิ: [[glm-link-family-guide-th]] [[poisson-regression-rates-lambda]]

0
ถึงนักอ่านชาวไทยและต่างชาติทำความเข้าใจบริบททางการแพทย์ของผมอ่านต่อ →ถึงนักอ่านชาวไทยและต่างชาติทำความเข้าใจเนื้อหาของผมที่นอกเหนือจากการแพทย์อ่านต่อ →

ความคิดเห็น

ยังไม่มีความคิดเห็น มาเป็นคนแรกกันเลย

เข้าสู่ระบบเพื่อแสดงความคิดเห็น