כותרות על מודל AI ש׳מנצח׳ שיטה סטטיסטית ותיקה נשמעות משכנעות, אבל הניצחון תלוי גם באופן שבו בונים את התחרות. מחקר מטא־מדעי חדש בחן את השאלה דרך מקרה מבחן ממוקד: מודלים לחיזוי תמותה אחרי טראומה שהשוו למידת מכונה לרגרסיה לוגיסטית על אותם נתונים.
מה נבדק
החוקרים ערכו סקירה שיטתית ומטא־אנליזה של מחקרים שהשוו ישירות בין השיטות. 20 מחקרים עמדו בתנאי הסקירה, ו־17 מהם — עם 243,324 מטופלים — נכללו בניתוח הכמותי העיקרי. המדד המרכזי היה ההפרש ב־AUC, כלומר ביכולת המודל לדרג נכון מי נמצא בסיכון גבוה יותר.
מה נמצא
היתרון המאוחד של למידת המכונה היה 0.026 נקודות AUC. בניתוח המצומצם למחקרים שדיווחו רווחי סמך לשני המודלים, היתרון ירד ל־0.017. אלה הבדלים קטנים, והשונות בין המחקרים הייתה קיצונית: I² של 97.9%.
חשוב עוד יותר, מרווח החיזוי של 95% נע בין מינוס 0.034 לפלוס 0.086. כלומר, בסביבה חדשה התוצאה הסבירה יכולה לנוע מיתרון לרגרסיה ועד יתרון גדול יותר ללמידת מכונה. רק שלושה מחקרים השתמשו באימות חיצוני או באימות על תקופה מאוחרת יותר, ורק ארבעה מתוך 17 דורגו בסיכון נמוך להטיה לפי PROBAST.
איך ההשוואה עלולה להטות את התוצאה
החוקרים מצביעים על ארבעה דפוסים שחזרו במחקרים: בחירת המודל הטוב ביותר מתוך כמה מודלי למידת מכונה מול מודל רגרסיה יחיד; הסתמכות על אימות פנימי; דיווח סלקטיבי; וסיכום התוצאות לפי AUC בלבד, בלי כיול או תועלת בהחלטות קליניות.
זו אינה הוכחה שרגרסיה לוגיסטית תמיד עדיפה, וגם לא סקירה של כל תחומי החיזוי הרפואי. זהו מקרה אמפירי ממוקד בטראומה, שמראה כי חלק מהיתרון המדווח של למידת מכונה עשוי לנבוע מאדריכלות ההשוואה ולא רק מהאלגוריתם.
השורה התחתונה
לפני שמכריזים שמודל AI טוב יותר, צריך לבדוק אם התחרות הייתה הוגנת: מפרט שנקבע מראש, מודל השוואה שטופל באותה רצינות, אימות חיצוני, דיווח על כיול ועל ערך בהחלטות קליניות ושקיפות מלאה. בלי התנאים האלה, AUC גבוה מעט אינו בהכרח שדרוג אמיתי בטיפול.
שינויים קטנים ועקביים בהרגלי התזונה וההתאוששות עשויים להיות משמעותיים לאורך זמן. מומלץ לבחון אותם לצד מדדים אישיים ובהתייעצות מקצועית כשנדרש.
