מודל שפה יכול להגיע למסקנה שנראית נכונה — ועדיין להסביר אותה באמצעות טענה שאינה מופיעה במסמך המקור. מחקר חדש מ־JMIR AI מדגים את הפער הזה בהערכת ראיות רפואיות: הדיוק ברמת ההחלטה היה גבוה, אך התמיכה התיעודית הייתה חלקית בלבד.
מה בדקו
החוקרים בחנו שלושה מודלים — GPT-5, OpenAI o3-mini ו־GPT-3.5 — במשימה של הערכת סיכון להטיה במחקרים אקראיים לפי כלי RoB 2. מאגר הבדיקה כלל 97 ניסויים שעבורם היו זמינים גם דוחות מלאים וגם הערכות אנושיות מלאות מתוך סקירות Cochrane.
לכל טענה שהמודל יצר, המערכת איתרה קטעים רלוונטיים בדוח הניסוי באמצעות BM25. לאחר מכן הטענה סווגה כנתמכת, סותרת את המקור, לא נמצאה במקור או חורגת מההקשר. כך החוקרים בדקו לא רק אם המסקנה התאימה לשופטים האנושיים, אלא אם אפשר לעגן אותה בטקסט עצמו.
דיוק גבוה אינו מבטיח ביסוס
הדיוק הבינארי של המודלים בתחומי ההערכה נע בין 90% ל־98%. אבל כשנדרשה התאמה מדויקת לרמת חומרת ההטיה, הדיוק ירד ל־42%–71%. GPT-5 הציג את הביצועים הכוללים הטובים ביותר והגיע להסכמה עם מעריכים אנושיים של עד κ=0.81.
למרות זאת, שיעור הטענות שקיבלו תמיכה ממסמכי המקור היה רק 60%–65% בכל המודלים. ל־GPT-5 נמדדה התמיכה הגבוהה ביותר, 64.3%, ובמקביל שיעור ההזיה המחמיר הנמוך ביותר — אך עדיין 35.7%. במילים אחרות, ביצוע טוב במדד החלטה לא הבטיח שהנימוק שמאחוריו היה ניתן לאימות.
מה זה אומר בפועל
המחקר לא בדק אבחון ליד מיטת מטופל, ולא הראה שמודל נתן המלצה טיפולית שגויה. הוא בדק משימה צרה ומובנית של הערכת מחקרים, על מאגר של 97 ניסויים וללא חלוקה נפרדת לאימון ולאימות. לכן אי אפשר להשליך את האחוזים ישירות לכל שימוש רפואי ב־AI.
עם זאת, המסר רלוונטי לכל מערכת שמסכמת ספרות רפואית: התאמה למסקנה אנושית אינה מספיקה. נדרשים ציטוטים מדויקים, קישור למסמך המקורי ובדיקה שמפרידה בין טענה נתמכת לבין טקסט משכנע שלא נמצא במקור.
השורה התחתונה
מודלי השפה הצליחו לקבל החלטות בינאריות מדויקות יחסית, אבל כשליש מהטענות שלהם לא עברו את מבחן התמיכה במסמך. במידע רפואי, מדד איכות צריך לשאול לא רק "האם התשובה נכונה?" — אלא גם "איפה בדיוק הראיה?".
שינויים קטנים ועקביים בהרגלי התזונה וההתאוששות עשויים להיות משמעותיים לאורך זמן. מומלץ לבחון אותם לצד מדדים אישיים ובהתייעצות מקצועית כשנדרש.
