The Integral Project ברשתות · בקרוב
המומחיםמילוןפודקאסט

בריאות, נפש וטכנולוגיה

כתבות ומחקרים

מודלי AI דייקו בכיוון ב־90%–98% — אבל כשליש מהטענות לא נתמכו במקור

מחקר על הערכת סיכון להטיה ב־97 ניסויים אקראיים מצא שמודלי שפה הגיעו לדיוק בינארי גבוה, אך רק 60%–65% מהטענות שיצרו קיבלו תמיכה ממסמכי המקור. גם GPT-5 הציג שיעור הזיה מחמיר של 35.7%.

צוות The Integral Project · בעריכת יורי אלטשולרעל העריכה והאחריות המערכתית16.9.20262 דק' קריאה
שיתוף הכתבה
מודלי AI דייקו בכיוון ב־90%–98% — אבל כשליש מהטענות לא נתמכו במקור
הדמיה: מערכת The Integral Project · נוצרה באמצעות בינה מלאכותית

מודל שפה יכול להגיע למסקנה שנראית נכונה — ועדיין להסביר אותה באמצעות טענה שאינה מופיעה במסמך המקור. מחקר חדש מ־JMIR AI מדגים את הפער הזה בהערכת ראיות רפואיות: הדיוק ברמת ההחלטה היה גבוה, אך התמיכה התיעודית הייתה חלקית בלבד.

מה בדקו

החוקרים בחנו שלושה מודלים — GPT-5, ‏OpenAI o3-mini ו־GPT-3.5 — במשימה של הערכת סיכון להטיה במחקרים אקראיים לפי כלי RoB 2. מאגר הבדיקה כלל 97 ניסויים שעבורם היו זמינים גם דוחות מלאים וגם הערכות אנושיות מלאות מתוך סקירות Cochrane.

לכל טענה שהמודל יצר, המערכת איתרה קטעים רלוונטיים בדוח הניסוי באמצעות BM25. לאחר מכן הטענה סווגה כנתמכת, סותרת את המקור, לא נמצאה במקור או חורגת מההקשר. כך החוקרים בדקו לא רק אם המסקנה התאימה לשופטים האנושיים, אלא אם אפשר לעגן אותה בטקסט עצמו.

דיוק גבוה אינו מבטיח ביסוס

הדיוק הבינארי של המודלים בתחומי ההערכה נע בין 90% ל־98%. אבל כשנדרשה התאמה מדויקת לרמת חומרת ההטיה, הדיוק ירד ל־42%–71%. GPT-5 הציג את הביצועים הכוללים הטובים ביותר והגיע להסכמה עם מעריכים אנושיים של עד κ=0.81.

למרות זאת, שיעור הטענות שקיבלו תמיכה ממסמכי המקור היה רק 60%–65% בכל המודלים. ל־GPT-5 נמדדה התמיכה הגבוהה ביותר, 64.3%, ובמקביל שיעור ההזיה המחמיר הנמוך ביותר — אך עדיין 35.7%. במילים אחרות, ביצוע טוב במדד החלטה לא הבטיח שהנימוק שמאחוריו היה ניתן לאימות.

מה זה אומר בפועל

המחקר לא בדק אבחון ליד מיטת מטופל, ולא הראה שמודל נתן המלצה טיפולית שגויה. הוא בדק משימה צרה ומובנית של הערכת מחקרים, על מאגר של 97 ניסויים וללא חלוקה נפרדת לאימון ולאימות. לכן אי אפשר להשליך את האחוזים ישירות לכל שימוש רפואי ב־AI.

עם זאת, המסר רלוונטי לכל מערכת שמסכמת ספרות רפואית: התאמה למסקנה אנושית אינה מספיקה. נדרשים ציטוטים מדויקים, קישור למסמך המקורי ובדיקה שמפרידה בין טענה נתמכת לבין טקסט משכנע שלא נמצא במקור.

השורה התחתונה

מודלי השפה הצליחו לקבל החלטות בינאריות מדויקות יחסית, אבל כשליש מהטענות שלהם לא עברו את מבחן התמיכה במסמך. במידע רפואי, מדד איכות צריך לשאול לא רק "האם התשובה נכונה?" — אלא גם "איפה בדיוק הראיה?".

מה אפשר לקחת מהמחקר?

שינויים קטנים ועקביים בהרגלי התזונה וההתאוששות עשויים להיות משמעותיים לאורך זמן. מומלץ לבחון אותם לצד מדדים אישיים ובהתייעצות מקצועית כשנדרש.

Liang et al. — Retrieve-Then-Verify for Evaluating Evidence Support and Hallucination in Large Language Model-Generated Medical Information (2026)המקור המחקרי
THE INTEGRAL UPDATE

העדכונים החשובים, ישר למייל

כתבות חדשות, מחקרים ועדכונים כלליים מ־The Integral Project — בלי רעש מיותר.

האימייל נשמר באופן מאובטח ולא יימסר לצדדים שלישיים לצורכי פרסום.

אהבתם את הכתבה?

המשוב שלכם עוזר לנו לבחור את התוכן הבא.

תגובות הקוראים

היו הראשונים להגיב

התגובה תפורסם לאחר בדיקה קצרה.
שאלו את PulseAI על המחקר
היועץ המדעי PulseAI