The Integral Project ברשתות · בקרוב
המומחיםמילוןפודקאסט

בריאות, נפש וטכנולוגיה

כתבות ומחקרים

GPT-5 העלה דיוק מ־86% ל־92% כשקרא מאמר מלא — אבל נבדק במשימה צרה

במחקר על 200 ניסויים אונקולוגיים אקראיים, GPT-5 סיווג התאמה לפי שלב המחלה בדיוק של 92% כשהוזן במאמרים מלאים, לעומת 86% עם תקצירים. השיפור היה מובהק, אך נבדקו מודל אחד, משימה אחת והרצה אחת לכל מאמר.

צוות The Integral Project · בעריכת יורי אלטשולרעל העריכה והאחריות המערכתית22.9.20263 דק' קריאה
שיתוף הכתבה
GPT-5 העלה דיוק מ־86% ל־92% כשקרא מאמר מלא — אבל נבדק במשימה צרה
הדמיה: מערכת The Integral Project · נוצרה באמצעות בינה מלאכותית

תקציר מדעי נועד לדחוס את עיקרי המחקר, אבל דווקא פרטי ההתאמה לניסוי עשויים להישאר בגוף המאמר. מחקר חדש ב־JAMIA Open בדק אם מודל שפה מפיק תועלת מהטקסט המלא — או טובע ברעש הנוסף.

מה בדקו

החוקרים לקחו 200 פרסומים של ניסויים אקראיים באונקולוגיה וביקשו מ־GPT-5 לסווג אם כל ניסוי כלל מטופלים עם מחלה מקומית, מחלה גרורתית, שתיהן או אף אחת מהן. כל פרסום סווג פעמיים: פעם על בסיס התקציר ופעם על בסיס הטקסט המלא שהומר לטקסט פשוט.

התשובות הושוו לסיווג ידני. זו משימת כריית מידע ממוקדת — לא החלטה אם אדם מסוים מתאים לניסוי ולא המלצה טיפולית.

יותר טקסט, יותר דיוק

בסיווג המשולב, הדיוק עלה מ־86% עם תקצירים ל־92% עם מאמרים מלאים. ההבדל היה מובהק סטטיסטית. בזיהוי ניסויים שכללו מחלה מקומית נרשמה אותה עלייה, מ־86% ל־92%; בזיהוי מחלה גרורתית הדיוק כבר היה גבוה מאוד ונשאר דומה — 99% עם תקציר ו־98% עם טקסט מלא.

היתרון הגיע בעיקר מניסויים שכללו גם מחלה מקומית וגם גרורתית. על בסיס תקצירים, המודל החמיץ לעיתים את האוכלוסייה המקומית וסיווג את הניסוי כגרורתי בלבד. הטקסט המלא חתך את סוג הטעות הזה מ־25 פרסומים ל־12.

למה התקציר לא הספיק

במאמרים רבים המחלה הגרורתית הוזכרה במפורש בתקציר, בעוד שמידע על מחלה מקומית או מקומית־מתקדמת הופיע רק בפרקי השיטות וההכללה. במקרים אחרים, ניסוחים כמו ״מחלה מתקדמת או גרורתית״ היו עמומים גם למודל וגם למעריכים האנושיים.

המסקנה אינה שכל משימת AI דורשת מסמך מלא. אם המידע המבוקש מופיע בעקביות בתקציר, תוספת הטקסט עלולה לייקר את העיבוד בלי להוסיף ערך. כאן הפרט המבוקש דווח לעיתים מחוץ לתקציר, ולכן ההקשר הנוסף היה שימושי.

הגבולות החשובים

המחקר כלל 200 ניסויים משישה כתבי עת, כולם עם תקצירים מובנים. הוא בדק את GPT-5 בלבד, בפרומפט ובהרצה יחידים, ולא בחן יציבות בין הרצות או מודלים אחרים. מאחר שהניסויים פורסמו לפני מועד חיתוך האימון של המודל, החוקרים גם אינם יכולים לשלול חשיפה מוקדמת לחלק מהטקסטים.

בנוסף, המאמרים הומרו לטקסט פשוט, ללא איורים ומידע חזותי. התוצאה לכן מצביעה על יתרון במשימה מוגדרת של סיווג ספרות, ולא מוכיחה שמודל יכול לנהל התאמת מטופלים לניסויים באופן אוטונומי.

השורה התחתונה

במשימת סיווג צרה באונקולוגיה, קריאת המאמר המלא שיפרה את דיוק GPT-5 בשש נקודות אחוז. המסר המעשי הוא לא ״יותר טקסט תמיד טוב יותר״, אלא שצריך להתאים את מקור המידע לפרט שמנסים לחלץ — ולשמור אדם בתהליך כאשר הסיווג עשוי להשפיע על גישה למחקר או לטיפול.

מה אפשר לקחת מהמחקר?

שינויים קטנים ועקביים בהרגלי התזונה וההתאוששות עשויים להיות משמעותיים לאורך זמן. מומלץ לבחון אותם לצד מדדים אישיים ובהתייעצות מקצועית כשנדרש.

Weyrich et al. — More signal versus more noise: comparing full text and abstract as inputs for large language model-based classification of oncology trial eligibility criteria (2026)המקור המחקרי
THE INTEGRAL UPDATE

העדכונים החשובים, ישר למייל

כתבות חדשות, מחקרים ועדכונים כלליים מ־The Integral Project — בלי רעש מיותר.

האימייל נשמר באופן מאובטח ולא יימסר לצדדים שלישיים לצורכי פרסום.

אהבתם את הכתבה?

המשוב שלכם עוזר לנו לבחור את התוכן הבא.

תגובות הקוראים

היו הראשונים להגיב

התגובה תפורסם לאחר בדיקה קצרה.
שאלו את PulseAI על המחקר
היועץ המדעי PulseAI