The Integral Project ברשתות · בקרוב
המומחיםמילוןפודקאסט

בריאות, נפש וטכנולוגיה

כתבות ומחקרים

ב־7 מחקרים, דיוק מכתבי מרפאה שנוצרו ב־AI נע בין 10% ל־100% — הוודאות נמוכה מאוד

סקירה שיטתית מצאה שמודלי שפה עשויים לקצר ניסוח ולפשט מכתבים למטופלים, אך נאמנות המידע השתנתה מאוד ורוב הראיות הגיעו מתרחישים מלאכותיים. החוקרים קבעו שאין עדיין בסיס להטמעה שגרתית ללא פיקוח אנושי.

צוות The Integral Project · בעריכת יורי אלטשולרעל העריכה והאחריות המערכתית23.9.20262 דק' קריאה
שיתוף הכתבה
ב־7 מחקרים, דיוק מכתבי מרפאה שנוצרו ב־AI נע בין 10% ל־100% — הוודאות נמוכה מאוד
צילום: National Cancer Institute / Wikimedia Commons · נחלת הכלל

מכתב מרפאה טוב צריך לעשות שתי פעולות יחד: לתעד במדויק את המפגש הרפואי ולהסביר למטופל בשפה מובנת מה נמצא ומה הצעד הבא. סקירה שיטתית חדשה בחנה אם מודלי שפה וכלי בינה מלאכותית כבר מסוגלים לנסח, לפשט או לשפר מכתבים כאלה — ומצאה פוטנציאל לצד פערי בטיחות גדולים.

שבעה מחקרים, ורק שניים עם נתוני מרפאה אמיתיים

החוקרים חיפשו בחמישה מאגרי מידע עד נובמבר 2025 וכללו שבעה מחקרים. שניים השתמשו בנתונים ממרפאות אמיתיות, וחמישה התבססו על תרחישים סינתטיים או היפותטיים. זהו בסיס ראיות קטן והטרוגני, ולכן קשה להשוות ישירות בין המודלים, סוגי המכתבים והמדדים שנבדקו.

התוצאות לגבי קריאות היו מעורבות. בחלק מהמחקרים AI הפיק טקסט קל יותר לקריאה ממכתב שנכתב בידי אדם, אך רוב התוצרים עדיין לא הגיעו לרמת הקריאה המומלצת בארצות הברית — בערך כיתה ו׳. שני מחקרים שמדדו תוצאות מדווחות בידי מטופלים מצאו שביעות רצון והבנה גבוהות, אך הסתמכו על הערכה סובייקטיבית או לא כללו קבוצת השוואה של מכתב אנושי.

טווח הדיוק הוא האזהרה המרכזית

נאמנות המידע הקליני נעה בין 10% ל־100% במחקרים השונים. הסקירה תיעדה גם הזיות, עצות רפואיות לא מתאימות וניסוחים חסרי רגישות כלפי מטופלים. מחקר אחד דיווח על זמן ניסוח קצר פי עשרה לעומת הכתבה אנושית — אות יעילות מעניין, אך לא הוכחה שמכתב מהיר יותר גם בטוח או מועיל יותר.

הטווח הרחב אינו אומר שכלי מסוים יטעה ב־90% מהמקרים. הוא בעיקר מראה שהביצועים תלויים מאוד במשימה, במודל ובדרך המדידה, ושעדיין אין אמת מידה אחידה שאפשר להשליך ממנה על שימוש קליני רגיל.

מה אפשר לקחת מכאן

החוקרים דירגו את ודאות הראיות כנמוכה מאוד בכל התוצאות המרכזיות. המדגמים היו קטנים, השיטות שונות זו מזו ורוב הבדיקות לא נערכו בתוך עבודה קלינית שגרתית. לכן הם סיכמו שהראיות אינן מספיקות להטמעה רחבה מעבר לניסויים מפוקחים ולפרויקטי שיפור איכות.

בשלב הזה, השימוש הסביר הוא כטיוטה תחת אחריות מקצועית: איש צוות צריך להשוות את המכתב לרשומה המקורית, לבדוק תרופות, אבחנות והנחיות מעקב, ולוודא שהשפה מדויקת ומכבדת. נדרשים מחקרים בעולם האמיתי שיבדקו לא רק קריאות ומהירות, אלא גם טעויות, הבנת מטופלים ותוצאות טיפול.

מה אפשר לקחת מהמחקר?

שינויים קטנים ועקביים בהרגלי התזונה וההתאוששות עשויים להיות משמעותיים לאורך זמן. מומלץ לבחון אותם לצד מדדים אישיים ובהתייעצות מקצועית כשנדרש.

Large language models and artificial intelligence for generating, simplifying, and enhancing outpatient clinic letters: A systematic reviewהמקור המחקרי
THE INTEGRAL UPDATE

העדכונים החשובים, ישר למייל

כתבות חדשות, מחקרים ועדכונים כלליים מ־The Integral Project — בלי רעש מיותר.

האימייל נשמר באופן מאובטח ולא יימסר לצדדים שלישיים לצורכי פרסום.

אהבתם את הכתבה?

המשוב שלכם עוזר לנו לבחור את התוכן הבא.

תגובות הקוראים

היו הראשונים להגיב

התגובה תפורסם לאחר בדיקה קצרה.
שאלו את PulseAI על המחקר
היועץ המדעי PulseAI