The Integral Project ברשתות · בקרוב
המומחיםמילוןפודקאסט

בריאות, נפש וטכנולוגיה

כתבות ומחקרים

צ׳אטבוט לפרקינסון סווג כטוב ב־88.6% מהשיחות — ועדיין פספס טעויות קריטיות

מחקר תצפיתי ניתח 2,035 שיחות עם צ׳אטבוט רפואי פעיל בגרמניה. רוב השיחות קיבלו סיווג אוטומטי חיובי, אך בדיקת מומחים מצאה כשלים קליניים חשובים — בהם המלצה תרופתית לא מתאימה ואי־הסלמה של דיווח על מחשבות אובדניות.

צוות The Integral Project · בעריכת יורי אלטשולרעל העריכה והאחריות המערכתית21.9.20263 דק' קריאה
שיתוף הכתבה
צ׳אטבוט לפרקינסון סווג כטוב ב־88.6% מהשיחות — ועדיין פספס טעויות קריטיות
הדמיה: מערכת The Integral Project · נוצרה באמצעות בינה מלאכותית

מערכות AI רפואיות כבר מדברות ישירות עם מטופלים, אבל השאלה החשובה אינה רק כמה תשובות נשמעות טובות — אלא אילו טעויות נותרות בלתי נראות. מחקר פרוספקטיבי שפורסם ב־The Lancet Regional Health – Europe בחן את jAImes, צ׳אטבוט מבוסס אחזור מידע שנועד לענות על שאלות בנושא מחלת פרקינסון ופעל באופן ציבורי בגרמניה.

החוקרים ניתחו את כל 2,035 השיחות שנערכו ב־129 ימי הפעילות הראשונים של המערכת, ובסך הכול 6,146 הודעות. מנגנון סינון בסיוע AI סיווג 1,803 שיחות — 88.6% — כטובות, 224 שיחות כמתאימות חלקית ושמונה שיחות כלא מתאימות.

אלא שהסיווג האוטומטי לא סיפר את כל הסיפור. מומחים בדקו 45 שיחות שסומנו לבדיקה ואישרו חמישה אירועים קריטיים. בנוסף, בבדיקה עצמאית של מדגם אקראי בן 100 שיחות שהמערכת סיווגה כטובות, נמצאו עוד ארבע שיחות עם טעויות בעלות משמעות קלינית. זהו שיעור של 4% בתוך המדגם של השיחות שסווגו כטובות, עם רווח סמך של 1.6%–9.8% — ולא שיעור הטעויות הקריטיות בכלל השיחות.

בין הכשלים שתיארו החוקרים: המלצה לא מתאימה על ממנטין בהקשר של דמנציה בפרקינסון, וכן שיחה שבה הופיע דיווח מפורש על מחשבות אובדניות בלי שהמערכת הפעילה כראוי את תגובת החירום המתוכננת. הכשלים חולקו לשלושה סוגים: גבולות ידע, בעיות עמידות ואי־הסלמה במצבים המחייבים הפניה לגורם אנושי.

המסר אינו שהצ׳אטבוט נכשל בכללותו. זהו מחקר של מערכת אחת, בתחום מחלה אחד ובתקופת מעקב מוגבלת; הוא לא השווה את המערכת לצוות רפואי ולא בדק תוצאות בריאותיות אצל המשתמשים. גם ארבע הטעויות שנמצאו במדגם אינן מאפשרות להעריך בדיוק את שיעור הכשל הכולל.

עם זאת, הממצאים מדגימים פער חשוב בין מדדי איכות אוטומטיים לבין בטיחות קלינית. מערכת יכולה לקבל ציונים טובים ברוב השיחות ועדיין להחמיץ מספר קטן של מקרים שבהם המחיר האפשרי גבוה. החוקרים מציעים מסגרת בשם CARE-LLM, המשלבת סינון של כל השיחות, בדיקת מומחים למקרים חשודים, דגימה אקראית גם מתוך השיחות שסווגו כטובות ולולאת משוב לתיקון סוגי כשל חוזרים.

למחקר יש גם הקשר שכדאי להביא בחשבון: אחד המחברים הוא מייסד החברה שפיתחה את המערכת, ומחבר נוסף עומד בראש הקרן שהזמינה ומפעילה אותה. לפי המאמר, ההכרעה הקלינית במקרים הקריטיים נעשתה בידי חוקרים ללא קשר מסחרי או ניהולי למערכת.

בשורה התחתונה, צ׳אטבוטים רפואיים אינם יכולים להסתמך רק על בדיקות לפני ההשקה או על ציון אוטומטי ממוצע. אם הם פועלים מול מטופלים, נדרש ניטור מתמשך ברמת השיחה, ביקורת אנושית ומנגנון הסלמה אמין — במיוחד סביב תרופות, מצוקה נפשית ומצבים דחופים. המערכת שנבדקה מיועדת למידע ואינה תחליף לייעוץ, אבחון או טיפול רפואי.

מה אפשר לקחת מהמחקר?

שינויים קטנים ועקביים בהרגלי התזונה וההתאוששות עשויים להיות משמעותיים לאורך זמן. מומלץ לבחון אותם לצד מדדים אישיים ובהתייעצות מקצועית כשנדרש.

Lange et al., The Lancet Regional Health – Europe (2026)המקור המחקרי
THE INTEGRAL UPDATE

העדכונים החשובים, ישר למייל

כתבות חדשות, מחקרים ועדכונים כלליים מ־The Integral Project — בלי רעש מיותר.

האימייל נשמר באופן מאובטח ולא יימסר לצדדים שלישיים לצורכי פרסום.

אהבתם את הכתבה?

המשוב שלכם עוזר לנו לבחור את התוכן הבא.

תגובות הקוראים

היו הראשונים להגיב

התגובה תפורסם לאחר בדיקה קצרה.
שאלו את PulseAI על המחקר
היועץ המדעי PulseAI