מערכות AI רפואיות כבר מדברות ישירות עם מטופלים, אבל השאלה החשובה אינה רק כמה תשובות נשמעות טובות — אלא אילו טעויות נותרות בלתי נראות. מחקר פרוספקטיבי שפורסם ב־The Lancet Regional Health – Europe בחן את jAImes, צ׳אטבוט מבוסס אחזור מידע שנועד לענות על שאלות בנושא מחלת פרקינסון ופעל באופן ציבורי בגרמניה.
החוקרים ניתחו את כל 2,035 השיחות שנערכו ב־129 ימי הפעילות הראשונים של המערכת, ובסך הכול 6,146 הודעות. מנגנון סינון בסיוע AI סיווג 1,803 שיחות — 88.6% — כטובות, 224 שיחות כמתאימות חלקית ושמונה שיחות כלא מתאימות.
אלא שהסיווג האוטומטי לא סיפר את כל הסיפור. מומחים בדקו 45 שיחות שסומנו לבדיקה ואישרו חמישה אירועים קריטיים. בנוסף, בבדיקה עצמאית של מדגם אקראי בן 100 שיחות שהמערכת סיווגה כטובות, נמצאו עוד ארבע שיחות עם טעויות בעלות משמעות קלינית. זהו שיעור של 4% בתוך המדגם של השיחות שסווגו כטובות, עם רווח סמך של 1.6%–9.8% — ולא שיעור הטעויות הקריטיות בכלל השיחות.
בין הכשלים שתיארו החוקרים: המלצה לא מתאימה על ממנטין בהקשר של דמנציה בפרקינסון, וכן שיחה שבה הופיע דיווח מפורש על מחשבות אובדניות בלי שהמערכת הפעילה כראוי את תגובת החירום המתוכננת. הכשלים חולקו לשלושה סוגים: גבולות ידע, בעיות עמידות ואי־הסלמה במצבים המחייבים הפניה לגורם אנושי.
המסר אינו שהצ׳אטבוט נכשל בכללותו. זהו מחקר של מערכת אחת, בתחום מחלה אחד ובתקופת מעקב מוגבלת; הוא לא השווה את המערכת לצוות רפואי ולא בדק תוצאות בריאותיות אצל המשתמשים. גם ארבע הטעויות שנמצאו במדגם אינן מאפשרות להעריך בדיוק את שיעור הכשל הכולל.
עם זאת, הממצאים מדגימים פער חשוב בין מדדי איכות אוטומטיים לבין בטיחות קלינית. מערכת יכולה לקבל ציונים טובים ברוב השיחות ועדיין להחמיץ מספר קטן של מקרים שבהם המחיר האפשרי גבוה. החוקרים מציעים מסגרת בשם CARE-LLM, המשלבת סינון של כל השיחות, בדיקת מומחים למקרים חשודים, דגימה אקראית גם מתוך השיחות שסווגו כטובות ולולאת משוב לתיקון סוגי כשל חוזרים.
למחקר יש גם הקשר שכדאי להביא בחשבון: אחד המחברים הוא מייסד החברה שפיתחה את המערכת, ומחבר נוסף עומד בראש הקרן שהזמינה ומפעילה אותה. לפי המאמר, ההכרעה הקלינית במקרים הקריטיים נעשתה בידי חוקרים ללא קשר מסחרי או ניהולי למערכת.
בשורה התחתונה, צ׳אטבוטים רפואיים אינם יכולים להסתמך רק על בדיקות לפני ההשקה או על ציון אוטומטי ממוצע. אם הם פועלים מול מטופלים, נדרש ניטור מתמשך ברמת השיחה, ביקורת אנושית ומנגנון הסלמה אמין — במיוחד סביב תרופות, מצוקה נפשית ומצבים דחופים. המערכת שנבדקה מיועדת למידע ואינה תחליף לייעוץ, אבחון או טיפול רפואי.
שינויים קטנים ועקביים בהרגלי התזונה וההתאוששות עשויים להיות משמעותיים לאורך זמן. מומלץ לבחון אותם לצד מדדים אישיים ובהתייעצות מקצועית כשנדרש.
