The Integral Project ברשתות · בקרוב
המומחיםמילוןפודקאסט

בריאות, נפש וטכנולוגיה

כתבות ומחקרים

שישה מודלי AI המליצו על מינוני אנטיביוטיקה בפער של עד 1,000%

בסדרת תרחישים של פגיעה כלייתית וטיפול כלייתי חלופי רציף, ההמלצות של שישה מודלי שפה תאמו לספרות בממוצע ב־63% בלבד. כשאותו מודל נשאל שוב, המינון היומי שהציע השתנה לעיתים עד 1,000% — תזכורת שמינון תרופות אינו משימה לצ׳אטבוט לבדו.

צוות The Integral Project · בעריכת יורי אלטשולרעל העריכה והאחריות המערכתית1.10.20262 דק' קריאה
שיתוף הכתבה
שישה מודלי AI המליצו על מינוני אנטיביוטיקה בפער של עד 1,000%
הדמיה ארכיונית: מערכת The Integral Project · נוצרה באמצעות בינה מלאכותית

מודל שפה יכול לנסח המלצת מינון בביטחון, אבל הביטחון אינו מבטיח עקביות או דיוק. סדרת מקרים שפורסמה ב־Pharmacotherapy בדקה מה קורה כששישה מודלי AI חינמיים מתבקשים להמליץ על מינוני אנטיביוטיקה במצבים כלייתיים מורכבים — ומצאה פערים גדולים בין המודלים וגם בין תשובות חוזרות של אותו מודל.

מה נבדק

שישה חוקרים הציגו ל־ChatGPT, Claude, Gemini, Microsoft Copilot, OpenEvidence ו־Perplexity שלושה תרחישים מתוקננים: מבוגר עם פגיעה כלייתית חריפה שקיבל cefepime, ילד שקיבל cefepime במהלך טיפול כלייתי חלופי רציף (CKRT), ופעוט שקיבל meropenem במהלך CKRT בעצימות גבוהה.

החוקרים השוו את המינונים לספרות הראשונית ובדקו גם את הנימוקים, השימוש במשוואות פרמקוקינטיות, דיוק המקורות, הכרה באי־ודאות והמלצה על ניטור רמות התרופה. כדי לבחון עקביות, כל חוקר שאל מודל אחד שלוש פעמים על כל תרחיש.

התשובות השתנו מאוד

ההתאמה הממוצעת להמלצות המבוססות על הספרות הייתה 63%, עם טווח רחב של 28%–94% בין המודלים והתרחישים. בחזרות על אותה שאלה לאותו משתמש, השונות במינון האחזקה היומי שהומלץ נעה מאפס ועד 1,000%.

OpenEvidence היה היחיד שהציג בכל המקרים מקורות רלוונטיים. מודלים אחרים השתמשו במקורות באופן לא עקבי או המציאו הפניות. כולם המליצו על ניטור תרופתי, אך לפי החוקרים רק Claude ציין בעקביות את אי־הוודאות בתשובה שלו.

למה זה חשוב

בפגיעה כלייתית חריפה וב־CKRT, פינוי התרופה עשוי להשתנות במהירות. מינון נמוך מדי עלול להיכשל בטיפול בזיהום, ומינון גבוה מדי עלול להגביר רעילות — במיוחד באנטיביוטיקות כמו cefepime, שעודף ממנה עלול לפגוע במערכת העצבים. לכן תשובה שנשמעת מקצועית אך משתנה בין ניסיונות אינה בסיס בטוח להחלטה קלינית.

עם זאת, זהו מחקר קטן של תרחישים מדומים, לא ניסוי במטופלים ולא השוואה מלאה בין כל גרסאות המודלים. הביצועים גם עשויים להשתנות עם עדכוני תוכנה, ניסוח הפרומפט וגישה למקורות. אי אפשר להסיק ממנו שמודל אחד עדיף באופן כללי.

השורה התחתונה

מודלי שפה עשויים לעזור בחיפוש ספרות או ביצירת שאלות לבדיקה, אבל המחקר הזה אינו תומך בשימוש בהם לבדם לקביעת מינון אנטיביוטיקה בחולים קשים. החלטות כאלה דורשות רוקח או רופאה, נתונים עדכניים על תפקוד הכליות ולעיתים ניטור רמות התרופה בדם.

מה אפשר לקחת מהמחקר?

שינויים קטנים ועקביים בהרגלי התזונה וההתאוששות עשויים להיות משמעותיים לאורך זמן. מומלץ לבחון אותם לצד מדדים אישיים ובהתייעצות מקצועית כשנדרש.

User Beware: Inaccuracy and Inconsistency of Large Language Models in Providing Precision Dosing Recommendations for Patients With Kidney Impairment (2026)המקור המחקרי
THE INTEGRAL UPDATE

העדכונים החשובים, ישר למייל

כתבות חדשות, מחקרים ועדכונים כלליים מ־The Integral Project — בלי רעש מיותר.

האימייל נשמר באופן מאובטח ולא יימסר לצדדים שלישיים לצורכי פרסום.

אהבתם את הכתבה?

המשוב שלכם עוזר לנו לבחור את התוכן הבא.

תגובות הקוראים

היו הראשונים להגיב

התגובה תפורסם לאחר בדיקה קצרה.
שאלו את PulseAI על המחקר
היועץ המדעי PulseAI