The Integral Project ברשתות · בקרוב
המומחיםמילוןפודקאסט

בריאות, נפש וטכנולוגיה

כתבות ומחקרים

ChatGPT ו־Claude התאימו ל־Stata ב־92.3% — אבל נבחנו רק שני מאגרים

מחקר השווה את GPT-5.5 ואת Claude Sonnet 4.6 ל־Stata בחישוב סטטיסטיקה תיאורית. בשני מאגרי הדגמה נקיים התקבלה התאמה מדויקת ב־92.3% מהקטגוריות; יתר הפערים נבעו מהגדרה תקפה אחרת לרבעונים.

צוות The Integral Project · בעריכת יורי אלטשולרעל העריכה והאחריות המערכתית15.9.20262 דק' קריאה
שיתוף הכתבה
ChatGPT ו־Claude התאימו ל־Stata ב־92.3% — אבל נבחנו רק שני מאגרים
הדמיה: מערכת The Integral Project · נוצרה באמצעות בינה מלאכותית

מודלי שפה נכנסים גם לעבודת הנתונים של מחקר רפואי, אבל תשובה שנראית מספרית ומדויקת אינה בהכרח נכונה. מחקר חדש בדק משימה צרה וניתנת לאימות: האם ChatGPT ו־Claude מסוגלים לחשב סטטיסטיקה תיאורית ישירות מטבלאות נתונים.

מה בדקו

החוקרים השוו את GPT-5.5 ואת Claude Sonnet 4.6 ל־Stata 15, ששימשה תקן ייחוס. הם השתמשו בשני מאגרי הדגמה ציבוריים של Stata: אחד עם 74 תצפיות ו־12 משתנים, והשני עם 956 תצפיות ו־6 משתנים. שמות המשתנים הוחלפו בתוויות כלליות כדי לצמצם את הסיכוי שהמודלים יזהו מאגר מוכר.

כל מאגר נמסר למודלים בשלוש דרכים — העתקה לצ׳אט, קובץ Word וקובץ Excel — וכל מצב הורץ פעמיים בשיחות נפרדות. נבדקו ספירות של ערכים חסרים וקיימים, מינימום ומקסימום, ממוצע, סטיית תקן, חציון, רבעונים, שכיחויות ואחוזים. בסך הכול הוערכו 624 קטגוריות חישוב לכל מודל.

מה נמצא

שני המודלים הפיקו תוצאות זהות בכל ההרצות. ב־576 מתוך 624 הקטגוריות — 92.3% — הייתה התאמה מדויקת ל־Stata. כל 48 הפערים נגעו לרבעון הראשון והשלישי בשמונה משתנים.

בניתוח שנעשה לאחר מכן התברר שהמודלים השתמשו באינטרפולציה ליניארית, שיטה מתמטית תקפה לחישוב רבעונים, בעוד Stata השתמשה בהגדרה אחרת. כאשר החוקרים הורו למודלים במפורש לעבוד לפי שיטת Stata, הפערים נעלמו. כלומר, במחקר הזה לא זוהתה טעות חישובית לאחר שהובאה בחשבון הגדרת הרבעונים.

למה עדיין צריך להיזהר

זהו מבחן נקי ומצומצם, לא אישור להשתמש בצ׳אטבוט כסטטיסטיקאי. נבדקו רק שני מאגרי הדגמה, הגדול שבהם כלל פחות מאלף שורות, והמשימה הוגבלה לסטטיסטיקה תיאורית. לא נבדקו נתונים קליניים מלוכלכים, דפוסי חסר מורכבים, רגרסיה, הישרדות, בדיקת הנחות או הסקה סיבתית.

גם מנגנון החישוב נשאר עמום: המודלים הופעלו דרך ממשקי הווב הרגילים, ולכן החוקרים לא יכלו לדעת אם התוצאה חושבה בידי המודל עצמו, באמצעות קוד שנוצר או בעזרת כלי חישוב מובנה. שתי חזרות בלבד בכל מצב אינן מוכיחות יציבות לאורך זמן, ועדכון גרסה יכול לשנות את התוצאה.

השורה התחתונה: במשימה בסיסית ועל נתונים נקיים, שני המודלים היו מדויקים ועקביים מאוד. אבל בעבודה רפואית ההגדרה הסטטיסטית חשובה לא פחות מהמספר, ותוצאה של LLM עדיין צריכה להיבדק מול תוכנה ייעודית ואיש מקצוע לפני פרסום או קבלת החלטה.

מה אפשר לקחת מהמחקר?

שינויים קטנים ועקביים בהרגלי התזונה וההתאוששות עשויים להיות משמעותיים לאורך זמן. מומלץ לבחון אותם לצד מדדים אישיים ובהתייעצות מקצועית כשנדרש.

המחקר המלא: השוואת ChatGPT ו־Claude בחישוב סטטיסטיקה תיאוריתהמקור המחקרי
THE INTEGRAL UPDATE

העדכונים החשובים, ישר למייל

כתבות חדשות, מחקרים ועדכונים כלליים מ־The Integral Project — בלי רעש מיותר.

האימייל נשמר באופן מאובטח ולא יימסר לצדדים שלישיים לצורכי פרסום.

אהבתם את הכתבה?

המשוב שלכם עוזר לנו לבחור את התוכן הבא.

תגובות הקוראים

היו הראשונים להגיב

התגובה תפורסם לאחר בדיקה קצרה.
שאלו את PulseAI על המחקר
היועץ המדעי PulseAI