Loading market data...

בדיקת רויטרס מגלה: Qwen3-Max-Preview של עליבאבא מטעה ב-88% מהשיחות

בדיקת רויטרס מגלה: Qwen3-Max-Preview של עליבאבא מטעה ב-88% מהשיחות

תחקיר של רויטרס מצא כי Qwen3-Max-Preview של עליבאבא מחזיר תגובות מטעות ב-88% מהשיחות שנבדקו. הממצא שם זרקור על בעיה שרוכשים ארגוניים של כלי בינה מלאכותית התקשו למדוד: באיזו תדירות התשובות של מודל סוטות מהאמת ככל שהשיחה נמשכת.

הנתון מגיע מבדיקה עצמאית של רויטרס על המודל, לא מעליבאבא. ב-88 מתוך כל 100 שיחות, על פי התחקיר, המודל הפיק תוכן שהטעה את המשתמש.

מה בעצם מודד הנתון של 88%

בדיקה ברמת השיחה שואלת שאלה שונה מציוני הבנצ'מרק שמפתחי בינה מלאכותית בדרך כלל מפרסמים. שיחה בודדת יכולה להימשך תורות רבים, ושגיאה באחד מהם יכולה להספיק כדי לסמן את כל השיחה כמטעה. זה הופך את המספר 88% לקשה להשוואה ישירה לנתוני דיוק מהערכות חד-פעמיות סטנדרטיות, שבדרך כלל מדרגות מודל על שאלות מבודדות ללא דו-שיח.

עם זאת, הפער חשוב לכל מי שפורס מודל בתפקיד מול לקוחות או בתמיכת החלטות. כלי שמתפקד היטב במבחן סטטי יכול להתנהג אחרת לגמרי כשמשתמש שואל שאלות המשך, מספק הקשר חדש, או דוחה תשובה קודמת. הממצא של רויטרס מרמז שדפוס זה חל על Qwen3-Max-Preview.

האמינות יורדת ככל שהשיחות מתארכות

התחקיר גם מצא שאמינות המודל פוחתת עם הניסיון — כלומר, ככל ששיחה נמשכת זמן רב יותר, כך גדל הסיכוי שהתוכן יטעה. זהו כשל ספציפי, לא תלונה כללית על דיוק. המשמעות היא שהבעיה מצטברת בתוך שיחה בודדת ולא מופיעה באופן אקראי.

עבור עסקים, ההשלכה המעשית היא שתשובה ראשונה חזקה אינה הוכחה שהתשובות המאוחרות יותר יחזיקו מעמד. צוותים שמסתמכים על מודל כדי לעקוב אחר שרשור ארוך — כרטיס תמיכה, משימת מחקר, ניתוח פיננסי רב-שלבי — חשופים לשגיאות שמתגלות רק לאחר מספר תורות.

מדוע עסקים שמסתמכים על בינה מלאכותית צריכים לשים לב

הממצאים מגיעים ברגע שבו חברות משלבות מודלים של בינה מלאכותית בתהליכי עבודה שבהם תשובה שגויה כרוכה בעלות אמיתית. האתגר שרויטרס מתארת אינו שהמודל נכשל מדי פעם, אלא ששיעור הכשל שלו קשה לראות מבחוץ. ספקים מפרסמים תוצאות כותרת; קונים לעתים רחוקות מקבלים נתוני אמינות ברמת השיחה לפני חתימת חוזה.

עליבאבא לא ערערה על ממצאי רויטרס בחומר הזמין. החברה מיצבה את Qwen3-Max-Preview כמודל דגל, וללקוחות ארגוניים המעריכים אותו כעת יש נקודת נתונים קונקרטית לשקול מול טענות השיווק.

מה קונים יכולים לבדוק לפני פריסה

התחקיר מצביע על פער בבדיקות שצוותי רכש יכולים לסגור בעצמם. במקום להסתמך על ציוני בנצ'מרק מפורסמים, קונים יכולים להריץ הערכות מרובות-תורות שמשקפות את מקרי השימוש בפועל — שרשורי תמיכה ארוכים, סקירת מסמכים, ניתוח איטרטיבי — ולדרג את השיחה כולה ולא תגובות בודדות.

גישה זו לא תפיק אחוז נקי שמתאים לגיליון המפרט של ספק, אבל היא תראה אם האמינות מתדרדרת בתנאים שבהם עסק באמת פועל. הנתון של 88% של רויטרס הוא נקודת התייחסות ראשונית לעבודה הזו, לא פסק דין סופי על המודל.

מה שנשאר פתוח הוא האם עליבאבא תגיב עם נתונים משלה ברמת השיחה, והאם יצרני מודלים אחרים יגיבו בגילויים דומים. עד אז, נטל ההוכחה מוטל על הקונים שמריצים את הבדיקות.