یک تحقیق رویترز نشان داده است که مدل Qwen3-Max-Preview علیبابا در ۸۸٪ جلسات آزمایششده پاسخهای گمراهکننده ارائه میدهد. این یافته، نوری بر مشکلی میتاباند که خریداران سازمانی ابزارهای هوش مصنوعی در اندازهگیری آن با دشواری مواجه بودهاند: اینکه پاسخهای یک مدل با ادامه گفتگو چقدر از حقیقت فاصله میگیرد.
این رقم از آزمایش خود رویترز بر روی مدل به دست آمده است، نه از علیبابا. بر اساس این تحقیق، در ۸۸ جلسه از هر ۱۰۰ جلسه، مدل خروجیای تولید کرد که کاربر را گمراه کرد.
رقم ۸۸٪ در واقع چه چیزی را اندازه میگیرد
آزمایش در سطح جلسه، پرسشی متفاوت از نمرات بنچمارکی که توسعهدهندگان هوش مصنوعی معمولاً منتشر میکنند، مطرح میکند. یک جلسه واحد میتواند شامل نوبتهای بسیاری باشد و خطا در هر یک از آنها میتواند کافی باشد تا کل جلسه بهعنوان گمراهکننده علامتگذاری شود. این موضوع مقایسه مستقیم عدد ۸۸٪ را با ارقام دقت حاصل از ارزیابیهای استاندارد تکنوبتی دشوار میکند، ارزیابیهایی که معمولاً یک مدل را روی پرسشهای مجزا و بدون گفتگوی رفتوبرگشتی نمرهدهی میکنند.
با این حال، این شکاف برای هر کسی که مدلی را در نقشی مشتریمحور یا پشتیبان تصمیمگیری به کار میگیرد اهمیت دارد. ابزاری که در یک آزمون ایستا عملکرد خوبی دارد، میتواند زمانی که کاربر پرسشهای پیگیرانه میپرسد، زمینه جدیدی ارائه میدهد، یا به پاسخ قبلی اعتراض میکند، رفتار بسیار متفاوتی از خود نشان دهد. یافته رویترز نشان میدهد که این الگو در مورد Qwen3-Max-Preview نیز صادق است.
با طولانیتر شدن جلسات، قابلیت اطمینان کاهش مییابد
این تحقیق همچنین دریافت که قابلیت اطمینان مدل با تجربه کاهش مییابد — یعنی هرچه یک جلسه طولانیتر شود، احتمال گمراهکننده بودن خروجی بیشتر میشود. این یک حالت شکست مشخص است، نه یک شکایت کلی درباره دقت. این امر دلالت بر آن دارد که مشکل درون یک گفتگوی واحد تشدید میشود، نه اینکه بهصورت تصادفی ظاهر شود.
برای کسبوکارها، پیامد عملی این است که یک پاسخ اولیه قوی شاهدی بر معتبر ماندن پاسخهای بعدی نیست. تیمهایی که به مدل برای پیگیری یک رشته طولانی — مانند یک تیکت پشتیبانی، یک کار تحقیقاتی، یا یک تحلیل مالی چندمرحلهای — تکیه میکنند، در معرض خطاهایی قرار میگیرند که تنها پس از چند نوبت آشکار میشوند.
چرا کسبوکارهایی که به هوش مصنوعی تکیه میکنند باید توجه کنند
این یافتهها در زمانی منتشر میشود که شرکتها مدلهای هوش مصنوعی را در جریانهای کاریای ادغام میکنند که پاسخ نادرست در آنها هزینه واقعی به همراه دارد. چالشی که رویترز توصیف میکند این نیست که یک مدل گهگاه شکست میخورد، بلکه این است که نرخ شکست آن بهسختی از بیرون قابل مشاهده است. فروشندگان نتایج اصلی را منتشر میکنند؛ خریداران بهندرت پیش از امضای قرارداد دادههای قابلیت اطمینان در سطح جلسه را دریافت میکنند.
علیبابا در مطالب موجود، یافتههای رویترز را رد نکرده است. این شرکت Qwen3-Max-Preview را بهعنوان یک مدل پرچمدار معرفی کرده است و مشتریان سازمانی که اکنون در حال ارزیابی آن هستند، یک نقطه داده مشخص برای سنجش در برابر ادعاهای بازاریابی دارند.
خریداران پیش از استقرار چه چیزی را میتوانند بررسی کنند
این تحقیق به شکافی در آزمایش اشاره میکند که تیمهای تدارکات میتوانند خودشان آن را پر کنند. خریداران بهجای تکیه بر نمرات بنچمارک منتشرشده، میتوانند ارزیابیهای چندنوبتی را اجرا کنند که موارد استفاده واقعی آنها را بازتاب میدهد — رشتههای پشتیبانی طولانی، بازبینی اسناد، تحلیل تکراری — و کل جلسه را نمرهدهی کنند، نه پاسخهای فردی را.
این رویکرد درصد تمیزی که با برگه مشخصات فروشنده مطابقت داشته باشد تولید نمیکند، اما نشان میدهد که آیا قابلیت اطمینان در شرایطی که یک کسبوکار واقعاً در آن فعالیت میکند کاهش مییابد یا خیر. رقم ۸۸٪ رویترز یک نقطه مرجع شروع برای آن کار است، نه حکم نهایی درباره مدل.
آنچه باز میماند این است که آیا علیبابا با دادههای سطح جلسه خود پاسخ میدهد، و آیا سایر سازندگان مدل با افشاگریهای قابل مقایسه از آن پیروی میکنند. تا آن زمان، بار اثبات بر دوش خریدارانی است که آزمایشها را اجرا میکنند.




