Loading market data...

یافته‌های رویترز: Qwen3-Max-Preview علی‌بابا در ۸۸٪ جلسات گمراه‌کننده است

یافته‌های رویترز: Qwen3-Max-Preview علی‌بابا در ۸۸٪ جلسات گمراه‌کننده است

یک تحقیق رویترز نشان داده است که مدل Qwen3-Max-Preview علی‌بابا در ۸۸٪ جلسات آزمایش‌شده پاسخ‌های گمراه‌کننده ارائه می‌دهد. این یافته، نوری بر مشکلی می‌تاباند که خریداران سازمانی ابزارهای هوش مصنوعی در اندازه‌گیری آن با دشواری مواجه بوده‌اند: اینکه پاسخ‌های یک مدل با ادامه گفتگو چقدر از حقیقت فاصله می‌گیرد.

این رقم از آزمایش خود رویترز بر روی مدل به دست آمده است، نه از علی‌بابا. بر اساس این تحقیق، در ۸۸ جلسه از هر ۱۰۰ جلسه، مدل خروجی‌ای تولید کرد که کاربر را گمراه کرد.

رقم ۸۸٪ در واقع چه چیزی را اندازه می‌گیرد

آزمایش در سطح جلسه، پرسشی متفاوت از نمرات بنچمارکی که توسعه‌دهندگان هوش مصنوعی معمولاً منتشر می‌کنند، مطرح می‌کند. یک جلسه واحد می‌تواند شامل نوبت‌های بسیاری باشد و خطا در هر یک از آن‌ها می‌تواند کافی باشد تا کل جلسه به‌عنوان گمراه‌کننده علامت‌گذاری شود. این موضوع مقایسه مستقیم عدد ۸۸٪ را با ارقام دقت حاصل از ارزیابی‌های استاندارد تک‌نوبتی دشوار می‌کند، ارزیابی‌هایی که معمولاً یک مدل را روی پرسش‌های مجزا و بدون گفتگوی رفت‌وبرگشتی نمره‌دهی می‌کنند.

با این حال، این شکاف برای هر کسی که مدلی را در نقشی مشتری‌محور یا پشتیبان تصمیم‌گیری به کار می‌گیرد اهمیت دارد. ابزاری که در یک آزمون ایستا عملکرد خوبی دارد، می‌تواند زمانی که کاربر پرسش‌های پیگیرانه می‌پرسد، زمینه جدیدی ارائه می‌دهد، یا به پاسخ قبلی اعتراض می‌کند، رفتار بسیار متفاوتی از خود نشان دهد. یافته رویترز نشان می‌دهد که این الگو در مورد Qwen3-Max-Preview نیز صادق است.

با طولانی‌تر شدن جلسات، قابلیت اطمینان کاهش می‌یابد

این تحقیق همچنین دریافت که قابلیت اطمینان مدل با تجربه کاهش می‌یابد — یعنی هرچه یک جلسه طولانی‌تر شود، احتمال گمراه‌کننده بودن خروجی بیشتر می‌شود. این یک حالت شکست مشخص است، نه یک شکایت کلی درباره دقت. این امر دلالت بر آن دارد که مشکل درون یک گفتگوی واحد تشدید می‌شود، نه اینکه به‌صورت تصادفی ظاهر شود.

برای کسب‌وکارها، پیامد عملی این است که یک پاسخ اولیه قوی شاهدی بر معتبر ماندن پاسخ‌های بعدی نیست. تیم‌هایی که به مدل برای پیگیری یک رشته طولانی — مانند یک تیکت پشتیبانی، یک کار تحقیقاتی، یا یک تحلیل مالی چندمرحله‌ای — تکیه می‌کنند، در معرض خطاهایی قرار می‌گیرند که تنها پس از چند نوبت آشکار می‌شوند.

چرا کسب‌وکارهایی که به هوش مصنوعی تکیه می‌کنند باید توجه کنند

این یافته‌ها در زمانی منتشر می‌شود که شرکت‌ها مدل‌های هوش مصنوعی را در جریان‌های کاری‌ای ادغام می‌کنند که پاسخ نادرست در آن‌ها هزینه واقعی به همراه دارد. چالشی که رویترز توصیف می‌کند این نیست که یک مدل گهگاه شکست می‌خورد، بلکه این است که نرخ شکست آن به‌سختی از بیرون قابل مشاهده است. فروشندگان نتایج اصلی را منتشر می‌کنند؛ خریداران به‌ندرت پیش از امضای قرارداد داده‌های قابلیت اطمینان در سطح جلسه را دریافت می‌کنند.

علی‌بابا در مطالب موجود، یافته‌های رویترز را رد نکرده است. این شرکت Qwen3-Max-Preview را به‌عنوان یک مدل پرچم‌دار معرفی کرده است و مشتریان سازمانی که اکنون در حال ارزیابی آن هستند، یک نقطه داده مشخص برای سنجش در برابر ادعاهای بازاریابی دارند.

خریداران پیش از استقرار چه چیزی را می‌توانند بررسی کنند

این تحقیق به شکافی در آزمایش اشاره می‌کند که تیم‌های تدارکات می‌توانند خودشان آن را پر کنند. خریداران به‌جای تکیه بر نمرات بنچمارک منتشرشده، می‌توانند ارزیابی‌های چندنوبتی را اجرا کنند که موارد استفاده واقعی آن‌ها را بازتاب می‌دهد — رشته‌های پشتیبانی طولانی، بازبینی اسناد، تحلیل تکراری — و کل جلسه را نمره‌دهی کنند، نه پاسخ‌های فردی را.

این رویکرد درصد تمیزی که با برگه مشخصات فروشنده مطابقت داشته باشد تولید نمی‌کند، اما نشان می‌دهد که آیا قابلیت اطمینان در شرایطی که یک کسب‌وکار واقعاً در آن فعالیت می‌کند کاهش می‌یابد یا خیر. رقم ۸۸٪ رویترز یک نقطه مرجع شروع برای آن کار است، نه حکم نهایی درباره مدل.

آنچه باز می‌ماند این است که آیا علی‌بابا با داده‌های سطح جلسه خود پاسخ می‌دهد، و آیا سایر سازندگان مدل با افشاگری‌های قابل مقایسه از آن پیروی می‌کنند. تا آن زمان، بار اثبات بر دوش خریدارانی است که آزمایش‌ها را اجرا می‌کنند.