وجد تحقيق أجرته رويترز أن Qwen3-Max-Preview من علي بابا يعيد ردودًا مضللة في 88% من الجلسات التي تم اختبارها. وتسلط هذه النتيجة الضوء على مشكلة طالما واجه المشترون من الشركات صعوبة في قياسها عند شراء أدوات الذكاء الاصطناعي: وهي عدد المرات التي تنحرف فيها إجابات النموذج عن الحقيقة مع استمرار المحادثة.
يأتي هذا الرقم من اختبار رويترز الخاصة للنموذج، وليس من علي بابا. ففي 88 من كل 100 جلسة، وفقًا للتحقيق، أنتج النموذج مخرجات ضللت المستخدم.
ما الذي يقيسه رقم 88% فعليًا
يطرح الاختبار على مستوى الجلسة سؤالًا مختلفًا عن درجات المعايير التي ينشرها مطورو الذكاء الاصطناعي عادةً. فقد تمتد الجلسة الواحدة لعدة أدوار، ويكفي خطأ في أي منها لتصنيف الجلسة بأكملها على أنها مضللة. وهذا يجعل من الصعب مقارنة رقم 88% مباشرة بأرقام الدقة من التقييمات المعيارية ذات اللقطة الواحدة، والتي تقيم عادةً النموذج على أسئلة منفصلة دون أي تبادل حوار.
ومع ذلك، تهم هذه الفجوة أي شخص ينشر نموذجًا في دور مواجه للعملاء أو دعم القرار. فالأداة التي تؤدي أداءً جيدًا في اختبار ثابت يمكن أن تتصرف بشكل مختلف جدًا عندما يطرح المستخدم أسئلة متابعة، أو يقدم سياقًا جديدًا، أو يعترض على إجابة سابقة. وتشير نتيجة رويترز إلى أن هذا النمط ينطبق على Qwen3-Max-Preview.
الموثوقية تنخفض مع طول الجلسات
وجد التحقيق أيضًا أن موثوقية النموذج تتضاءل مع الخبرة — بمعنى أنه كلما طالت الجلسة، زاد احتمال تضليل المخرجات. وهذا نمط فشل محدد، وليس شكوى عامة بشأن الدقة. وهو يعني أن المشكلة تتفاقم داخل المحادثة الواحدة بدلًا من أن تظهر بشكل عشوائي.
وبالنسبة للشركات، فإن النتيجة العملية هي أن إجابة أولى قوية ليست دليلًا على أن الإجابات اللاحقة ستصمد. فالفرق التي تعتمد على نموذج لتتبع سلسلة طويلة — تذكرة دعم، أو مهمة بحثية، أو تحليل مالي متعدد الخطوات — معرضة لأخطاء لا تظهر إلا بعد عدة أدوار.
لماذا ينبغي للشركات التي تعتمد على الذكاء الاصطناعي أن تنتبه
تأتي هذه النتائج في وقت تدمج فيه الشركات نماذج الذكاء الاصطناعي في سير عمل يحمل فيه الجواب الخاطئ تكلفة حقيقية. والتحدي الذي تصفه رويترز ليس أن النموذج يفشل أحيانًا، بل أن معدل فشله يصعب رؤيته من الخارج. فالبائعون ينشرون نتائج رئيسية؛ بينما نادرًا ما يحصل المشترون على بيانات موثوقية على مستوى الجلسة قبل توقيع العقد.
ولم تنفِ علي بابا نتائج رويترز في المواد المتاحة. وقد روّجت الشركة لـ Qwen3-Max-Preview كنموذج رائد، ولدى العملاء من المؤسسات الذين يقيّمونه الآن نقطة بيانات ملموسة يمكنهم موازنتها مع الادعاءات التسويقية.
ما يمكن للمشترين التحقق منه قبل النشر
يشير التحقيق إلى فجوة في الاختبار يمكن لفرق الشراء سدها بنفسها. فبدلًا من الاعتماد على درجات المعايير المنشورة، يمكن للمشترين إجراء تقييمات متعددة الأدوار تحاكي حالات الاستخدام الفعلية — سلاسل دعم طويلة، ومراجعة مستندات، وتحليل تكراري — وتقييم الجلسة الكاملة بدلًا من الردود الفردية.
لن ينتج هذا النهج نسبة مئوية نظيفة تطابق ورقة مواصفات البائع، لكنه سيُظهر ما إذا كانت الموثوقية تتدهور في الظروف التي تعمل فيها الشركة فعليًا. ويعد رقم رويترز البالغ 88% نقطة مرجعية أولية لهذا العمل، وليس حكمًا نهائيًا على النموذج.
ويبقى السؤال مفتوحًا حول ما إذا كانت علي بابا سترد ببيانات خاصة بها على مستوى الجلسة، وما إذا كان صانعو نماذج آخرون سيسيرون على خطى إفصاحات مماثلة. وحتى ذلك الحين، يقع عبء الإثبات على عاتق المشترين الذين يجرون الاختبارات.




