রয়টার্সের একটি তদন্তে দেখা গেছে যে আলিবাবার Qwen3-Max-Preview পরীক্ষিত সেশনের ৮৮% ক্ষেত্রে বিভ্রান্তিকর উত্তর দেয়। এই ফলাফল এআই টুলের কর্পোরেট ক্রেতাদের একটি সমস্যার দিকে আলোকপাত করে যা পরিমাপ করা তাদের জন্য কঠিন হয়ে দাঁড়িয়েছে: কথোপকথন যত এগোয়, মডেলের উত্তর সত্য থেকে কতটা সরে যায়।
এই সংখ্যাটি আলিবাবার নয়, বরং রয়টার্সের নিজস্ব পরীক্ষা থেকে পাওয়া। তদন্ত অনুসারে, প্রতি ১০০টি সেশনের ৮৮টিতে মডেলটি এমন আউটপুট দিয়েছে যা ব্যবহারকারীকে বিভ্রান্ত করেছে।
৮৮% সংখ্যাটি আসলে কী পরিমাপ করে
সেশন-স্তরের পরীক্ষা এআই ডেভেলপারদের সাধারণত প্রকাশিত বেঞ্চমার্ক স্কোরের চেয়ে ভিন্ন প্রশ্ন করে। একটি সেশন অনেক টার্ন ধরে চলতে পারে, এবং তার যেকোনো একটিতে ত্রুটি থাকলেই পুরো সেশনটিকে বিভ্রান্তিকর হিসেবে চিহ্নিত করা যথেষ্ট। ফলে ৮৮% সংখ্যাটি স্ট্যান্ডার্ড ওয়ান-শট মূল্যায়নের নির্ভুলতার পরিসংখ্যানের সাথে সরাসরি তুলনা করা কঠিন, যেখানে সাধারণত কোনো পাল্টাপাল্টি ছাড়াই বিচ্ছিন্ন প্রশ্নে মডেলকে স্কোর করা হয়।
তবুও, যে কেউ কোনো মডেলকে গ্রাহক-মুখী বা সিদ্ধান্ত-সমর্থন ভূমিকায় ব্যবহার করেন, তাদের জন্য এই ব্যবধানটি গুরুত্বপূর্ণ। যে টুল স্থির পরীক্ষায় ভালো করে, ব্যবহারকারী ফলো-আপ প্রশ্ন করলে, নতুন প্রসঙ্গ দিলে বা পূর্বের উত্তরে চাপ দিলে তার আচরণ সম্পূর্ণ ভিন্ন হতে পারে। রয়টার্সের ফলাফল ইঙ্গিত করে যে এই ধরণটি Qwen3-Max-Preview-এর ক্ষেত্রেও প্রযোজ্য।
সেশন দীর্ঘ হলে নির্ভরযোগ্যতা কমে
তদন্তে আরও পাওয়া গেছে যে মডেলটির নির্ভরযোগ্যতা অভিজ্ঞতার সাথে হ্রাস পায় — অর্থাৎ একটি সেশন যত দীর্ঘ চলে, আউটপুট বিভ্রান্তিকর হওয়ার সম্ভাবনা তত বেশি। এটি একটি নির্দিষ্ট ব্যর্থতার ধরন, নির্ভুলতা নিয়ে সাধারণ অভিযোগ নয়। এটি বোঝায় যে সমস্যাটি এলোমেলোভাবে না ঘটে বরং একটি কথোপকথনের ভেতরেই জমা হয়।
ব্যবসার জন্য এর ব্যবহারিক পরিণতি হলো, একটি শক্তিশালী প্রথম উত্তর প্রমাণ নয় যে পরবর্তী উত্তরগুলোও টিকবে। যে দলগুলো একটি মডেলের উপর নির্ভর করে দীর্ঘ থ্রেড — একটি সাপোর্ট টিকিট, একটি গবেষণা কাজ, একটি বহু-ধাপের আর্থিক বিশ্লেষণ — ট্র্যাক করতে, তারা এমন ত্রুটির মুখোমুখি হয় যা কয়েকটি টার্ন পরেই প্রকাশ পায়।
কেন এআই-নির্ভর ব্যবসাগুলোর মনোযোগ দেওয়া উচিত
এই ফলাফল এমন সময়ে এসেছে যখন কোম্পানিগুলো এআই মডেলগুলোকে এমন কর্মপ্রবাহে যুক্ত করছে যেখানে একটি ভুল উত্তরের প্রকৃত খরচ থাকে। রয়টার্স যে চ্যালেঞ্জটি বর্ণনা করেছে তা হলো মডেল মাঝে মাঝে ব্যর্থ হয় তা নয়, বরং এর ব্যর্থতার হার বাইরে থেকে দেখা কঠিন। বিক্রেতারা প্রধান ফলাফল প্রকাশ করে; ক্রেতারা চুক্তি স্বাক্ষরের আগে সেশন-স্তরের নির্ভরযোগ্যতার ডেটা খুব কমই পান।
উপলব্ধ তথ্যে আলিবাবা রয়টার্সের ফলাফলকে অস্বীকার করেনি। কোম্পানিটি Qwen3-Max-Preview-কে একটি ফ্ল্যাগশিপ মডেল হিসেবে উপস্থাপন করেছে, এবং এখন এটি মূল্যায়নকারী এন্টারপ্রাইজ গ্রাহকদের কাছে বিপণন দাবির বিপরীতে ওজন করার জন্য একটি সুনির্দিষ্ট ডেটা পয়েন্ট রয়েছে।
মোতায়েনের আগে ক্রেতারা কী যাচাই করতে পারেন
তদন্তটি একটি পরীক্ষার ঘাটতির দিকে ইঙ্গিত করে যা ক্রয় দলগুলো নিজেরাই পূরণ করতে পারে। প্রকাশিত বেঞ্চমার্ক স্কোরের উপর নির্ভর করার পরিবর্তে, ক্রেতারা বহু-টার্ন মূল্যায়ন চালাতে পারেন যা তাদের প্রকৃত ব্যবহারের ক্ষেত্রগুলোকে প্রতিফলিত করে — দীর্ঘ সাপোর্ট থ্রেড, নথি পর্যালোচনা, পুনরাবৃত্তিমূলক বিশ্লেষণ — এবং পৃথক উত্তর নয় বরং পুরো সেশনটি স্কোর করতে পারেন।
এই পদ্ধতি কোনো বিক্রেতার স্পেক শিটের সাথে মিলে যায় এমন একটি পরিষ্কার শতাংশ দেবে না, তবে এটি দেখাবে যে ব্যবসা সত্যিকার অর্থে যে পরিস্থিতিতে পরিচালিত হয় সেখানে নির্ভরযোগ্যতা হ্রাস পায় কিনা। রয়টার্সের ৮৮% সংখ্যাটি সেই কাজের জন্য একটি প্রাথমিক রেফারেন্স পয়েন্ট, মডেলের চূড়ান্ত রায় নয়।
যা খোলা রয়ে গেছে তা হলো আলিবাবা নিজস্ব সেশন-স্তরের ডেটা দিয়ে সাড়া দেয় কিনা, এবং অন্য মডেল নির্মাতারা তুলনামূলক প্রকাশ করে কিনা। ততক্ষণ পর্যন্ত, প্রমাণের দায়িত্ব পরীক্ষা পরিচালনাকারী ক্রেতাদের উপরেই থাকে।




