Investigasi Reuters menemukan bahwa Qwen3-Max-Preview dari Alibaba memberikan respons yang menyesatkan dalam 88% sesi yang diuji. Temuan ini menyoroti masalah yang sulit diukur oleh pembeli korporat alat AI: seberapa sering jawaban model melenceng dari kebenaran seiring berjalannya percakapan.
Angka tersebut berasal dari pengujian Reuters sendiri terhadap model tersebut, bukan dari Alibaba. Dalam 88 dari setiap 100 sesi, menurut investigasi tersebut, model menghasilkan output yang menyesatkan pengguna.
Apa yang sebenarnya diukur oleh angka 88%
Pengujian tingkat sesi mengajukan pertanyaan yang berbeda dari skor tolok ukur yang biasanya dipublikasikan pengembang AI. Satu sesi dapat berlangsung selama banyak giliran, dan kesalahan pada salah satunya bisa cukup untuk menandai seluruh sesi sebagai menyesatkan. Hal itu membuat angka 88% sulit dibandingkan secara langsung dengan angka akurasi dari evaluasi satu kali standar, yang biasanya menilai model pada pertanyaan-pertanyaan terpisah tanpa tanya jawab.
Meski demikian, kesenjangan itu penting bagi siapa pun yang menggunakan model dalam peran yang berhadapan dengan pelanggan atau mendukung pengambilan keputusan. Alat yang berkinerja baik pada tes statis dapat berperilaku sangat berbeda ketika pengguna mengajukan pertanyaan lanjutan, memberikan konteks baru, atau membantah jawaban sebelumnya. Temuan Reuters menunjukkan pola tersebut berlaku pada Qwen3-Max-Preview.
Keandalan menurun seiring sesi menjadi lebih panjang
Investigasi juga menemukan bahwa keandalan model berkurang seiring pengalaman — artinya semakin lama sesi berjalan, semakin besar kemungkinan output menyesatkan. Ini adalah mode kegagalan yang spesifik, bukan keluhan umum tentang akurasi. Ini menyiratkan masalah tersebut menumpuk di dalam satu percakapan, bukan muncul secara acak.
Bagi bisnis, konsekuensi praktisnya adalah jawaban pertama yang kuat bukan bukti bahwa jawaban selanjutnya akan bertahan. Tim yang mengandalkan model untuk melacak utas panjang — tiket dukungan, tugas riset, analisis keuangan multi-langkah — terpapar pada kesalahan yang baru muncul setelah beberapa giliran.
Mengapa bisnis yang mengandalkan AI harus memperhatikan
Temuan ini muncul pada saat perusahaan memasukkan model AI ke dalam alur kerja di mana jawaban yang salah membawa biaya nyata. Tantangan yang dijelaskan Reuters bukanlah bahwa model kadang-kadang gagal, tetapi bahwa tingkat kegagalannya sulit dilihat dari luar. Vendor mempublikasikan hasil utama; pembeli jarang mendapatkan data keandalan tingkat sesi sebelum menandatangani kontrak.
Alibaba tidak membantah temuan Reuters dalam materi yang tersedia. Perusahaan telah memposisikan Qwen3-Max-Preview sebagai model unggulan, dan pelanggan perusahaan yang mengevaluasinya kini memiliki titik data konkret untuk ditimbang terhadap klaim pemasaran.
Apa yang dapat diperiksa pembeli sebelum penerapan
Investigasi menunjukkan adanya celah pengujian yang dapat ditutup sendiri oleh tim pengadaan. Daripada mengandalkan skor tolok ukur yang dipublikasikan, pembeli dapat menjalankan evaluasi multi-giliran yang mencerminkan kasus penggunaan aktual mereka — utas dukungan panjang, tinjauan dokumen, analisis iteratif — dan menilai seluruh sesi, bukan balasan individual.
Pendekatan itu tidak akan menghasilkan persentase bersih yang sesuai dengan lembar spesifikasi vendor, tetapi akan menunjukkan apakah keandalan menurun dalam kondisi bisnis yang sebenarnya. Angka 88% Reuters adalah titik referensi awal untuk pekerjaan itu, bukan putusan akhir atas model tersebut.
Yang masih terbuka adalah apakah Alibaba akan merespons dengan data tingkat sesinya sendiri, dan apakah pembuat model lain akan menyusul dengan pengungkapan serupa. Sampai saat itu, beban pembuktian ada pada pembeli yang menjalankan pengujian.




