Loading market data...

Ujian Reuters Dapati Qwen3-Max-Preview Alibaba Mengelirukan dalam 88% Sesi

Ujian Reuters Dapati Qwen3-Max-Preview Alibaba Mengelirukan dalam 88% Sesi

Siasatan Reuters mendapati bahawa Qwen3-Max-Preview Alibaba memberikan respons yang mengelirukan dalam 88% sesi yang diuji. Penemuan ini menyerlahkan masalah yang sukar diukur oleh pembeli korporat alat AI: berapa kerap jawapan model menyimpang daripada kebenaran apabila perbualan berterusan.

Angka tersebut diperoleh daripada ujian Reuters sendiri terhadap model itu, bukan daripada Alibaba. Dalam 88 daripada setiap 100 sesi, menurut siasatan itu, model tersebut menghasilkan output yang mengelirukan pengguna.

Apa yang sebenarnya diukur oleh angka 88%

Ujian pada peringkat sesi menanyakan soalan yang berbeza daripada skor penanda aras yang biasanya diterbitkan oleh pembangun AI. Satu sesi boleh berjalan selama banyak giliran, dan satu kesilapan dalam mana-mana giliran boleh mencukupi untuk menandakan keseluruhan sesi sebagai mengelirukan. Ini menjadikan angka 88% sukar untuk dibandingkan secara langsung dengan angka ketepatan daripada penilaian sekali sahaja yang standard, yang biasanya menilai model berdasarkan soalan terpisah tanpa soal jawab.

Namun begitu, jurang itu penting bagi sesiapa yang menggunakan model dalam peranan yang berhadapan dengan pelanggan atau sokongan keputusan. Alat yang berprestasi baik dalam ujian statik boleh berkelakuan sangat berbeza apabila pengguna mengemukakan soalan susulan, memberikan konteks baharu, atau mencabar jawapan terdahulu. Penemuan Reuters menunjukkan corak itu terpakai kepada Qwen3-Max-Preview.

Kebolehpercayaan menurun apabila sesi menjadi lebih panjang

Siasatan itu juga mendapati bahawa kebolehpercayaan model berkurang dengan pengalaman — bermakna semakin lama sesi berjalan, semakin besar kemungkinan output mengelirukan. Ini adalah mod kegagalan yang khusus, bukan aduan umum tentang ketepatan. Ia menunjukkan masalah itu terkumpul dalam satu perbualan dan bukan muncul secara rawak.

Bagi perniagaan, akibat praktikalnya ialah jawapan pertama yang kukuh bukan bukti bahawa jawapan seterusnya akan kekal tepat. Pasukan yang bergantung pada model untuk menjejak urutan panjang — tiket sokongan, tugasan penyelidikan, analisis kewangan berbilang langkah — terdedah kepada kesilapan yang hanya muncul selepas beberapa giliran.

Mengapa perniagaan yang bergantung pada AI perlu memberi perhatian

Penemuan ini muncul pada saat syarikat sedang memasukkan model AI ke dalam aliran kerja di mana jawapan yang salah membawa kos sebenar. Cabaran yang digambarkan Reuters bukanlah bahawa model kadangkala gagal, tetapi kadar kegagalannya sukar dilihat dari luar. Penjual menerbitkan keputusan utama; pembeli jarang mendapat data kebolehpercayaan peringkat sesi sebelum menandatangani kontrak.

Alibaba tidak membantah penemuan Reuters dalam bahan yang tersedia. Syarikat itu telah meletakkan Qwen3-Max-Preview sebagai model perdana, dan pelanggan perusahaan yang menilainya kini mempunyai titik data konkrit untuk ditimbang berbanding dakwaan pemasaran.

Apa yang boleh diperiksa pembeli sebelum penggunaan

Siasatan itu menunjukkan jurang ujian yang boleh ditutup oleh pasukan perolehan sendiri. Daripada bergantung pada skor penanda aras yang diterbitkan, pembeli boleh menjalankan penilaian berbilang giliran yang mencerminkan kes penggunaan sebenar mereka — urutan sokongan panjang, semakan dokumen, analisis berulang — dan menilai keseluruhan sesi dan bukan balasan individu.

Pendekatan itu tidak akan menghasilkan peratusan bersih yang sepadan dengan helaian spesifikasi penjual, tetapi ia akan menunjukkan sama ada kebolehpercayaan merosot dalam keadaan perniagaan sebenarnya beroperasi. Angka 88% Reuters adalah titik rujukan permulaan untuk kerja itu, bukan keputusan muktamad tentang model tersebut.

Apa yang masih terbuka ialah sama ada Alibaba akan bertindak balas dengan data peringkat sesi sendiri, dan sama ada pembuat model lain akan menyusul dengan pendedahan yang setanding. Sehingga itu, beban pembuktian terletak pada pembeli yang menjalankan ujian.