Loading market data...

Testul Reuters constată că Alibaba Qwen3-Max-Preview induce în eroare în 88% din sesiuni

Testul Reuters constată că Alibaba Qwen3-Max-Preview induce în eroare în 88% din sesiuni

O investigație Reuters a constatat că Qwen3-Max-Preview de la Alibaba oferă răspunsuri înșelătoare în 88% din sesiunile testate. Constatarea evidențiază o problemă pe care cumpărătorii corporativi de instrumente AI au avut dificultăți în a o măsura: cât de des se abat răspunsurile unui model de la adevăr pe măsură ce conversația continuă.

Cifra provine din testarea proprie a Reuters a modelului, nu de la Alibaba. În 88 din 100 de sesiuni, conform investigației, modelul a produs rezultate care au indus utilizatorul în eroare.

Ce măsoară de fapt cifra de 88%

Testarea la nivel de sesiune pune o întrebare diferită față de scorurile de referință pe care dezvoltatorii de AI le publică de obicei. O singură sesiune poate dura multe ture, iar o eroare în oricare dintre ele poate fi suficientă pentru a marca întreaga sesiune ca fiind înșelătoare. Astfel, numărul de 88% este greu de comparat direct cu cifrele de acuratețe din evaluările standard unice, care de obicei notează un model pe întrebări izolate, fără schimb bidirecțional.

Totuși, diferența contează pentru oricine implementează un model într-un rol de interacțiune cu clienții sau de suport decizional. Un instrument care performează bine la un test static se poate comporta foarte diferit atunci când un utilizator pune întrebări suplimentare, oferă context nou sau contestă un răspuns anterior. Constatarea Reuters sugerează că acest tipar se aplică și în cazul Qwen3-Max-Preview.

Fiabilitatea scade pe măsură ce sesiunile devin mai lungi

Investigația a mai constatat că fiabilitatea modelului scade odată cu experiența – ceea ce înseamnă că, cu cât o sesiune durează mai mult, cu atât este mai probabil ca rezultatul să inducă în eroare. Acesta este un mod specific de eșec, nu o plângere generală despre acuratețe. Implică faptul că problema se acumulează în interiorul unei singure conversații, în loc să apară aleatoriu.

Pentru companii, consecința practică este că un prim răspuns puternic nu este dovada că răspunsurile ulterioare vor rezista. Echipele care se bazează pe un model pentru a urmări un fir lung – un tichet de suport, o sarcină de cercetare, o analiză financiară în mai mulți pași – sunt expuse la erori care apar abia după mai multe ture.

De ce ar trebui să fie atenți cei care se bazează pe AI în afaceri

Constatările apar într-un moment în care companiile integrează modele AI în fluxuri de lucru unde un răspuns greșit are un cost real. Provocarea descrisă de Reuters nu este că un model eșuează ocazional, ci că rata sa de eșec este greu de observat din exterior. Furnizorii publică rezultate principale; cumpărătorii rareori primesc date privind fiabilitatea la nivel de sesiune înainte de a semna un contract.

Alibaba nu a contestat constatările Reuters în materialele disponibile. Compania a poziționat Qwen3-Max-Preview ca model emblematic, iar clienții enterprise care îl evaluează au acum un punct de date concret pe care să îl cântărească în raport cu afirmațiile de marketing.

Ce pot verifica cumpărătorii înainte de implementare

Investigația indică o lacună de testare pe care echipele de achiziții o pot acoperi singure. În loc să se bazeze pe scorurile de referință publicate, cumpărătorii pot rula evaluări cu mai multe ture care oglindesc cazurile lor reale de utilizare – fire lungi de suport, revizuirea documentelor, analiză iterativă – și să noteze întreaga sesiune, nu doar răspunsurile individuale.

Această abordare nu va produce un procentaj curat care să corespundă specificațiilor unui furnizor, dar va arăta dacă fiabilitatea scade în condițiile în care o afacere operează de fapt. Cifra de 88% a Reuters este un punct de referință de pornire pentru această activitate, nu un verdict final asupra modelului.

Rămâne deschis dacă Alibaba va răspunde cu date proprii la nivel de sesiune și dacă alți creatori de modele vor urma cu dezvăluiri comparabile. Până atunci, sarcina probei revine cumpărătorilor care rulează testele.