Loading market data...

Test di Reuters rileva che Alibaba Qwen3-Max-Preview fuorvia nell'88% delle sessioni

Test di Reuters rileva che Alibaba Qwen3-Max-Preview fuorvia nell'88% delle sessioni

Un'indagine di Reuters ha scoperto che Alibaba Qwen3-Max-Preview restituisce risposte fuorvianti nell'88% delle sessioni testate. La scoperta mette in luce un problema che gli acquirenti aziendali di strumenti di intelligenza artificiale hanno avuto difficoltà a misurare: quanto spesso le risposte di un modello si discostano dalla verità man mano che una conversazione procede.

La cifra proviene dai test effettuati da Reuters sul modello, non da Alibaba. In 88 sessioni su 100, secondo l'indagine, il modello ha prodotto output che hanno fuorviato l'utente.

Cosa misura effettivamente il dato dell'88%

I test a livello di sessione pongono una domanda diversa rispetto ai punteggi di benchmark che gli sviluppatori di IA di solito pubblicano. Una singola sessione può durare molti turni e un errore in uno qualsiasi di essi può essere sufficiente a contrassegnare l'intera sessione come fuorviante. Ciò rende il numero dell'88% difficile da confrontare direttamente con le cifre di accuratezza delle valutazioni standard one-shot, che in genere valutano un modello su domande isolate senza botta e risposta.

Tuttavia, il divario è importante per chiunque implementi un modello in un ruolo a contatto con il cliente o a supporto delle decisioni. Uno strumento che si comporta bene in un test statico può comportarsi in modo molto diverso quando un utente pone domande di follow-up, fornisce nuovo contesto o contesta una risposta precedente. La scoperta di Reuters suggerisce che questo schema si applica a Qwen3-Max-Preview.

L'affidabilità cala con l'allungarsi delle sessioni

L'indagine ha anche rilevato che l'affidabilità del modello diminuisce con l'esperienza, nel senso che più a lungo dura una sessione, più è probabile che l'output fuorvii. Si tratta di una modalità di guasto specifica, non di un reclamo generico sull'accuratezza. Implica che il problema si accumuli all'interno di una singola conversazione anziché manifestarsi in modo casuale.

Per le aziende, la conseguenza pratica è che una prima risposta forte non è prova che le risposte successive reggeranno. I team che si affidano a un modello per seguire un lungo filo conduttore — un ticket di assistenza, un compito di ricerca, un'analisi finanziaria a più fasi — sono esposti a errori che emergono solo dopo diversi turni.

Perché le aziende che si affidano all'IA dovrebbero prestare attenzione

I risultati arrivano in un momento in cui le aziende stanno integrando modelli di IA in flussi di lavoro in cui una risposta sbagliata comporta costi reali. La sfida descritta da Reuters non è che un modello fallisca occasionalmente, ma che il suo tasso di fallimento è difficile da vedere dall'esterno. I fornitori pubblicano risultati principali; gli acquirenti raramente ottengono dati sull'affidabilità a livello di sessione prima di firmare un contratto.

Alibaba non ha contestato i risultati di Reuters nel materiale disponibile. L'azienda ha posizionato Qwen3-Max-Preview come modello di punta, e i clienti aziendali che lo valutano ora hanno un punto dati concreto da soppesare rispetto alle affermazioni di marketing.

Cosa possono verificare gli acquirenti prima dell'implementazione

L'indagine indica una lacuna nei test che i team di approvvigionamento possono colmare da soli. Invece di affidarsi ai punteggi di benchmark pubblicati, gli acquirenti possono eseguire valutazioni multi-turno che rispecchiano i loro casi d'uso reali — lunghe discussioni di supporto, revisione di documenti, analisi iterativa — e valutare l'intera sessione anziché le singole risposte.

Questo approccio non produrrà una percentuale netta che corrisponda alla scheda tecnica di un fornitore, ma mostrerà se l'affidabilità peggiora nelle condizioni in cui un'azienda opera effettivamente. La cifra dell'88% di Reuters è un punto di riferimento iniziale per quel lavoro, non un verdetto definitivo sul modello.

Ciò che resta aperto è se Alibaba risponderà con dati a livello di sessione propri e se altri produttori di modelli seguiranno con divulgazioni comparabili. Fino ad allora, l'onere della prova spetta agli acquirenti che eseguono i test.