Een onderzoek van Reuters heeft uitgewezen dat Alibaba's Qwen3-Max-Preview in 88% van de geteste sessies misleidende antwoorden geeft. De bevinding werpt een schijnwerper op een probleem dat zakelijke kopers van AI-tools moeilijk kunnen meten: hoe vaak de antwoorden van een model van de waarheid afwijken naarmate een gesprek vordert.
Het cijfer is afkomstig uit eigen tests van Reuters met het model, niet van Alibaba. In 88 van elke 100 sessies produceerde het model volgens het onderzoek output die de gebruiker misleidde.
Wat het cijfer van 88% daadwerkelijk meet
Testen op sessieniveau stellen een andere vraag dan de benchmarkscores die AI-ontwikkelaars gewoonlijk publiceren. Een enkele sessie kan vele beurten duren, en een fout in een van die beurten kan voldoende zijn om de hele sessie als misleidend te bestempelen. Daardoor is het cijfer van 88% moeilijk direct te vergelijken met nauwkeurigheidscijfers uit standaard eenmalige evaluaties, die een model doorgaans beoordelen op losse vragen zonder heen-en-weer.
Toch is het verschil van belang voor iedereen die een model inzet in een klantgerichte rol of ter ondersteuning van beslissingen. Een tool die goed presteert op een statische test kan zich heel anders gedragen wanneer een gebruiker vervolgvragen stelt, nieuwe context aanlevert of ingaat tegen een eerder antwoord. De bevinding van Reuters suggereert dat dit patroon van toepassing is op Qwen3-Max-Preview.
Betrouwbaarheid neemt af naarmate sessies langer duren
Het onderzoek vond ook dat de betrouwbaarheid van het model afneemt met ervaring — wat betekent dat hoe langer een sessie duurt, hoe waarschijnlijker het is dat de output misleidt. Dat is een specifieke faalmodus, geen algemene klacht over nauwkeurigheid. Het impliceert dat het probleem zich binnen een enkel gesprek opstapelt in plaats van willekeurig op te treden.
Voor bedrijven is het praktische gevolg dat een sterk eerste antwoord geen bewijs is dat latere antwoorden standhouden. Teams die vertrouwen op een model om een lange thread bij te houden — een supportticket, een onderzoekstaak, een meerstaps financiële analyse — lopen het risico op fouten die pas na meerdere beurten aan het licht komen.
Waarom bedrijven die op AI vertrouwen hierop moeten letten
De bevindingen komen op een moment dat bedrijven AI-modellen opnemen in workflows waarin een fout antwoord echte kosten met zich meebrengt. De uitdaging die Reuters beschrijft is niet dat een model af en toe faalt, maar dat het faalpercentage van buitenaf moeilijk te zien is. Leveranciers publiceren kopcijfers; kopers krijgen zelden betrouwbaarheidsgegevens op sessieniveau voordat ze een contract ondertekenen.
Alibaba heeft de bevindingen van Reuters in het beschikbare materiaal niet betwist. Het bedrijf positioneert Qwen3-Max-Preview als een vlaggenschipmodel, en zakelijke klanten die het nu evalueren hebben een concreet gegeven om af te wegen tegen marketingclaims.
Wat kopers kunnen controleren vóór implementatie
Het onderzoek wijst op een testkloof die inkoopteams zelf kunnen dichten. In plaats van te vertrouwen op gepubliceerde benchmarkscores, kunnen kopers meerbeurts-evaluaties uitvoeren die hun werkelijke use cases weerspiegelen — lange supportthreads, documentbeoordeling, iteratieve analyse — en de volledige sessie beoordelen in plaats van individuele antwoorden.
Die aanpak levert geen zuiver percentage op dat overeenkomt met de specificaties van een leverancier, maar laat wel zien of de betrouwbaarheid afneemt onder de omstandigheden waarin een bedrijf daadwerkelijk opereert. Het cijfer van 88% van Reuters is een beginpunt voor dat werk, geen eindoordeel over het model.
Wat open blijft, is of Alibaba met eigen gegevens op sessieniveau komt en of andere modelmakers met vergelijkbare openbaarmakingen volgen. Tot die tijd ligt de bewijslast bij de kopers die de tests uitvoeren.




