Loading market data...

Reuters-test visar att Alibabas Qwen3-Max-Preview vilseleder i 88 % av sessionerna

Reuters-test visar att Alibabas Qwen3-Max-Preview vilseleder i 88 % av sessionerna

En Reuters-undersökning har visat att Alibabas Qwen3-Max-Preview ger vilseledande svar i 88 % av de testade sessionerna. Resultatet sätter strålkastarljuset på ett problem som företagsköpare av AI-verktyg har haft svårt att mäta: hur ofta en modells svar glider bort från sanningen ju längre en konversation pågår.

Siffran kommer från Reuters egen testning av modellen, inte från Alibaba. I 88 av 100 sessioner, enligt undersökningen, producerade modellen resultat som vilseledde användaren.

Vad siffran 88 % faktiskt mäter

Testning på sessionsnivå ställer en annan fråga än de benchmarkpoäng som AI-utvecklare vanligtvis publicerar. En enskild session kan pågå i många turer, och ett fel i någon av dem kan räcka för att markera hela sessionen som vilseledande. Det gör siffran 88 % svår att jämföra direkt med noggrannhetssiffror från standardutvärderingar med ett enda svar, som vanligtvis poängsätter en modell på isolerade frågor utan fram-och-tillbaka.

Ändå spelar gapet roll för alla som driftsätter en modell i en kundvändande eller beslutsstödjande roll. Ett verktyg som presterar bra på ett statiskt test kan bete sig mycket annorlunda när en användare ställer följdfrågor, tillför ny kontext eller ifrågasätter ett tidigare svar. Reuters fynd tyder på att det mönstret gäller för Qwen3-Max-Preview.

Tillförlitligheten sjunker när sessionerna blir längre

Undersökningen fann också att modellens tillförlitlighet minskar med erfarenheten – vilket innebär att ju längre en session pågår, desto större är sannolikheten att resultatet vilseleder. Det är ett specifikt felmönster, inte ett allmänt klagomål på noggrannhet. Det antyder att problemet förvärras inom en enda konversation snarare än att uppstå slumpmässigt.

För företag är den praktiska konsekvensen att ett starkt första svar inte är bevis för att senare svar kommer att hålla. Team som förlitar sig på en modell för att följa en lång tråd – ett supportärende, en forskningsuppgift, en flerstegs finansiell analys – utsätts för fel som bara visar sig efter flera turer.

Varför företag som förlitar sig på AI bör uppmärksamma detta

Resultaten kommer vid en tidpunkt då företag införlivar AI-modeller i arbetsflöden där ett felaktigt svar medför verkliga kostnader. Utmaningen som Reuters beskriver är inte att en modell ibland misslyckas, utan att dess felfrekvens är svår att se utifrån. Leverantörer publicerar rubrikresultat; köpare får sällan data om tillförlitlighet på sessionsnivå innan de skriver på ett kontrakt.

Alibaba har inte bestridit Reuters fynd i det tillgängliga materialet. Företaget har positionerat Qwen3-Max-Preview som en flaggskeppsmodell, och företagskunder som utvärderar den har nu en konkret datapunkt att väga mot marknadsföringspåståenden.

Vad köpare kan kontrollera före driftsättning

Undersökningen pekar på en testlucka som inköpsgrupper kan täppa till på egen hand. Istället för att förlita sig på publicerade benchmarkpoäng kan köpare köra utvärderingar över flera turer som speglar deras faktiska användningsfall – långa supporttrådar, dokumentgranskning, iterativ analys – och poängsätta hela sessionen snarare än enskilda svar.

Den metoden ger ingen ren procentandel som motsvarar en leverantörs specifikationsblad, men den visar om tillförlitligheten försämras under de förhållanden ett företag faktiskt verkar i. Reuters siffra på 88 % är en startreferens för det arbetet, inte en slutgiltig dom över modellen.

Det som återstår att se är om Alibaba svarar med egna data på sessionsnivå, och om andra modelltillverkare följer efter med jämförbara upplysningar. Fram till dess ligger bevisbördan hos köparna som kör testerna.