En Reuters-undersøkelse har funnet at Alibabas Qwen3-Max-Preview gir villedende svar i 88 % av testede økter. Funnet setter søkelyset på et problem som bedriftskjøpere av AI-verktøy har hatt problemer med å måle: hvor ofte en modells svar avviker fra sannheten etter hvert som en samtale fortsetter.
Tallet kommer fra Reuters' egen testing av modellen, ikke fra Alibaba. I 88 av hver 100 økter, ifølge undersøkelsen, produserte modellen output som villedet brukeren.
Hva 88 %-tallet faktisk måler
Testing på øktnivå stiller et annet spørsmål enn benchmarkskårene AI-utviklere vanligvis publiserer. En enkelt økt kan vare i mange runder, og en feil i én av dem kan være nok til å merke hele økten som villedende. Det gjør 88 %-tallet vanskelig å sammenligne direkte med nøyaktighetstall fra standard enkeltstående evalueringer, som vanligvis scorer en modell på isolerte spørsmål uten frem-og-tilbake.
Likevel betyr gapet noe for alle som tar i bruk en modell i en kundevendt rolle eller beslutningsstøtterolle. Et verktøy som presterer godt på en statisk test, kan oppføre seg svært annerledes når en bruker stiller oppfølgingsspørsmål, gir ny kontekst eller utfordrer et tidligere svar. Reuters' funn tyder på at dette mønsteret gjelder for Qwen3-Max-Preview.
Påliteligheten synker når øktene blir lengre
Undersøkelsen fant også at modellens pålitelighet svekkes med erfaring – noe som betyr at jo lengre en økt varer, desto mer sannsynlig er det at outputen villeder. Dette er en spesifikk feilmodus, ikke en generell klage på nøyaktighet. Det antyder at problemet forsterkes inne i en enkelt samtale i stedet for å oppstå tilfeldig.
For bedrifter er den praktiske konsekvensen at et sterkt første svar ikke er bevis på at senere svar vil holde. Team som er avhengige av en modell for å følge en lang tråd – en support-sak, en research-oppgave, en flertrinns finansiell analyse – utsettes for feil som først dukker opp etter flere runder.
Hvorfor bedrifter som er avhengige av AI, bør følge med
Funnene kommer på et tidspunkt da selskaper fletter AI-modeller inn i arbeidsflyter der et feil svar har reell kostnad. Utfordringen Reuters beskriver, er ikke at en modell av og til feiler, men at feilraten er vanskelig å se utenfra. Leverandører publiserer overskrifttall; kjøpere får sjelden pålitelighetsdata på øktnivå før de signerer en kontrakt.
Alibaba har ikke bestridt Reuters' funn i det tilgjengelige materialet. Selskapet har posisjonert Qwen3-Max-Preview som en flaggskipmodell, og bedriftskunder som vurderer den, har nå et konkret datapunkt å veie mot markedsføringspåstander.
Hva kjøpere kan sjekke før utrulling
Undersøkelsen peker på et testgap som innkjøpsteam kan tette på egen hånd. I stedet for å stole på publiserte benchmarkskårer, kan kjøpere kjøre flerrundes evalueringer som speiler deres faktiske bruksområder – lange support-tråder, dokumentgjennomgang, iterativ analyse – og score hele økten i stedet for enkeltsvar.
Den tilnærmingen vil ikke gi en ren prosentandel som passer til en leverandørs spesifikasjonsark, men den vil vise om påliteligheten forringes under forholdene en bedrift faktisk opererer i. Reuters' 88 %-tall er et startreferansepunkt for dette arbeidet, ikke en endelig dom over modellen.
Det som fortsatt er åpent, er om Alibaba svarer med sine egne data på øktnivå, og om andre modellutviklere følger etter med sammenlignbare opplysninger. Inntil da ligger bevisbyrden hos kjøperne som kjører testene.




