En Reuters-undersøgelse har fundet, at Alibabas Qwen3-Max-Preview giver vildledende svar i 88 % af de testede sessioner. Fundet sætter fokus på et problem, som virksomheders købere af AI-værktøjer har haft svært ved at måle: hvor ofte en models svar afviger fra sandheden, efterhånden som en samtale skrider frem.
Tallet stammer fra Reuters' egen test af modellen, ikke fra Alibaba. Ifølge undersøgelsen producerede modellen output, der vildledte brugeren, i 88 ud af hver 100 sessioner.
Hvad 88 %-tallet faktisk måler
Test på sessionsniveau stiller et andet spørgsmål end de benchmark-scorer, som AI-udviklere normalt offentliggør. En enkelt session kan køre i mange runder, og en fejl i blot én af dem kan være nok til at markere hele sessionen som vildledende. Det gør 88 %-tallet svært at sammenligne direkte med nøjagtighedstal fra standardiserede enkeltstående evalueringer, som typisk scorer en model på isolerede spørgsmål uden dialog frem og tilbage.
Ikke desto mindre har forskellen betydning for alle, der implementerer en model i en kundevendt rolle eller en rolle, der understøtter beslutninger. Et værktøj, der klarer sig godt i en statisk test, kan opføre sig meget anderledes, når en bruger stiller opfølgende spørgsmål, giver ny kontekst eller udfordrer et tidligere svar. Reuters' fund tyder på, at dette mønster gælder for Qwen3-Max-Preview.
Pålideligheden falder, efterhånden som sessionerne bliver længere
Undersøgelsen fandt også, at modellens pålidelighed aftager med erfaringen – hvilket betyder, at jo længere en session varer, desto mere sandsynligt er det, at outputtet vildleder. Det er en specifik fejltilstand, ikke en generel klage over nøjagtighed. Det antyder, at problemet forstærkes inde i en enkelt samtale snarere end at optræde tilfældigt.
For virksomheder er den praktiske konsekvens, at et stærkt første svar ikke er bevis for, at senere svar holder. Teams, der er afhængige af en model til at følge en lang tråd – en support-sag, en researchopgave, en flertrins-finansanalyse – er udsat for fejl, der først dukker op efter flere runder.
Hvorfor virksomheder, der er afhængige af AI, bør være opmærksomme
Fundene kommer på et tidspunkt, hvor virksomheder i stigende grad indarbejder AI-modeller i arbejdsgange, hvor et forkert svar har reelle omkostninger. Udfordringen, som Reuters beskriver, er ikke, at en model lejlighedsvis fejler, men at dens fejlrate er svær at se udefra. Leverandører offentliggør overskrifttal; købere får sjældent data om pålidelighed på sessionsniveau, før de underskriver en kontrakt.
Alibaba har ikke bestridt Reuters' fund i det tilgængelige materiale. Virksomheden har positioneret Qwen3-Max-Preview som en flagskibsmodel, og virksomhedskunder, der evaluerer den nu, har et konkret datapunkt at veje op mod marketingpåstande.
Hvad købere kan tjekke før implementering
Undersøgelsen peger på et testhul, som indkøbsteams selv kan lukke. I stedet for at stole på offentliggjorte benchmark-scorer kan købere køre evalueringer over flere runder, der afspejler deres faktiske anvendelsesscenarier – lange supporttråde, dokumentgennemgang, iterativ analyse – og score hele sessionen frem for enkeltsvar.
Denne tilgang giver ikke en ren procentdel, der kan mappes til en leverandørs specifikationsark, men den vil vise, om pålideligheden forringes under de betingelser, en virksomhed faktisk opererer i. Reuters' 88 %-tal er et startreferencepunkt for dette arbejde, ikke en endelig dom over modellen.
Det står stadig åbent, om Alibaba svarer med sine egne data på sessionsniveau, og om andre modelproducenter følger efter med tilsvarende oplysninger. Indtil da ligger bevisbyrden hos de købere, der udfører testene.




