Investigace agentury Reuters zjistila, že model Qwen3-Max-Preview od společnosti Alibaba vrací zavádějící odpovědi v 88 % testovaných relací. Toto zjištění upozorňuje na problém, který firemní zákazníci nástrojů umělé inteligence jen obtížně měří: jak často se odpovědi modelu během konverzace odchylují od pravdy.
Údaj pochází z vlastního testování modelu agenturou Reuters, nikoli od společnosti Alibaba. Podle investigace model v 88 ze 100 relací vytvořil výstup, který uvedl uživatele v omyl.
Co ve skutečnosti údaj 88 % měří
Testování na úrovni relací klade jinou otázku než benchmarková skóre, která vývojáři AI obvykle zveřejňují. Jedna relace může mít mnoho kol a chyba v kterémkoli z nich může stačit k označení celé relace za zavádějící. To činí číslo 88 % obtížně srovnatelné s údaji o přesnosti ze standardních jednorázových hodnocení, která obvykle hodnotí model na izolovaných otázkách bez vzájemné interakce.
Přesto je tento rozdíl důležitý pro každého, kdo model nasazuje v roli zaměřené na zákazníky nebo na podporu rozhodování. Nástroj, který si dobře vede ve statickém testu, se může chovat velmi odlišně, když uživatel klade doplňující otázky, poskytuje nový kontext nebo zpochybní dřívější odpověď. Zjištění agentury Reuters naznačuje, že tento vzorec platí pro Qwen3-Max-Preview.
Spolehlivost klesá s délkou relace
Investigace také zjistila, že spolehlivost modelu se s délkou zkušenosti snižuje – čím déle relace probíhá, tím pravděpodobněji bude výstup zavádějící. Jde o specifický režim selhání, nikoli o obecnou stížnost na přesnost. To naznačuje, že se problém v rámci jedné konverzace kumuluje, místo aby se objevoval náhodně.
Pro firmy je praktickým důsledkem to, že silná první odpověď není důkazem, že pozdější odpovědi obstojí. Týmy, které se spoléhají na model při sledování dlouhého vlákna – zákaznického ticketu, výzkumného úkolu, vícestupňové finanční analýzy – jsou vystaveny chybám, které se projeví až po několika kolech.
Proč by firmy spoléhající na AI měly věnovat pozornost
Tato zjištění přicházejí v době, kdy společnosti začleňují modely AI do pracovních postupů, kde má nesprávná odpověď skutečné náklady. Výzvou, kterou Reuters popisuje, není to, že model občas selže, ale že jeho míra selhání je zvenčí obtížně viditelná. Dodavatelé zveřejňují výsledky na titulních stránkách; kupující jen zřídka získají data o spolehlivosti na úrovni relací před podpisem smlouvy.
Společnost Alibaba v dostupných materiálech zjištění agentury Reuters nezpochybnila. Firma prezentuje Qwen3-Max-Preview jako vlajkový model a podnikoví zákazníci, kteří jej nyní hodnotí, mají konkrétní datový bod, který mohou porovnat s marketingovými tvrzeními.
Co mohou kupující zkontrolovat před nasazením
Investigace poukazuje na mezeru v testování, kterou mohou nákupní týmy zacelit samy. Místo spoléhání na zveřejněná benchmarková skóre mohou kupující provádět vícetahová hodnocení, která odpovídají jejich skutečným případům použití – dlouhá podpůrná vlákna, kontrola dokumentů, iterativní analýza – a hodnotit celou relaci, nikoli jednotlivé odpovědi.
Tento přístup nepřinese čisté procento, které by odpovídalo specifikaci dodavatele, ale ukáže, zda se spolehlivost zhoršuje v podmínkách, ve kterých firma skutečně působí. Údaj 88 % agentury Reuters je výchozím referenčním bodem pro tuto práci, nikoli konečným verdiktem o modelu.
Otevřenou otázkou zůstává, zda Alibaba odpoví vlastními daty na úrovni relací a zda se další výrobci modelů připojí srovnatelným zveřejněním. Do té doby leží důkazní břemeno na kupujících, kteří testy provádějí.




