Dochodzenie Reutersa wykazało, że Alibaba Qwen3-Max-Preview zwraca wprowadzające w błąd odpowiedzi w 88% testowanych sesji. Odkrycie to rzuca światło na problem, który nabywcy narzędzi AI w firmach mieli trudność zmierzyć: jak często odpowiedzi modelu odbiegają od prawdy w miarę trwania rozmowy.
Liczba ta pochodzi z własnych testów Reutersa, a nie od Alibaby. Według dochodzenia, w 88 na 100 sesji model generował odpowiedzi, które wprowadzały użytkownika w błąd.
Co faktycznie mierzy liczba 88%
Testowanie na poziomie sesji zadaje inne pytanie niż wyniki benchmarków, które zwykle publikują twórcy AI. Pojedyncza sesja może trwać wiele tur, a błąd w którejkolwiek z nich może wystarczyć, aby oznaczyć całą sesję jako wprowadzającą w błąd. To sprawia, że liczba 88% jest trudna do bezpośredniego porównania z dokładnością z standardowych jednorazowych ewaluacji, które zazwyczaj oceniają model na izolowanych pytaniach bez interakcji.
Niemniej jednak ta różnica ma znaczenie dla każdego, kto wdraża model w roli obsługi klienta lub wsparcia decyzyjnego. Narzędzie, które dobrze wypada w statycznym teście, może zachowywać się zupełnie inaczej, gdy użytkownik zadaje pytania uzupełniające, dostarcza nowy kontekst lub kwestionuje wcześniejszą odpowiedź. Odkrycie Reutersa sugeruje, że ten wzorzec dotyczy Qwen3-Max-Preview.
Niezawodność spada wraz z wydłużaniem sesji
Dochodzenie wykazało również, że niezawodność modelu maleje wraz z doświadczeniem — co oznacza, że im dłużej trwa sesja, tym większe prawdopodobieństwo, że odpowiedzi będą wprowadzać w błąd. Jest to konkretny tryb awarii, a nie ogólna skarga na dokładność. Sugeruje to, że problem narasta w ramach pojedynczej rozmowy, a nie pojawia się losowo.
Dla firm praktyczną konsekwencją jest to, że mocna pierwsza odpowiedź nie jest dowodem, że późniejsze odpowiedzi będą równie solidne. Zespoły, które polegają na modelu w śledzeniu długiego wątku — zgłoszenia wsparcia, zadania badawczego, wieloetapowej analizy finansowej — są narażone na błędy, które ujawniają się dopiero po kilku turach.
Dlaczego firmy polegające na AI powinny zwrócić uwagę
Wyniki pojawiają się w momencie, gdy firmy włączają modele AI do procesów, w których błędna odpowiedź wiąże się z realnymi kosztami. Wyzwanie opisane przez Reutersa polega nie na tym, że model czasami zawodzi, ale że jego wskaźnik awaryjności jest trudny do zauważenia z zewnątrz. Dostawcy publikują wyniki nagłówkowe; nabywcy rzadko otrzymują dane o niezawodności na poziomie sesji przed podpisaniem umowy.
Alibaba nie zakwestionowała ustaleń Reutersa w dostępnych materiałach. Firma pozycjonuje Qwen3-Max-Preview jako model flagowy, a klienci korporacyjni oceniający go mają teraz konkretny punkt danych, który mogą zważyć przeciwko twierdzeniom marketingowym.
Co nabywcy mogą sprawdzić przed wdrożeniem
Dochodzenie wskazuje na lukę w testowaniu, którą zespoły zakupowe mogą same wypełnić. Zamiast polegać na publikowanych wynikach benchmarków, nabywcy mogą przeprowadzać wieloturowe oceny odzwierciedlające ich rzeczywiste przypadki użycia — długie wątki wsparcia, przegląd dokumentów, iteracyjną analizę — i oceniać całą sesję, a nie pojedyncze odpowiedzi.
To podejście nie da czystego procentu, który można przypisać do specyfikacji dostawcy, ale pokaże, czy niezawodność spada w warunkach, w których firma faktycznie działa. Liczba 88% Reutersa jest punktem odniesienia dla tych prac, a nie ostatecznym werdyktem o modelu.
Pozostaje otwarte, czy Alibaba odpowie własnymi danymi na poziomie sesji i czy inni twórcy modeli pójdą za tym z porównywalnymi ujawnieniami. Do tego czasu ciężar dowodu spoczywa na nabywcach przeprowadzających testy.




