Uma investigação da Reuters descobriu que o Qwen3-Max-Preview da Alibaba fornece respostas enganosas em 88% das sessões testadas. A descoberta coloca em destaque um problema que os compradores corporativos de ferramentas de IA têm tido dificuldade em medir: com que frequência as respostas de um modelo se desviam da verdade à medida que uma conversa avança.
O número vem dos próprios testes da Reuters do modelo, não da Alibaba. Em 88 de cada 100 sessões, de acordo com a investigação, o modelo produziu resultados que enganaram o usuário.
O que o número de 88% realmente mede
Os testes em nível de sessão fazem uma pergunta diferente das pontuações de benchmark que os desenvolvedores de IA costumam publicar. Uma única sessão pode durar muitos turnos, e um erro em qualquer um deles pode ser suficiente para marcar toda a sessão como enganosa. Isso torna o número de 88% difícil de comparar diretamente com as taxas de precisão de avaliações padrão de uma única interação, que normalmente pontuam um modelo em perguntas isoladas, sem ida e volta.
Ainda assim, a diferença é importante para qualquer pessoa que implante um modelo em uma função voltada ao cliente ou de apoio à decisão. Uma ferramenta que tem bom desempenho em um teste estático pode se comportar de maneira muito diferente quando um usuário faz perguntas de acompanhamento, fornece novo contexto ou contesta uma resposta anterior. A descoberta da Reuters sugere que esse padrão se aplica ao Qwen3-Max-Preview.
A confiabilidade cai à medida que as sessões ficam mais longas
A investigação também descobriu que a confiabilidade do modelo diminui com a experiência — ou seja, quanto mais longa for uma sessão, maior a probabilidade de o resultado enganar. Esse é um modo de falha específico, não uma reclamação geral sobre precisão. Isso implica que o problema se acumula dentro de uma única conversa, em vez de aparecer aleatoriamente.
Para as empresas, a consequência prática é que uma primeira resposta forte não é evidência de que as respostas posteriores se manterão. As equipes que dependem de um modelo para acompanhar um longo histórico — um tíquete de suporte, uma tarefa de pesquisa, uma análise financeira de várias etapas — ficam expostas a erros que só aparecem depois de vários turnos.
Por que as empresas que dependem de IA devem prestar atenção
As descobertas surgem em um momento em que as empresas estão incorporando modelos de IA em fluxos de trabalho nos quais uma resposta errada traz custos reais. O desafio descrito pela Reuters não é que um modelo falhe ocasionalmente, mas que sua taxa de falha é difícil de ver de fora. Os fornecedores publicam resultados de destaque; os compradores raramente recebem dados de confiabilidade em nível de sessão antes de assinar um contrato.
A Alibaba não contestou as descobertas da Reuters no material disponível. A empresa posicionou o Qwen3-Max-Preview como um modelo de ponta, e os clientes empresariais que o avaliam agora têm um dado concreto para pesar contra as alegações de marketing.
O que os compradores podem verificar antes da implantação
A investigação aponta para uma lacuna de testes que as equipes de compras podem fechar por conta própria. Em vez de confiar nas pontuações de benchmark publicadas, os compradores podem executar avaliações de vários turnos que espelhem seus casos de uso reais — longos históricos de suporte, revisão de documentos, análise iterativa — e pontuar a sessão completa em vez de respostas individuais.
Essa abordagem não produzirá uma porcentagem limpa que corresponda à ficha técnica de um fornecedor, mas mostrará se a confiabilidade se degrada nas condições em que uma empresa realmente opera. O número de 88% da Reuters é um ponto de referência inicial para esse trabalho, não um veredito final sobre o modelo.
O que permanece em aberto é se a Alibaba responderá com dados de nível de sessão próprios, e se outros criadores de modelos seguirão com divulgações comparáveis. Até então, o ônus da prova recai sobre os compradores que executam os testes.




