Une enquête de Reuters a révélé que Qwen3-Max-Preview d'Alibaba fournit des réponses trompeuses dans 88 % des sessions testées. Cette conclusion met en lumière un problème que les acheteurs professionnels d'outils d'IA ont du mal à mesurer : la fréquence à laquelle les réponses d'un modèle s'écartent de la vérité au fil d'une conversation.
Ce chiffre provient des propres tests de Reuters sur le modèle, et non d'Alibaba. Selon l'enquête, dans 88 sessions sur 100, le modèle a produit des résultats qui ont induit l'utilisateur en erreur.
Ce que mesure réellement le chiffre de 88 %
Les tests au niveau des sessions posent une question différente de celle des scores de référence que les développeurs d'IA publient habituellement. Une seule session peut comporter de nombreux échanges, et une erreur dans l'un d'eux peut suffire à marquer toute la session comme trompeuse. Cela rend le chiffre de 88 % difficile à comparer directement avec les taux d'exactitude des évaluations standard à un seul tour, qui notent généralement un modèle sur des questions isolées sans interaction.
Néanmoins, cet écart compte pour quiconque déploie un modèle dans un rôle orienté client ou d'aide à la décision. Un outil qui performe bien sur un test statique peut se comporter très différemment lorsqu'un utilisateur pose des questions de suivi, fournit un nouveau contexte ou conteste une réponse antérieure. La conclusion de Reuters suggère que ce schéma s'applique à Qwen3-Max-Preview.
La fiabilité chute à mesure que les sessions s'allongent
L'enquête a également révélé que la fiabilité du modèle diminue avec l'expérience — autrement dit, plus une session dure, plus la probabilité que le résultat soit trompeur est élevée. Il s'agit d'un mode de défaillance spécifique, et non d'une plainte générale sur l'exactitude. Cela implique que le problème s'aggrave au sein d'une même conversation plutôt que d'apparaître au hasard.
Pour les entreprises, la conséquence pratique est qu'une première réponse solide ne prouve pas que les réponses ultérieures tiendront. Les équipes qui s'appuient sur un modèle pour suivre un long fil — un ticket d'assistance, une tâche de recherche, une analyse financière en plusieurs étapes — sont exposées à des erreurs qui ne se manifestent qu'après plusieurs tours.
Pourquoi les entreprises qui s'appuient sur l'IA devraient y prêter attention
Ces conclusions surviennent à un moment où les entreprises intègrent les modèles d'IA dans des flux de travail où une mauvaise réponse a un coût réel. Le défi décrit par Reuters n'est pas qu'un modèle échoue occasionnellement, mais que son taux d'échec est difficile à percevoir de l'extérieur. Les fournisseurs publient des résultats phares ; les acheteurs obtiennent rarement des données de fiabilité au niveau des sessions avant de signer un contrat.
Alibaba n'a pas contesté les conclusions de Reuters dans les éléments disponibles. L'entreprise a positionné Qwen3-Max-Preview comme un modèle phare, et les clients entreprises qui l'évaluent disposent désormais d'un point de données concret à mettre en balance avec les arguments marketing.
Ce que les acheteurs peuvent vérifier avant le déploiement
L'enquête met en évidence une lacune en matière de tests que les équipes d'approvisionnement peuvent combler elles-mêmes. Au lieu de s'appuyer sur les scores de référence publiés, les acheteurs peuvent réaliser des évaluations multi-tours qui reflètent leurs cas d'usage réels — longs fils d'assistance, révision de documents, analyse itérative — et noter la session entière plutôt que les réponses individuelles.
Cette approche ne produira pas un pourcentage clair correspondant à la fiche technique d'un fournisseur, mais elle montrera si la fiabilité se dégrade dans les conditions dans lesquelles une entreprise opère réellement. Le chiffre de 88 % de Reuters est un point de référence de départ pour ce travail, et non un verdict définitif sur le modèle.
Ce qui reste en suspens, c'est de savoir si Alibaba répondra avec ses propres données au niveau des sessions, et si d'autres fabricants de modèles suivront avec des divulgations comparables. D'ici là, la charge de la preuve incombe aux acheteurs qui réalisent les tests.




