Loading market data...

Una prueba de Reuters encuentra que Qwen3-Max-Preview de Alibaba induce a error en el 88% de las sesiones

Una prueba de Reuters encuentra que Qwen3-Max-Preview de Alibaba induce a error en el 88% de las sesiones

Una investigación de Reuters ha encontrado que Qwen3-Max-Preview de Alibaba devuelve respuestas engañosas en el 88% de las sesiones probadas. El hallazgo pone el foco en un problema que los compradores corporativos de herramientas de IA han tenido dificultades para medir: con qué frecuencia las respuestas de un modelo se desvían de la verdad a medida que avanza una conversación.

La cifra proviene de las propias pruebas de Reuters del modelo, no de Alibaba. En 88 de cada 100 sesiones, según la investigación, el modelo produjo resultados que indujeron a error al usuario.

Qué mide realmente la cifra del 88%

Las pruebas a nivel de sesión plantean una pregunta diferente a las puntuaciones de referencia que suelen publicar los desarrolladores de IA. Una sola sesión puede durar muchos turnos, y un error en cualquiera de ellos puede ser suficiente para marcar toda la sesión como engañosa. Eso hace que el número del 88% sea difícil de comparar directamente con las cifras de precisión de las evaluaciones estándar de un solo intento, que normalmente puntúan a un modelo en preguntas aisladas sin ida y vuelta.

Aun así, la diferencia importa para cualquiera que despliegue un modelo en un rol de cara al cliente o de apoyo a la toma de decisiones. Una herramienta que funciona bien en una prueba estática puede comportarse de manera muy diferente cuando un usuario hace preguntas de seguimiento, aporta nuevo contexto o cuestiona una respuesta anterior. El hallazgo de Reuters sugiere que ese patrón se aplica a Qwen3-Max-Preview.

La fiabilidad disminuye a medida que las sesiones se alargan

La investigación también encontró que la fiabilidad del modelo disminuye con la experiencia, es decir, cuanto más dura una sesión, más probable es que el resultado induzca a error. Se trata de un modo de fallo específico, no de una queja general sobre la precisión. Implica que el problema se agrava dentro de una misma conversación en lugar de aparecer al azar.

Para las empresas, la consecuencia práctica es que una primera respuesta sólida no es prueba de que las respuestas posteriores vayan a mantenerse. Los equipos que dependen de un modelo para seguir un hilo largo —un ticket de soporte, una tarea de investigación, un análisis financiero de varios pasos— están expuestos a errores que solo salen a la luz después de varios turnos.

Por qué las empresas que dependen de la IA deberían prestar atención

Los hallazgos llegan en un momento en que las empresas están incorporando modelos de IA en flujos de trabajo donde una respuesta incorrecta conlleva un coste real. El desafío que describe Reuters no es que un modelo falle ocasionalmente, sino que su tasa de fallo es difícil de ver desde fuera. Los proveedores publican resultados destacados; los compradores rara vez obtienen datos de fiabilidad a nivel de sesión antes de firmar un contrato.

Alibaba no ha disputado los hallazgos de Reuters en el material disponible. La compañía ha posicionado Qwen3-Max-Preview como un modelo insignia, y los clientes empresariales que lo evalúan ahora tienen un dato concreto que sopesar frente a las afirmaciones de marketing.

Qué pueden comprobar los compradores antes del despliegue

La investigación señala una brecha de pruebas que los equipos de compras pueden cerrar por su cuenta. En lugar de confiar en las puntuaciones de referencia publicadas, los compradores pueden realizar evaluaciones de múltiples turnos que reflejen sus casos de uso reales —hilos de soporte largos, revisión de documentos, análisis iterativo— y puntuar la sesión completa en lugar de las respuestas individuales.

Ese enfoque no producirá un porcentaje limpio que se corresponda con la hoja de especificaciones de un proveedor, pero mostrará si la fiabilidad se degrada en las condiciones en las que opera realmente una empresa. La cifra del 88% de Reuters es un punto de referencia inicial para ese trabajo, no un veredicto final sobre el modelo.

Lo que queda por ver es si Alibaba responde con datos a nivel de sesión propios, y si otros fabricantes de modelos siguen con divulgaciones comparables. Hasta entonces, la carga de la prueba recae en los compradores que realizan las pruebas.