Loading market data...

路透测试发现阿里巴巴Qwen3-Max-Preview在88%的会话中产生误导

路透测试发现阿里巴巴Qwen3-Max-Preview在88%的会话中产生误导

路透的一项调查发现,阿里巴巴的Qwen3-Max-Preview在88%的测试会话中返回了误导性回复。这一发现凸显了企业AI工具买家一直难以衡量的一个问题:随着对话的进行,模型的答案偏离真相的频率有多高。

这一数字来自路透自己对模型的测试,而非阿里巴巴。根据调查,在每100次会话中,有88次模型产生了误导用户的输出。

88%这个数字实际衡量的是什么

会话级测试所问的问题与AI开发者通常发布的基准分数不同。一次会话可能持续多轮,其中任何一轮出现错误都足以将整个会话标记为具有误导性。这使得88%这个数字很难与标准单次评估的准确率数字直接比较,后者通常在没有来回交互的情况下对模型进行孤立问题的评分。

尽管如此,对于任何在面向客户或决策支持角色中部署模型的人来说,这一差距都很重要。一个在静态测试中表现良好的工具,当用户提出后续问题、提供新上下文或对早先的答案提出质疑时,其行为可能大不相同。路透的发现表明,这种模式适用于Qwen3-Max-Preview。

会话越长,可靠性越低

调查还发现,模型的可靠性随着经验而降低——这意味着会话运行的时间越长,输出越有可能产生误导。这是一种特定的故障模式,而不是对准确性的泛泛抱怨。它意味着问题在单次对话内部会累积,而不是随机出现。

对企业而言,实际后果是:一个强有力的首次回答并不能证明后续回答也站得住脚。依赖模型跟踪长线程的团队——无论是支持工单、研究任务还是多步骤财务分析——都会面临只有在几轮之后才会浮现的错误。

为什么依赖AI的企业应该关注

这些发现出炉之际,企业正将AI模型融入错误答案会带来真实成本的工作流程中。路透所描述的挑战并不是模型偶尔失败,而是其失败率很难从外部看到。供应商发布的是头条结果;买家在签订合同前很少能获得会话级的可靠性数据。

在现有材料中,阿里巴巴并未对路透的发现提出异议。该公司将Qwen3-Max-Preview定位为旗舰模型,而正在评估它的企业客户现在有了一个具体的数据点,可以用来权衡营销宣传。

买家在部署前可以检查什么

调查指出了一个采购团队可以自行弥补的测试缺口。买家不应依赖已发布的基准分数,而可以运行反映其实际用例的多轮评估——长支持线程、文档审查、迭代分析——并对整个会话而非单个回复进行评分。

这种方法不会产生一个与供应商规格表相对应的干净百分比,但它会显示可靠性是否在企业实际运营的条件下下降。路透的88%数字是这项工作的起始参考点,而不是对模型的最终定论。

仍未确定的是,阿里巴巴是否会用自己的会话级数据作出回应,以及其他模型制造商是否会跟进做出可比的披露。在那之前,举证责任在于进行测试的买家。