Loading market data...

ロイターのテストでAlibabaのQwen3-Max-Previewが88%のセッションで誤解を招くことが判明

ロイターのテストでAlibabaのQwen3-Max-Previewが88%のセッションで誤解を招くことが判明

ロイターの調査により、AlibabaのQwen3-Max-Previewがテストされたセッションの88%で誤解を招く応答を返すことが判明した。この発見は、AIツールの企業購入者が測定に苦慮してきた問題、つまり会話が進むにつれてモデルの回答がどの程度真実から逸脱するかという問題にスポットライトを当てている。

この数字はAlibabaによるものではなく、ロイター独自のモデルテストから得られたものである。調査によれば、100セッション中88セッションで、モデルはユーザーを誤解させる出力を生成した。

88%という数字が実際に測定しているもの

セッションレベルのテストは、AI開発者が通常公開するベンチマークスコアとは異なる問いを投げかける。1つのセッションは何ターンも続くことがあり、そのうちのどれか1つでエラーが発生すれば、セッション全体が誤解を招くものとしてマークされるのに十分である。そのため、88%という数字は、通常は前後のやり取りなしに孤立した質問でモデルを評価する標準的な単発評価の精度数値と直接比較するのは難しい。

それでも、このギャップは顧客対応や意思決定支援の役割でモデルを展開する誰にとっても重要である。静的なテストで良好な性能を発揮するツールでも、ユーザーが追加の質問をしたり、新しい文脈を提供したり、以前の回答に反論したりすると、まったく異なる動作をすることがある。ロイターの発見は、このパターンがQwen3-Max-Previewに当てはまることを示唆している。

セッションが長くなるにつれて信頼性が低下する

調査ではまた、モデルの信頼性は経験とともに減少すること、つまりセッションが長く続くほど、出力が誤解を招く可能性が高まることも判明した。これは一般的な精度への不満ではなく、特定の故障モードである。これは問題がランダムに現れるのではなく、1つの会話の中で複合化することを意味する。

企業にとっての実際的な結果は、最初の回答が優れていても、その後の回答が持ちこたえる証拠にはならないということである。サポートチケット、調査タスク、多段階の財務分析など、長いスレッドを追跡するためにモデルに依存するチームは、数ターン後に初めて表面化するエラーにさらされる。

AIに依存する企業が注意を払うべき理由

この発見は、企業が誤った回答が実際のコストをもたらすワークフローにAIモデルを組み込みつつある時期に浮上した。ロイターが描写する課題は、モデルが時折失敗することではなく、その失敗率が外部から見えにくいことである。ベンダーは主要な結果を公表するが、購入者が契約を結ぶ前にセッションレベルの信頼性データを入手することはほとんどない。

Alibabaは入手可能な資料においてロイターの発見に異議を唱えていない。同社はQwen3-Max-Previewをフラッグシップモデルとして位置付けており、それを評価する企業顧客は、マーケティング上の主張と比較検討するための具体的なデータポイントを今持っている。

購入者が展開前に確認できること

調査は、調達チームが自ら埋めることができるテストのギャップを指摘している。公開されたベンチマークスコアに頼る代わりに、購入者は実際のユースケース(長いサポートスレッド、文書レビュー、反復的な分析)を反映したマルチターン評価を実行し、個々の返信ではなくセッション全体を採点することができる。

このアプローチは、ベンダーの仕様書に対応するきれいなパーセンテージを生み出すことはないが、企業が実際に運用する条件で信頼性が低下するかどうかを示すだろう。ロイターの88%という数字は、その作業のための出発点となる参照値であり、モデルに対する最終的な評決ではない。

未解決なのは、Alibabaが自社のセッションレベルデータで応答するかどうか、そして他のモデルメーカーが同等の開示で続くかどうかである。それまでは、証明責任はテストを実行する購入者側にある。