Loading market data...

로이터 테스트, 알리바바의 Qwen3-Max-Preview가 88%의 세션에서 오해를 유발하는 것으로 나타나

로이터 테스트, 알리바바의 Qwen3-Max-Preview가 88%의 세션에서 오해를 유발하는 것으로 나타나

로이터 조사에 따르면 알리바바의 Qwen3-Max-Preview가 테스트된 세션의 88%에서 오해를 불러일으키는 응답을 반환하는 것으로 나타났다. 이 발견은 AI 도구를 구매하는 기업들이 측정하기 어려워했던 문제, 즉 대화가 진행됨에 따라 모델의 답변이 얼마나 자주 진실에서 벗어나는지를 조명한다.

이 수치는 알리바바가 아닌 로이터의 자체 테스트에서 나온 것이다. 조사에 따르면 100개 세션 중 88개에서 모델이 사용자를 오도하는 출력을 생성했다.

88% 수치가 실제로 측정하는 것

세션 수준 테스트는 AI 개발자들이 일반적으로 발표하는 벤치마크 점수와는 다른 질문을 던진다. 단일 세션은 여러 턴에 걸쳐 진행될 수 있으며, 그 중 어느 한 턴에서의 오류만으로도 전체 세션을 오해를 유발하는 것으로 표시하기에 충분하다. 따라서 88%라는 숫자는 일반적으로 상호작용 없이 개별 질문에 대해 모델을 평가하는 표준 일회성 평가의 정확도 수치와 직접 비교하기 어렵다.

그럼에도 불구하고, 이 격차는 고객 대면 또는 의사 결정 지원 역할에 모델을 배포하는 모든 사람에게 중요하다. 정적 테스트에서 좋은 성능을 보이는 도구는 사용자가 후속 질문을 하거나 새로운 맥락을 제공하거나 이전 답변에 반박할 때 매우 다르게 작동할 수 있다. 로이터의 발견은 이러한 패턴이 Qwen3-Max-Preview에 적용된다는 것을 시사한다.

세션이 길어질수록 신뢰성 저하

조사는 또한 모델의 신뢰성이 경험이 쌓일수록 감소한다는 것을 발견했다. 즉, 세션이 더 오래 실행될수록 출력이 오해를 유발할 가능성이 더 높아진다. 이는 정확도에 대한 일반적인 불만이 아니라 특정 실패 모드이다. 이는 문제가 무작위로 나타나는 것이 아니라 단일 대화 내에서 누적된다는 것을 의미한다.

기업의 경우 실질적인 결과는 강력한 첫 답변이 이후 답변도 견딜 것이라는 증거가 아니라는 점이다. 지원 티켓, 연구 작업, 다단계 재무 분석과 같은 긴 스레드를 추적하기 위해 모델에 의존하는 팀은 여러 턴 후에야 표면화되는 오류에 노출된다.

AI에 의존하는 기업이 주목해야 하는 이유

이 발견은 기업들이 잘못된 답변이 실제 비용을 초래하는 워크플로우에 AI 모델을 통합하고 있는 시점에 나왔다. 로이터가 설명하는 과제는 모델이 때때로 실패한다는 것이 아니라, 그 실패율을 외부에서 보기가 어렵다는 점이다. 공급업체는 주요 결과를 발표하지만, 구매자는 계약을 체결하기 전에 세션 수준의 신뢰성 데이터를 거의 얻지 못한다.

알리바바는 이용 가능한 자료에서 로이터의 발견에 이의를 제기하지 않았다. 이 회사는 Qwen3-Max-Preview를 플래그십 모델로 포지셔닝했으며, 이를 평가하는 기업 고객은 이제 마케팅 주장과 비교해 저울질할 수 있는 구체적인 데이터 포인트를 갖게 되었다.

구매자가 배포 전에 확인할 수 있는 것

조사는 조달 팀이 스스로 메울 수 있는 테스트 격차를 지적한다. 구매자는 발표된 벤치마크 점수에 의존하는 대신, 실제 사용 사례(긴 지원 스레드, 문서 검토, 반복 분석)를 반영하는 다중 턴 평가를 실행하고 개별 답변이 아닌 전체 세션을 평가할 수 있다.

이 접근 방식은 공급업체의 사양서에 매핑되는 깔끔한 백분율을 제공하지는 않지만, 기업이 실제로 운영하는 조건에서 신뢰성이 저하되는지 여부를 보여줄 것이다. 로이터의 88% 수치는 그 작업을 위한 시작 참조점이지 모델에 대한 최종 판결이 아니다.

남은 질문은 알리바바가 자체적인 세션 수준 데이터로 대응할지, 그리고 다른 모델 제조사들이 유사한 공개를 할지 여부이다. 그때까지는 테스트를 실행하는 구매자에게 입증 책임이 있다.