การสอบสวนของรอยเตอร์พบว่า Qwen3-Max-Preview ของอาลีบาบาให้คำตอบที่ทำให้เข้าใจผิดใน 88% ของเซสชันที่ทดสอบ การค้นพบนี้ทำให้เห็นปัญหาใหญ่ที่ผู้ซื้อเครื่องมือ AI ระดับองค์กรต้องเผชิญในการวัดว่า คำตอบของโมเดลเบี่ยงเบนไปจากความจริงบ่อยแค่ไหนเมื่อการสนทนายืดเยื้อออกไป
ตัวเลขนี้มาจากการทดสอบของรอยเตอร์เอง ไม่ใช่จากอาลีบาบา จากการสอบสวน ใน 88 จากทุก 100 เซสชัน โมเดลสร้างผลลัพธ์ที่ทำให้ผู้ใช้เข้าใจผิด
ตัวเลข 88% วัดอะไรกันแน่
การทดสอบระดับเซสชันถามคำถามที่แตกต่างจากคะแนนมาตรฐานที่ผู้พัฒนา AI มักเผยแพร่ เซสชันเดียวอาจดำเนินไปหลายรอบ และข้อผิดพลาดในรอบใดรอบหนึ่งก็เพียงพอที่จะทำให้ทั้งเซสชันถูกทำเครื่องหมายว่าทำให้เข้าใจผิด ซึ่งทำให้ตัวเลข 88% ยากที่จะเปรียบเทียบโดยตรงกับตัวเลขความแม่นยำจากการประเมินแบบครั้งเดียวมาตรฐาน ซึ่งมักให้คะแนนโมเดลจากคำถามแยกเดี่ยวโดยไม่มีการโต้ตอบไปมา
อย่างไรก็ตาม ช่องว่างนี้มีความสำคัญสำหรับผู้ที่นำโมเดลไปใช้ในบทบาทที่ต้องเผชิญกับลูกค้าหรือสนับสนุนการตัดสินใจ เครื่องมือที่ทำได้ดีในการทดสอบแบบคงที่อาจมีพฤติกรรมแตกต่างอย่างมากเมื่อผู้ใช้ถามคำถามต่อ ให้บริบทใหม่ หรือโต้แย้งคำตอบก่อนหน้า การค้นพบของรอยเตอร์ชี้ให้เห็นว่ารูปแบบนี้ใช้ได้กับ Qwen3-Max-Preview
ความน่าเชื่อถือลดลงเมื่อเซสชันยาวขึ้น
การสอบสวนยังพบว่าความน่าเชื่อถือของโมเดลลดลงตามประสบการณ์ หมายความว่ายิ่งเซสชันดำเนินไปนานเท่าไร ผลลัพธ์ก็ยิ่งมีแนวโน้มที่จะทำให้เข้าใจผิดมากขึ้น นี่เป็นโหมดความล้มเหลวที่เฉพาะเจาะจง ไม่ใช่ข้อร้องเรียนทั่วไปเกี่ยวกับความแม่นยำ มันบ่งชี้ว่าปัญหาสะสมภายในบทสนทนาเดียว แทนที่จะปรากฏขึ้นแบบสุ่ม
สำหรับธุรกิจ ผลที่ตามมาในทางปฏิบัติคือ คำตอบแรกที่ดีไม่ได้เป็นหลักฐานว่าคำตอบต่อๆ มาจะยังคงถูกต้อง ทีมที่พึ่งพาโมเดลในการติดตามเธรดยาว เช่น ตั๋วสนับสนุน งานวิจัย หรือการวิเคราะห์ทางการเงินหลายขั้นตอน ต้องเผชิญกับข้อผิดพลาดที่ปรากฏเฉพาะหลังจากการสนทนาหลายรอบ
ทำไมธุรกิจที่พึ่งพา AI ควรให้ความสนใจ
การค้นพบนี้เกิดขึ้นในขณะที่บริษัทต่างๆ กำลังนำโมเดล AI เข้าสู่กระบวนการทำงานที่คำตอบผิดมีต้นทุนจริง ความท้าทายที่รอยเตอร์อธิบายไม่ใช่แค่โมเดลล้มเหลวเป็นครั้งคราว แต่เป็นอัตราความล้มเหลวที่ยากจะมองเห็นจากภายนอก ผู้ขายเผยแพร่ผลลัพธ์ระดับพาดหัวข่าว แต่ผู้ซื้อแทบไม่เคยได้ข้อมูลความน่าเชื่อถือระดับเซสชันก่อนเซ็นสัญญา
อาลีบาบาไม่ได้โต้แย้งผลการค้นพบของรอยเตอร์ในเอกสารที่มีอยู่ บริษัทได้วางตำแหน่ง Qwen3-Max-Preview เป็นโมเดลเรือธง และลูกค้าองค์กรที่กำลังประเมินโมเดลนี้ตอนนี้มีจุดข้อมูลที่เป็นรูปธรรมให้ชั่งน้ำหนักกับคำกล่าวอ้างทางการตลาด
สิ่งที่ผู้ซื้อสามารถตรวจสอบก่อนนำไปใช้
การสอบสวนชี้ให้เห็นช่องว่างในการทดสอบที่ทีมจัดซื้อสามารถปิดได้เอง แทนที่จะพึ่งพาคะแนนมาตรฐานที่เผยแพร่ ผู้ซื้อสามารถรันการประเมินแบบหลายรอบที่สะท้อนกรณีการใช้งานจริงของตน เช่น เธรดสนับสนุนยาว การตรวจสอบเอกสาร การวิเคราะห์แบบวนซ้ำ และให้คะแนนทั้งเซสชันแทนที่จะให้คะแนนแต่ละคำตอบ
วิธีนี้จะไม่ให้เปอร์เซ็นต์ที่สะอาดซึ่งตรงกับเอกสารสเปกของผู้ขาย แต่จะแสดงว่าความน่าเชื่อถือลดลงในเงื่อนไขที่ธุรกิจดำเนินงานจริงหรือไม่ ตัวเลข 88% ของรอยเตอร์เป็นจุดอ้างอิงเริ่มต้นสำหรับงานนั้น ไม่ใช่คำตัดสินสุดท้ายเกี่ยวกับโมเดล
สิ่งที่ยังคงเปิดอยู่คืออาลีบาบาจะตอบกลับด้วยข้อมูลระดับเซสชันของตนเองหรือไม่ และผู้ผลิตโมเดลรายอื่นจะเปิดเผยข้อมูลที่เทียบเคียงได้ตามมาหรือไม่ จนกว่าจะถึงตอนนั้น ภาระการพิสูจน์ตกอยู่กับผู้ซื้อที่รันการทดสอบ




