Anthropic'in yapay zeka asistanı Claude, 1872 yılına kadar uzanan maç verilerini kullanarak 50.000 Dünya Kupası simülasyonu gerçekleştirdi. Bu çalışma, bir tahmin yarışmasında yapay zeka destekli tahmin yeteneğini test etmenin bir parçasıydı.
Simülasyonların kapsamı
Her bir simülasyon, grup aşamasından finale kadar tüm turnuvayı modelledi ve olasılıkları belirlemek için geçmiş sonuçları kullandı. Veri seti, 150 yılı aşkın uluslararası futbol tarihini kapsıyor; buna 1872'de İskoçya ile İngiltere arasında oynanan ilk resmi uluslararası maç da dahil. Claude, bu verileri işleyerek takım formu, ikili maç kayıtları ve turnuva geçmişi gibi faktörleri ağırlıklandırarak binlerce olası sonuç üretti.
Tek bir turnuva için 50.000 simülasyon büyük bir örneklem. Karşılaştırma yapmak gerekirse, birçok tahmin modeli birkaç bin simülasyon çalıştırır. Bu ölçek, Anthropic'in yalnızca doğruluğu değil, aynı zamanda tutarlılığı da test etmek istediğini gösteriyor — aynı takımın farklı rastgele tohumlarda ne sıklıkla kazandığı.
Geçmiş veriler neden önemli?
Dünya Kupası 1930'da başladı, ancak veri seti on yıllar öncesine uzanıyor. Buna erken Britanya Ev Şampiyonası maçları, 1900'lerin başındaki Olimpiyat futbol turnuvaları ve diğer uluslararası hazırlık maçları dahil. Daha kısa geçmişe sahip takımlar (örneğin yeni kurulan milli takımlar) için model muhtemelen daha güncel verilere veya bölgesel kalıplara dayandı.
1872'den itibaren veri kullanmak, simülasyonların çok farklı oyun tarzları, kurallar ve rekabet dengesi olan dönemleri hesaba katması anlamına geliyor. 1900'deki bir maç, 2022 Dünya Kupası maçıyla doğrudan karşılaştırılamaz. Modelin bu değişimi ayarlaması gerekirdi, ancak Anthropic, sporun değişen doğasını nasıl ele aldığını detaylandırmadı.
Tahmin yarışması
Simülasyonlar, yapay zeka destekli tahminin daha geniş bir testinin parçasıydı. Yarışma, Claude'un tahminlerini diğer yöntemlerle (muhtemelen insan uzmanlar, istatistiksel modeller veya her ikisi) karşı karşıya getirdi. Büyük turnuvalar için tahmin yarışmaları yaygındır; katılımcılar spor gazetecilerinden veri bilimcilerine kadar uzanır. Bu yarışma özellikle bir yapay zeka asistanının tahmin doğruluğunu artırıp artıramayacağını test etti.
Anthropic, simülasyonların sonuçlarını veya diğer katılımcılarla nasıl karşılaştırıldığını açıklamadı. Şirket ayrıca aynı yaklaşımın gelecekteki turnuvalar (örneğin bir sonraki Kadınlar Dünya Kupası veya kıta şampiyonaları) için kullanılıp kullanılmayacağını da belirtmedi.
Açık olan şu ki, bu test Claude'u olağan metin üretme görevlerinin ötesine taşıdı. 50.000 simülasyon çalıştırmak, önemli miktarda hesaplama gücü ve yapılandırılmış bir akıl yürütme süreci gerektirir — sadece bir sonraki kelimeyi tahmin etmek değil, karmaşık bir turnuva ağacı boyunca olasılıkları hesaplamak.
Claude'un simülasyonlarının insan tahmincilerden daha iyi performans gösterip göstermediği hala cevaplanmamış bir soru. Yarışma sonuçları kamuoyuyla paylaşılmadı.




