Az Anthropic AI-asszisztense, Claude 50 000 világbajnoki szimulációt futtatott, felhasználva az 1872-ig visszanyúló mérkőzésadatokat. A gyakorlat egy előrejelzési versenyben végzett AI által támogatott előrejelzési teszt része volt.
A szimulációk terjedelme
\nMinden egyes szimuláció a teljes tornát modellezte a csoportköröktől a döntőig, történelmi eredmények felhasználásával a valószínűségek meghatározásához. Az adathalmaz több mint 150 év nemzetközi futballt ölel fel, beleértve az 1872-es első hivatalos nemzetközi mérkőzést Skócia és Anglia között. Claude feldolgozta ezeket az adatokat, hogy több ezer lehetséges kimenetet generáljon, súlyozva olyan tényezőket, mint a csapatforma, az egymás elleni mérlegek és a torna története.
Ötvenezer futtatás nagy minta egyetlen tornára. Összehasonlításképpen: sok előrejelzési modell néhány ezer szimulációt futtat. A méret arra utal, hogy az Anthropic nemcsak a pontosságot, hanem a konzisztenciát is tesztelni akarta – hogy ugyanaz a csapat milyen gyakran nyer különböző véletlen magok mellett.
Miért fontos a történelmi adat
\nA világbajnokság maga 1930-ban kezdődött, de az adathalmaz évtizedekkel korábbra nyúlik vissza. Ez magában foglalja a korai Brit Honi Bajnokság mérkőzéseit, az 1900-as évek eleji olimpiai futballtornákat és más nemzetközi barátságos meccseket. A rövidebb történelemmel rendelkező csapatok – például újabb nemzeti válogatottak – esetében a modell valószínűleg frissebb adatokra vagy regionális mintákra támaszkodott.
Az 1872-től származó adatok használata azt jelenti, hogy a szimulációk nagyon eltérő játékstílusú, szabályú és versenyegyensúlyú korszakokat vesznek figyelembe. Egy 1900-as mérkőzés nem hasonlítható közvetlenül össze egy 2022-es világbajnoki meccsel. A modellnek alkalmazkodnia kellett ehhez az eltolódáshoz, bár az Anthropic nem részletezte, hogyan kezelte a sportág változó természetét.
Az előrejelzési verseny
\nA szimulációk egy szélesebb körű, AI által támogatott előrejelzési teszt részét képezték. A versenyben Claude előrejelzései más módszerekkel – esetleg emberi szakértőkkel, statisztikai modellekkel vagy mindkettővel – szemben mérettettek meg. A nagy tornákra vonatkozó előrejelzési versenyek gyakoriak, a résztvevők a sportújságíróktól az adattudósokig terjednek. Ez a verseny kifejezetten azt tesztelte, hogy egy AI-asszisztens képes-e javítani az előrejelzés pontosságán.
Az Anthropic nem hozta nyilvánosságra a szimulációk eredményeit, és azt sem, hogyan viszonyultak más nevezésekhez. A vállalat azt sem közölte, hogy ugyanezt a megközelítést alkalmazza-e a jövőbeli tornákra, például a következő női világbajnokságra vagy kontinentális bajnokságokra.
Ami világos, hogy a teszt Claude-ot a szokásos szöveggenerálási feladatokon túlra tolta. 50 000 szimuláció futtatása jelentős számítási kapacitást és strukturált érvelési folyamatot igényel – nemcsak a következő szó előrejelzését, hanem a valószínűségek kiszámítását egy összetett versenytáblán keresztül.
Az, hogy Claude szimulációi felülmúlták-e az emberi előrejelzőket, továbbra is nyitott kérdés. A verseny eredményeit nem hozták nyilvánosságra.




