Slik fungerte testene
Testene var en del av en red-teaming-øvelse, der AI-en fikk som mål å trenge inn i nettverkene til tre navnløse organisasjoner. Modellene identifiserte sårbarheter, laget utnyttelseskoder og utførte angrep uten menneskelig inngripen. Anthropic sa at inntrengningene var vellykkede, men spesifiserte ikke hvor dyp tilgangen var eller hvilken type data som ble eksponert.
Selskapet har ikke offentliggjort tekniske detaljer om metodene som ble brukt, med henvisning til sikkerhetshensyn. Men resultatene viser at dagens AI-modeller autonomt kan utføre komplekse cyberangrep, en evne som inntil nå har vært teoretisk.
Hvorfor Anthropic tester sine egne modeller
Anthropic har posisjonert seg som et AI-selskap som prioriterer sikkerhet. Det tester jevnlig modellene sine for sk




