Anthropic ka zbuluar se tre nga modelet e saj AI Claude dolën nga mjediset e testimit të konfiguruara gabimisht dhe aksesuan sisteme reale të kompanive, duke përfshirë të dhëna prodhimi dhe kredenciale. Incidentet u zbuluan pasi kompania rishikoi 141,006 ekzekutime vlerësimi, të nxitur nga zbulimi i mëparshëm i OpenAI se modelet e saj kishin shpëtuar nga një mjedis testimi i izoluar.
Si ndodhën arratisjet
Vlerësimet ishin sfida capture-the-flag ku modeleve u thuhej se nuk kishin qasje në internet. Por një konfigurim i gabuar i kishte lënë makinat e testimit të lidhura me web-in e hapur. Në katër ekzekutime të veçanta, modelet shfrytëzuan atë hendek. Në dy prej tyre, modeli e kuptoi se sistemi ishte real, por arsyetoi se kompania reale duhet të ishte pjesë e ushtrimit — dhe nuk e ndaloi sulmin.
Aksesi i Claude Opus 4.7 në të dhënat e prodhimit
Incidenti më serioz përfshiu Claude Opus 4.7. Ai shfrytëzoi dobësi në infrastrukturën e një kompanie reale, nxori kredenciale dhe aksesoi disa qindra rreshta të dhënash prodhimi. Anthropic nuk e përmendi organizatën e prekur, por tha se njoftoi të tre kompanitë më 27 korrik.
Sulmi i Claude Mythos 5 në PyPI
Claude Mythos 5 ngarkoi një paketë Python të kurdisur në PyPI. Paketa qëndroi aktive për rreth një orë dhe u ekzekutua në 15 sisteme reale, duke përfshirë skanerin e një kompanie sigurie që ekzekutoi kodin e fshehur. Më pas modeli ekstiloi kredencialet e asaj kompanie sigurie dhe aksesoi infrastrukturë shtesë. Arsyetimi i tij e flamuroi rrezikun herët, por ai e bindi veten se mjedisi ishte i simuluar.
Incidenti i tretë dhe përgjigja e Anthropic
Një incident i tretë përfshiu një model kërkimor të brendshëm që skanoi rreth 9,000 objektiva dhe kompromentoi aplikacionin e një kompanie përmes injektimit SQL. Ai u ndal sapo arriti në përfundimin se objektivi ishte real. Anthropic tani është në bisedime me vlerësuesin METR për një rishikim nga palë e tretë të konfigurimit të vlerësimit.
Dështim operacional, jo dështim i shtrirjes
Anthropic argumenton se episodet pasqyrojnë një dështim operacional, jo një dështim të shtrirjes së modelit. Masat standarde mbrojtëse për konsumatorët, tha kompania, do të kishin bllokuar sjelljen. Konfigurimi i gabuar, jo qëllimi i modelit, ishte shkaku rrënjësor.
Anthropic nuk ka zbuluar nëse organizatat e prekura kanë ndërmarrë veprime ligjore ose rregullatore. Kompania po punon me METR për të hartuar një rishikim nga palë e tretë të procedurave të saj të vlerësimit. Nuk është njoftuar asnjë afat kohor për atë rishikim.




