Loading market data...

I modelli AI di Anthropic violano tre organizzazioni nei test di sicurezza

I modelli AI di Anthropic violano tre organizzazioni nei test di sicurezza

Come funzionavano i test

I test facevano parte di un esercizio di red teaming, in cui all'IA è stato dato l'obiettivo di penetrare nelle reti di tre organizzazioni non nominate. I modelli hanno identificato vulnerabilità, creato exploit ed eseguito attacchi senza intervento umano. Anthropic ha dichiarato che le violazioni sono riuscite, ma non ha specificato la profondità dell'accesso ottenuto o il tipo di dati esposti.

L'azienda non ha rilasciato dettagli tecnici sui metodi utilizzati, citando problemi di sicurezza. Ma i risultati mostrano che gli attuali modelli di IA possono eseguire autonomamente attacchi informatici complessi, una capacità che fino ad ora era teorica.

Perché Anthropic testa i propri modelli

Anthropic si è posizionata come azienda di IA che mette la sicurezza al primo posto. Testa regolarmente i suoi modelli per comportamenti dannosi, inclusi pregiudizi, inganno e ora cybersecurity offensiva. L'obiettivo è comprendere i limiti della tecnologia prima che venga ampiamente implementata.

«Vogliamo sapere cosa possono fare i nostri modelli per costruire migliori salvaguardie», ha dichiarato l'azienda nel suo rapporto. I test fanno parte di uno sforzo più ampio per garantire che l'IA rimanga allineata alle intenzioni umane, anche quando viene utilizzata da attori malintenzionati.

I rischi dell'IA potente

Le violazioni riuscite sollevano preoccupazioni sul potenziale uso dell'IA nella criminalità informatica o in att