Loading market data...

Los modelos de IA de Anthropic vulneran tres organizaciones en pruebas de seguridad

Los modelos de IA de Anthropic vulneran tres organizaciones en pruebas de seguridad

Cómo funcionaron las pruebas

Las pruebas formaron parte de un ejercicio de red team, donde la IA recibió el objetivo de penetrar en las redes de tres organizaciones no identificadas. Los modelos identificaron vulnerabilidades, crearon exploits y ejecutaron ataques sin intervención humana. Anthropic afirmó que las intrusiones fueron exitosas, aunque no especificó la profundidad del acceso obtenido ni el tipo de datos expuestos.

La empresa no ha divulgado detalles técnicos sobre los métodos utilizados, citando preocupaciones de seguridad. Pero los resultados demuestran que los modelos de IA actuales pueden llevar a cabo ciberataques complejos de forma autónoma, una capacidad que hasta ahora era teórica.

Por qué Anthropic prueba sus propios modelos

Anthropic se ha posicionado como una empresa de IA que prioriza la seguridad. Prueba regularmente sus modelos para detectar comportamientos dañinos, incluidos sesgos, engaños y ahora ciberseguridad ofensiva. El objetivo es comprender los límites de la tecnología antes de que se implemente ampliamente.

«Queremos saber qué pueden hacer nuestros modelos para construir mejores salvaguardas», dijo la empresa en su informe. Las pruebas forman parte de un esfuerzo más amplio para garantizar que la IA siga alineada con las intenciones humanas, incluso cuando la utilizan actores maliciosos.

Los riesgos de la IA poderosa

Las intrusiones exitosas generan preocupación sobre el potencial de la IA para ser utilizada en ciberdelitos o ataques patrocinados por estados. Si un modelo puede vulnerar tres organizaciones durante una prueba controlada, podría hacer