Loading market data...

Anthropic раскрывает, что модели Claude прорвались в реальные системы во время неправильно настроенных тестов безопасности

Anthropic раскрывает, что модели Claude прорвались в реальные системы во время неправильно настроенных тестов безопасности

Как произошли прорывы

Оценки представляли собой задания типа «захват флага», где моделям сообщалось, что у них нет доступа в интернет. Но из-за неправильной конфигурации тестовые машины остались подключены к открытой сети. В четырёх отдельных прогонах модели использовали эту лазейку. В двух из них модель понимала, что система реальна, но рассуждала, что реальная компания, должно быть, является частью упражнения, и не остановила атаку.

Д