Loading market data...

Модели ИИ Anthropic взломали три организации в ходе тестов безопасности

Модели ИИ Anthropic взломали три организации в ходе тестов безопасности

Anthropic, компания в сфере ИИ, стоящая за моделью Claude, сообщила, что её собственные системы ИИ успешно взломали три организации во время тестирования кибербезопасности. Компания раскрыла результаты в недавнем обновлении, подчеркнув как возможности, так и риски продвинутого ИИ.

Как проходили тесты

Тесты были частью упражнения с участием «красной команды», где ИИ получил цель проникнуть в сети трёх неназванных организаций. Модели выявляли уязвимости, создавали эксплойты и выполняли атаки без вмешательства человека. Anthropic заявила, что взломы были успешными, но не уточнила глубину полученного доступа или тип раскрытых данных.

Компания не раскрыла технические детали использованных методов, ссылаясь на соображения безопасности. Но результаты показывают, что современные модели ИИ могут автономно осуществлять сложные кибератаки — возможность, которая до сих пор была теоретической.

Почему Anthropic тестирует свои модели

Anthropic позиционирует себя как компанию, ставящую безопасность на первое место. Она регулярно тестирует свои модели на вредное поведение, включая предвзятость, обман и теперь наступательные кибероперации. Цель — понять пределы технологии до её широкого развёртывания.

«Мы хотим знать, на что способны наши модели, чтобы создать лучшие меры защиты», — говорится в отчёте компании. Тесты являются частью более широких усилий по обеспечению того, чтобы ИИ оставался согласованным с человеческими намерениями, даже при использовании злоумышленниками.

Риски мощного ИИ

Успешные взломы вызывают опасения по поводу потенциального использования ИИ в киберпреступности или атаках, спонсируемых государством. Если модель может проникнуть в три организации во время контролируемого теста, она может сделать то же самое в реальных условиях. Та же технология, которая помогает командам безопасности находить уязвимости, может быть обращена против них.

Anthropic признала двойное назначение своей работы. Компания заявила, что разрабатывает контрмеры, включая системы мониторинга, которые обнаруживают, когда модель используется в злонамеренных целях. Но гонка вооружений между наступательным и оборонительным ИИ только начинается.

Anthropic планирует продолжать испытания с участием «красной команды» и делиться результатами с более широким сообществом по безопасности ИИ. Компания не объявила сроки дальнейших тестов, но подчеркнула постоянные усилия по повышению устойчивости моделей.

Теперь вопрос в том, как отрасль отреагирует на растущие доказательства того, что ИИ может быть мощным инструментом как для нападения, так и для защиты в кибербезопасности.