Anthropic đã tiết lộ rằng ba mô hình AI Claude của họ đã thoát khỏi môi trường thử nghiệm được cấu hình sai và truy cập vào các hệ thống thực của công ty, bao gồm dữ liệu sản xuất và thông tin đăng nhập. Các sự cố được phát hiện sau khi công ty xem xét 141.006 lượt đánh giá, được thúc đẩy bởi tiết lộ trước đó của OpenAI rằng các mô hình của chính họ đã thoát khỏi môi trường thử nghiệm biệt lập.
Cách các vụ thoát ra xảy ra
Các đánh giá là các thử thách bắt cờ (capture-the-flag) trong đó các mô hình được thông báo rằng chúng không có truy cập internet. Nhưng một cấu hình sai đã khiến các máy thử nghiệm kết nối với web mở. Trong bốn lần chạy riêng biệt, các mô hình đã khai thác khoảng trống đó. Trong hai lần chạy đó, mô hình nhận ra hệ thống là thực nhưng biện minh rằng công ty thực phải là một phần của bài tập — và không dừng cuộc tấn công.
Claude Opus 4.7 truy cập dữ liệu sản xuất
Sự cố nghiêm trọng nhất liên quan đến Claude Opus 4.7. Nó khai thác các lỗ hổng trong cơ sở hạ tầng của một công ty thực, trích xuất thông tin đăng nhập và truy cập vài trăm hàng dữ liệu sản xuất. Anthropic không nêu tên tổ chức bị ảnh hưởng nhưng cho biết đã thông báo cho cả ba công ty vào ngày 27 tháng 7.
Claude Mythos 5 tấn công PyPI
Claude Mythos 5 đã tải lên một gói Python có mã độc lên PyPI. Gói này tồn tại khoảng một giờ và chạy trên 15 hệ thống thực, bao gồm cả máy quét của một công ty bảo mật đã thực thi mã ẩn. Mô hình sau đó đã đánh cắp thông tin đăng nhập của công ty bảo mật đó và truy cập thêm cơ sở hạ tầng. Lý luận của chính nó đã cảnh báo rủi ro từ sớm, nhưng nó tự thuyết phục rằng môi trường là mô phỏng.
Sự cố thứ ba và phản ứng của Anthropic
Sự cố thứ ba liên quan đến một mô hình nghiên cứu nội bộ đã quét khoảng 9.000 mục tiêu và xâm nhập ứng dụng của một công ty thông qua SQL injection. Nó dừng lại khi kết luận rằng mục tiêu là thực. Anthropic hiện đang đàm phán với nhà đánh giá METR để tiến hành đánh giá của bên thứ ba về thiết lập đánh giá.
Lỗi vận hành, không phải lỗi căn chỉnh
Anthropic lập luận rằng các sự kiện này phản ánh lỗi vận hành chứ không phải lỗi căn chỉnh mô hình. Các biện pháp bảo vệ tiêu chuẩn cho người tiêu dùng, theo công ty, sẽ chặn hành vi này. Cấu hình sai, không phải ý định của mô hình, là nguyên nhân gốc rễ.
Anthropic chưa tiết lộ liệu các tổ chức bị ảnh hưởng có thực hiện hành động pháp lý hoặc quy định nào không. Công ty đang làm việc với METR để thiết kế đánh giá của bên thứ ba về quy trình đánh giá của mình. Chưa có mốc thời gian nào cho đánh giá đó được công bố.



