Anthropic, syarikat AI di sebalik model Claude, melaporkan bahawa sistem AI mereka sendiri berjaya menembusi tiga organisasi semasa ujian keselamatan siber. Syarikat itu mendedahkan keputusan ini dalam kemas kini terkini, menonjolkan kedua-dua keupayaan dan risiko AI termaju.
Bagaimana ujian dijalankan
Ujian ini adalah sebahagian daripada latihan red-team, di mana AI diberi matlamat untuk menembusi rangkaian tiga organisasi yang tidak dinamakan. Model-model tersebut mengenal pasti kelemahan, mencipta eksploitasi, dan melaksanakan serangan tanpa campur tangan manusia. Anthropic berkata serangan itu berjaya, walaupun ia tidak menyatakan kedalaman akses yang diperoleh atau jenis data yang terdedah.
Syarikat itu tidak mendedahkan butiran teknikal tentang kaedah yang digunakan, dengan alasan kebimbangan keselamatan. Tetapi keputusan menunjukkan bahawa model AI semasa boleh melaksanakan serangan siber kompleks secara autonomi, satu keupayaan yang sebelum ini hanya teori.
Mengapa Anthropic menguji modelnya sendiri
Anthropic telah meletakkan dirinya sebagai syarikat AI yang mengutamakan keselamatan. Ia sentiasa menguji modelnya untuk tingkah laku berbahaya, termasuk berat sebelah, penipuan, dan kini keselamatan siber ofensif. Matlamatnya adalah untuk memahami had teknologi sebelum ia digunakan secara meluas.
“Kami mahu tahu apa yang model kami boleh lakukan supaya kami dapat membina perlindungan yang lebih baik,” kata syarikat itu dalam laporannya. Ujian ini adalah sebahagian daripada usaha yang lebih luas untuk memastikan AI kekal selaras dengan niat manusia, walaupun digunakan oleh pihak yang berniat jahat.
Risiko AI yang berkuasa
Kejayaan serangan ini menimbulkan kebimbangan tentang potensi AI digunakan dalam jenayah siber atau serangan yang disokong negara. Jika model boleh menembusi tiga organisasi semasa ujian terkawal, ia boleh melakukan perkara yang sama di dunia sebenar. Teknologi yang sama yang membantu pasukan keselamatan mencari kelemahan juga boleh digunakan terhadap mereka.
Anthropic mengakui sifat dwiguna kerjanya. Syarikat itu berkata ia sedang membangunkan langkah balas, termasuk sistem pemantauan yang mengesan apabila model digunakan untuk tujuan berniat jahat. Tetapi perlumbaan senjata antara serangan dan pertahanan AI baru sahaja bermula.
Anthropic merancang untuk meneruskan ujian red-team modelnya dan berkongsi penemuan dengan komuniti keselamatan AI yang lebih luas. Syarikat itu tidak mengumumkan garis masa untuk ujian lanjut tetapi menekankan usaha berterusan untuk meningkatkan keteguhan model.
Persoalan sekarang ialah bagaimana industri akan bertindak balas terhadap bukti yang semakin meningkat bahawa AI boleh menjadi alat yang kuat untuk kedua-dua serangan dan pertahanan dalam keselamatan siber.



