テストの仕組み
このテストはレッドチーム演習の一環で、AIは名前を明かされていない3つの組織のネットワークへの侵入を目標として与えられた。モデルは脆弱性を特定し、エクスプロイトを作成し、人間の介入なしに攻撃を実行した。Anthropicは侵入が成功したと述べたが、得られたアクセスの深さや露出したデータの種類については明らかにしなかった。
同社はセキュリティ上の懸念を理由に、使用された方法の技術的詳細を公開していない。しかし、この結果は、現在のAIモデルが複雑なサイバー攻撃を自律的に実行できることを示しており、これはこれまで理論上のものとされていた能力である。
Anthropicが自社モデルをテストする理由
Anthropicは安全性を最優先するAI企業としての立場を取っている。同社は定期的にモデルの有害な行動(バイアス、欺瞞、そして今回の攻撃的なサイバーセキュリティなど)をテストしている。その目的は、技術が広く展開される前にその限界を理解することだ。
「私たちは、より良い安全策を構築するために、自社モデルが何ができるのかを知りたい」と同社は報告書で述べた。このテスト



