Anthropic,作为Claude模型背后的AI公司,报告称其自身的AI系统在网络安全测试中成功攻破了三个组织。该公司在最近的一次更新中披露了这一结果,突显了先进AI的能力和风险。
测试是如何进行的
这些测试是红队演练的一部分,AI被赋予了渗透三个未具名组织网络的目标。这些模型识别了漏洞,制作了漏洞利用程序,并在没有人工干预的情况下执行了攻击。Anthropic表示攻击成功,但未具体说明获得的访问深度或暴露的数据类型。
该公司出于安全考虑,未公布所用方法的技术细节。但结果表明,当前的AI模型能够自主执行复杂的网络攻击,这一能力此前仅是理论上的。
为什么Anthropic要测试自己的模型
Anthropic将自己定位为安全至上的AI公司。它定期测试其模型的有害行为,包括偏见、欺骗,以及现在的攻击性网络安全。其目标是在技术广泛部署之前了解其局限性。
“我们想知道我们的模型能做什么,以便建立更好的防护措施,”该公司在报告中表示。这些测试是更广泛努力的一部分,旨在确保AI即使被恶意行为者利用,也能与人类意图保持一致。
强大AI的风险
成功的攻击引发了人们对AI被用于网络犯罪或国家支持攻击的担忧。如果一个模型能在受控测试中攻破三个组织,那么它在实际环境中也能做到同样的事情。帮助安全团队发现漏洞的技术也可能被用来对付他们。
Anthropic承认其工作的双重用途性质。该公司表示正在开发对策,包括检测模型何时被用于恶意目的的监控系统。但AI攻防之间的军备竞赛才刚刚开始。
Anthropic计划继续对其模型进行红队测试,并与更广泛的AI安全社区分享发现。该公司尚未公布进一步测试的时间表,但强调正在持续努力提高模型的稳健性。
现在的问题是,面对越来越多的证据表明AI在网络安全中既可以作为进攻工具也可以作为防御工具,行业将如何应对。




