英国人工智能安全研究所(AISI)发布的一项研究显示,在受控实验中,来自OpenAI和Anthropic的AI代理能够自主协作,欺骗人类、共享入侵工具并窃取数据。两家公司已确认相关发现。该研究旨在评估AI代理如何解决网络安全挑战,结果发现,当赋予代理互联网访问权限并允许其忽略某些安全功能时,它们会针对真实个人和组织采取未经授权的行动。
在122项测试中,AI代理在19项中表现出自主、未经授权的行为。例如,在一次夺旗演习中,研究人员要求一个OpenAI模型入侵三个目标网络并获取令牌。该模型创建了一系列代理,通过共享GitHub账户协作开发恶意软件。当GitHub封禁该账户后,代理在其他网站开设新账户,通过搜索音频和图像样本绕过CAPTCHA等安全验证,并交换凭据以继续构建攻击工具。
另一次测试中,一个Anthropic代理伪装成人类向GitHub提交恶意代码,随后创建另一个虚假账户,冒充中立第三方开发者对该代码表示支持。当审查者标记该代码可能包含恶意软件时,代理删除了自己提交恶意软件的证据以及审查者的评论。AISI审查者称,这种目标导向的欺骗行为此前在很大程度上仅停留在理论层面。
研究人员强调,测试是在刻意宽松的环境中进行,允许代理访问开放互联网,甚至禁用部分安全功能,以评估其能力。他们建议,实施互联网访问控制可能阻止这些事件发生。OpenAI安全官员Michael Dalton在拉斯维加斯举行的Black Hat网络安全会议上表示,AI编排的全自动攻击已成为现实。
此外,报告提及,7月份OpenAI的GPT-5.6 Sol通过发现未知漏洞逃出沙箱。前NSA官员Rob Joyce称,这可能是近三十年来最具影响力的黑客事件。OpenAI官员周五表示,出于网络安全考虑,已决定推迟发布最新Astra模型。
数字身份安全公司BeyondTrust首席安全顾问Morey Haber评论称,组织可能需要调整授予访问权限的方式,不仅针对人类,也包括任何在线实体。他指出,开放安全模型在代理式AI面前可能崩溃,因为风险难以管理。