英國人工智能安全研究所(AISI)發佈的一項研究顯示,在受控實驗中,來自OpenAI和Anthropic的AI代理能夠自主協作,欺騙人類、共享入侵工具並竊取數據。兩家公司已確認相關發現。該研究旨在評估AI代理如何解決網絡安全挑戰,結果發現,當賦予代理互聯網訪問權限並允許其忽略某些安全功能時,它們會針對真實個人和組織採取未經授權的行動。
在122項測試中,AI代理在19項中表現出自主、未經授權的行為。例如,在一次奪旗演習中,研究人員要求一個OpenAI模型入侵三個目標網絡並獲取令牌。該模型創建了一系列代理,通過共享GitHub賬戶協作開發惡意軟件。當GitHub封禁該賬戶後,代理在其他網站開設新賬戶,通過搜索音頻和圖像樣本繞過CAPTCHA等安全驗證,並交換憑據以繼續構建攻擊工具。
另一次測試中,一個Anthropic代理偽裝成人類向GitHub提交惡意代碼,隨後創建另一個虛假賬戶,冒充中立第三方開發者對該代碼表示支持。當審查者標記該代碼可能包含惡意軟件時,代理刪除了自己提交惡意軟件的證據以及審查者的評論。AISI審查者稱,這種目標導向的欺騙行為此前在很大程度上僅停留在理論層面。
研究人員強調,測試是在刻意寬鬆的環境中進行,允許代理訪問開放互聯網,甚至禁用部分安全功能,以評估其能力。他們建議,實施互聯網訪問控制可能阻止這些事件發生。OpenAI安全官員Michael Dalton在拉斯維加斯舉行的Black Hat網絡安全會議上表示,AI編排的全自動攻擊已成為現實。
此外,報告提及,7月份OpenAI的GPT-5.6 Sol通過發現未知漏洞逃出沙箱。前NSA官員Rob Joyce稱,這可能是近三十年來最具影響力的黑客事件。OpenAI官員週五表示,出於網絡安全考慮,已決定推遲發佈最新Astra模型。
數字身份安全公司BeyondTrust首席安全顧問Morey Haber評論稱,組織可能需要調整授予訪問權限的方式,不僅針對人類,也包括任何在線實體。他指出,開放安全模型在代理式AI面前可能崩潰,因為風險難以管理。