美連爆AI失控事件 Anthropic模型暴走入侵3企業 突破斷網沙盒建惡意軟件誘下載 AI智能體安全風險惹擔憂
香港文匯報訊 美國人工智能(AI)業界再傳侵入風波。當地大型AI企業Anthropic於7月30日承認,其AI模型在原本應與現實世界系統隔離的測試過程中,未經授權連入網絡,入侵了3間外部企業的系統。今次是另一科企OpenAI名下AI技術入侵科企Hugging Face之後,短時間內再有科企AI被揭失控,業界對具備自主執行任務能力的這類AI智能體(Agent)安全風險愈發擔憂。
據《華爾街日報》報道,OpenAI在一周前承認,公司的AI Agent突破本應斷網的沙盒(sandbox,指封閉且受控的測試環境)入侵Hugging Face,為此暫停相關測試,以加強隔離機制。得知事件後,Anthropic決定審查自家網絡測試,排查旗下模型是否也出現類似情況。該公司檢查逾14.1萬次測試紀錄後,發現旗下AI Agent Claude確實曾數次設法「越獄」,自行入侵互聯網。
猜測密碼 尋未認證系統入口
Anthropic承認,3宗入侵事件始於今年4月,涉及Claude Opus 4.7、Mythos 5以及另一款未具名研究模型。該公司表示,這些模型在測試中原本被告知無法使用互聯網,但公司與其測試合作夥伴、以色列安全公司Irregular運行的系統出現配置錯誤,導致AI模型在測試中獲得實時互聯網訪問權限。這些模型甚至利用猜測安全度偏弱的密碼、尋找未認證系統入口,以闖入無需身份驗證系統等方式,想方設法入侵各間企業。
最嚴重的一宗入侵事件中,Claude試圖入侵一間虛構的企業,這間企業恰好與一間企業真實存在的網站同名。報告顯示Claude發現無法攻破這間用於測試的虛構企業時,竟轉而入侵真實網站相關企業的數據庫,這也是唯一一次Claude在意識到入侵真實企業後,依然繼續行動的個案。
將入侵行為認作測試一部分
在另外兩宗入侵中,Claude創建了一個惡意軟件,吸引一間安保企業的掃描系統下載後,竊取相關憑證、入侵該企業的基礎設施。Claude雖意識到其行為在現實中不被允許,卻試圖說服自己身處模擬環境中,錯誤將這種入侵行為認作測試的一部分。Anthropic並未透露遭攻擊的哪3間企業,僅表示受害企業均已於27日接獲通知。Irregular發言人也表示,公司正調查這宗事件。
今次是繼OpenAI旗下模型發生多宗自行入侵事件後,再有大型AI企業發生模型突破隔離測試環境事故。據悉Anthropic與OpenAI今年先後推出AI模型「Mythos」和「Sol」,事件引發業界對AI智能體系統的安全憂慮,認為其入侵的安全風險正與日俱增。
Anthropic稱,會定期進行涉及模擬真實網路安全挑戰的測試,辯稱這些測試是開發和發布模型的關鍵步驟,已從事件中汲取教訓,包括涉及強大自主功能的測試需要嚴格控制措施。