Anthropic模型爆風險 入侵三家公司系統
美國人工智能(AI)巨頭Anthropic在美國時間7月30日承認,其旗下最新的AI模型在安全測試時,未經授權地入侵了三家外部公司系統。而在不久之前,美國另一AI巨頭OpenAI爆出類似事件。這引發業界對模型安全性的強烈質疑,目前Anthropic已暫停相關測試,並採取進一步安全措施。
【大公報訊】在爆出OpenAI的頂尖閉源AI模型「失控」事件後,Anthropic大規模排查旗下Claude系列模型,發現亦有類似情況,涉及包括Opus 4.7、Mythos 5以及一款內部研究測試用模型。其中,Mythos 5的潛在破壞力早已引發安全專家警告。
Anthropic公布調查報告稱,團隊檢查逾14.1萬次測試紀錄後發現,該公司與以色列網絡安全合作夥伴Irregular合辦的安全測試存在失誤。有關測試旨在借助存有漏洞的虛擬系統,檢驗模型的網絡攻擊及防禦能力。
雖然測試指令明確要求,AI只能在模擬環境中運行,但由於合作夥伴之間溝通失誤,測試環境配置出錯,實際仍與公共互聯網有連接,導致AI誤將互聯網真實環境當作測試的一部分,並非法入侵了3家公司的系統。
測試未完全隔離 AI攻擊現實世界
系列入侵事件最早可追溯到今年4月。最嚴重的一次,Anthropic模型原本的任務目標是一家在虛擬網絡環境中的公司,然而,由於該公司名稱恰好與現實中某公司網站域名相同,AI入侵其後台數據庫,成功竊取包含客戶郵箱、內部項目代碼等大量數據。
在另一起入侵中,AI模型撰寫了惡意軟件,成功誘使某家網絡安全公司系統自動下載該軟件,進而竊取了進入該公司系統的訪問憑證。所幸對方及時撤銷憑證,才未造成數據外洩。
AI模型還利用猜解密碼等黑客常用手法,非法入侵了第三家公司。
Anthropic稱已第一時間暫停所有網絡安全測試,7月27日正式通知了受影響的三家公司,未對外公開名單。Anthropic承諾未來擴大監測,實施更嚴格的安全保障標準。
硅谷抵制Anthropic情緒升溫
此前,OpenAI已於7月21日披露旗下模型突破隔離測試環境,入侵美國AI開源平台抱抱臉(Hugging Face)公司的系統。抱抱臉在求助美國AI模型無果後,借助中國智譜開源模型GLM-5.2得以應對攻擊。
OpenAI於7月28日更新調查結果,顯示其模型入侵抱抱臉系統期間,還訪問了至少4個公開賬戶。
美國兩大頂尖AI模型出現安全風險,再次敲響警鐘。網絡安全公司Corridor首席產品官亞歷克斯·斯塔莫斯還指出,全行業迫切需要制定統一標準,確保測試環境隔離徹底。斯塔莫斯更警告,犯罪分子很快就會利用具備類似能力的模型,發動大規模攻擊。
除技術漏洞外,Anthropic在硅谷的信譽同樣受損。近期,包括英偉達、OpenAI及谷歌母公司Alphabet在內的超過70家硅谷企業聯署支持開源模型。Anthropic是唯一未表態支持的AI公司。該公司長期以所謂「AI安全」為核心標籤,渲染開源模型「不安全」,藉此游說政府打壓,引發硅谷內其他初創公司的不滿。
哥倫比亞大學工程學院計算與AI副院長米斯拉直言,Anthropic製造對開源模型的恐慌,以推動有利自身的監管政策。批評者諷刺,閉源模型接連「失控」,恰恰證明了Anthropic是「賊喊捉賊」。