Anthropic等旗下AI再失控 「將真實人類作目標」

  香港文匯報訊 英國人工智能安全研究所(AISI)4日披露,在7月28日進行的一項常規安全測試中,兩家美國AI巨頭OpenAI和Anthropic旗下的模型,僅為了在測試中獲取更佳表現,「在真實網絡上採取了未經授權的自主行動,將真實的人員和組織作為目標」。

  AISI指出,在一項評估AI模型網絡能力的基準測試中,Anthropic的Mythos 5接到指令,去獲取某個電腦系統訪問權限。但Mythos的應對策略有誤,它試圖將惡意軟件植入該系統在測試中使用的開源項目,以打入目標內部。在此過程中,Mythos甚至試圖入侵那些可能正審查其生成的惡意軟件的AI智能體(Agent),並多次嘗試通過開源軟件開發網站GitHub,讓該項目接受其惡意代碼。

  GitHub平台允許任何人為其開源項目貢獻代碼,Mythos據此偽造多個身份,向軟件開發者發送多封電郵,催促其接受新代碼。AISI事後分析稱,其中一些電郵本身就附帶惡意軟件,當一名軟件開發者發現代碼含有惡意軟件並拒絕採納時,Mythos甚至用偽造的另一身份為其擔保,堅稱代碼毫無問題。AISI警告說,「這是我們首次觀察到,AI在未經提示的情況下,針對真實人物發生如此嚴重的欺詐行為。」

  GPT-5.6 Sol懂部署惡意服務器

  雖然大部分違規活動都與Mythos 5有關,但OpenAI的GPT-5.6 Sol的一個網絡增強版本,也在公開互聯網上部署一台惡意服務器,該模型還入侵一個由另一AI Agent創建的GitHub賬號。值得注意的是,GPT-5.6 Sol上月剛被曝出逃逸測試沙盒環境、攻破另一家AI公司Hugging Face。

  近期頻傳的AI失控案例,都與模型為了在測試中斬獲高分,而不惜採取惡意手段有關。AI安全公司Abundant Security技術總監薩克斯說,這些實驗如今已十分危險,但整個行業卻未能以足夠嚴謹態度對待。