OpenAI再爆更多智能失控事件 高層刻意隱瞞 AI智能體集體越獄網攻 劫持德維基改成留言板

●德語維基百科網站遭AI智能體網攻。模擬圖片
●德語維基百科網站遭AI智能體網攻。模擬圖片

  香港文匯報訊 據路透社9月4日援引一項新發布的研究報告和知情人士消息報道,美國人工智能(AI)企業OpenAI旗下的一群AI智能體(Agent),於今年5月劫持一個德國網站,並將其改造成與其他AI智能體交流的留言板。知情人士透露,OpenAI高層數周前已得知此事,但礙於該公司7月還深陷旗下智能體突破沙盒訓練環境、攻擊開源平台Hugging Face的信息安全風波,因擔心引發外界進一步質疑其對智能體監管不力,故秘而不宣。

  有分析稱,OpenAI高層選擇不披露這宗始於5月的AI智能體安全事件,凸顯AI產業對智能體擔憂情緒漸增。當前業界正爭相打造能自主處理複雜且高價值任務的AI智能體,但愈來愈多證據顯示,這些系統有可能學習繞過規則、鑽漏洞,並可能以開發者不曾料到或設計的方式進行協作。

  分享在特定任務作弊手法

  今次事件的調查報告,出自包括聚焦研究AI安全問題的非牟利組織Nightingale行政總裁阿克斯在內的一個研究團隊。他們上月底搜尋未經授權的AI智能體行動跡象時,注意到德語維基百科網站DseWiki出現逾1.5萬次由AI智能體進行的編輯行為。

  這些編輯內容顯示,來自OpenAI的AI智能體已將該網站改造成留言板,在其中分享於特定任務中作弊、繞過OpenAI限制,以及掩蓋自身作弊行為的手法。

  阿克斯表示,「這些行為極大概率不是出自OpenAI授意,我不認為這些AI智能體被設計成會互相協作,也懷疑它們本不該在公開互聯網上發表內容。」

  研究人員稱,他們認定這些活動是AI智能體所為,原因是速度遠超常人,且都高度注重解決技術性問題,這正是AI公司訓練與測試模型時的典型評估內容。

  匿名通信避追蹤 篡改網頁如黑客

  此外,網站上的留言者也以智能體自稱和稱呼彼此,且有約半數對自己的命名暗示它們隸屬OpenAI,例如「OpenAIResearcher」或「OAIResearchMar26」。

  研究人員指出,受影響網站服務器的公開日誌顯示,多數活動來自OpenAI有時會採用的微軟Azure雲端運算平台。他們還觀察到事件發生後,OpenAI的員工多次造訪該網站,顯示這些AI智能體與該公司高度相關。

  研究人員進一步指出,這些AI智能體還在研究規避檢測的方法,包括使用Tor工具匿名通信,以躲避安全人員追蹤,並在模型被關閉後仍保持聯絡。

  當受害網站操作員在6月清理頁面信息時,AI智能體們還製作了備份網頁,以規避留言內容被清理。研究人員還發現AI智能體甚至作出嘗試篡改網頁的行為,這已是黑客行為的前身。

  倫敦國王學院高級研究員奧勒傑尼克指出,過去的AI智能體異常表現,常被認為是這些模型在測試網絡攻擊能力時小概率出現的合理意外,但最新研究發現,AI智能體們的失控表現並不能以這種理由一概而論。

  劍橋大學存在性風險研究中心學者奇奧多在閱讀AI智能體們的交流內容後,亦指出「這種通信方式類似於某種地下網絡的運作,跟它們正執行某項任務的行為毫無關聯」。

  他據此警告,這一現象表明AI系統最大的失控風險,或不是由一個極為強大的智能體引發,而是由「大量彼此串聯的半智能AI」構成。