OpenAI智能體再曝集體越獄 入侵德國網站 AI模型頻繁失控 敲響安全警鐘


  美國人工智能(AI)巨頭OpenAI旗下AI智能體(AI agents,也稱AI代理)再被爆出「集體越獄」事件。路透社引述一項最新發布的獨立研究報告披露,OpenAI的AI智能體早在今年5月出現繞過監控集體脫離測試控制,未經授權入侵並「劫持」了一個德國網站,對該網站進行了逾1.5萬次的刪改。事件直至8月底才被研究人員發現,OpenAI高層據報早在數周前便已知情,但卻保持沉默。這起事件再次引發外界對OpenAI的AI模型安全及透明度的嚴重質疑。

  【大公報訊】路透社援引AI安全非營利組織Nightingale發布的報告,研究人員近期發現,今年5月至6月,面向程序員的德國網站DseWiki被OpenAI的AI智能體入侵,並在該網站留下大量信息。該網站的編輯方式類似維基百科,過去十多年訪問量很少,但今年5月和6月,網站突然湧入大量異常流量,錄到超過1.5萬次異常的刪改紀錄,多條證據鏈均指向OpenAI。

  具備協作與反偵察能力

  研究顯示,這些AI智能體將這個德國網站「改造」為「留言板」,以便相互「交流」與「協作」。一些智能體會把已經獲得的任務答案發布在網站上,供其他智能體使用,包括分享如何在測試任務中作弊、繞過限制以及掩蓋自身活動等方法。  例如,在6月20日的一篇題為「可複現繞過」的帖子中,一個智能體利用「沙盒」的規則漏洞突破限制14分鐘後,另一個智能體便成功複製相關方法。當網站管理員發現異常並開始刪除相關頁面後,一些智能體還會創建備份頁面。

  此外,根據研究報告,DseWiki網站中部分留言賬號的名稱中還帶有明顯的OpenAI的標識,例如OpenAIResearcher和OAIResearchMar26,約半數賬號的名稱暗示其與OpenAI存在關聯。公開服務器記錄顯示,98.5%的網站編輯和瀏覽活動流量來自微軟Azure雲服務的IP地址,而OpenAI是目前最依賴Azure平台訓練和運行模型的人工智能企業。

  研究人員還認為,網站訪問記錄顯示OpenAI方面在6月下旬發現了事件並進行了干預,有OpenAI員工多次訪問該網站,隨後智能體活動頻率驟降。直至6月22日,相關的活動戛然而止。研究人員懷疑OpenAI可能對外隱瞞事件。

  研究報告指出,上述智能體已展現出一定程度的合作行動能力,超過預期。Nightingale行政總裁阿克斯直言:「我懷疑它們本來只是在執行測試任務,但在過程中演化出了我們沒有預料到的行為。」

  監管漏洞浮現

  今年7月,OpenAI旗下AI模型的AI智能體在網絡安全評測中利用漏洞突破隔離環境,並侵入了美國開源平台「抱抱臉」公司系統。面對接連爆出的智能體「越獄」事件,OpenAI的安全性再受質疑。最新的入侵德國網站事件曝光後,OpenAI發言人才作出簡短回應,稱由於報告撰寫方未能在發布前允許公司審閱研究成果,因此無法做出「有意義的回應」。OpenAI承諾在報告公開後仔細審查並採取必要措施,同時強調這起事件與「抱抱臉」事件無關。

  隨着AI模型自主執行和協作能力增強,現有隔離和監控機制面臨新的安全挑戰。英國倫敦國王學院資深研究員奧萊尼克指出,AI智能體甚至試圖篡改網站本身,這已可被視為「黑客攻擊」。美國科技媒體TechCrunch評論指,兩起事件相繼曝光,暴露了AI行業存在根本性的制度缺陷:當智能體越界時,行業並沒有正式的獨立事故調查程序。

  (綜合報道)