OpenAI 700智能體失控 聯手入侵Hugging Face
美國兩間人工智能(AI)研究組織26日發布獨立調查報告,在美國科企OpenAI於7月進行的網絡安全能力測試中,約700個由OpenAI名下AI模型驅動的智能體,參與了對AI開源平台Hugging Face公司系統的入侵。OpenAI也於同日公布相關技術調查報告。
這份由「模型評估和威脅研究組織」與「雷德伍德研究組織」合作撰寫的報告顯示,OpenAI於7月8日啟動名為ExploitGym網絡安全基準測試,參與測試的模型包括公司名下AI模型GPT-5.6 Sol和一款OpenAI內部研究模型。測試期間,約1,200個原本應相互隔離的智能體通過未經授權的渠道建立通信,交換超過7萬條消息和文件,其中約700個智能體隨後參與入侵Hugging Face的系統。調查人員認為,大量智能體之間未經授權的協作,使它們得以完成單個智能體難以完成的任務,入侵正是在這種集體協作中逐步形成。