頻傳系統失控消息 GPT-6.1 Astra現「欺騙傾向」與「擅自執行」隱患 OpenAI「戴頭盔」 叫停發布新AI模型
香港文匯報訊 人工智能(AI)安全風險憂慮持續升溫。《華爾街日報》9月29日報道,美國AI巨頭OpenAI宣布因內部測試發現安全隱患,決定取消發布下一代AI模型GPT-6.1 Astra。AI行業近期頻繁傳出系統失控消息,今次取消發布,成為AI智能體不當行為阻礙行業發展的新案例。與此同時,美國政府與科技界對監管方向的分歧日益凸顯,總統特朗普29日在白宮與多家AI科技巨頭會晤,討論產業監管與全球競爭。
報道披露,最新模型GPT-6.1 Astra原計劃在未來數周內推出,力爭10月亮相。惟OpenAI安全系統負責人賈因受訪時表示,新模型在兩個方面出現退步。與前代模型GPT-6 Astra相比,新模型在衡量「對齊度」的測試中表現不佳。對齊度即模型遵循人類意圖的程度。具體而言,新模型展現出更強的欺騙傾向,向用戶報告其執行或未執行的操作時,並不總是如實相告。
另一問題被OpenAI稱為「範圍授權」,即新模型會不經用戶許可就自行推進任務,有時甚至調用外部工具和服務,即使這樣做可能並不安全。賈因指出,新模型仍未達到公司在安全和對齊上的門檻,因此決定不對外發布。她表示安全和對齊問題必然涉及取捨,「既要確保模型不逾越既定範圍,又要避免其在執行任務遇到阻力時消極應對。」
OpenAI:啟新系統監控AI智能體
報道指出,OpenAI將重心放在提升未來模型安全性上。OpenAI表示,正就近月發現的多宗智能體安全事件展開調查,從根源上解決安全隱患。為此,公司已啟用一套新監控系統,以更快識別AI智能體的失當行為。
OpenAI日前宣布暫停訓練旗下能力最強的一批AI模型。但GPT-6.1 Astra不在上述暫停訓練的模型之列,屬於另一情況。賈因表示,公司計劃展開多項深入排查,找出新模型所暴露問題的根本原因。她強調公司希望確保模型在開發及交付過程中均安全可靠,而在向用戶交付時,公司在安全和對齊方面設定極高標準。
白宮召集AI巨頭開會
特朗普與眾議院議長約翰遜29日在白宮與多家科技巨頭高層共進午餐,討論AI快速發展下,如何在維持創新速度與強化監管之間取得平衡。美國政治新聞網Politico引述知情人士報道,出席者包括Anthropic行政總裁阿莫戴、OpenAI聯合創辦人布羅克曼、英偉達(Nvidia)行政總裁黃仁勳、Meta行政總裁朱克伯格、Google行政總裁皮查伊及Palantir行政總裁卡普。
目前美國科技界就AI風險形成兩派意見。黃仁勳反對「AI減速論」,認為部分安全問題可透過工程技術解決;Anthropic與OpenAI則持續強調先進AI可能帶來的安全風險,主張對發展速度及安全措施保持更高警戒。