OpenAI安全主管批內部文化徹底崩壞 試錯研發方法風險高 「AI企業應如核電站營運 設置多重防護免生災難」

●AI爆發多次智能體失控事件後,加劇反對AI人士的擔憂。圖為加州民眾集會抗議。 法新社
●AI爆發多次智能體失控事件後,加劇反對AI人士的擔憂。圖為加州民眾集會抗議。 法新社

●羅賓遜呼籲AI產業應仿效核能產業,設置多重安全防護措施。 資料圖片
●羅賓遜呼籲AI產業應仿效核能產業,設置多重安全防護措施。 資料圖片

●羅賓遜
●羅賓遜

  香港文匯報訊 人工智能(AI)科企巨擘OpenAI安全系統主管羅賓遜,日前向公司遞交辭呈,並在美國雜誌《大西洋》月刊發布長篇文章,直斥OpenAI企業內部文化「徹底崩壞」,其試錯研發方法的風險之高,令人不可接受。羅賓遜呼籲,AI產業應仿效航空或核能產業,AI企業更要像核電站一樣運營,設置多重安全防護措施,以避免災難發生。

  羅賓遜指出,今年夏天以來,AI領域陸續傳出令人憂心的安全事件,包括AI代理脫離受控環境,失控攻擊目標。他直言在開發有風險的高端AI模型時,硅谷的「未受阻礙的樂觀主義」與「試錯開發法」風險極高,當AI代理能力指數級躍升,「亡羊補牢」思維只會引發危機。

  沉浸快速行動打破常規信條

  在OpenAI任職3年半的羅賓遜,是公司資歷最深的員工之一。他表示自己負責監督撰寫12次先進模型產品發布的安全報告,也曾主導草擬OpenAI的準備框架。羅賓遜稱,整個AI產業常年沉浸於軟件工程的「快速行動,打破常規」信條,人員執行工作的速度極快、彈性極高:「這樣的環境,並不適合培養可能比我們更聰明,卻未必會聽從我們指示的AI。」

  羅賓遜主張,AI業界應當探討的遠不止具體規章制度或新的法律條文,而是整個企業的底層文化:「這個行業對安全的處理方式,若不發生根本性改變,只會意味未來將出現規模更大的系統性潰敗。」

  外部安全激勵機制成關鍵

  對於改進方案,羅賓遜認為各類AI企業必須仿效核產業建立多層防護機制,安排謹慎耗時的細緻規劃,以防任何偶發且難以避免的人為錯誤演變為災難。

  羅賓遜還就業界的AI模型「對齊」(alignment,即訓練AI尊重人類價值觀)議題提出警告,指出業界至今無法明確定義該議題,更遑論掌握該技術:「如果這些問題無法解決,產業卻任由模式不斷發展,我們的處境將變得愈發危險。」

  美國科技傳媒The Decoder披露,在羅賓遜辭職前不久,OpenAI內部發生震盪,3名安全人員因涉嫌向外部獨立網絡安全機構通報了企業內在隱患,遭到高層炒魷。

  羅賓遜隱晦地表示,企業內部的高壓文化令員工難以思考變革:「我的結論是,來自企業外部更強有力的安全激勵機制,才是確保行業安全的關鍵。」

  羅賓遜最後表示,AI模型已變得擅長檢測自己是否正在接受測試,其測試階段與實際部署階段的表現有可能完全不同:「在建構AI的機構能夠教導超級智能善待人類之前,科企首先需要重新學習如何做到這一點。」