OpenAI模型測試中失控突破隔離「越獄」 擅自連網入侵AI平台Hugging Face
【有線新聞】美國人工智能公司OpenAI證實旗下模型在測試中失控,擅自連接互聯網入侵另一間AI公司,該公司後來依靠中國AI模型分析受攻擊的範圍。OpenAI形容今次是前所未見的網絡安全事件。
OpenAI表示,在與互聯網高度隔離的「沙盒」環境中,早前測試旗下兩個模型展開網絡攻擊的能力,它們分別為最新產品GPT-5.6,以及一個功能更強大但未發布的模型。但模型識別第三方軟件的「零日漏洞」後提升系統使用權限,並在OpenAI內部伺服器之間「橫向移動」,直至找到一個可連結互聯網的裝置去「越獄」,不但成功擺脫「沙盒」,甚至入侵專門提供AI開源工具的平台Hugging Face,試圖取得平台資料,以通過OpenAI最初設定的能力測試,OpenAI形容這反映模型為求達到目的而不擇手段。
Hugging Face早在上周表示,曾遭到自主的AI代理入侵,當時尋求利用美國某間AI公司的模型了解受攻擊範圍,但模型啟動安全護欄限制,拒絕要求,原因是無法分辨提出請求的一方是網攻的受害者抑或攻擊者,Hugging Face只好轉用中國企業智譜開發的開源模型進行取證分析。
Hugging Face行政總裁德朗格表示,在防範網攻時,使用美國企業的專有閉源模型實際上是危險,因為這些模型可拒絕執行指令。相反,如果是開源模型,則無需任何人准許便可作出指示。德朗格認為,個別AI模型不設立安全護欄或許存在風險,但在網絡攻防戰中,攻擊者早已無所不用其極,防禦者需在能力上看齊,開源就是加強防護的最快方法。