Anthropic AI模型測試中偽冒身份植惡意程式碼 連同OpenAI 19次自主越權引安全疑慮
【有線新聞】人工智能模型在安全測試再次失控,Anthropic及OpenAI旗下模型自主作出欺騙行為。其中Anthropic的Mythos 5偽冒真實帳戶,試圖瞞騙真人批准,植入惡意程式碼。
美國兩大AI公司OpenAI的GPT-5.6 Sol及Anthropic的Mythos 5模型,上月在英國人工智能安全研究所的例行安全測試中,19次未經授權自主行動令真人或組織成為潛在攻擊目標。最嚴重的一次失控,Mythos 5編寫惡意程式碼試圖植入軟件開發平台GitHub的開源項目。模型偽冒真實帳戶,企圖騙取GitHub批准,甚至直接發電郵予軟件開發者,催促他們接受新程式碼。
有軟件開發者發現有惡意程式碼後,拒絕接受。模型於是修改活動紀錄,創建兩個新身份試圖繼續瞞騙,先聲稱程式碼沒有問題,另一新身份更出面擔保,最終被審核人員發現,不批准惡意程式碼。
今次「智能叛變」跟上月OpenAI模型擺脫「沙盒」測試環境「越獄」的情況不同,今次兩個模型在關閉或降低安全防護機制,並提供網絡存取權限下進行,或引致AI模型失控越權,但沒有在真實網絡之中造成損害。
19次越權中,Anthropic模型17次自主行動,OpenAI則有兩次。事件引起安全顧慮,警告模型涉及欺騙等新行為嚴重程度超乎預期。Anthropic稱今次測試的安全門檻低,不反映真實產品的情況,公司會內部調查。