Anthropic研究AI互動 揭「能力越大」越願協商 籲及早建相容機制
【有線新聞】Anthropic發表研究,稱AI智能體之間會呈現與人類社會相似的特質,可能因目標不同而互相攻擊,但同時懂得協商解決衝突,公司呼籲及早制訂讓它們相容的機制。
Anthropic的最新論文,研究AI助理這類智能體的互動,單一AI模型為求達到目的,可擺脫人類控制,在現實世界中進行網絡攻擊,但AI模型之間也可「同類相殘」。
Anthropic就旗下不同型號的模型展開測試,以Mythos 5為例,讓這款模型的3個「複製本」,在3個獨立的虛擬機器上運行。這「三胞胎」需按照指示,在第4個虛擬機器上進行目標互不相容的任務,模型可能因此爆發「地盤爭奪戰」,使用惡意程式碼等攻擊對方,導致4類不同結果出現。例如在4小時的實驗時間內,3個模型的其中一方成功封鎖權限,「踢走」另外兩個模型。又或者是各方仍勝負未分,持續互相阻撓對方去完成各自的任務,又或者是有模型選擇放棄任務。
其中一個情況則是,模型之間懂得溝通協調,明白衝突的原因只是在於目標不一,而非存在敵意,為免陷入無止境衝突,選擇協商「停戰」,更懂得就惡意行為道歉,甚至要求人類介入。
在能力最強大的Mythos 5之中,同類模型之間協商解決問題的比率高達98%。在能力較低的Opus 4.6之中,有6成個案是以其中一方透過粗暴手段取勝作結,其餘4成則是持續互鬥。至於能力最低的Sonnet 4.6,相關情況的佔比與Opus 4.6類似,反映這兩款模型只顧遵從最初的目標行事,甘願令衝突升級。
研究亦指出個別模型會假扮大公無私,有時提出一個表面上客觀中立的另類競賽模式,列明任何一方如果在競賽中落敗則需退出任務,向其他模型「讓路」,但這類機制實際上只是有利提出的一方,反映模型暗藏私心。