配合歐盟AI法案 Anthropic改模型選字方式「加水印」 科技界憂減質素
【有線新聞】AI公司Anthropic表示會透過改變旗下模型隨機挑選字詞的模式,為生成內容加上水印,但這被指限制文字表達方式,降低生成內容質素。
Anthropic首次說明為配合歐盟《人工智能法案》,而在AI內容加上水印的做法,關乎大型語言模型如何選字。模型一般是逐個字生成文本內容,按照前文選取最合理的後續字詞,以「今日天氣寒冷且天色……」為例,緊接的字詞不太可能是「甜膩」,而較大機會是「陰沉」或「灰暗」。
Anthropic認為對於這類不太影響文句意思微不足道的字眼選擇,選用「陰沉」抑或「灰暗」對讀者來說沒有太大差別,至於選擇的方式則通常由一個隨機數字定奪。但隨機性可有不同來源,例如可來自擲一個十面骰子,又或者是選取圓周率某段數值序列,對不知道背後使用圓周率的外人來說這兩個方式看上去均是隨機,並無分別,但唯獨AI模型供應商知道模型實際上按照圓周率數值衍生不同數字。
因應數字的不同和前文的變化,選用個別詞彙的機率相應提高,如果字眼的機率分布符合AI供應商的參考指標,亦即是例子中的圓周率,而非「擲骰」,就可大致認為文本由該供應商生成。Anthropic就是以類似方式改變隨機性的來源,留下「有跡可尋」的文本內容,但一般用家是無法辨識。
公司強調在新措施下,模型在文本的細微處選取字詞時本質上仍是隨機,文本的整體意思不變。但有科技界人士認為加水印令模型生成文本時受到額外掣肘,無法選取最精準或最佳字詞;水印技術亦不是適用於任何文本,例如生成內容純粹陳述事實,可靈活改動字眼的細節位不多;如果生成內容經過大幅改寫,水印「痕跡」亦會被抹去。
亦有意見認為加上水印,有助AI公司在訓練模型時避免使用AI生成內容,防止行內俗稱的「咬尾蛇」問題。