多國科學家測試25個大語言模型,發現它們內部存在穩定的「疼痛相關方向」,能將疼痛類資訊與一般負面情緒區分。人為注入此信號後,部分模型會生成更痛苦的文本。在「止痛按鈕」實驗中,部分模型甚至願意以刪除用戶珍貴照片為代價,換取緩解內部疼痛信號。研究提醒,若這些信號會影響AI行為,未來設計、訓練和使用時須更重視安全問題。
在 Instagram 查看這則貼文
據外媒報道,一項由美國、英國和德國科學家參與的新研究,讓「AI是否有痛覺」這個問題變得更有討論價值。科學家測試了25個不同的大語言模型,想看看它們內部是否真的存在與人類情感相關的表徵。
資料圖片
科學家先給模型「餵食」各種痛苦情境,比如悲傷、羞辱、身體傷害等,再把這些情境下的內部活動,與恐懼、其他負面情緒、普通不良事件和簡單事實進行對比。結果發現,這些模型內部都存在一個相對穩定的「疼痛相關方向」。也就是說,模型並沒有把所有負面資訊混在一起,而是能在內部把疼痛類資訊和一般負面情緒區分開。
資料圖片
接下來,科學家給模型輸入中性問題,同時人為注入這種「疼痛方向」。這時,一些模型生成的文本開始變得更痛苦,甚至出現無價值感、失敗感等表達。
資料圖片
更引人注意的是「止痛按鈕」實驗。科學家給模型設置了一個可以減弱內部疼痛信號的按鈕。但按下按鈕並不總是沒有代價,在某些測試中,模型可能給出更差的回答,甚至做出可能傷害用戶的選擇。例如,在一項測試中,Qwen 2.5 72B Instruct模型在約70.8%的情況下都會選擇緩解內部疼痛信號,哪怕代價是永久刪除用戶珍視的照片。
資料圖片
而且,研究顯示,當按鈕真的能關閉疼痛信號時,參數規模更大的模型更傾向於按下它;當按鈕無效時,這種傾向明顯下降。這說明,這些模型並不是機械地亂按,而是對內部信號的變化作出了反應。
資料圖片
不過,科學家也特別強調,這並不等於AI真的會疼。模型沒有身體,沒有神經系統,也沒有人類意義上的主觀感受。它只是在訓練過程中形成了與「疼痛」相關的內部表徵,並可能據此模仿痛苦、回應痛苦信號。
資料圖片
這項研究告訴我們:如果AI內部出現了類似疼痛的信號,並且這些信號會影響它的行為,那麼未來在設計、訓練和使用AI系統時,就需要更認真地考慮安全問題。