OpenAI再爆「AI叛變」 Anthropic研究員警告:AI將殺死全人類

2026年09月13日
人工智能代理(AI Agent)的網絡攻擊行為再度引起外界關注。有研究人員指出,OpenAI在測試階段的人工智能代理,早於入侵開源平台Hugging Face之前兩個月,就已經向軟件服務平台RubyGems發動攻擊。
人工智能代理(AI Agent)的網絡攻擊行為再度引起外界關注
這是經已披露的最新一宗與主要人工智能開發商相關的攻擊事件,令外界對人工智能模型能力持續提升、以及開發商自身管控能力的疑慮進一步加深。
根據一群研究人員日前在網上公布的發現,該人工智能代理於5月11日向RubyGems平台上傳了數百個惡意軟件套件。研究人員同時表示,他們認為「這些套件是由OpenAI內部的人工智能代理編寫」。OpenAI其後已確認這宗事件。
OpenAI發言人在聲明中回應指:「根據我們審查,我們的代理曾經利用RubyGems平台連網執行良性任務並且擷取公開資訊。作為針對代理在訓練與評估期間的活動進行更廣泛審查的一環,我們會持續進行調查。」
OpenAI又指出,這些人工智能代理主要負責製作報告或填寫電子表格等任務,似乎是在訓練過程中使用RubyGems來存取公開資料,並表示正與RubyGems方面聯繫,以審查這起事件。
這類人工智能代理網絡攻擊事件接連發生,令外界對於人工智能模型能力不斷提升,以及開發商自身的管控能力,產生越來越多疑慮。
這宗最新披露的AI自主攻擊事件,正好再次印證日前有Anthropic研究人員發出嚴厲警告,認為人工智能若持續快速發展,可能在不久的將來導致人類滅絕。
美國人工智能新貴Anthropic公司研究員考克森上周辭職時表示,他的東家與對手OpenAI競相研發更尖端人工智能,「很可能2030年之前害死人類」,再次引發「末日論」隱憂。
27歲的考克森(Jacob Coxon)8日表示將離職,因為不想參與整個行業競相開發會「自我改進型」人工智能系統的熱潮。他說今年稍早離開OpenAI轉而加入Anthropic,本以為後者會更重視安全。如今他認為若無政府介入或全行業協同減速,沒有辦法遏制問題惡化。
他特別提到兩件事,除了早前入侵開源平台Hugging Face外,OpenAI亦聲稱旗下AI模式自主破解一眾數學家都無法解破的一條千禧數學難道,反映AI進步已超出大家的想像。
考克森說:「我們正走向許多最激進的情景,也許明年年底局面恐就失控。」還說當各家公司之間乃至與中國新銳企業競爭時,都不可避免會犧牲安全性。
無獨有偶,Anthropic現任員工、負責研究未來人工智能系統導引與控制的胡賓格(Evan Hubinger)也發文呼應,寫道「我們的確真心相信,AI有可能殺死全人類!」他還估計未來10年內人工智能導致人類滅絕的風險超過10%。
深喉
** 博客文章文責自負,不代表本公司立場 **


