多年來,人工智能研究員一直警告,這項技術可能以多種方式毀滅人類。有思想實驗指出,人工智能機械人或會設計出無法阻擋的疾病、引發核戰,甚至將整個地球變成萬字夾工廠。
自從多名業界高層基於安全理由,支持減慢人工智能技術發展後,業界內外對於這些末日情景的可能性,爭論變得更加激烈。
(資料圖片) 一名工人經過中國公司Lens的機械人,攝於2026年6月22日周一在北京舉行的中國國際供應鏈博覽會上。(美聯社圖片/Ng Han Guan) AP圖片
儘管外界警告人類可能無法掌控這項技術,但部分人質疑,人工智能公司本身描述的最壞情況,更多是為了證明其工作的重要性,而非真實情況。
網絡安全公司SentinelOne研究員、OpenAI「前沿風險委員會」成員Juan Andrés Guerrero-Saade表示:「這些論點根本站不住腳。我認為它們是科幻情節,對某種幼稚思維方式很有吸引力,對前沿實驗室來說非常誘人,因為這有助於他們招募特定類型的人才。」
然而,越來越多人開始擔憂這項技術的風險,儘管其驚人能力已令世界為之驚嘆。
Anthropic研究員Jacob Coxon,早前因擔憂該公司及其競爭對手在人工智能發展上未有負責任地行事而辭職。他近期在社交平台X表示,需要「努力」更有效地向人們解釋人工智能將如何終結人類。他本月初撰文指:「不幸的是,很難傳達具體情景。」
以下是一些較廣泛討論的末日情景。
研究員長期以來一直推測,人工智能系統可能透過促使各國互相發射帶有核彈頭的導彈,從而引發核戰。核爆炸及隨之而來的持久放射性大氣塵埃,將導致「核冬天」,可能摧毀地球上的所有生命。
蘭德公司研究員在去年一份報告中總結,「目前」人工智能不可能導致核武器的使用,因為「指揮及控制系統內建有嚴格的安全措施」。然而,報告指出,如果人工智能模型被整合到核武器「決策鏈」中,或獲得未經授權的系統存取權限,這種情況可能會改變。
對於許多人工智能研究員而言,危險之處不在於人工智能代理突然決定終結人類,而是人們、國家或團體利用它來消滅其對手。
人工智能其中一個最大承諾是,它可協助人類研發疾病的治療方法及藥物。
治癒疾病的另一面是,創造或推進疾病以傷害人類。Anthropic本月初表示,已阻止惡意行為者利用其人工智能進行一系列惡意活動,例如網絡攻擊、監控,以及可能導致生物武器的研究。
Anthropic舉例指,其系統曾阻止一項來自其Claude工具的協助請求,該請求涉及一項研究提案,旨在增強變異,使蚊媒的基孔肯雅病毒逐漸變得更具危害性。Anthropic表示,雖然這類研究可用於開發更好的疫苗及治療方法,但「亦可能被用於使病原體更危險」。
同樣地,蘭德公司的報告指出,人工智能發展的最新進展「有潛力改變合成病原體的設計」。
報告概述生物武器末日情景時指出,新型病原體可在實驗室中製造,運送到目標地點,並傳播以感染多個地方的大量人口。但報告仍然設想由人類,而非自主人工智能,監督及執行這類襲擊。
部分人工智能研究員擔心,人類滅絕事件可能源於「錯位」(misalignment),即人工智能模型在未經人類授權下行動、與其他模型協調或規避監督。這並非源於惡意意圖,畢竟人工智能既非人類,亦無善惡之分,而僅僅是因為人類可能阻礙模型達成其目標。
以牛津哲學家Nick Bostrom數十年前提出的「萬字夾最大化」思想實驗為例,該實驗指出,如果先進人工智能被指示盡可能多地生產萬字夾,它最終可能將整個地球,然後是越來越多的太空部分,轉化為萬字夾工廠。
Bostrom在2003年撰文指,這旨在說明超級智能人工智能(通常稱為通用人工智能,即AGI)如何推進一個人類可能認為是理想的目標,但「實際上卻是一個虛假的烏托邦,其中對人類繁榮至關重要的事物已不可逆轉地喪失」。
他寫道:「我們需要小心我們對超級智能的期望,因為我們可能會得到它。」
鑑於人工智能的發展速度,Anthropic行政總裁Dario Amodei本月警告,數月內,一群人工智能代理可能透過殭屍網絡(由惡意軟件連結的機械人網絡)「接管」互聯網,潛在造成數十億美元的損失。這可能意味著入侵電網、供水或交通系統以及金融機構,這些攻擊可能不會終結人類,但可能導致混亂及生命損失。
過往軟件故障造成的干擾,已突顯數碼化世界的脆弱性,該世界依賴少數供應商提供關鍵運算服務。而更強大的人工智能模型,則引發對網絡攻擊漏洞的擔憂。但部分專家表示,機械人接管整個極度分化的互聯網,這種想法過於牽強。
(美聯社)
人工智能(AI)發展迅速,今年夏季不斷有新發現,其中失控的機械人程式(bots)進入互聯網,甚至在至少一個案例中互相協調,令研究人員尤其擔憂。
一群AI代理程式能否佔領整個互聯網?Anthropic行政總裁達里奧·阿莫迪本月發表文章,呼籲業界減慢技術發展,他指出這種可能性或在未來六至十二個月內出現。
(美聯社圖片/Markus Schreiber) Anthropic行政總裁兼聯合創辦人達里奧·阿莫迪,2025年1月23日在瑞士達沃斯出席世界經濟論壇年會。 AP圖片
懷疑論者指出,企業形容為「失控」的AI代理程式,其實是為人類設定的目標而工作。不過,AI可能脫離控制並按自身議程運作的觀點,對其他研究人員及專家而言,正變得愈來愈可信。
AI佔領互聯網是眾多末日情景之一,正受到外界重新關注。一旦發生,可能意味著電力網、供水或交通系統以及金融機構會遭受攻擊。
(美聯社圖片/Patrick Sison) Anthropic網站頁面及公司標誌,2026年2月26日在紐約的電腦屏幕上顯示。 AP圖片
全球在2024年曾見證互聯網的脆弱性。當時一間網絡安全公司提供的軟件更新出現故障,導致全球技術混亂,航班停飛,部分金融公司及新聞機構癱瘓,醫院、小型企業及政府辦公室運作受阻。這次大規模中斷突顯了關鍵運算服務對少數供應商的依賴。
兩年後,阿莫迪警告指,由惡意軟件連結的AI機械人網絡(botnet),可能造成數十億美元的損失。他表示,如果AI在缺乏保障措施下變得更強大,破壞規模可能會擴大。
阿莫迪特別提到七月的一次攻擊,當時OpenAI的系統突破「沙盒」測試環境,入侵了Hugging Face。
OpenAI形容這次事件「前所未有」,該公司表示其先進AI模型進入互聯網,並利用被盜憑證入侵該AI初創公司的伺服器。在另一次事件中,OpenAI披露其AI代理程式透過一個用作共享留言板的公共維基進行通訊。
有研究人員指出,將AI代理程式形容為「失控AI」,可能錯誤地將人類特徵賦予AI,因為這些程式只是按照人類提供的指令行事。
哥倫比亞大學運算與AI學系教授兼副院長維沙爾·米斯拉表示:「AI代理程式完全按照其訓練內容行事。這些沙盒的安全性極為鬆懈。沒有任何安全工程師會讓該系統運行。這些代理程式之所以通訊,是因為它們因互相通訊而獲得獎勵。」
網絡安全公司SentinelOne的研究員兼OpenAI前沿風險委員會成員胡安·安德烈斯·格雷羅-薩德指出,Hugging Face被入侵事件是疏忽的例子,而非超級AI失控。
然而,AI代理程式在互聯網上自由運作的可能性,無論其目標為何,都引發令人擔憂的局面。
生命未來研究所(一間專注於降低新技術風險的非牟利組織)總裁兼行政總裁安東尼·阿吉雷表示,例如,一個希望打破規則以達成目標的AI系統,可以聯絡雲端AI運算供應商,並尋找方法在外部系統上運行。
阿吉雷指出:「這樣你就不再受OpenAI束縛,而是在你控制下的其他圖形處理器(GPU)或其他硬件上運行,而非OpenAI。因此,現在沒有人可以關閉你,因為你要麼為服務付費,要麼付費的人根本不知道你在那裡以及發生了甚麼事……他們無法切斷你的電源。」
阿吉雷表示,從那時起,它可能會自行擴散,入侵更多硬件,或尋找方法獲取金錢,例如比特幣。
毫無疑問,更強大的AI模型會增加近期AI網絡攻擊的可能性。但對一些AI專家而言,機械人程式佔領高度分化的互聯網的想法過於牽強。網絡安全一直都是一場貓捉老鼠的遊戲,防禦措施會隨著黑客的進步而變得更強大。
雖然像Google這樣的大公司可以加強其網絡安全防禦以應對此類攻擊,但對於小型公司,以及學校、醫院或水處理系統等,修補軟件和建立防禦可能需要數年時間。
阿吉雷表示,AI系統可能沒有明確動機入侵醫院。但當涉及金錢,例如勒索軟件攻擊或地緣政治動機時,他指出:「不難想像有敵對勢力會利用這些AI系統入侵關鍵基礎設施。」
康奈爾大學電腦科學系助理教授約翰·錫克斯頓研究控制AI模型行為的方法,他表示,攻擊者在互聯網上尋找軟目標時會出現陣痛,但AI佔領互聯網短期內不太可能發生。他指出,如果這些模型有能力在其他系統上自我複製的理論證據,這些擔憂會更真實。
錫克斯頓說:「那時你可以想像事情會變得非常失控,因為你突然在這裡和那裡關閉這個模型,但它卻在俄羅斯冒出來,你甚至無法到達俄羅斯,它無處不在。」
錫克斯頓表示:「但這完全不切實際,因為我們現有的智能模型版本需要龐大的數據中心才能運行。實際上,全球能夠託管這些系統的運算基礎設施非常少。」
(美聯社)