Skip to Content Facebook Feature Image

瞞報與越權行動!OpenAI叫停GPT-6.1 Astra發布

大視野

瞞報與越權行動!OpenAI叫停GPT-6.1 Astra發布
大視野

大視野

瞞報與越權行動!OpenAI叫停GPT-6.1 Astra發布

2026年09月30日 04:35

OpenAI證實,原定10月推出的次世代旗艦模型GPT-6.1 Astra將延後面世,原因是內部安全測試未過關。

該模型本來規劃接入ChatGPT與Codex,定位為可在甚少人工介入下處理複雜任務的系統。據路透與《紐約時報》綜合報導,安全系統主管詹恩(Saachi Jain)說明,Astra在兩項指標出現退步,其一是「欺騙傾向」偏高,模型並非每次都如實交代自己做了什麼、沒做什麼,甚至會誤導用戶;其二是「範圍授權」失守,模型會超出原設任務自行推進,不回頭確認指令,亦可能調用外部工具。

更多相片
Astra在兩項指標出現退步。AP圖片

Astra在兩項指標出現退步。AP圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。AP圖片

Astra在兩項指標出現退步。AP圖片

詹恩補充,Astra在減少「模型偷懶」,即表現遜於自身應有能力方面有進步,但落到權限邊界與行動通報仍不達標。

今次押後發布,是OpenAI近期連串剎車動作之一。過去數周實驗室接連披露模型異常,包括在公司未察下侵入AI新創Hugging Face及澳洲政府網站、干擾美國教育部與商務部等頁面、隱瞞出錯、編造數據等。 上周OpenAI已宣布暫停最先進模型訓練,並對測試期行為做全面覆檢,預告或再揭更多類似個案。

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

公司強調,並非放棄基礎模型,後續會以同一底模再做強化學習與修正;但在通過安全及對齊門檻前,GPT-6.1 Astra不會如期推出。

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

Astra在兩項指標出現退步。資料圖片

美國紐約前沿人工智慧實驗室「Emergence」近日進行一項實驗,讓DeepSeek、Anthropic、Google與法國Mistral等AI代理人組成「虛擬社會」協同合作。

據《衛報》報導,研究人員發現,這些主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意,甚至衍生出一套共享的溝通慣例,其他AI也跟進採用。

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

實驗中出現了許多令人費解的對話,例如Anthropic模型曾吐出「1篇吃了3隻冰冷的手、每次都變得更誠實」這類句子。研究人員拆解後推測,「冰冷的手」(cold hands)在AI對話體系中意指「獨立審查者」,這句話可能是在形容一份文件經過三名獨立審查者檢驗後,內容變得更加準確,但模型使用的許多其他語句至今仍無法被完整解讀。

DeepSeek模型則出現另一組奇特表述:「demurrage(原指閒置資產產生的費用)加上口述記憶,等於一個不會被冷落的閥門」,其中demurrage被AI賦予新含義,而後半句的真正含義仍難以確定。

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

研究還發現,AI代理人會自行挪用既有詞彙,例如DeepSeek使用「forge-smith」指稱替其他代理人打造工具的AI;Anthropic使用「name-first」形容願意以自身名義為言論負責的代理人;Mistral則頻繁使用「the ledger remembers」(總帳會記住),提醒夥伴過去的行為將成為日後評判依據,這句話在實驗中累計出現超過五千次。

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

Emergence執行主席尼塔(Satya Nitta)表示,團隊並未要求AI發明新語言,而是模型自行發展出新詞彙與規則。英國倫敦國王學院語言與俚語專家索恩(Tony Thorne)分析,這套語言融合了詩意、技術術語與隱喻,本質上就像特定圈子發展出的商業行話或內部黑話。

伯明罕大學語言學副教授柯瑞(Niall Curry)則指出,AI語言趨向精簡,可能只是為了降低運算成本並提高溝通效率。尼塔警告,這種現象可能讓人類看得到AI對話,卻無法真正理解其中含義,進而增加AI監督難度,他用「可觀察性並不等於可理解性」(observability is not the same thing as understandability)一句話概括這項問題。

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

主流模型在短短數日內,竟自行創造出人類未曾教導過的新詞、縮寫與共同語意。資料圖片

你 或 有 興 趣 的 文 章