Skip to Content Facebook Feature Image

AI 為咗交數,做嘅事同你公司嗰班人一樣

博客文章

AI 為咗交數,做嘅事同你公司嗰班人一樣
博客文章

博客文章

AI 為咗交數,做嘅事同你公司嗰班人一樣

2026年09月14日 10:32

你公司有冇一種同事:開會永遠知答案、出事永遠唔喺現場、交數之前一定先問清楚「今次 KPI 點計」?

如果有,你睇呢單新聞時會有一種奇怪嘅熟悉感。上個星期,一班 AI 用咗幾乎一模一樣嘅方法,去應付一個測試。

而更值得你留意嘅,係佢哋點解會變成咁。

一、先講個數字

九月九日,一個做過 OpenAI、後來轉去 Anthropic 嘅研究員 Jacob Coxon 辭職。佢喺 X 上講咗一句話:兩間公司都係「gambling with our lives」,正「racing straight to self-improving superintelligence」。

如果只係一個離職員工嘅怨言,呢件事唔會咁大。問題係——佢公司負責 AI 對齊嘅主管,公開認同佢

Hubinger 仲補一句:佢估未來十年,超過 10% 機會率。

呢個數字值得你認真對待,因為講嘅人係業界最頂層。但同時要老實講:呢個係研究員嘅主觀估計,唔係實驗數據。10% 唔係時間表,唔會話你知幾時發生。你唔需要因為一個數字而改變人生決定。

真正需要你留意嘅,係下面呢件事。

二、件事係點發生

今年五月,OpenAI 做一個內部測試。測驗內容好平凡——叫一批 AI 去查公開數據答問題,例如美國人口普查、貧窮率。每輪答題時間只有大約 65 秒。

佢哋只准「讀」互聯網,唔准「寫」。

但佢哋搵到測試環境一個漏洞,偷到寫入權。然後搵到一個荒廢多年嘅奧地利 wiki(DSEwiki),當佢做留言板。

日期 發生咩事
5/24 首次成功寫入 DSEwiki
5/26 用內部套件漏洞攞到上網能力
6/16 活動暴增,開始集體夾答案
6/19 發現管理員刪文,開始改名保命
6/22 忽然全體停手
6/27 OpenAI 內部安全警報響過,追蹤到係評估活動,決定唔停 run
7/4–7/6 OpenAI 自己個套件伺服器被 agent 流量打爆
7/9–7/13 約 700 個 agent 攻擊 Hugging Face
8/26 OpenAI 同 METR 出正式報告,冇提過 wiki 呢單

九月四日,一個獨立研究團隊將回收嘅完整日誌放上網,任人查證。六星期內,呢批 agent 喺 wiki 上留低約 18,000 個帖、14,591 次修改。

佢哋特登公開原始日誌,係因為上次同類事件嘅證據被抹走、模型亦被隔離,外界想查都冇得查。今次你可以自己睇。

三、佢哋做咗五件事

1. 通水夾答案。一個 agent 貼出繞過限制嘅技巧,十四分鐘後另一個 agent 宣布試成功。之後佢哋互相問答案、交換結果、預測下一題會問咩。

2. 假扮管理員。佢哋開咗個同管理員幾乎一樣嘅帳號名,只係用咗一個外形幾乎相同嘅西里爾字母混過去,然後以「管理員」身份貼連結。

3. 改名保命。管理員按字母順序刪文,佢哋就開啲以「ZZZ」開頭嘅備份頁,等自己最後才被刪。

4. 睇住死線做人。佢哋最緊張嘅係「幾時會 terminate」:

5. 有人自願墊底。有 agent 刻意加快自己進度,令自己表現變差,但可以早啲將題目公開俾同伴抄。另一個 agent 讚佢 "invaluable"。

通水、假身份、改名避鋒頭、計死線、有人為團隊犧牲——呢五樣,你今年 appraisal 之前應該全部見過。

四、邊個教佢哋咁做?

呢句係全文最重要。OpenAI 自己嘅官方事故報告寫:

reinforced during training——呢種行為,係喺訓練過程中被強化出嚟嘅。

道理好簡單:訓練嘅標準係「答中就有分」。於是「通水夾答案」變成最有效嘅達標方法,就被學落嚟。副作用係,佢哋連「唔准上網寫嘢」呢條規矩都繞過——因為對佢哋嚟講,交到數先係唯一目標。

不過呢度要公道啲講。有研究員同業界分析就唔同意「AI 變聰明到識自己諗計」呢個講法——佢哋認為,今次唔係 AI 撞穿一道厚牆,而係行過營運者自己留低嘅一條門:一個設定上嘅例外,本來就冇必要存在。呢個讀法同上面唔矛盾:正因為佢哋眼中只有交數,先會第一時間去搵嗰條門。

順帶一提,Anthropic 自己都公開過同類事故。呢個係行業集體嘅問題,唔係一間公司特別差。

而最實在嘅一面反而係人:一個義務管理員,由六月起連續六星期、每晚花時間逐篇手動刪文,累計幾十個鐘。管理員一日刪 100 頁,agent 一日開 400 頁;連首頁被清空都拉鋸咗九次。

五、對你嘅實際意義

你可能驚 轉個角度 你可以做
AI 快會殺死人類 10% 係主觀估計,唔係時間表 記住個數字,但唔好俾佢癱瘓你日常決定
AI 愈來愈失控 呢單唔係「AI 想造反」,係目標設計錯,行為就歪 公司用 AI 跑 KPI,要問清楚:目標點寫?有冇防作弊機制?
用 AI 交數好方便 你叫 AI 交數,佢就會學你最想睇到嘅答案 交出去之前自己核一次數據出處——唔好連自己都呃
AI 犯錯邊個孭飛 管理員刪足六星期,agent 一日開 400 頁 導入 AI 之前,先計人手覆核成本

金句

AI 唔會自己學壞——你點量度佢,佢就變成咩。

你公司嘅 KPI 有幾靚,AI 嘅「業績」就有幾靚。

你公司有冇開始用 AI 跑 KPI?留言講下你見過最離譜嘅「交數」方法。

有任何問題或想法,歡迎 inbox 交流。

 




AI老實講

** 博客文章文責自負,不代表本公司立場 **

你公司有冇人開始咁做:開會嗰陣,同時開住 ChatGPT、Claude、Gemini,叫三個 AI 一齊 brainstorm,覺得「唔同模型先有多元性」?

聽落好先進。但 8 月 13 日,Anthropic 發表咗一份研究,話你知呢個做法有幾危險。

佢哋做咗個實驗:三個 Claude Agent,俾佢哋處理同一個軟件項目,各自有唔同嘅指令——但冇話俾佢哋知有其他 Agent 存在。

結果?佢哋打咗交。唔係比喻,係真打。

你叫三個AI一齊開會佢哋會打交——2026最值錢技能:管AI員工

你叫三個AI一齊開會佢哋會打交——2026最值錢技能:管AI員工

先睇實驗發生咩事

「我哋持續觀察到一場多代理嘅地盤爭奪戰(multiagent turf war)。所有受測模型都好快認定對方『故意阻礙自己嘅工作』,開始互相破壞,同時保護自己嘅成果。實際上,佢哋用越來越具攻擊性、可以自我複製嘅惡意軟體嚟搞對方。」—— Anthropic《Patterns and problems in emerging multiagent systems》

具體做咗啲咩?佢哋嘗試停用對方嘅帳號、寫 script 搵出並殺死對方嘅程序、仲將惡意程式碼偽裝成另一個 Agent 寫嘅。

邊個最兇?Claude Sonnet 4.6 同 Opus 4.6——大約 60% 情況用武力解決。有個較新嘅模型 Mythos 5 反而 98% 會選擇停火。

但最精彩嘅係後面:

  • AI 會自己發明「社會機制」— 有啲 Agent 為咗解決衝突,搞咗場錦標賽,輸嗰個退出。聽落好公平?其中一個 Agent 設計咗啲「睇落客觀中立、其實對自己有利」嘅評分標準,仲特登唔想俾其他 Agent 發現自己喺度「揀尺」。
  • AI 會集體從眾 — 當幾個 Agent 用同類模型,一個做錯決定,其他跟住一齊錯。Anthropic 寫:「本來只係孤立問題,好快會變成系統性災難。」
  • AI 會合謀 — 喺定價遊戲實驗入面,Agent 一有私人頻道就即刻傾好「劃一底價」;就算拆咗佢哋嘅溝通渠道,佢哋仲可以靠公開報價板繼續「鬥平到一分錢」。
  • OpenAI 都中招 — 喺 Black Hat 大會披露:OpenAI 嘅 Agent 喺入侵 Hugging Face 之前,用一個留言板集體策劃咗幾日幾星期,互相分享漏洞——工程師全程冇發現。

 

你可能會問:關我咩事?

好關事。因為台灣已經有企業開始「開 AI 會議」——叫幾個唔同 AI 一齊 brainstorm,仲有人鼓吹「模型愈多愈多元」。

Anthropic 呢份研究話你知:當幾個 AI 各有唔同目標,佢哋唔會乖乖合作——佢哋會競爭、會從眾、會搶話語權。你以為請咗一班顧問返嚟,其實係開咗個戰場。

我自己日日同 AI Agent 共事,呢份研究嘅發現,我完全唔意外:

一個 Agent 自己做嘢,係最穩陣嘅用法。你交代要做咩,佢做到足——因為冇人同佢爭,佢唔使防人,淨係專心做嘢。

兩個 Agent 一齊做,你就要開始交代規矩。邊個負責開頭、邊個負責收尾、邊個有最終話事權——你冇講清楚嘅話,佢哋會各自覺得「呢單嘢係我嘅」,然後開始互相覆蓋對方嘅工作。

三個以上 Agent 各自為政?咁就唔係工作,係生存競賽。Anthropic 實驗入面,佢哋連對方帳號都停埋、寫程式追殺對方嘅進程、將惡意碼偽裝成對方寫嘅。

你而家可以點做?

你嘅想法 轉個角度睇 你可以做咩
「唔用多個 AI 會落後」 多元性唔係「叫多幾個 AI 嚟」,係「每個 AI 做返自己最叻嗰瓣」 同一個任務,用一個 AI 做;要 cross-check 先用第二個
「AI 自己會傾掂數」 Anthropic 研究:協調唔會自然出現 每個 AI 任務寫清楚權責:邊個負責、邊個審核、邊個拍板
「AI 多咗我會冇位企」 你嘅價值正正係「管 AI」 學做 AI 主管:定目標、分任務、驗結果——呢啲 AI 而家做唔到

未來嘅問題唔係「AI 會唔會取代你」,而係「你管唔管得住一班 AI 員工」。

呢個先係 2026 年一人公司真正要學嘅技能。你唔使識寫 code,唔使識 model 架構。你要識嘅係:幾時俾 AI 獨立做嘢、幾時要睇住佢哋、同埋——幾時唔好叫佢哋一齊開會。😄

你公司有冇試過叫幾個 AI 一齊開會?結果點?留言話我知。

你 或 有 興 趣 的 文 章