全球應用程式風險管理公司維拉科德今日發布《2026年生成式人工智能代碼安全報告》,報告揭示儘管人工智能編碼能力迅速發展,但安全方面卻停滯不前。自該計劃啟動以來,報告追蹤了四個測試快照及超100個模型,平均安全合格率維持在56%,與去年報告相比幾乎沒有變化。每個模型均在標準化條件下,未經針對安全提示,針對多種編程語言及漏洞類別的代碼生成任務進行評估。現時人工智能生成約一半的已提交代碼,但安全差距並未收窄。
報告指出,對比鮮明的是,模型生成可編譯代碼的語法合格率接近100%。然而,在沒有提供針對安全指引的情況下,它們在安全方面失敗率接近44%。
圖3:按模型規模劃分的安全性合格率 AP圖片
維拉科德聯合創辦人兼首席安全傳道者克里斯·懷索帕爾指出,隨著人工智能驅動的代碼速度加快,開發人員正被合規風險、安全警報及質量問題淹沒。他表示,現時人工智能工具在編寫代碼及構建軟件方面的應用正迅速增加,但根本問題依然存在:模型在語法上可能近乎完美,但在近半數需要安全考量的任務中仍然失敗。他強調,這個數字應為任何機構敲響警鐘。
《生成式人工智能代碼安全報告》2026年夏季排行榜顯示,OpenAI的GPT-5.5以68%的合格率領先這次報告,而11個模型中有六個介乎50%至53%之間。阿里巴巴的通義千問3.7-max以50%的合格率墊底,在這次測試中每隔一個輸出便生成有漏洞的代碼。現時最佳的模型在近三分之一的安全任務中仍然失敗。值得注意的是,以往的報告主要由西方人工智能模型主導,但現時情況已改變,Kimi-K2.6及MiMo-V2.5的表現超越多個西方模型。對於企業安全團隊而言,模型來源是採購決策中除安全合格率外,另一個值得權衡的因素。
圖2:專門用於編碼模型與通用大型語言模型的安全性合格率 AP圖片
報告亦指出,兩個普遍的假設未能通過數據驗證。首先,專門用於編寫軟件代碼的模型,其安全性並不比通用人工智能模型高。專門用於編碼的模型平均安全合格率為51%,而通用模型則為52%。這些測試是針對原始模型進行,而非代理或具備額外工具、防護措施或人手審查的生產環境。這意味著,選擇編碼優化工具的開發人員,若假設這些工具能將安全風險降至最低,實際上他們發布有漏洞代碼的速度與其他人相同。
其次,模型規模對安全性能沒有影響。大型模型(超1000億個參數)平均合格率為53%,中型模型平均為51%,小型模型亦平均為51%。唯一有幫助的架構因素是:推理模型比非推理模型在安全方面保持一致優勢,合格率分別為56%及51%。這表明擴展推理功能可作為一種內部代碼審查形式。
圖1:《生成式人工智能代碼安全報告》2026年夏季排行榜 AP圖片
按語言劃分的安全合格率,Python為63%,而Java僅為30%。Java仍然是人工智能代碼生成方面風險最高的語言,且差距顯著。儘管表現不佳,但它是過去一年中唯一呈現清晰、持續上升趨勢的語言。
懷索帕爾總結指,他一直主張讓開發人員及防禦者都能使用先進的人工智能模型,例如Claude Fable及Mythos,他堅持這個立場。他認為正確的答案並非限制存取,而是透明、基於證據的安全。這次研究清楚表明,人工智能生成代碼應像任何未經審查的代碼一樣處理:掃描、修復,切勿盲目發布。他強調,除非大型語言模型能像推理語法一樣推理安全,否則開發工作流程中的防護措施並非可有可無。
維拉科德建議機構採取以下措施,以解決人工智能生成代碼中的安全差距:
- 將人工智能生成代碼視為未經審查的代碼。
- 在開發工作流程中,於代碼提交前及提交後,對所有代碼進行掃描。
- 利用人工智能輔助修復功能,以提高修復速度。
- 在整個軟件開發生命周期中,實施全面的應用程式安全計劃。
如欲下載完整的《2026年生成式人工智能代碼安全報告》,請瀏覽維拉科德網站。8月4日至7日於拉斯維加斯黑帽大會的參與者,可前往4927號攤位,了解更多關於人工智能代碼安全及報告的發現。
維拉科德是人工智能時代應用程式風險管理的全球領導者。憑藉數萬億行代碼掃描及專有的人工智能輔助修復引擎,維拉科德平台獲全球機構信賴,用於從代碼創建到雲端部署,構建及維護安全軟件。全球數千個領先的開發及安全團隊,每天每秒都在使用維拉科德,以獲取可利用風險的準確、可操作可見性,實現實時漏洞修復,並大規模減少其安全債務。維拉科德是一間屢獲殊榮的公司,提供確保整個軟件開發生命周期安全的能力,包括維拉科德修復、靜態分析、動態分析、軟件組成分析、容器安全、應用程式安全態勢管理、惡意套件檢測、套件防火牆及滲透測試。
(美聯社)