無晶圓半導體公司Panmnesia與全球超大規模數據中心營運商Meta,共同提出下一代人工智能數據中心架構,令整個數據中心能像單一晶片般運作。這項研究以特邀評論形式,刊登於自然出版集團旗下期刊《自然評論:電機工程》(NREE)。
人工智能運算單位正由單一晶片轉向整個數據中心。
Meta與Panmnesia在《自然評論:電機工程》中介紹的CXL單晶片式數據中心架構,展示將整個數據中心視為單一晶片運作的理念。 AP圖片
隨着人工智能模型發展至數萬億參數規模,單次訓練步驟可能涉及數百至數千個加速器,交換數TB數據。由於整體進度取決於最慢的參與者,增加加速器雖可提升運算能力,但亦令系統容易因瓶頸延遲而導致頻繁延誤及故障。當一個組件反應遲緩,其餘組件便會停下等候,而延遲範圍愈廣,便愈難預測工作何時完成。
收窄延遲範圍,從而建立更大、更穩定的運算單位,是業界的共同挑戰。在機架內部,裝置已透過專用高速連結緊密耦合。下一個挑戰在於機架以外的連接,即機架之間的連接。現時,該部分主要依賴以太網或InfiniBand等通用網絡,每個請求必須經過網絡介面及基於軟件的協調層,兩者均會擴大傳輸過程中的延遲範圍。這次研究旨在為這種跨機架連接帶來更高可預測性。
他們的基礎是開放行業標準CXL(運算快速連結)。CXL由半導體及基礎設施公司共同開發,因此可在整個行業採用,而不會受限於單一供應商的生態系統。Panmnesia與Meta提出的架構利用CXL,盡量減少機架以外的延遲變動。目標是令數據中心能像單一晶片般,具備可預測性。
CXL架構的核心:三個硬件元素及分層部署
建議的架構將中央處理器、加速器及記憶體置於單一CXL域內,將快取一致性維持範圍由機架內部擴展至整個數據中心。三個硬件元素,包括高扇出無阻塞交換器、連結加速單元(LAU)及結構控制器,可限制延遲變動。資源本身的佈局,亦採用與晶片內部區塊放置相同的原則。為克服電氣訊號的物理傳輸距離限制,該評論亦闡述光學連結(CXL光學傳輸)如何擴展CXL結構的傳輸範圍。
為評估該架構的效果,該評論以傳統機架規模配置,即一個中央處理器連接兩個加速器,作為參考點。相較於該基準,單一中央處理器協調的加速器數量增加八倍,由兩個增至16個。作為單一單元運作的一致性域,則可擴展至多達960個加速器,約為參考平台的13倍。過往需離開機架經網絡傳輸的存取,現時可循固定路徑進行,來回延遲由微秒級降至數百納秒,低一個數量級。故障後替換單位亦由整部伺服器縮小至單一裝置。將此規模的裝置耦合為一個運算環境,將可不間斷地訓練規模更大的單一人工智能模型,或在共享基礎設施上同時運行多項服務,而不會互相阻礙。
《自然評論:電機工程》的評論文章僅限受邀發表:該期刊會識別特定領域的少數領先研究人員或機構,並委託他們撰寫。自然出版集團選擇Panmnesia作為CXL數據中心架構文章的作者,反映其技術獲認可為該領域的代表。Panmnesia是全球首家主導《自然評論:電機工程》評論文章的半導體初創企業,而該文章亦是該期刊首篇探討CXL技術及人工智能數據中心架構的評論。
Panmnesia行政總裁鄭明洙表示,隨着人工智能系統持續擴展,快速高效地連接大量加速器及記憶體裝置的能力,正變得與個別加速器的性能同樣重要。這次研究為下一代人工智能基礎設施勾勒出方向,CXL將令整個數據中心能作為單一運算系統運作。
Panmnesia已將該架構的核心組件實現在晶片上,並完成驗證,現正準備將其投入商業供應。
(美聯社)