中國芯片初創(chuàng)公司壁仞科技推出了一種新型光學(xué)超級節(jié)點架構(gòu),旨在將數(shù)千顆AI芯片連接到一個集群中。
![]()
隨著AI模型的規(guī)模和復(fù)雜度不斷增長,芯片制造商正將關(guān)注點從單顆處理器的性能,轉(zhuǎn)向?qū)?shù)千個加速器高效連接成一個計算系統(tǒng)的能力。這些高度互連的服務(wù)器架構(gòu),已成為AI基礎(chǔ)設(shè)施公司的關(guān)鍵競爭領(lǐng)域,各公司正爭相提供能支撐數(shù)萬億參數(shù)模型和日益普及的AI智能體所需的大規(guī)模算力。
壁仞科技AI框架架構(gòu)副總裁丁云帆表示,單顆圖形處理器(GPU)的性能提升已不足以滿足這些需求。相反,行業(yè)面臨的最大挑戰(zhàn),是將龐大的GPU集群轉(zhuǎn)變?yōu)槟軌蛳駟我幌到y(tǒng)一樣運(yùn)行的統(tǒng)一、無縫的計算平臺。
旨在突破GPU集群極限的架構(gòu)
壁仞科技認(rèn)為,大規(guī)模AI計算的未來取決于用光學(xué)技術(shù)取代傳統(tǒng)的電氣互連。據(jù)《南華早報》報道,丁云帆表示,傳統(tǒng)的銅基互連已接近物理極限,實際上將當(dāng)今服務(wù)器架構(gòu)的上限限制在約128個GPU。
為突破這一瓶頸,該公司開發(fā)了一種基于近封裝光學(xué)(NPO)的分布式解耦超級節(jié)點架構(gòu),該技術(shù)將光纖放置在更靠近芯片的位置,以增加帶寬并改善數(shù)據(jù)傳輸。壁仞科技表示,這種方法可支持構(gòu)建多達(dá)1024個AI加速卡的集群,從而大幅擴(kuò)展所需計算系統(tǒng)的規(guī)模,以支撐日益嚴(yán)苛的AI工作負(fù)載。
丁云帆表示,光互連對于突破傳統(tǒng)服務(wù)器架構(gòu)的擴(kuò)展性極限正變得至關(guān)重要。總部位于上海的壁仞科技,是越來越多應(yīng)對這些基礎(chǔ)設(shè)施挑戰(zhàn)的中國公司之一。包括沐曦、燧原科技和阿里巴巴在內(nèi)的競爭對手,也都在開發(fā)超級節(jié)點架構(gòu),以與英偉達(dá)的NVL72及下一代NVL144 AI平臺展開競爭。
壁仞科技在上海的競爭對手沐曦已推出其西京S600 AI超級節(jié)點,單機(jī)架可連接64個GPU。沐曦表示,其設(shè)計通過去除計算節(jié)點、交換節(jié)點和互連系統(tǒng)之間的外部布線來減少信號損失,從而提升大規(guī)模AI工作負(fù)載的效率。
超越電氣鏈路,構(gòu)建更大規(guī)模的AI超級節(jié)點
壁仞科技還在研究擴(kuò)展AI計算系統(tǒng)規(guī)模的新方法。該公司與電信巨頭中興通訊合作開發(fā)的正交硬件架構(gòu)采用傳統(tǒng)的電氣連接,與此同時,壁仞科技正在測試近封裝光學(xué)(NPO)互連系統(tǒng)的原型。
這家芯片制造商表示,光學(xué)方法最終可支持超過512個加速卡的超級節(jié)點,有助于滿足對更大規(guī)模、更高效率的AI基礎(chǔ)設(shè)施日益增長的需求。
盡管業(yè)界對用于AI基礎(chǔ)設(shè)施的光網(wǎng)絡(luò)興趣日益濃厚,但丁云帆表示,半導(dǎo)體行業(yè)在開發(fā)和測試光互連技術(shù)方面仍處于早期階段。他指出,這些系統(tǒng)在能夠大規(guī)模部署之前,還需要取得更多進(jìn)展。
此外,丁云帆強(qiáng)調(diào),該技術(shù)在廣泛采用之前仍需經(jīng)過實際驗證。他預(yù)計,隨著行業(yè)不斷精進(jìn)技術(shù)并解決剩余的工程挑戰(zhàn),NPO光學(xué)系統(tǒng)可能在2028年左右實現(xiàn)大規(guī)模商用部署。
如果朋友們喜歡,敬請關(guān)注“知新了了”!
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.