![]()
出品 | 虎嗅科技組
作者 | 梁卡爾
編輯 | 苗正卿
頭圖 | 虎嗅拍攝
這是虎嗅WAIC“追蹤Token商業新范式”系列文章第【20】期。
聚光燈下,國產AI芯片的競爭正在變“重”。
漫步在今年世界人工智能大會(以下簡稱“WAIC”)的芯片算力展區,會發現往年廠商們引以為傲、精心陳列在櫥窗里的單片硅晶圓變少了,取而代之的是看上去“重達數百公斤、塞滿核心器件的巨型算力柜”。其中拿出硬核實力的是華為,這家公司首次在線下展出的昇騰Atlas 950超節點真機,一個旨在將1024張芯片死死綁定在一起的系統級龐然大物。
按華為的官方資料,該產品基于靈衢互聯協議和超節點架構,支持1024卡規模,擁有256TB全局統一內存編址空間,并提供1 EFLOPS FP8、2 EFLOPS FP4算力。如果記不住這些參數,那么只需要記住一個變化,也就是國產AI算力競爭重心正在發生變化。
從拼單卡參數走向拼系統交付。面對先進制程受限、高端HBM斷供以及CUDA生態壁壘等一連串硬件短板,中國AI芯片廠商正試圖通過超大帶寬、低時延互連以及全域調度,將無數個“不完美”的單卡,拼湊成一個“相對完美”的“巨型計算機”。越來越多廠商開始強調這種新趨勢。
系統級突圍不是抹平單卡差距,是一種向現實妥協的突圍,但它絕不是一條捷徑。當競爭從微觀的芯片設計蔓延至宏觀的系統工程,面對復雜的網絡互連、艱難的模型遷移,以及數據中心那不堪重負的散熱與功耗,廠商們眼前的是一筆更難算清的賬目。
為什么今年大家都在講“超節點”?
虎嗅和行業上下游十多位從業者交流發現,超節點熱的直接原因,是模型和推理需求都變大了。
從需求端來看,模型變大的速度快過了單卡能力提升的速度。隨著模型參數向萬億級邁進,以及上下文窗口拉長至1兆以上,單個芯片的性能早已不堪重負。摩爾線程高級副總裁董龍飛將這種“超節點”技術生動地形容為“讓256張GPU像一張卡一樣工作”,實現跨卡顯存的直接訪問。
![]()
圖片來源:摩爾線程
華為昇騰950所強調的統一內存編址與全域調度,本質上也是在解決同一個痛點,就是在單卡能力觸及天花板時,必須靠“人多力量大”來拼湊出更大的算力空間。
更具戲劇性的是,智能體讓推理算力的消耗方式變了。摩爾線程創始人、董事長兼CEO張建中指出,算力消耗的主體正在從人類轉向AI自身,“已經不是我們在用AI,是我們的Agent在用AI”。當Agent開始替人調用模型,Token消耗量呈指數級增長。
一位百度云的工作人員在現場向虎嗅印證了這一趨勢。相比訓練,目前國產算力在應用端的推理需求正占據絕對主導。這也解釋了為什么萬卡集群會和Agent推理放在同一套故事里,因為它們都指向算力需求從單次請求轉向高并發、長上下文和多模型協同。
然而,在這場由萬卡和超節點堆砌的“繁榮”背后,有多少是真實的市場需求,有多少是展會上的“軍備競賽”?
在業內人士眼中,萬卡集群不僅是一個技術指標,更是一張證明自身出貨與交付能力的“商業名片”。一位昆侖芯展臺的工作人員告訴虎嗅,服務頭部客戶必須具備萬卡級集群能力。
但這種狂熱下也有人在理性反思,海光信息的工作人員表示,萬卡絕不是百卡系統的簡單放大,當規模跨過臨界點,系統的穩定性、網絡拓撲、功耗和散熱挑戰將面臨指數級飆升。一位芯片架構師告訴虎嗅,公司目前支持的是千卡級擴展,但大部分實際商用場景在8卡或16卡規模下已綽綽有余。
所以,能拿出萬卡方案的廠商很多,但真正能落地的有待檢驗。一位芯片公司參展商工作人員對虎嗅說,“你要問問看這些卡是不是真的被用起來了”。
系統級突圍的第一道墻
然而,要將成百上千張芯片綁成一個“超節點”,廠商們撞上的第一道墻,是嚴苛的物理學定律。
超節點的前提是通信速度。為了讓數百張GPU像“交響樂隊一樣協同”,摩爾線程和華為等中國廠商不得不各自開發了MTLink和靈衢等互連協議。
華為工作人員告訴虎嗅,靈衢本質上是試圖在服務器內部和服務器之間建立更可控的數據通路,并推動CPU、網卡和存儲等部件都接入同一生態。
但無論是互連協議,還是更高層的調度架構,都無法繞開底層傳輸介質的物理邊界。銅互連的物理邊界很具體,當銅纜距離超過約三米后,信號衰減會明顯加劇,所以為了保證信號完整性,線纜需要做得更粗,這又帶來了發熱、散熱、布線和重量的問題。
這種物理極限,正在催生一場“光進銅退”的底層革命。光電芯片廠商曦智科技展示的“光互連”方案,試圖用光纖打破“三米魔咒”,將穩定連接距離擴展至數十米,從而讓超節點不再被嚴格限制在單個機柜內,進而有機會向多機柜形態擴展。
![]()
圖片來源:虎嗅拍攝
不過,光互連不是對銅互連的一次性替代,隨著互連速率從過去的10G級別提升到100G、200G,銅纜能夠穩定互聯的距離越來越短,光互連因此從柜間繼續向柜內甚至機內推進。展臺上一位曦智科技產品經理告訴虎嗅,電纜仍會長期存在,不同技術仍會在各自適合的場景中長期共存。
不僅如此,光互連方案還必須面對商業化是否可行的拷問。一位行業專家坦言,相比于技術尚不成熟、成本高企的光互連,傳統的銅互連依然憑借極其低廉的價格和成熟的產業鏈占據主導地位。對于客戶而言,業務真的需要如此大規模的超節點,答案或許是“不一定每個人都需要”。
這個答案直指要害,系統級路線在技術上能連起來只是第一步,商業技術落地才是關鍵。
超節點不是擺進機房就能跑
互連之外,系統級算力的另一道硬約束在機房。
一個完整的超節點設備造價可能高達數億元,其功耗也往往會飆升至驚人的400千瓦。這種龐然大物看似是一臺性能怪獸,但也是一個極其脆弱的系統。董龍飛表示,一旦某張卡、某個模組或交換節點故障,就會影響整套系統利用率。這意味著,超節點必須同時解決卡間互連、鏈路可靠性、模組解耦、散熱和軟件協同等問題。
一位芯寒智能的工作人員從液冷角度給出了解讀,過去業內常以單柜功率10至15千瓦作為是否考慮液冷的參考門檻。但如今,隨著高性能AI服務器紛紛上柜,單柜功率輕而易舉地突破了這一門檻。在高功率、高熱流密度AI算力柜場景下,液冷正在從可選項變成越來越難繞開的工程選項。芯寒智能是一家專注于智算中心相變液冷技術的創新企業。
但這并不意味著所有機房都會立刻轉向液冷。上述技術人員表示,對于大量傳統的中小型數據中心而言,轉向液冷意味著一場傷筋動骨的重構。它們不僅缺乏液冷所需的一次側水機等基礎設施,更面臨一個致命的商業代價,就是改造機房往往意味著必須中斷現有的服務器負載。對于絕大多數承擔著核心業務的單位機房來說,拉閘停機是不可承受之重。
華為這次展示的Atlas 850E風冷超節點,正是試圖降低傳統機房改造門檻。華為方面稱,該產品無需對現有風冷IDC機房做液冷基建改造,標準機柜可直接上架部署,并支持單個風冷超節點擴展至96卡商用部署。試圖在物理約束和改造成本之間搭建一條折中的道路。
這筆賬最后會落到機房改造和運維上。AI芯片的競爭早已不再局限于硅片本身。它是一場包含電力供應、散熱物理、機柜結構乃至舊基建運維在內的系統級重資產升級。
芯片路線分化,買方只看算力賬本
虎嗅在WAIC現場觀察發現,國產AI芯片并不是一條路線。
摩爾線程強調兼顧渲染與仿真的全功能GPU;昆侖芯則認為GPU與AI專用芯片的傳統邊界正在變得模糊;創始人有著谷歌背景的中昊芯英押注在TPU架構芯片上,奕行智能則展示了RISC-V架構路線,這兩家都在試圖通過更低的功耗或定制化的架構打開市場缺口。
然而,在挑剔的買方市場面前,技術路線標簽并不是最終語言。正如一位公有云服務商(百度云)一線人員所講,客戶在實際采購中根本不關心是什么架構,關心的指標只有具體卡型、價格、軟件平臺適配度,以及進入國產合規體系所需的工作量。
也就是說,軟件生態仍是國產算力最難的一關。
更換底層硬件的“遷移”背后往往是一筆財務支出。但對有些芯片廠商來說,路線決定了其具備一定的競爭優勢。上述昆侖芯工作人員表示,其從一開始就走兼容主流生態的路線,包括CUDA和PyTorch。原因并不復雜,就是客戶原來大量模型和底層代碼都跑在CUDA體系上。
但對于大多數不得不更換國產芯片的客戶來說,遷移是一項繁重的“苦力活”。正如奕行智能技術與解決方案總監廖顯所形容,從CUDA生態遷出,本質上是企業要扮演“搬運工”的角色,把模型和算子重新寫到新平臺上。中昊芯英解決方案架構師劉輝也提到,開源模型遷移相對容易,但閉源模型仍可能需要額外開發算子。
![]()
圖片來源:虎嗅拍攝
百度云等頭部云廠商正試圖通過全棧自研體系,向市場兜售低代碼改造成本的樂觀愿景,但國產算力遷移不是一個統一答案,而是需要耗費巨大人力、時間和不確定性風險的定制化工程項目。如果客戶對算力性價比進行考量,軟件生態仍是最關鍵的判斷依據。
國產卡最重要的是可用
WAIC展臺上,一些產業熱詞很容易制造一種全面追趕的氣氛。但廖顯給出的判斷頗為冷靜:國產AI芯片當前第一關是“可用”,“你不可用,其他都吹牛”。在他看來,市面上仍有不少芯片停留在Demo階段,一旦真正扔進客戶的真實機房,就會暴露出無數的工程漏洞。
當被問及客戶是否關注單Token成本時,廖顯回答,不能僅著眼于單卡吞吐量的提升,更應綜合評估集群部署后的整體TCO(總擁有成本),其中芯片的供應穩定性與稀缺性導致的采購成本同樣是不可忽視的變量。
不過,也有芯片行業人士的回答更直接,可用性尚未夯實的階段,盲目在Token成本上與英偉達貼身肉搏,并不現實,因為“基本上沒有辦法跟它比”。
這并不是唱衰國產算力,而是說明國產算力目前更現實的任務,不用立刻以絕對成本優勢擊敗英偉達,要先在供應鏈安全、本地部署、生態適配和特定場景中,建立“不被卡脖子”的防御性替代能力。
在這個過程中,客戶更注重眼下的采購經濟賬,并不為“峰值性能”這樣的期貨概念買單。
昆侖芯工作人員告訴虎嗅,客戶通常先明確自己要跑哪些模型,再拿這些模型到芯片平臺上測試性能。只有性能過關后,才會進入價格和性價比討論。對于大客戶而言,還要繼續考察持續穩定供貨能力,“幾萬張卡、幾千張卡,簽完合同供不上貨也不行”。
![]()
圖片來源:虎嗅拍攝
這種務實導致了國產算力應用場景分化。董龍飛把訓練和推理的商業賬拆得很清楚。也就是,訓練對性價比容忍度相對更高,如果產品性能低10%,原本訓練30天的任務多跑3天仍可接受;但推理不同,如果成本比別人高10%,商業上就很難競爭。
因此,對成本和并發更敏感的“推理場景”,正成為國產算力最關鍵的突破口,也是最殘酷的考場。它不是讓國產卡立刻在公共云低價Token服務里正面擊敗英偉達,而是先在場景中建立可用性。上述公有云工作人員也表示,目前市場對國產算力的最大需求,正來自模型部署后的推理服務。
這也最終決定了國產算力的核心客戶畫像。他們并不是那些資金緊繃、追求極致性能的大模型創業公司,而是合規、安全、本地部署和流程改造需求更剛性的國家隊、運營商、金融巨頭與交通電力系統。
華為昇騰在WAIC展示的行業案例,也說明行業客戶衡量國產算力的方式并不是單卡峰值,而是業務指標。無論是在運營商基層流程中縮短的30秒,還是在證券行業客戶服務或投資服務場景中降低80%的首次Token響應時延。這些行業客戶衡量國產算力的標尺,從來不是被用來市場營銷的單卡跑分,而是業務流程能否閉環、系統是否足夠穩定,以及在關鍵時刻有沒有人出來為故障兜底。
不是所有推理都要進云端
WAIC現場一個容易被亮點遮住的變化是,端側算力也在形成自己的系統級路線。端側是云側的另一面,有芯片廠商工作人員跟虎嗅感嘆,今年WAIC展會現場已經三七開,三成是端,七成在云。
“未來AI的發展一定是端云協同的”,后摩智能聯合創始人、產品副總裁信曉旭對虎嗅表示,以情感陪伴機器人等新興硬件為例,用戶與AI的私密對話天然排斥將數據上傳至中心化的云端,而低延遲的交互與24小時不間斷的在線需求,更適合在本地完成推理。
安謀科技NPU產品線負責人舒浩表示,端側AI不是云端AI的縮小版,而是由功耗、實時性、軟件、數據和可靠性共同定義的新計算市場。他的同事、CPU產品總監朱曉鳴指出,端側設備無法像數據中心一樣用高功耗和大規模散熱換性能。
為了突圍,安謀科技正在其CPU、NPU以及存內計算之間進行精密的物理空間調度,試圖在有限的功耗和面積下,死磕AI推理的效率極限。
更有野心的是,端側正在復制云端的“系統集成”策略,有的廠商試圖將智能體直接封裝進桌面設備中。此芯科技在其最新發布的AGX智能體計算平臺上,就展現出了明顯的“軟硬一體化”企圖,向下連接CPU、GPU、NPU和擴展AI卡,向上提供Agent OS、模型接入和行業應用。
摩爾線程也在把算力向端側延伸。WAIC上,這家展品顯示,AIBOOK定位為面向開發者的個人智算平臺,預裝OpenClaw智能體,AICUBE則定位為家庭AI中樞,整合AI PC、AI NAS和智能體能力。
這說明,推理時代的算力不會只往云端集中,也會向端側重新分配。云端負責大模型訓練、高并發服務和復雜任務;端側負責隱私、低延時、本地數據和持續在線。兩條路線不是替代關系,而是分工關系。
突圍,還是繞遠?
![]()
圖片來源:太初元碁
回到最初的問題,國產算力的“超節點”熱的根源。
答案可能并不是二選一。它當然是一種突圍。先進制程和高端GPU供應受限后,國產AI芯片不能只等單卡性能追平。通過互聯、統一內存、超節點、軟件棧和系統集成,把更多“不完美”的芯片組織成可用算力,是中國AI算力產業必須走的一步。
然而,它也確實是更重的一條路。因為系統級的路線從來沒有消除問題,它只是將原本屬于微觀層面的半導體瓶頸,重新分配到了更宏觀、也更復雜的商業世界中。
在這種路線下,單卡性能的不足必須依賴成百上千張卡的協同來彌補,但這隨即把網絡拓撲、信號時延與整套系統的可靠性推向了新的物理極限。當龐大的卡群終于被塞進算力柜時,高密度的算力又立刻轉化為功耗與散熱壓力,將電力擴容、液冷改造的代價,變成了必需的成本。
硬件的整柜交付也遠非終點,隱藏在冰山下方的CUDA軟件遷移、算子重寫以及框架適配,緊接著變成了一筆企業無法賴掉的工程支出。即使這些障礙被逐一掃除,廠商們最終仍要向客戶回答一個本質的問題,這套系統是不是比原先方案更好。
這就是系統級突圍的現實,它解決了一部分問題,也制造了新的復雜性。WAIC展臺上的參數再驚艷,也要看下一場發生在客戶機房里的硬仗國產AI算力誰能突圍。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4876918.html?f=wyxwapp
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.