聽雨 發(fā)自 凹非寺量子位 | 公眾號 QbitAI
CUDA又雙叒叕被創(chuàng)了…
這回動手的,還是英偉達親手喂大的AI。
一家成立僅一年的小公司,用AI編程Agent,只花10小時,就搭出了一套「類CUDA軟件」。
![]()
停停停。
你是說這套英偉達花了近20年搭起來的軟件帝國,就這么被復(fù)刻了??
![]()
不止如此。DeepSeek也在嘗試少寫一點底層CUDA。
他們已經(jīng)開源了一套名為TileKernels的GPU算子庫,用TileLang來編寫,省去了大量手寫底層CUDA代碼的工作。
不過類似的「CUDA危機」,咱也不是第一次聽了。
每隔一段時間,CUDA都要被拎出來鞭打一番,動輒替代了、擊穿了、護城河又被顛覆了…
真的是這樣么?
10小時「復(fù)刻」CUDA
提起英偉達,很多人的第一反應(yīng)是GPU。
H100、Blackwell、Rubin,靠著一代代性能更強的芯片,英偉達吃下了這一輪AI浪潮的最大紅利。
但英偉達真正難以撼動的優(yōu)勢,其實不是硬件,而是軟件
芯片可以買,參數(shù)可以追,制程也會迭代。真正讓客戶用了英偉達之后很難再換走的,是圍繞GPU建立起來的整套軟件生態(tài)
CUDA,就是這套軟件帝國的核心。
CUDA全稱Compute Unified Device Architecture,由英偉達高管Ian Buck帶隊,花了近20年打造。
![]()
它常被叫作編程語言,但更準(zhǔn)確地說,CUDA是一整套圍繞英偉達GPU建立的軟件平臺
如果簡單拆成三層,最底下是內(nèi)核層,直接讓芯片干活的Kernel、編譯器和運行時。
中間是庫層——cuBLAS、cuDNN等經(jīng)過高度優(yōu)化的計算庫,以及調(diào)試、驗證和性能分析工具。
最上面,則是PyTorch、TensorFlow等開發(fā)框架,企業(yè)積累的海量代碼和工作流,以及圍繞CUDA成長起來的開發(fā)者生態(tài)。
AI生成
![]()
這么說可能有點抽象,但你可以把英偉達GPU想象成一家工廠。
CUDA最底層負(fù)責(zé)告訴機器每一步怎么干,中間層提供現(xiàn)成的生產(chǎn)工具,最上層則是一整套已經(jīng)運轉(zhuǎn)多年的生產(chǎn)體系。
所以,對客戶來說,買到的不只是英偉達的一塊卡,而是一座開箱即用的工廠。
現(xiàn)在,一位名叫Jeremy Nixon的老哥,帶著AI Agent來了。
![]()
Nixon是AI軟件初創(chuàng)公司的創(chuàng)始人,此前也在Google Brain當(dāng)研究員。
他的團隊開發(fā)了一套名為Ignition的AI研究Agent,專門給不同AI芯片編寫底層軟件。
它可以生成GPU Kernel、運行測試、尋找錯誤、測量性能,再根據(jù)結(jié)果自動改寫代碼。
人類工程師負(fù)責(zé)給出高層方向,剩下那些瑣碎又費腦子的工作,就交給Agent反復(fù)循環(huán)。
就這樣,Infinity用Ignition為AI芯片初創(chuàng)公司d-Matrix搭建了一套類CUDA軟件。
只花了10小時
啊??
那些過去需要芯片軟件工程師反復(fù)調(diào)試的底層代碼,現(xiàn)在真能交給AI了?
![]()
還真不能說完全是炒作。
AI Agent確實很適合這種具有明確反饋的編程任務(wù)。
代碼能不能編譯,結(jié)果算得對不對,性能有沒有提高,都可以通過實際運行得到答案。
于是,Agent能夠形成一個完整閉環(huán):
- 寫代碼→編譯→運行→測試正確性和性能→根據(jù)反饋繼續(xù)修改
不過,Infinity主要攻入的是CUDA的第一層:為不同芯片生成和優(yōu)化推理Kernel,并圍繞這些Kernel搭建底層軟件能力。
它正在開發(fā)一套面向多種芯片的通用推理庫,但這不等于它在10小時內(nèi)復(fù)制了CUDA近20年積累的完整生態(tài)。
但是…
但是!
你實際上并不需要復(fù)制一個CUDA,就可以拿下1500萬美元的融資
![]()
這家公司目前的估值也已經(jīng)來到了1億美元
有沒有威脅到英偉達不知道,反正資本是相當(dāng)買賬的。(doge)
推理側(cè),第二戰(zhàn)場啟動!
如果說AI Agent是攻城的武器,那推理市場就是城墻上的缺口。
大模型的計算主要分成兩段:
訓(xùn)練是造模型,需要上萬塊卡協(xié)同跑幾個月;推理是用訓(xùn)好的模型回答問題,小集群甚至單卡就能跑。
在訓(xùn)練側(cè),CUDA目前依然近乎無解。
大規(guī)模訓(xùn)練對性能、穩(wěn)定性和集群協(xié)同極為敏感。芯片之間的通信、顯存的調(diào)度、程序出錯后如何恢復(fù),任何一點效率損失,放大到數(shù)千乃至數(shù)萬塊芯片上,都會變成真實的時間和成本。
因此,企業(yè)選擇訓(xùn)練平臺時往往極其保守。
其他芯片即使紙面參數(shù)不錯,只要軟件不夠成熟、集群不夠穩(wěn)定,省下來的硬件成本,很可能從開發(fā)和試錯成本里加倍償還。
但在推理側(cè),游戲規(guī)則變了
韓國AI芯片公司Rebellions首席商務(wù)官Marshall Choy就認(rèn)為:
- 在推理側(cè),CUDA不再是決定因素。這將是一場開源軟件的競爭。
![]()
為什么競爭者都盯上了推理?
因為訓(xùn)練在乎「極致性能」,而推理在乎的是「每個回答的成本」。
訓(xùn)練需要上萬塊卡協(xié)同,推理可以拆分到小集群甚至單卡;訓(xùn)練不敢換芯片,但推理可以。
反正只要能跑、便宜,客戶就愿意試。
更關(guān)鍵的是,推理軟件可以跨芯片運行。如果推理框架能支持多種芯片,用戶就能在不同硬件之間切換,不用重寫代碼——
CUDA最大的鎖定效應(yīng),就此失效。
這就給專用推理芯片留下了機會。
推理任務(wù)并不都需要CUDA從訓(xùn)練到集群協(xié)同的全部能力。針對特定模型、特定場景重新設(shè)計的芯片,只要能夠跑得更快、更便宜或者更省電,就有機會從英偉達手里切下一塊市場。
比如d-Matrix,本身就是一家主打推理的芯片公司。
![]()
這家公司成立于2019年,主攻生成式AI推理芯片。
聯(lián)合創(chuàng)始人兼CEOSid Sheth曾回憶,他們很早便判斷,AI推理帶來的機會最終會超過訓(xùn)練
Infinity用AI Agent花10小時搭建的類CUDA軟件,服務(wù)的正是d-Matrix的推理芯片。
于是,「10小時事件」的完整故事就連起來了:
新芯片想進入推理市場,但缺少成熟軟件;AI Agent快速生成和優(yōu)化底層Kernel,把原本可能耗費數(shù)月乃至數(shù)年的適配工作壓縮到小時或天。
Sid還明著放話:
- 雖然英偉達在訓(xùn)練領(lǐng)域保持主導(dǎo)地位,但在推理方面,護城河有所削弱。
![]()
盯上這個缺口的,也不止d-Matrix一家。
主攻推理的Rebellions、d-Matrix,押注晶圓級芯片的Cerebras,亞馬遜的Inferentia、谷歌的TPU、AMD的MI300X……
各路芯片廠和云計算巨頭,早已在推理市場排兵布陣,準(zhǔn)備從英偉達手里搶下一塊肉。
對這些公司來說,他們不需要立刻替代英偉達。
他們只需要證明,在某些推理任務(wù)中,不依賴英偉達的全套硬件和CUDA生態(tài),也能跑得更快或者更便宜。
這就足夠了。
英偉達護城河,到底顛沒顛覆
答案可能是…還差得遠
前面也說了,10小時重寫的是「一塊芯片的適配代碼」,而CUDA生態(tài)還有20年積累的庫、調(diào)試工具、社區(qū)、幾百萬開發(fā)者。
這并不是輕輕松松就能被顛覆的。
更關(guān)鍵的是,代碼能生成,不等于能用。
INT21創(chuàng)始人Bing Xu,上一家AI芯片軟件公司HippoML被英偉達收購,他本人今年4月才離開英偉達。
![]()
他的判斷是:Agent能在短時間內(nèi)生成大量代碼,但驗證才是最大瓶頸
AI生成一萬行代碼很快,但「證明這一萬行在各種邊界情況下都算得對、跑得穩(wěn)」極慢。
CUDA最深的資產(chǎn)恰恰是它的驗證工具鏈——所以他認(rèn)為,Agent時代,驗證生態(tài)會成為CUDA的下一道護城河
Modular聯(lián)合創(chuàng)始人兼CEOChris Lattner,也潑了盆冷水。
![]()
他認(rèn)為編碼Agent帶來的改進是漸進式的,「炒作被嚴(yán)重夸大」。
理由有三:第一,寫代碼只是軟件工程的一小部分,生產(chǎn)級優(yōu)化才決定芯片性能,直接決定跑AI的成本;
第二,芯片軟件是小眾精英領(lǐng)域,公開代碼遠少于應(yīng)用開發(fā),AI在這塊能學(xué)的訓(xùn)練數(shù)據(jù)本來就少;
第三,幾百萬行存量代碼的遷移成本還在,這不是技術(shù)能解決的,屬于組織決策。
還有一點容易忽略的是:英偉達自己也在使用AI
英偉達開發(fā)者生態(tài)副總裁Ankit Patel表示:
- 我們也在使用AI Agent來更快地開發(fā)CUDA,并在更大規(guī)模上進行驗證。
以己之矛,攻彼之盾,進攻方的相對優(yōu)勢也會打折。
Bing Xu總結(jié)下來:這場仗的勝負(fù),取決于競爭對手追趕英偉達的速度,能否快過英偉達自我迭代的速度。
但很顯然,這家全球最大的芯片制造商,「并沒有在睡覺或原地踏步」。
總的來說,短期內(nèi)英偉達的護城河安然無恙,但變化會先在推理側(cè)悄悄發(fā)生。
長期的真正懸念是:護城河正在從「代碼的存量」遷移到「驗證和優(yōu)化的生態(tài)」。
誰先占住新位置,誰才是下一個贏家。
[1]https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.