7月18日消息,在WAIC 2026期間,聆思科技市場(chǎng)副總裁韓超陽(yáng)圍繞端側(cè)大模型推理芯片發(fā)表主題演講,并在會(huì)后接受對(duì)話交流。談及當(dāng)前市場(chǎng),韓超陽(yáng)給出了兩個(gè)判斷。韓超陽(yáng)表示:“需求非常迫切。”但就產(chǎn)業(yè)進(jìn)程而言,韓超陽(yáng)同時(shí)表示:“目前還處于萌芽階段。”在他看來(lái),方向已經(jīng)明確,但真正匹配終端需求的芯片和應(yīng)用仍在形成,需要終端、模型和芯片廠商共同推進(jìn)。
據(jù)介紹,聆思此前主要面向智能家居、智能穿戴和教育辦公等場(chǎng)景提供端側(cè)感知模型AI推理芯片,相關(guān)產(chǎn)品累計(jì)出貨量已超過(guò)1.5億顆。約兩年前,聆思開(kāi)始布局端側(cè)大模型推理芯片Nebula,并與模型廠商及內(nèi)部算法團(tuán)隊(duì)共同研究Transformer架構(gòu)、底層算子和模型運(yùn)行特征。對(duì)于研發(fā)進(jìn)度,韓超陽(yáng)表示:“目前的節(jié)奏是,到年底進(jìn)行流片,明年上半年正式推出樣片。”根據(jù)產(chǎn)品規(guī)劃,Nebula單芯片支持3B至13B參數(shù)規(guī)模的LLM、VLM和VLA模型。在7B模型推理場(chǎng)景下,目標(biāo)實(shí)現(xiàn)Decode每秒100個(gè)Token,典型平均功耗為5W至15W。目前,聆思已與聯(lián)想、面壁智能、海爾等合作伙伴圍繞終端形態(tài)和應(yīng)用需求開(kāi)展聯(lián)合預(yù)研。
在韓超陽(yáng)看來(lái),端側(cè)大模型芯片不能只比較TOPS。韓超陽(yáng)表示:“算力很重要,但不是唯一指標(biāo)。”大模型推理中的Prefill和Decode階段對(duì)算力、內(nèi)存帶寬的需求不同,標(biāo)稱(chēng)算力高并不等于實(shí)際推理效率高。韓超陽(yáng)表示:“除了關(guān)注絕對(duì)算力外,還要關(guān)注算力利用率。”聆思為Nebula設(shè)定的算力利用率目標(biāo)超過(guò)70%,并認(rèn)為在利用率合適的前提下,端側(cè)80T至200T是較為合理的算力范圍。
為緩解內(nèi)存帶寬瓶頸,Nebula采用3D WoW近存計(jì)算技術(shù),通過(guò)3D DRAM堆疊將內(nèi)存帶寬提升至1TB/s。韓超陽(yáng)表示:“3DDRAM確實(shí)是平衡各方面成本、功耗跟性能的最優(yōu)綜合解決方案。”他認(rèn)為,云端可以優(yōu)先追求性能,終端卻必須在功耗、散熱、空間和成本的多重限制中完成推理,因此單一性能指標(biāo)難以反映產(chǎn)品的真實(shí)可用性。
此外,端側(cè)芯片還要面對(duì)模型迭代速度遠(yuǎn)快于芯片研發(fā)周期的問(wèn)題。韓超陽(yáng)表示:“我們不能針對(duì)當(dāng)前的算法,用固化的理念去做固化的芯片,否則可能跟不上時(shí)代潮流,在大模型迭代時(shí)很快被淘汰。”聆思的做法是,對(duì)Transformer架構(gòu)中通用、高頻且相對(duì)穩(wěn)定的算子進(jìn)行專(zhuān)門(mén)優(yōu)化,同時(shí)為可能變化的部分保留靈活算力和可編程架構(gòu)。韓超陽(yáng)表示:“一定要上下游緊密耦合設(shè)計(jì),才能發(fā)揮出最大的性能優(yōu)勢(shì)。”
在應(yīng)用落地上,韓超陽(yáng)認(rèn)為AIPC及其他AI辦公硬件可能最快形成規(guī)模需求。用戶已通過(guò)云端大模型感受到效率提升,司法、金融、信創(chuàng)和軟件開(kāi)發(fā)等涉及敏感數(shù)據(jù)或核心代碼的場(chǎng)景,對(duì)本地推理和隱私保護(hù)的需求尤其明確。智能座艙同樣需求迫切,但汽車(chē)量產(chǎn)周期更長(zhǎng);與自動(dòng)駕駛相比,座艙中的交互、理解和服務(wù)場(chǎng)景更適合率先采用端側(cè)大模型。
具身智能機(jī)器人是另一個(gè)重要方向。韓超陽(yáng)認(rèn)為,當(dāng)前機(jī)器人的運(yùn)動(dòng)控制能力進(jìn)步較快,但負(fù)責(zé)理解、規(guī)劃和泛化的大腦仍顯不足。韓超陽(yáng)表示:“智能機(jī)器人一定是剛需。”不過(guò),機(jī)器人要形成實(shí)際使用價(jià)值,芯片仍需在更小體積和更低功耗下提升推理能力。全屋智能也被聆思列為重點(diǎn)場(chǎng)景,本地家庭算力主機(jī)有望解決隱私和云端調(diào)用成本問(wèn)題。
面對(duì)模型公司、終端廠商進(jìn)入芯片環(huán)節(jié),韓超陽(yáng)并不將其視為零和競(jìng)爭(zhēng)。韓超陽(yáng)表示:“沒(méi)有一家廠商能獨(dú)自完成所有硬件產(chǎn)品,這是不可能的。”聆思現(xiàn)階段計(jì)劃以推理協(xié)處理器適配不同主控芯片,在具體應(yīng)用形成足夠規(guī)模后,再考慮集成為SoC。對(duì)聆思而言,Nebula能否按計(jì)劃完成流片和樣片交付,并把聯(lián)合預(yù)研轉(zhuǎn)化為量產(chǎn)終端,將成為下一階段的重要任務(wù)。(定西)
