![]()
智東西
作者 李水青
編輯 心緣
智東西8月11日報道,今日,螞蟻百靈大模型開源了一款輕量級混合推理MoE模型——Ling-3.0-tiny。
該模型總參數量為7.9B,推理時激活參數量為1.3B,主要面向高效本地部署而設計。其同步提供BF16、FP8和INT4三個版本,已在DGX Spark、MacBook、Mac mini等設備上完成驗證,兼顧性能、效率與可部署性。
![]()
在Artificial Analysis Intelligence Index評價體系中,Ling-3.0-tiny獲得25分,僅比Gemma-4-26B-A4B低1分,同時高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B和Gemma-4-E4B。
該模型的關鍵要點總結如下:
1、高效的混合線性架構:Ling-3.0-tiny采用月之暗面自研的KDA(Kimi增量注意力)與DeepSeek自研的MLA(多頭潛在注意力)的3:1 交替堆疊結構,并配備由128個路由專家組成的稀疏MoE前饋網絡,構建起高效的混合線性架構。
每個Token僅激活8個路由專家和1個共享專家,使該模型能夠在長上下文建模能力、參數效率與計算成本之間實現平衡。
2、原生混合推理與智能體能力:Ling-3.0-tiny兼顧快速響應與多步推理能力,可通過enable_thinking參數在單次請求中靈活開啟或關閉思考模式。該模型在通用智能體任務、代碼生成、數理科學推理以及指令遵循場景下均具備均衡表現。
3、本地與邊緣部署:在FP8精度下,Ling-3.0-tiny在DGX Spark上的推理吞吐量可達100–105tokens/s,而在M4 Pro MacBook上則為86–90tokens/s,且在8K上下文長度時,峰值內存占用僅為8.34GiB。
如下面視頻所示,百靈在36GB內存MacBook Pro復刻Infinite Wiki(無限百科)核心體驗。用戶閱讀時點擊詞語即可生成上下文解釋卡片,支持多層知識下鉆。
該Demo全程本地推理,無需云端調用,實測首Token響應低于100毫秒;所有數據留存設備端,不會產生云端API計費,接近一個原生速度的本地知識引擎。
Hugging Face地址:
https://huggingface.co/inclusionAI/Ling-3.0-tiny
https://huggingface.co/inclusionAI/Ling-3.0-tiny-fp8
https://huggingface.co/inclusionAI/Ling-3.0-tiny-int4
ModelScope地址:
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-fp8
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-int4
一、1.3B激活參數“以小博大”,評分緊咬26B大模型
在Artificial Analysis Intelligence Index評價體系中,Ling-3.0-tiny獲得25分。該指數從真實任務、工具使用、代碼、科學推理、知識可靠性和長上下文等九個方向,綜合衡量模型的跨任務能力。
百靈公布的對比結果顯示,Ling-3.0-tiny的綜合得分僅比Gemma-4-26B-A4B低1分,接近激活參數約4B的更大MoE模型,同時高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B和Gemma-4-E4B。
Ling-3.0-tiny擁有7.9B總參數,但每個Token僅激活1.3B參數。這意味著,它以較低的實際計算規模,進入了主流4B至12B級模型的綜合能力區間。
單項分數無法覆蓋模型的全部能力,Tiny模型也無法取代所有大型模型。但從相關評測看,Ling-3.0-tiny已經具備進入代碼輔助、知識工作流、工具調用和本地Agent應用的能力基礎,其定位也超出了單純追求“設備裝得下”的小尺寸模型。
![]()
二、Agent評分超31B大模型,輸出速度超160 tokens/s
Ling-3.0-tiny較突出的方向是真實任務與Agent執行。
其Artificial Analysis Agentic Index得分為16,高于Gemma-4-31B;其中,GDPval-AA v2取得772 Elo,τ3-Banking得分為20.80,體現了模型在任務理解、工具調用和流程推進方面的能力。
![]()
在百靈此次列出的對比模型中,Ling-3.0-tiny在IMO-AnswerBench和非幻覺率指標上取得領先成績,在數學、科學推理、代碼Agent、指令遵循和長上下文等任務上的表現也較為均衡。
![]()
在綜合智能指數達到25分的同時,Ling-3.0-tiny輸出速度超過160 tokens/s,輸出500個Token的端到端用時約18秒,這一時間已經包含模型思考過程。
![]()
較小的激活規模由此轉化為更短的任務等待時間,也有助于提升Agent連續執行任務時的響應效率。
![]()
三、站在DeepSeek、Kimi肩膀上創新架構,降低本地部署門檻
Ling-3.0-tiny延續Ling-3.0系列的原生混合線性注意力技術路線,并針對輕量化和低門檻部署進一步優化。其總參數量被控制在7.9B,每個Token的激活參數量為1.3B。
模型采用3:1 KDA-MLA架構,即每4層包含3層KDA和1層MLA,以提高長上下文處理效率。
在MoE部分,Ling-3.0-tiny設置了128個稀疏專家。每個Token會激活8個路由專家和1個共享專家,以較小的激活參數量承載更完整的模型能力。
該模型還采用原生混合推理機制,讓常規任務的快速響應和復雜任務的多步思考由同一模型完成。Multi-Token Prediction訓練目標則為更高效的Token預測及后續推理加速提供基礎。
這些架構設計主要指向三項實際價值:減少推理所需的計算資源,降低本地部署和二次開發門檻,并讓輕量模型具備接入真實Agent工作流的能力。
![]()
四、從DGX Spark到MacBook,三個精度版本覆蓋不同設備
Ling-3.0-tiny此次同步開源BF16、FP8和INT4三個版本,開發者可以按照硬件條件、性能要求和成本選擇部署方案。
其中,BF16版本適用于重視完整精度的研究評測和生產應用;FP8版本在模型效果、運行速度和資源占用之間尋求平衡;INT4版本進一步壓低資源需求,面向算力和內存相對有限的本地環境。
三個版本的推出,使模型能夠覆蓋從專業級本地AI工作站到個人電腦的不同設備。開發者可以將其接入本地知識庫、代碼助手、UI自動化、企業任務智能體等工作流,并將模型和業務數據保留在本地環境中。
1、DGX Spark:單機可支撐小規模本地服務
Ling-3.0-tiny可在單臺NVIDIA DGX Spark上運行FP8推理,模型權重文件約為7.85GB。
在2K輸入測試中,單請求穩態解碼速度約為100至105 tokens/s;兩路請求并發時,聚合解碼吞吐約為161 tokens/s。
按照上述測試結果,開發者和中小團隊無需搭建大規模算力集群,僅使用一臺DGX Spark便可搭建獨立運行的本地模型服務,為小規模用戶提供推理能力。潛在應用包括企業內部知識助手、研發團隊代碼助手和面向特定業務流程的任務智能體。
百靈還在DGX Spark上部署Ling-3.0-tiny,并用其驅動移動設備,演示模型理解任務、調用工具、執行自動化操作并完成驗證的過程。該Demo面向開發測試中的批量試跑和回歸驗證場景,驗證了本地模型在運行成本、數據可控性和執行可靠性方面的應用潛力。
2、MacBook:首Token響應低于100毫秒
目前,Ling-3.0-tiny已完成面向MacBook(Apple Silicon)的本地運行適配,BF16和FP8版本均可運行。
在MacBook上,該模型可以用于代碼輔助、文檔處理、本地知識問答和工作流自動化。由于模型與數據均留在本地,用戶可以減少對云端模型服務的依賴,并在處理隱私敏感信息時擁有更可控的數據邊界。
其中,FP8版本進一步降低了本地運行所需資源,并將持續生成速度提高約30%,以改善多輪交互和Agent運行體驗。
正如前文提到,為驗證本地高頻交互能力,百靈在一臺配備36GB內存的MacBook Pro上復刻了Infinite Wiki(無限百科)的核心體驗。測試表明,Ling-3.0-tiny已經能夠在Mac上承擔高頻本地交互任務,并以接近原生應用的響應速度充當本地知識引擎。
3、Mac mini:變身常駐式本地智能節點
Ling-3.0-tiny面向Apple Silicon的部署方案也可以延伸至Mac mini。
相比更側重移動辦公的MacBook,Mac mini更適合作為低功耗、常駐式的本地智能節點,為個人或小型團隊持續提供知識庫檢索、文檔分析、自動化任務和本地模型API服務。
在百靈展示的Demo中,Ling-3.0-tiny被部署在Mac mini上,用于劃詞翻譯、語法糾錯和文本改寫。相關任務無需將數據上傳云端,可以離線運行并提供低延遲響應,適用于個人及企業的本地閱讀與寫作場景。
至此,Ling-3.0-tiny已經完成從DGX Spark、MacBook到Mac mini的適配驗證。不同精度版本與設備形態共同擴大了這款模型的部署范圍,也讓中小團隊能夠根據算力、數據邊界和業務需求選擇更合適的本地運行方式。
結語:下一步將補強事實準確性和長程Agent穩定性
百靈稱,接下來其將繼續增強Ling-3.0-tiny的長尾知識覆蓋和事實準確性,提高復雜工具調用及長程Agent任務的穩定性,并優化代碼、科學推理和長上下文能力。
團隊還計劃改善模型推理能力、響應時間和任務成本之間的平衡,完善FP8和INT4版本的硬件適配、推理框架支持與部署文檔,并與硬件廠商、高校及開發者社區共同建設輕量模型生態。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.