![]()
8 月 5 日,Sand.ai 發(fā)布并開(kāi)源 MAGI-2 Preview。這是一款統(tǒng)一音視頻生成模型:文本、視頻和音頻進(jìn)入同一個(gè) Transformer,畫(huà)面和聲音由同一套主干共同生成。模型總參數(shù)約 114B,每次生成激活約 6B,這是全球首個(gè)開(kāi)源千億級(jí) MoE 視頻生成模型。
2025 年 4 月,Sand.ai 曾開(kāi)源 24B 參數(shù)的自回歸視頻模型 MAGI-1。時(shí)隔一年多,這家公司再次把主力視頻生成模型帶入開(kāi)源體系,參數(shù)規(guī)模從 240 億擴(kuò)大至 1,140 億。
過(guò)去兩年,開(kāi)源視頻生成模型的參數(shù)規(guī)模大多停在十幾 B 以?xún)?nèi),最大的也不過(guò)二三十 B。語(yǔ)言模型那邊,開(kāi)源模型早就進(jìn)入了幾千億甚至萬(wàn)億參數(shù),靠的都是 MoE。
雖然說(shuō)兩類(lèi)模型面對(duì)的任務(wù)不同,參數(shù)規(guī)模不能直接代表能力高低,但這組差距仍然說(shuō)明,視頻模型擴(kuò)展規(guī)模要付出更高的計(jì)算和通信代價(jià)。視頻模型的參數(shù)規(guī)模長(zhǎng)期停留在這一水平,也主要受制于這兩項(xiàng)成本。MAGI-2 Preview 將總參數(shù)推至 114B,嘗試解決的正是這個(gè)問(wèn)題。
視頻模型為什么一直做不大?
視頻的序列遠(yuǎn)比文本長(zhǎng),模型生成視頻,需要把畫(huà)面切分成大量空間 patch。一幀畫(huà)面對(duì)應(yīng)一批 token,連續(xù)數(shù)秒的視頻再疊加文本與音頻,最終形成的序列遠(yuǎn)長(zhǎng)于普通語(yǔ)言任務(wù)。分辨率、幀率和生成時(shí)長(zhǎng)中的任何一項(xiàng)增加,都會(huì)進(jìn)一步推高 token 數(shù)量。
稠密模型中,每個(gè) token 都要經(jīng)過(guò)全部參數(shù)。模型參數(shù)增加,單個(gè) token 的計(jì)算量也會(huì)同步上升;再乘上視頻的超長(zhǎng)序列,訓(xùn)練和推理成本很快變得難以承受。在語(yǔ)言模型中可行的參數(shù)擴(kuò)張方式,移到視頻任務(wù)上,往往先撞上成本與效率的限制。2026 年 3 月 OpenAI 停止運(yùn)營(yíng) Sora,其背后很大一部分原因就在于:以當(dāng)時(shí)的架構(gòu)和推理成本,大規(guī)模商用幾乎不具備經(jīng)濟(jì)上的可行性。
語(yǔ)言模型緩解這一問(wèn)題,依靠的是混合專(zhuān)家模型(Mixture of Experts,MoE)。模型保留一個(gè)龐大的專(zhuān)家池,每個(gè) token 只激活其中一小部分,由此把總體容量和單次計(jì)算拆開(kāi)。模型可以繼續(xù)增加參數(shù),拓展能力上限,但每次推理不必調(diào)用全部權(quán)重。
把這套方法移到視頻模型上,困難主要出現(xiàn)在通信環(huán)節(jié)。
傳統(tǒng)專(zhuān)家并行(Expert Parallel)會(huì)先為每個(gè) token 選出需要調(diào)用的專(zhuān)家,再把 token 發(fā)送到專(zhuān)家所在的 GPU。激活的專(zhuān)家越多、序列越長(zhǎng),設(shè)備之間需要搬運(yùn)的數(shù)據(jù)也越多;專(zhuān)家負(fù)載還會(huì)隨著輸入內(nèi)容變化,導(dǎo)致不同設(shè)備承擔(dān)的計(jì)算量不斷波動(dòng)。
在文本序列中,這套機(jī)制尚可運(yùn)轉(zhuǎn)。但換成視頻的 token 規(guī)模,跨卡通信就很容易抵消稀疏計(jì)算節(jié)省下來(lái)的算力。視頻模型因此需要的不只是 MoE 架構(gòu),還包括一套專(zhuān)門(mén)為長(zhǎng)序列和高頻路由設(shè)計(jì)的分布式系統(tǒng)。
114B 的容量,6B 的激活參數(shù)
MAGI-2 Preview 的解法分兩步,第一步是把專(zhuān)家切得更細(xì)。
傳統(tǒng) MoE 通常為一個(gè) token 的完整隱藏表示選擇專(zhuān)家。MAGI-2 Preview 則先把 3,072 維隱藏表示拆成 12 個(gè) 256 維子空間,每個(gè)子空間稱(chēng)為一個(gè) head。每個(gè) head 擁有 256 個(gè)專(zhuān)家,并從中選出 6 個(gè)。
![]()
(來(lái)源:Sand.ai)
由此計(jì)算,一層網(wǎng)絡(luò)包含 3,072 個(gè)相互獨(dú)立的小專(zhuān)家,每個(gè) token 在每層合計(jì)激活 72 個(gè)。放到整個(gè)模型中,MAGI-2 Preview 擁有約 114B 總參數(shù),每次生成實(shí)際激活約 6B。
作為參照,DeepSeek-V4-Pro-Preview 每層設(shè)置 384 個(gè)路由專(zhuān)家,每個(gè) token 選擇 6 個(gè);Kimi K3 設(shè)置 896 個(gè)專(zhuān)家,每個(gè) token 選擇 16 個(gè)。
大語(yǔ)言模型對(duì)“專(zhuān)家”的定義,以及面向的維度和任務(wù)與視頻模型并不相同,數(shù)量不能直接換算成能力。兩者對(duì)比更能說(shuō)明的是路由粒度:MAGI-2 Preview 將一個(gè) token 拆進(jìn)多個(gè)低維子空間,讓動(dòng)作、外觀、聲音和語(yǔ)義分別尋找適合的專(zhuān)家,再把不同專(zhuān)家的輸出組合起來(lái)。
Sand.ai 將這種結(jié)構(gòu)稱(chēng)為 Ultra-fine-grained MoE。更細(xì)的專(zhuān)家分工擴(kuò)大了能力組合空間,也為統(tǒng)一音視頻生成提供了基礎(chǔ)。
MAGI-2 Preview 將文本、視頻和音頻放在同一個(gè)上下文中處理。模型內(nèi)部既有三種模態(tài)共享的專(zhuān)家,也有各自的專(zhuān)屬專(zhuān)家。聲音、口型、表情、動(dòng)作和鏡頭節(jié)奏從生成開(kāi)始便相互影響,減少了先生成畫(huà)面、再串聯(lián)聲音模型所產(chǎn)生的接口和對(duì)齊問(wèn)題。
![]()
圖丨文本、視頻和音頻進(jìn)入同一個(gè) Transformer(來(lái)源:Sand.ai)
專(zhuān)家增加到數(shù)千個(gè)后,傳統(tǒng)調(diào)度方式很快觸及效率上限。對(duì)此,Sand.ai 引入了 Head Parallel,改變通信與路由的順序。
傳統(tǒng) Expert Parallel 先路由、再通信;Head Parallel 先按照 head 分發(fā) token 表示,再由設(shè)備在本地完成專(zhuān)家選擇和計(jì)算。由于分發(fā)的數(shù)據(jù)形狀固定,主要通信量只取決于輸入表示,不再隨激活專(zhuān)家數(shù)量線性增長(zhǎng),設(shè)備之間的負(fù)載也更穩(wěn)定。
這套機(jī)制讓 MAGI-2 Preview 能夠把專(zhuān)家劃分得更細(xì),同時(shí)避免通信成本吞掉稀疏計(jì)算帶來(lái)的收益。3,072 個(gè)專(zhuān)家能夠真正協(xié)同工作,前提正在于此。
圖丨分層 Head Parallel 架構(gòu)(來(lái)源:Sand.ai)
架構(gòu)之外,還需要一整套工程系統(tǒng)支撐。
數(shù)千個(gè)小專(zhuān)家意味著高頻路由、反復(fù)的數(shù)據(jù)重排和大量小矩陣計(jì)算。通用 MoE 很難在這種負(fù)載下保持足夠高的硬件利用率。Sand.ai 為此開(kāi)發(fā)了計(jì)算內(nèi)核庫(kù) MagiMoE,將路由、排序和專(zhuān)家計(jì)算合并執(zhí)行,減少中間結(jié)果與顯存搬運(yùn)。
訓(xùn)練部分由分布式優(yōu)化器 MagiMuon 支撐。它使用 Muon 處理主體矩陣參數(shù),用 AdamW 更新其余參數(shù),并針對(duì)大量細(xì)粒度專(zhuān)家重新設(shè)計(jì)參數(shù)組織和跨設(shè)備計(jì)算方式,使訓(xùn)練能夠穩(wěn)定擴(kuò)展到千億參數(shù)規(guī)模。
專(zhuān)家劃分越細(xì),數(shù)據(jù)也越需要支撐這種分工。Sand.ai 沒(méi)有把“高質(zhì)量數(shù)據(jù)”簡(jiǎn)單理解為反復(fù)過(guò)濾,團(tuán)隊(duì)希望盡可能保留復(fù)雜動(dòng)作、少見(jiàn)主體、特殊鏡頭、非典型聲音和長(zhǎng)尾組合,再通過(guò)更準(zhǔn)確的標(biāo)注組織這些數(shù)據(jù)。這樣能讓模型更好地模型理解主體、動(dòng)作、場(chǎng)景、鏡頭、時(shí)序,以及聲音、畫(huà)面和文本之間的關(guān)系。
模型、系統(tǒng)和數(shù)據(jù)由此連在一起。對(duì)于視頻生成,擴(kuò)大參數(shù)已經(jīng)不再是單純的算法問(wèn)題,模型架構(gòu)、計(jì)算內(nèi)核、分布式訓(xùn)練和數(shù)據(jù)管線需要同時(shí)變化。
這套改造最終要落到生成成本上。根據(jù) Sand.ai 團(tuán)隊(duì)提供的內(nèi)部測(cè)算,在 8 卡 H100、按照當(dāng)前月租價(jià)格折算的條件下,不同推理配置生成一段 10 秒視頻的成本約 0.5 元(蒸餾后的模型)。按團(tuán)隊(duì)口徑,折算到每秒,價(jià)格約為行業(yè)主流模型的十分之一。
視頻生成通常按時(shí)長(zhǎng)計(jì)價(jià)。單位成本如果下降一個(gè)數(shù)量級(jí),批量生成素材、多版本迭代等過(guò)去不夠經(jīng)濟(jì)的用法,才可能進(jìn)入常規(guī)生產(chǎn)流程。
生成效果則有第三方榜單可以對(duì)照。在 Artificial Analysis 的圖生視頻(image-to-video)榜單上,MAGI-2 Preview 排在第 6 位。一個(gè)激活參數(shù)僅 6B 的開(kāi)源模型,生成效果已經(jīng)進(jìn)入當(dāng)前視頻生成的第一梯隊(duì)。
![]()
(來(lái)源:Artificial Analysis)
作為預(yù)覽版,MAGI-2 Preview 與最頂尖模型仍有差距,Sand.ai 對(duì)此并不諱言;對(duì)一家資源遠(yuǎn)少于大廠的創(chuàng)業(yè)公司而言,這個(gè)結(jié)果證明的是另一件事:把功夫花在架構(gòu)和系統(tǒng)上,同樣的卡可以換出更多的生成能力。按團(tuán)隊(duì)的說(shuō)法,正式版會(huì)沿著這套已經(jīng)跑通的架構(gòu)繼續(xù)擴(kuò)大參數(shù)和數(shù)據(jù)規(guī)模,探索更長(zhǎng)時(shí)長(zhǎng)的視頻生成,進(jìn)一步提升生成質(zhì)量、音畫(huà)同步和長(zhǎng)時(shí)一致性,并持續(xù)降低單位生成成本。
開(kāi)源改變的是參與邊界
這次發(fā)布的另一個(gè)重點(diǎn),是開(kāi)源本身。過(guò)去,千億級(jí)視頻模型如何設(shè)計(jì)架構(gòu)、保持穩(wěn)定訓(xùn)練,關(guān)鍵細(xì)節(jié)大多留在閉源公司的內(nèi)部系統(tǒng)中。
而 MAGI-2 Preview 提供了一個(gè)可供拆解和驗(yàn)證的對(duì)象。研究機(jī)構(gòu)可以觀察細(xì)粒度專(zhuān)家如何分工,路由是否會(huì)隨著人物、動(dòng)作和聲音變化。推理框架與芯片廠商也獲得了一種新的公開(kāi)工作負(fù)載:數(shù)千個(gè)細(xì)粒度專(zhuān)家?guī)?lái)的高頻路由、數(shù)據(jù)重排和大量小矩陣計(jì)算,需要新的內(nèi)核、通信策略和硬件適配。
更下游的變化發(fā)生在企業(yè)側(cè)。影視、廣告、游戲和電商企業(yè)掌握大量專(zhuān)有素材,其中一部分受到保密、版權(quán)和合規(guī)要求限制,不適合直接發(fā)送給外部 API。開(kāi)放權(quán)重讓模型進(jìn)入企業(yè)自己的計(jì)算環(huán)境成為可能,企業(yè)也可以圍繞特定人物、商品和鏡頭語(yǔ)言繼續(xù)訓(xùn)練。
應(yīng)用公司同樣多了一個(gè)選擇。調(diào)用閉源 API 時(shí),成本、并發(fā)、接口能力和產(chǎn)品節(jié)奏主要由模型廠商決定;有了開(kāi)源模型,應(yīng)用公司可以在外部 API、本地部署和定制模型之間重新計(jì)算成本。
114B 模型當(dāng)然不是下載后便能輕松運(yùn)行的工具。部署依然需要一定的硬件、通信、工程和運(yùn)維門(mén)檻。它改變的是參與邊界:過(guò)去主要由頭部模型公司掌握的千億級(jí)視頻模型,如今開(kāi)始進(jìn)入研究機(jī)構(gòu)、基礎(chǔ)設(shè)施團(tuán)隊(duì)和行業(yè)企業(yè)的視野。
語(yǔ)言模型已經(jīng)提供了一條可供參照的路徑。開(kāi)源模型不需要在每一項(xiàng)能力上都超過(guò)最強(qiáng)的閉源模型;只要進(jìn)入可用區(qū)間,企業(yè)就會(huì)開(kāi)始比較部署成本、數(shù)據(jù)控制、定制空間和供應(yīng)商風(fēng)險(xiǎn),閉源廠商也會(huì)面臨降低價(jià)格、開(kāi)放更多能力的壓力。
視頻生成可能形成相近的格局。閉源模型繼續(xù)在產(chǎn)品體驗(yàn)、服務(wù)穩(wěn)定性和商業(yè)支持上保持優(yōu)勢(shì),開(kāi)源模型則提供部署和改造的空間。雙方的競(jìng)爭(zhēng)會(huì)從生成質(zhì)量延伸到價(jià)格、數(shù)據(jù)和開(kāi)發(fā)工具,性能天花板很難再單獨(dú)決定勝負(fù)。
過(guò)去兩年,視頻模型比較的是畫(huà)面是否逼真、動(dòng)作是否自然。接下來(lái),決定行業(yè)走向的問(wèn)題會(huì)更多地出現(xiàn)在畫(huà)面之外:一段視頻以什么成本生成,模型由誰(shuí)控制,規(guī)模能否繼續(xù)擴(kuò)大。
MAGI-2 Preview 不會(huì)立即改寫(xiě)視頻模型的排名。它帶來(lái)的變化,是讓這些問(wèn)題第一次有了一個(gè)千億參數(shù)級(jí)的公開(kāi)樣本,可以由更多人拆解、驗(yàn)證。
參考資料:
1.https://sand.ai/blog/magi-2-preview
運(yùn)營(yíng)/排版:何晨龍
注:封面/首圖由 AI 輔助生成
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.