![]()
作者|梁耀丹
主編|趙妍
來源|星火Ember
7 月 27 日,月之暗面官方正式開源 Kimi K3 模型。當天,月之暗面發布Kimi K3的模型權重、技術報告,并開源支撐Kimi K3模型訓練的關鍵Infra技術:MoonEP、FlashKDA和AgentEnv。
Kimi K3模型發布于7月16日。據悉,該模型總參數達到2.8萬億,是目前全球參數規模最大的開源模型。
Kimi K3 的問世,被行業視作全新里程碑。在由加州大學伯克利分校搭建的國際AI盲測平臺 Arena 上,K3憑借前端代碼榜單1679分的成績位居第一,超越了Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol等頂尖閉源模型。這也是中國大模型首次在編程能力測評中斬獲榜首。
資本市場的反應幾乎是條件反射式的。Kimi K3發布的首個交易日,英偉達單日市值蒸發約1000億美元,費城半導體、納斯達克綜合指數,全部下跌。
IG市場分析師Tony Sycamore估計,來自Kimi K3的沖擊,導致尚未上市的兩大美國AI巨頭OpenAI和Anthropic的預期估值合計蒸發了3140億美元。
“DeepSeek時刻重現”——多家外媒的報道中,不約而同地使用了這個措辭。提到這個說法的還有中信建投,“K3的發布意味著中國大模型第一次以‘競爭威脅’身份進入全球大模型敘事。”中信建投在7月20日的文章中稱。
歷史似乎正在重演,但熱潮褪去后,疑問隨之而來:Kimi K3 高達2.8 萬億參數背后,真實技術含金量究竟如何?伴隨產品發布涌現的各類爭議,又暴露了這家頭部AI創業公司哪些隱憂?
2.8萬億參數背后
要理解Kimi K3的2.8萬億參數規模意味著什么,需要建立幾個坐標系。
Anthropic的Claude模型沒有披露過參數規模,外界推測總參數量級大致在1萬億到5 萬億之間;OpenAI的GPT-4,被業內廣泛推測為約1.8萬億參數;行業內對 Google Gemini Ultra 的總參數量估算普遍在 1.5 萬億;Meta開源的Llama 3最大版本停留在4050億。在國內,百度發布的文心大模型5.0總參數規模超2.4萬億;DeepSeek最新發布的V4-Pro 總參數量為1.6萬億;智譜GLM-5.2模型參數規模為7440億。
月之暗面有關負責人對媒體表示:“參數越大,能力上限越高,可以提供更智能的模型表現。參數就像人腦里的神經連接,近3萬億參數意味著這個模型能把更多的知識和規律裝進‘腦子’,懂得更多、想得更深、答得更準。”
但參數不是全部,關鍵在于有效參數背后的“經濟學”。
據月之暗面披露,Kimi K3 基于混合線性注意力機制 (Kimi Delta Attention,下稱KDA)和注意力殘差( Attention Residuals,下稱AttnRes)構建。這兩項架構更新,都是為了讓信息在更長序列和更深模型中流動得更順暢。團隊也進一步擴大了 Mixture of Experts(MoE)的稀疏度:結合 Stable LatentMoE 框架后,模型可以在 896 個專家中高效激活 16 個。再加上訓練方法和數據配方的優化,這些結構性改進讓 Kimi K3 相比 K2 的整體擴展效率提升約 2.5 倍,能更有效地把算力轉化為能力。
假如把K3理解為一個內部就像一個擁有上千名員工的超級公司,那么KDA相當于給員工發了一個“隨用隨取的記事本”;AttnRes則相當于在公司每層樓之間修了“直達電梯”——底層發現的關鍵信息,可以一路暢通地送到最高層。混合專家模型(MoE)則是一種讓 AI 模型更聰明且更省資源的架構,好比這家公司有 896 名員工,但每次接到任務,只叫其中 16 個最對口的上班,其余 880 多人休息。Stable LatentMoE分發機制則是這套“排班系統”的升級版——讓每一次挑哪 16 個人更準、更穩定。
這也是在芯片受限的大背景下,國內大模型研發側重算法優化和資源利用效率的縮影。
不過,在 AI 行業,參數規模從來都不是衡量模型能力的唯一標尺。
月之暗面也承認,“盡管 Kimi K3 總體上是一個非常有競爭力的模型,但與 Claude Fable 5 和 GPT-5.6 Sol 相比,在用戶體驗上仍有一定差距。”
唯一可以確認的是,正如月之暗面所說的,“它在我們的整套評測中展現出前沿水平的能力,并穩定超過了其他所有模型。”
雖然 K3的性能表現讓市場看到了中國大模型持續縮小與全球頂尖模型的差距,但也有觀點認為,Kimi K3的發布又不完全等同于“DeepSeek時刻”。
時針撥回2025年1月,DeepSeek R1橫空出世,以極低的訓練成本打造出比肩GPT-4o的推理能力,被視為大模型的研發可以“繞過高算力壁壘”,導致英偉達單日市值蒸發近6000億美元。
但在Kimi K3發布后,來自多家國際投行的觀點認為,Kimi K3不是算力需求的終結者,相反,加大了對算力的需求。
半導體研究機構Semi Analysis在報告中也提到,K3采用的KDA混合線性注意力機制不僅不會削弱高端AI硬件需求,反而可能進一步強化對英偉達高端GPU、HBM以及高速互聯設備的需求。
狂奔背后的裂縫
技術實力從來不等同于商業上的成功。伴隨Kimi K3誕生的還有諸多爭議,暴露了月之暗面狂奔背后的裂縫與隱憂。
K3發布48小時內,用戶請求量大幅超出預估,逼近現有集群承載極限,7月19日深夜,月之暗面被迫發布公告,暫停C端新用戶的會員訂閱,將算力全部投入已訂閱用戶。直至7月28日,這一限制仍未得以解除。
K3 發布不到三天即暫停C 端訂閱,對一家傳出6個月內赴港IPO、估值約315億美元的公司而言,拒絕新用戶等于中斷增長曲線。
與算力瓶頸伴生的,還有昂貴的定價體系。
Kimi K3未緩存輸入20元/百萬Token、輸出100元/百萬Token,位列國產模型最貴一檔,遠超DeepSeek V4 Pro的價格(未緩存輸入 3 元、輸出 6 元)。國外主流大模型與之相比,GPT-5.6 Sol的價格是輸入5美元、輸出30美元,Fable 5輸入10美元、輸出50美元。
對此,月之暗面方面硬氣回應:“開源模型、中國大模型不該被貼上低價標簽,我們做出了SOTA級模型,也能匹配合理商業定價。”
K3發布不到一周,來自地緣政治的風險也初見苗頭。
7月22日,美國白宮科技政策辦公室主任邁克爾·克拉齊奧斯(Michael Kratsios)在其社交賬號上拋出一個驚人言論稱,Kimi K3是靠“蒸餾”美國最強的閉源模型Fable5才研發出來的。
但這個說法根本站不住腳。Fable 5大模型是于今年6月9日正式發布的,而Kimi K3發布于7月16日。兩者發布時間相差僅1個多月,根本不可能完成克拉齊奧斯所說的“蒸餾”,更別提模型的研發流程還涉及大量的測試工作。
此外,據環球時報,近期有外媒報道稱,美國政府正考慮禁止使用中國人工智能模型。相關禁令傳聞已在硅谷初創圈引發普遍恐慌。大量初創企業創始人依靠成本更低的中國開放權重模型開發產品,無力承擔Anthropic、OpenAI等美國人工智能企業高昂的調用費用。
即便如此,K3引發的連鎖反應遠未結束。
至今為止,Kimi K3 已經收獲SpaceX CEO埃隆·馬斯克、英偉達CEO黃仁勛、OpenAI 總裁兼聯合創始人在內的美國科技圈大佬的“點贊”。
但真正的檢驗時刻尚未到來。如何持續守住技術優勢、直面全球市場復雜的監管環境、跑出可行的商業模式,才是Kimi K3需要交出的長期答卷。
