MiniMax M3發布了,后面還會開源,
看到技術報告后我就只想說三四五六個字,
真齊活了,啥都不缺了。
今年模型發布太多了,我對又一個更強模型其實已經有點麻了,贏的指標太多了,每個月都充Token Plan的我更關心的是,它有沒有把Agent高頻用到的幾大能力都湊齊,
從紙面能力上看,
M3在SWE-Bench Pro(軟件工程)拿到59.0,超過了GPT-5.5和Gemini 3.1 Pro,接近Opus 4.7;在GPT5.5擅長的終端編程上,跟Opus 4.7同分。在多模態測試集OmniDocBench上,得分超了Gemini 3.1 Pro;在自主Agent的端到端評測框架Claw-Eval上拿到最高分。
感覺就像是張無忌,拿著乾坤大挪移在對手最厲害的招數上打敗TA。
![]()
說實話,GPT5.5 400k的上下文我忍很久了,放到Hermes里不夠用啊,
Claude就別說了,看到我Agent里不是Claude Code的系統提示語之后第一時間就ban我了。
用的時間越久越覺得有點像個不可能三角一樣,
寫代碼強但上下文短,進到代碼庫里,改幾輪就開始忘前文了。
上下文長但代碼力不夠,結果就是讀了很久文件然后給我一個丑不垃圾的網頁
![]()
拜托,真的不要再讓我看到這種雷霆大丑網頁了好嗎。
那接下來就是傳統環節了,把MiniMax M3放哪個框架來測試呢?
我這里整合了一張表,我出于想試試看Claude Code新能力Dynamic Workflows,一口氣開幾百個subagent的壯觀之感就單方面選這個了。
![]()
額外補充一下,M3在MiniMax Code里面是可以調用Minimax全家桶API的,文字、語音、視頻分析都有。
大家如果跟我一樣經常換模型測試的話,可以用cc switch來切換模型。
直接先來復刻一把,這次MiniMax放出來的主case本來是把ICLR 2025 Outstanding Paper Award論文丟給M3,讓它獨立復現。
技術報告里面給到的數據是,M3自主運行接近12小時,產出了18次commit和23張實驗圖表,并跑通了核心實驗。
離譜的是,M3的多模態能力已經可以做到把論文里的公式,曲線圖、實驗設定放到同一個長線程里處理。
我第一時間想到的跟這個類似的就是Karpathy大神三個月前把他的nanoGPT升級成了nanochat,這是一套完整的大模型訓練實驗框架,覆蓋了所有主要階段,包括分詞,預訓練,微調,評估,推理和聊天 UI,只花48刀就把模型訓練到了GPT-2水平。
![]()
我今天就讓MiniMax m3用動態工作流在我這臺mabookpro訓練一個GPT出來,
觸發動態工作流的方式主要有兩種,
最簡單的方式就是帶上workflow這個詞,詞會變成一個彩虹的配色,系統識別到之后就會生成一個腳本,在執行之前會給我們預覽,確定后再啟動多Agent的并行。
在運行的過程中,隨時可以用/workflow指令或者直接用/config 指令關掉這個動態工作流。
![]()
如果都想要MiniMax M3的額度打滿,也可以輸入/effort 選擇ultracode,然后按shift+tab切換到auto mode自動模式,后面基本上都全自動多Agent了。
之前用Claude sonnet 4.6的時候都沒敢切換成ultracode,現在用MiniMax m3頂上之后這大紫色是真好看啊。確認之后,對話框還會短暫地變換成全彩虹色,非常有儀式感,所以這就是氪金玩家的愉悅之感嘛。
![]()
真正跑起來的時候反而是有點唏噓了,
大家都知道我是個算法程序員,幾年前運行個比GPT小40倍LSTM(循環神經網絡),從數據準備到模型訓練,然后等訓練曲線出來再到模型推理,再快也要個三五天,最崩潰的就是跑一半發現包的版本不對,模型智力倒退五十年,現在一個Agent就可以在90分鐘把所有活干完了。
![]()
接著又訓練了1000步之后,
這個模型就從一個我咋問都只會回答A的版本變成開始有邏輯的回復,還能算個乘法,簡單做問答的版本了。
![]()
大模型訓練,很神奇吧!
現在你也可以做到了。
![]()
很多模型最容易掛在前30次的嘗試里,
跑幾輪不行,就開始繞圈,擺爛,不然就是來個萬金油話術建議我手動檢查。
但真實工程里,很多進展就是出現在這種平臺期后面。你試了很多次都沒提升,然后突然某個方向打穿了。
如果一個Agent沒有足夠長的上下文,沒有穩定的工具調用,它根本走不到后期。
第二個case我來給正在開發2.0版本的Humanize PPT加加速,
Humanize PPT的出發點是給HTML PPT加一個人話大綱和演講模式,也就是在生成之前先把所有的資料整理一遍,缺失的細節會進一步補全,確定要用多少頁,每頁都是什么內容才能把我們想講的內容講明白。
至于演講模式一看就清楚了,
有下一頁的預覽,演講主題,大小進度條,口播稿,想要脫稿的也可以看關鍵點。
樣式的部分本著不重復造輪子的想法,我兼容了中文的guizang-ppt-skill和英文的frontend-slides,用它們來生成HTML PPT的頁面,Humanize PPT完成其他部分。
為了保證設計出來的中英文HTML PPT都好看,
我之前要Claude Code輔助設計,Codex來做資料整合和大綱生成的,這個對于模型的多模態能力還是要求很高的。每一頁PPT我都需要模型先用瀏覽器自動化打開HTML PPT的當前頁,然后來個截圖讓模型去判斷動態背景有沒有生效,字體有沒有大小不一致啥的,跟上一頁的視覺元素有沒有不同。
![]()
但是GPT5.5偷懶得很嚴重,
就算我給它開啟了超高的推理模式,在前幾次運行的時候,它還是只給我做了一個臨時的兼容處理,
就算我明確跟它說了,我們的定位是原生兼容這個 HTML PPT,完全可以以自然語言的方式去批量生成。
![]()
能看得出來我都有點破防了,甚至想自己上手去改代碼了。
剛好現在就把這這條做到一半鏈路全交給MiniMax M3出個計劃試試看。
![]()
又花了一小時,重新梳理了一遍解決了GPT偷懶留下來的歷史代碼,Humanize PPT現在可以在對話中調用子Agent,一次性生成guizang-ppt-skill里所有主題了。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
執行的過程是有體感上的提速的,2分50s就讀完了項目的所有代碼還給出了具體到哪一行的修改方案。
![]()
看了一下,是因為M3還有一個新架構MSA,能把每個token的計算量壓到上一代的1/20,也就說一百萬 token 的上下文窗口,預填充(模型在正式回答之前,先把你發給它的內容理解一遍)快9倍,解碼(模型個字一個字把答案寫出來的過程)快15倍。
最后的最后,
到了經典價格環節,
M3上線之后,Token Plan從固定時間刷新額度變成了固定token。Plus 6 億 token 49 元/月 ,Max 18 億 token 119 元/月 ,Ultra 55 億 token 469 元/月。
不得不說,
百萬上下文+動態工作流帶來的體感太不一樣了,
富足到連開發完后做個最小測試,
M3都給我模擬了七種場景,
我打算就把M3當做動態工作流的專屬模型了,
直接先來個一個月的Ultra試試看耐不耐用。
@ 作者 / 卡爾
最后,感謝你看到這里如果喜歡這篇文章,不妨順手給我們點贊|在看|轉發|評論
如果想要第一時間收到推送,不妨給我個星標
如果你有更有趣的玩法,歡迎在評論區聊聊
更多的內容正在不斷填坑中……
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.