從生態說起
封面這張圖,是我上周六參加 MiniMax 北京場 DevMeetup 的時候拍的,當時做了場分享《奇觀時代:我們應該 build 什么》
![]()
所謂奇觀時代,是「Agent 的能力越來越強,人人都能造奇觀」,在生產力大爆發時代,大家都能說 I can,但越來越難回答 why me
很顯然,我是文明玩家,也是p社玩家
那么,在這個時代,我們可以怎么做呢?我的想法是不執著于每次 build 出來的產品,而是通過 build 進入生態、獲取認可,然后與行業一同發展
這些想法一直縈繞在心頭,但卻也不甚清晰:都能造東西,憑什么機會給你?
適逢上周 MiniMax 發布了視頻模型 h3,很多國內外開發社區里的開發者、創作者已經有了豐富探索。這些驚艷的工作,一直在刺激著我的大腦皮層,想法才逐漸清晰了下來,也便記錄于此
![]()
折騰的權利
對比與成品模型,開源給人們最大的權利,我能隨意的「調用、魔改」并且沒有很多詭異的約束,比如來生成個寶可夢
作為更多例證,H3 開源一周,B 站和 YouTube 上冒出來大量技術內容,各種語言都有,量化、LoRA 加速、工作流封裝、顯卡適配
![]()
也比如有 UP 做了一套加速 LoRA 和雙時鐘采樣器,把原本二十步左右的采樣壓到四步出片
![]()
YouTube 上一個叫 Tensor Alchemist 的創作者,去測了 H3 在 8GB 顯存上跑 FP8 和 INT8 的效果對比,評論區一堆人跟著復現,同一時間,也有許多韓語、日語、西班牙語的部署教程...技術無國籍的具像化了算是
![]()
而官方也在此間開了一場 AMA,要點如下,不贅述了:
![]()
恍惚間我想到了三年前 ControlNet,當時張呂敏還是斯坦福在讀,一個人寫了個方法,改了整個圖像生成的工作流,后來的事情大家都知道了:ControlNet 成為了當時幾乎每個圖像生成工具的基礎組件
當然,我不是在說天才的敘述,而是想表達:當一個東西足夠開放,你根本不知道誰會在上面做出什么來
生產可以不是閉門造車,而是變成一個開放的、可疊加的過程
開放,是一種身位
前幾天的時候,我在 AGI Bar 部署了兩臺 DGX Spark,給大家提供免費無限量的 Token,反響還算不錯,引起了不少討論
![]()
但網上也有一些聲音問道:這怎么賺錢?是不是參了點不純的?...我上面確實也提供了免費的老北京豆包
...這些質疑在我看來挺離譜的,這種東西就是提供一個由頭讓大家相聚,在一個生態環境,能一起把更多的事情做好
大家都說 Token 以后會變成水電網一樣的基礎設施,咱們把推理盒子理解成一個大點的路由器就好了...路由器需要什么商業模式?
而我只是負責把這些東西裝起來,開了個內網接口而已,并沒啥;
其實我還打算把 H3 部署上去,畢竟剛剛英偉達的 SANA 團隊,主動給 H3 做了推理加速,在 DGX Spark 上實現了 3.92 倍加速,在 RTX 5090 上 4.52 倍
![]()
模型是開放的,所以所有人都有資格在上面 Build,每一個 Builder 都在擴大這個模型的生態邊界
還有一點,就是合規
今天頭部視頻模型的質量都很好,但在自由度上都必須有很大的取舍,比如如果想生成寶可夢,各種閉源模型一定做不到,它會從風控的角度直接把內容卡掉...甚至寶可夢公司自己,也不能生成自己的版權內容
這算不算一種荒誕?合規保護了版權,但連版權所有者自己都失去了操作空間。開源沒有這個問題。開源模型只負責提供能力,不負責判斷你的意圖
![]()
一路而來的人
回到本文標題:大家都能說 I can,但越來越難回答 why me
這個標題是來自于tianzhou,我覺得非常有道理
首先得承認:你哪有 Fable 聰明?哪有 GPT 聰明?...你和 xx 一樣聰明
以前缺的是技能與執行,而現在許個愿就能有了,大家都是 Agent 干活,那么為什么是交給你的 Agent 干活?我覺這是一個必須要回答的問題
對此我是覺得:去做模型生產不出的東西,比如信任
模型可以生產代碼、圖像、視頻,但它生產不了信任,大家都知道你是誰,知道你做過什么
![]()
之前有個段子“在 AI 領域,只要你學的足夠慢,就啥也不用學了”
這話有玩笑的成分,但也不全是。過去幾年,我們見過太多生態起起落落,比如 WebUI、GPTs、Stable Diffusion...等等等等,這些現在多半退了環境。幸災樂禍的人說:我就說吧,這些東西沒用
但你仔細去看今天那些在各領域做出真正成果的人,幾乎全是當初在這些生態里折騰過的老手。為什么?手感這東西,真沒法速成
你今天打開一個視頻 Agent 工具,可能覺得也就那么回事:不就是對著一個 chatbot 的許愿嗎?但如果你從 Stable Diffusion 那個時代就開始折騰,你會知道:一致性為什么難做,LoRA 到底是用來解決什么問題的,txt2img 和 img2img 的邊界在哪里,為什么同樣的提示詞在不同模型上差那么多?
AI 使用工具這件事,很多人覺得:不就是個 MCP 嗎?但我們是如何走到這一步的?
最早的時候,是有人發現可以誘導模型生成結構化文本,比如 XML。然后這些技巧被驗證可行,接著被訓進模型里,有了 function calling、json mode、struct output。再往后才有了 MCP、Skill、A2A 這些標準化的協議和框架
![]()
以往,我們的每一次進步,都是都是有人卡住然后想辦法繞過去,再把解法分享出來...就這么一層層堆起來的
我常說 AI 時代要練出我們的內功與外功:內功是你自己知道原理,知道什么能做什么不能做,知道怎么調度。外功是別人知道你的功底,知道生態里的種種是你做的,知道你是值得信任的,知道你能 Build
![]()
最后
開源這個動作,本身很難直接給企業帶來即時的財務回報,這回避不了。但它對整個行業的價值,那是難以估量的
我特別喜歡黃宗羲的一段話,也時常用以自省:大丈夫行事,論是非,不論利害;論順逆,不論成敗;論萬世,不論一生
對于喜歡折騰的人來說,能夠在一個不斷生長的東西里,留下了自己的痕跡,然后看到不斷有人繼續建設,這才是生態真正的魅力
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.