金磊 發自 上海
量子位 | 公眾號 QbitAI
剛剛,生圖圈殺出一個新國產模型——
不僅原生8K直出,還是會自己打草稿、做設計、檢查作業的那種!
瞧,下面這張超超超超長的8K圖,就是它做出來的:
![]()
這幅超長卷的主題,是“WAIC九周年2018—2026”;從左往右,時間依次鋪開,并且把每一屆的亮點內容都涵蓋了進來。
或許你會有疑問了,這么大的圖,細節能穩嗎?
好問題,我們這就“拿著放大鏡”再細細品鑒一下
![]()
字字清晰,字字清晰。
這,便是商湯剛剛在WAIC 2026上最新發布的的新模型——日日新SenseNova U1 Pro。
簡單來說,U1 Pro是一套面向復雜多模態任務的交付系統,它要圍繞目標完成理解、規劃、信息組織、多模態生成、檢查修正和最終交付,內核是理解、生成、行動的原生統一。
在看完整體的發布之后,我們可以把U1 Pro的亮點歸攏為如下三點:
- 原生8K輸出:重點不只是像素更高,還在于超大畫幅里繼續維持文字、構圖和細節;
- 圖文交錯思維:模型可以圍繞目標連續完成草圖、細化、著色、檢查和調整;
- 面向成品交付:商湯瞄準的場景包括信息圖、城市規劃、影視分鏡、學術海報和商業設計,希望模型少一些反復抽卡,多一些真正能拿去用的結果。
如果說以前的生圖模型,比的是誰畫得更像、誰出圖更快,那U1 Pro更像是把問題再往前推一步:
一張圖能不能少靠人收拾殘局,自己把整套活做完?
為了檢驗U1 Pro真實效果,我們又給它出了四道題。
生成8K版“二十四節氣”
第一個實測,繼續考驗一下U1 Pro的超長畫幅。
我們讓它圍繞二十四節氣,生成一張橫向展開的8K長圖。
這個任務其實考的還是AI抓細節的能力,比如24個節氣的名稱和順序不能亂;每個節氣要對應合適的物候與季節顏色;24個豎向單元需要彼此區分,同時保持完整的視覺風格;從春到冬的色彩也要自然過渡。
來看下U1 Pro生成的圖:
![]()
從整體看,模型確實把24個節點放進了同一套橫向版式里。
它沒有把結果處理成24張尺寸相同、彼此無關的壁紙。每一格的山水高度、植物位置和留白都在變化,畫面因此有了類似屏風和長卷結合的節奏。
所以U1 Pro已經是穩穩能夠輸出8K超長圖的選手了。
第二個實測,我們讓它設計一張高級實驗室視覺海報,主體就叫做《機器如何觀察和理解人類》。
Prompt要求畫面中央出現一位背對鏡頭、略微側身的人物,頭部和上半身疊加檢測框、坐標軸、幾何圓、運動軌跡、視線追蹤、空間網格和數據節點。
![]()
來看下細節:
![]()
比較意外的是,一般生圖模型只要提到的“科技”、“機器人”等關鍵詞,大多數可能都會選擇科技藍的色調。
但U1 Pro直接避開了這一點,暗金線條、黑色背景與紙張顆粒感,形成了比較完整的視覺層級。中心焦點明確,信息量很高,畫面卻沒有完全失控。
第三道題,是一幅琉璃質感的古風建筑山河圖。
要求里同時出現青綠色山脈、藍色河流、瀑布、寶塔、山門、亭臺、廊橋、宮殿、桃花林、松樹、祥云,以及一座帶有東方結構語言的未來建筑。
材質方面,山體要像琉璃、玉石和琺瑯共同燒制,表面有流動高光、釉面層次和金色描邊;水面要有通透感和反射;建筑則不能變成廉價的3D模型。
![]()
U1 Pro生成的結果如下:
![]()
從最終生成圖來看,模型能夠把琉璃山體、水系、古建和未來建筑組織成相對完整的世界,已經體現出它對復雜風格要求的執行力。
前三題全是大場景、超長圖和復雜排版,因此,最后一個任務,我們嘗試一下可以直接交付的、商業化的電影海報。
Prompt如下:
設計一張原創電影海報,整體為高完成度、可直接上映宣傳使用的成片海報,氣質介于東方詩意、懸疑史詩與現代藝術電影之間,具有強烈的視覺沖擊力和高級審美。
![]()
最終結果中,依舊是字字清晰,并且整體效果就是那種可以直接商用的感覺!
四道題看下來,U1 Pro的長處并不只在8K。
它更擅長圍繞一個完整目標組織畫面,把信息、版式、人物、材質和風格放進同一次任務里。
除此之外,像結構圖、可商用圖等等,U1 Pro都是能hold得住的
從一次生圖,到自己檢查
實測中幾張圖的共同點,已經不只在畫質。
無論是二十四節氣長圖,還是復雜海報和琉璃山河,U1 Pro都需要同時記住多組要求,并在同一張畫面里持續處理信息、構圖、風格和細節。
這也對應了當前生圖工具里一個很實際的問題。
如今不少模型已經可以通過自然語言反復修改,但任務稍微復雜一點,結果依然容易失控。改對一個局部,其他區域跟著變化;畫面看起來很專業,文字和結構卻經不起檢查;多改幾輪后,紋理、人物和背景也可能逐漸跑偏。
商湯CEO徐立在現場將這一問題概括為:
能交互,不等于能交付。
![]()
U1 Pro選擇的方向,是把一次生圖拉長成一套連續的創作流程。
這里所說的“思考”,并非向用戶展示一長串文字推理,更接近圖像與文字交錯進行的連續創作。
在商湯聯合創始人、首席科學家林達華與量子位的交流過程中,他表示:
商湯在U1階段已經觀察到連續創作的雛形。模型可以先畫草圖,再補充細節、著色,逐步生成完整圖像。團隊也由此看到,視覺模型有機會接近設計師的工作方式,將生圖能力推向內容設計的真實生產環節。
由此,進入U1 Pro后,這套流程進一步擴展成一條閉環:
理解目標、規劃任務、組織信息、生成內容、檢查問題、持續修正,最后完成交付。
以我們最開始展示的WAIC九周年長卷為例,模型要先消化九年資料,再決定事件如何分布、年份之間如何銜接、山水和城市怎樣組織、文字信息放在哪里,最后還要保持統一的東方視覺風格。
原生8K,難點遠不止多幾個像素
雖然8K直出,是這次U1 Pro非常亮眼的一個標簽,但分辨率大幅提高背后帶來的難度,也是同倍增加。
因為分辨率越高,視覺Token數量也會增加,Attention的計算量和顯存占用隨之上漲。
對此,商湯采用的一個關鍵方案是使用32×32的大Patch。
正如林達華所說,常見生圖模型可能采用16×16 Patch,如果一個Patch對應一個或一組Token,邊長擴大一倍后,視覺Token總數可以降到原來的四分之一。
這相當于把一張圖劃分成更大的格子,格子少了,計算壓力會降低;但與此同時,大格子也更容易丟細節。
為了解決這個問題,團隊又加入了自適應Noise Control,對細節區域使用更有針對性的訓練策略;Patch之間保留一定重疊,同時在空間采樣、Loss設計和模型結構上進行優化。
這些手段共同控制上下文規模,避免8K帶來爆炸式增長,同時盡量保住小字、紋理和結構。
總結來說,U1 Pro把格子放大,先減少總量,再通過重疊和更精細的訓練,把大格子內部的細節找回來。
生圖,也在復刻AI Coding的路
從行業角度看,U1 Pro更值得關注的地方,是它對應了一次產品范式變化。
要理解這種變化,我們其實可以看下一下AI Coding。
AI Coding最早是Copilot,幫助專業開發者補全代碼;接著是Vibe Coding,用戶用自然語言表達需求;再往后,Coding Agent開始拆解任務、寫代碼、調用工具、測試和修復,承擔完整工程。
![]()
模型價值也從“寫了多少行代碼”,轉向“能不能把項目做出來”。
而多模態的內容,也正在出現相似變化:
- 第一階段是單點生成。
- 第二階段是意圖驅動,用戶可以持續修改。
- 第三階段則指向系統級內容交付。
模型不只生成一張圖,還要理解目標、組織信息、保持長程一致性、檢查錯誤,并交付可以使用的結果。
![]()
Coding給商湯帶來的啟發,是一項技術一旦突破工業紅線,真正帶來生產力變化,就有機會打開更大的商業空間。
商湯由此判斷,圖文交錯思維和理解生成統一,也可能打開視覺設計這條差異化賽道。
當然,U1 Pro目前還不能說是完美。
因為異步生成意味著用戶要用等待時間換更高完成度;編輯能力、成本和穩定性仍需真實項目驗證;專業設計場景也不會只依賴一張最終圖片,圖層、矢量元素、版本管理和團隊協作同樣重要。
但可以確定的是,方向已經變得清楚——
當生圖告別反復抽卡,開始對結果負責,多模態Agent的競爭,才算真正開場。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.