![]()
新智元報(bào)道
![]()
直出8K長(zhǎng)卷,中國AI還是首次!
就在今天,WAIC大會(huì)上,商湯正式發(fā)布下一代「滿血旗艦」——日日新SenseNova-U1 Pro。
這是業(yè)界頭一回,把「看懂、生成、動(dòng)手」原生做進(jìn)了同一個(gè)多模態(tài)基座的底層。
現(xiàn)場(chǎng),商湯科技董事長(zhǎng)兼CEO徐立揭曉了一幅為WAIC九周年特制的「東方城市長(zhǎng)卷」——《智會(huì)世圖》。
![]()
8K超清巨制,受限于上傳規(guī)格,畫質(zhì)有所壓縮
從2018到2026,滿城人物、山水樓閣、市井百態(tài),盡數(shù)收進(jìn)這一卷里——看到它,很難不想起《清明上河圖》。
而這么大一幅、鋪滿整面迎賓墻的畫,竟然是U1 Pro直出的。
換個(gè)場(chǎng)景,張張能交差
但一張全景圖,還裝不下它的全部本事。
東方長(zhǎng)卷 · 盛唐長(zhǎng)安西市
![]()
這張圖的細(xì)節(jié)堪稱恐怖。在21:9的超寬畫幅下,盛唐的煙火氣撲面而來。
畫面中足足塞進(jìn)了五十多號(hào)人物,最絕的是完全沒有AI常見的「復(fù)制粘貼」敷衍感。
放大來看,騎馬的官員、樂師彈琵琶、賣香料的胡商、追燈籠的孩童,每一個(gè)角色的神態(tài)、動(dòng)作和服飾制式都精準(zhǔn)獨(dú)立。
朱紅、赭石、深藍(lán)、琥珀金四色鋪開,燈籠暖光撞上夜色冷調(diào),全在一次生成里落定。
電影海報(bào) · 雨夜來信
![]()
一張民國上海的懸疑電影海報(bào)。
雨夜的街頭,玻璃倒影里藏著三個(gè)人物——
AI畫面沒有簡(jiǎn)單粗暴地將偵探、神秘男和送信人「貼」在背景里,而是嚴(yán)格遵循了真實(shí)的物理空間關(guān)系。
通過老式郵局玻璃、雨水與薄霧的多層折射,將這三位敘事人物精妙地隱藏在倒影中,空間景深與懸疑張力直接拉滿。
片名帶著手寫的墨跡,就連演職員表都巧妙地被「加密」的黑線代替。氛圍、光影、文字、構(gòu)圖,一次到位。
動(dòng)畫海報(bào) ·二次元樂隊(duì)
![]()
一張8K的國風(fēng)二次元樂隊(duì)《長(zhǎng)安未眠》舞臺(tái)海報(bào),簡(jiǎn)直令人拍案叫絕。
五個(gè)人,五種樂器,五套不重樣的國潮打扮,U1 Pro極其聰明地處理了群像排布。
背景中,水墨山河化作金色的聲波和飛鳥,與頂部的中文「長(zhǎng)安未眠」完美契合。朱紅、墨黑與鎏金的光影碰撞,把那種「盛唐賽博」的舞臺(tái)炸裂感直接拉到了最高。
商業(yè)廣告 · 山嵐高山烏龍茶
![]()
再看一張奢侈品級(jí)的茶葉廣告,最考驗(yàn)的是材質(zhì)和文字。
啞光紙盒、燙金字、薄胎白瓷、胡桃木桌、裊裊茶湯蒸汽——五種質(zhì)感堆在一張圖里,任何一處露出塑料感就廢了。
展覽海報(bào) · 山河入畫
![]()
換到平面設(shè)計(jì),這張圖的高級(jí)感,是那種可以直接掛在頂級(jí)美術(shù)館門口的水平。
U1 Pro極其聰明地處理了「二維與三維」的打破與重組,底部的山體還是帶著在宣紙上洇開的墨跡,往上走,竟順滑地變成了有真實(shí)光影的3D巖石和云層。
朱紅色的絲帶貫穿山谷,與山腳下極小的白衣人物形成鮮明對(duì)比,那種「寄蜉蝣于天地」的宏大尺度感撲面而來。
而且,標(biāo)題、展期、地點(diǎn)、開放時(shí)間,不僅干凈利落,而且一個(gè)字都沒寫錯(cuò)。
![]()
老實(shí)說,在生圖領(lǐng)域,「長(zhǎng)文本排版」和「物理科學(xué)邏輯」是公認(rèn)的兩座大山。
但U1 Pro的成圖,直接把這兩座大山給推平了。
《月相》中文科普海報(bào)畫面中,從主副標(biāo)題、四段密集的科普正文,到圖注、底部知識(shí)卡片,幾百個(gè)漢字竟然做到了逐字精準(zhǔn),零錯(cuò)字、零亂碼、零「AI偽漢字」。
更絕的是,AI常常缺乏空間物理常識(shí),但U1 Pro精準(zhǔn)構(gòu)建了「日-地-月」的位置關(guān)系示意圖。
信息設(shè)計(jì) · 中國茶的六大茶類
![]()
信息圖再進(jìn)一步:六個(gè)模塊環(huán)繞中心茶杯,茶名、茶湯色、產(chǎn)地、山水小插畫各就各位,幾十處中文零亂碼,配色克制、邏輯清楚——一張能直接掛上博物館展板的圖。
從繁華長(zhǎng)卷到商業(yè)廣告,從科普卡片到電影海報(bào),同一個(gè)模型,一口氣全包了。
![]()
這張《嵐月》角色設(shè)定圖,足以證明了U1 Pro具備了「主美級(jí)」的落地能力。
在這個(gè)二次元原創(chuàng)角色設(shè)定集中,AI一并繪制了主圖,以及三視圖、四個(gè)動(dòng)作圖、技能特效,外加一堆裝備細(xì)節(jié)和中文資料卡。
角色面部、復(fù)雜苗族銀飾、多層蠟染裙甲,在所有視角下保持絕對(duì)統(tǒng)一。
接下來,讓U1 Pro和GPT Image 2進(jìn)行一場(chǎng)「硬碰硬」的實(shí)戰(zhàn)。
在同一提示詞下,究竟誰的成圖更勝一籌?話不多說,直接看效果。
先來看看這道「麻婆豆腐」菜譜圖。 從整體觀感來說,U1 Pro贏在了「清爽」。
它知道菜譜的重點(diǎn)就是食材和做法,所以果斷去掉了花里胡哨的背景,讓人一眼就能抓住關(guān)鍵信息。
相比之下,GPT的畫面就顯得有些「用力過猛」了。
不僅整體色調(diào)偏黃,還在邊邊角角塞滿了川蜀建筑,讓整個(gè)畫面顯得十分擁擠、不夠直觀。
最致命的是它還加入了大量文字,結(jié)果弄巧成拙,比如角落里的印章,上面全是看不懂的「AI造字」,直接讓人出戲。
![]()
![]()
把一位設(shè)計(jì)師,裝進(jìn)模型里
這些圖隨便拎一張出來,都像出自專業(yè)設(shè)計(jì)師之手。
發(fā)布會(huì)上,SenseNova U1 Pro的官方定位是——面向復(fù)雜多模態(tài)任務(wù)的交付系統(tǒng)。
![]()
對(duì)此,商湯科技聯(lián)合創(chuàng)始人、首席科學(xué)家林達(dá)華給它概括了個(gè)更一目了然的名字:創(chuàng)作模型。
區(qū)別就在「創(chuàng)作」兩個(gè)字。
傳統(tǒng)的AI生成流程是:你輸一段prompt,它出一張圖。不推敲、不打草稿,成不成看運(yùn)氣。
但U1 Pro不一樣,它干起活來更像是個(gè)會(huì)思考的設(shè)計(jì)師。
在接到需求之后,U1 Pro會(huì)先想版式、打草圖,然后還會(huì)回頭審一遍對(duì)不對(duì)味,再一塊塊填細(xì)節(jié),最后統(tǒng)一調(diào)色、精修。
這一整套「看—改—想下一步」的背后,是Agentic Generation Loop數(shù)十輪的長(zhǎng)程迭代。只不過復(fù)雜的思維鏈被壓在底層,交到你手里的直接就是成品。
就像Coding模型交付的不是軟件,是一個(gè)會(huì)敲代碼的程序員;U1 Pro交付的,是一個(gè)活在數(shù)字里的設(shè)計(jì)師。
而設(shè)計(jì)師和抽卡機(jī),差的就是能不能交付。
錯(cuò)一個(gè)字,就是0分
舉個(gè)例子。
一張100個(gè)字的圖,錯(cuò)1個(gè)字,普通生圖模型按平均分算還能給你99;可到了交付級(jí),錯(cuò)1個(gè)字整張圖就是0分。畢竟誰也不想等海報(bào)貼滿了大街,才猛然發(fā)現(xiàn)角落里還躺著一個(gè)錯(cuò)字。
為了驗(yàn)證U1 Pro的成色到底怎樣,商湯特地請(qǐng)來200位美院學(xué)生和設(shè)計(jì)師組成評(píng)審團(tuán),給每張圖打分——
如果你是設(shè)計(jì)師,你敢不敢把它交給客戶?
如果一批圖里有六成敢直接交給客戶,才算合格。
目前,能夠做到這一步的只有兩個(gè)模型。一個(gè)是U1 Pro,另一個(gè)是GPT-Image-2;甚至在文字、設(shè)計(jì)感、東方細(xì)節(jié)上,U1 Pro還稍勝一籌。
原生統(tǒng)一架構(gòu)NEO-unify
為了夠到這個(gè)標(biāo)準(zhǔn),U1 Pro采用的是一套自研的理解生成統(tǒng)一架構(gòu)——NEO-unify。
它砍掉了傳統(tǒng)多模態(tài)里VE(管理解)和VAE(管生成)這兩個(gè)獨(dú)立的編解碼組件,讓理解、生成、行動(dòng)共用同一套表征、同一套計(jì)算。整個(gè)模型,就是一套渾然一體的Transformer。
![]()
生成過程中,沒有專門的調(diào)度器指揮,模型所做的就是一路往下預(yù)測(cè)下一個(gè)token——寫著寫著,它自己判斷「該出圖了」,就切進(jìn)圖像token接著畫,畫完再切回文字。
文字和圖始終跑在同一條自回歸序列上,像說同一種「語言」,不靠外掛、不靠工具在中間對(duì)齊。
這么做的好處是,模型學(xué)得又快又省,十分之一的數(shù)據(jù)就能追平頂尖SOTA;而且結(jié)構(gòu)簡(jiǎn)單、天然好scale,訓(xùn)練和推理的成本也遠(yuǎn)低于谷歌和OpenAI。
采用NEO-unify架構(gòu)后,商湯在今年4月率先發(fā)布了SenseNova U1一個(gè)輕量級(jí)的開源模型,并且在5-7月升級(jí)多個(gè)基于U1的infographic-V1、V2和V3版本。
![]()
在多項(xiàng)信息圖生成基準(zhǔn)中,SenseNova U1展現(xiàn)出降維打擊般的實(shí)力:生成質(zhì)量全面領(lǐng)跑開源陣營,更在推理速度上實(shí)現(xiàn)了絕對(duì)的效率壓制。
![]()
![]()
圖文交錯(cuò)思維
對(duì)于普通生圖來說,或許可以一筆直出。但一張交付級(jí)的圖,得像設(shè)計(jì)師那樣反復(fù)推敲、邊看邊改。
這份「會(huì)思考」的本事,就來自「圖文交錯(cuò)思維」。
它不再一口氣把圖吐完,而是把創(chuàng)作拆成一套動(dòng)作空間:生成、編輯、局部重繪、組合。每往下走一步,都回看前面已經(jīng)落筆的部分,再?zèng)Q定下一筆怎么畫。
而調(diào)度這套動(dòng)作的本事,是訓(xùn)出來的。
冷啟動(dòng)階段,商湯先把設(shè)計(jì)師的專業(yè)判斷整理成「指令思維鏈」喂進(jìn)去打底,讓模型學(xué)會(huì)「先定版式、再鋪大色、最后摳細(xì)節(jié)」這樣的先后章法。
在此基礎(chǔ)上,再上強(qiáng)化學(xué)習(xí),用一個(gè)幾十維度一起打分的獎(jiǎng)勵(lì)模型:構(gòu)圖、文字準(zhǔn)確度、設(shè)計(jì)美感、整體一致性各算一筆,每出一張圖就反饋「哪好、哪不好」。
一輪輪打磨下來,模型就自己長(zhǎng)出了「下一步該干什么」的判斷。
8K直出,算力卻沒爆
除此之外,交付級(jí)的圖是要拿去印、經(jīng)得起放大的。
尤其像開頭那張鋪滿整面墻的長(zhǎng)卷,分辨率不夠,湊近一看全糊了。所以U1 Pro把原生分辨率頂?shù)搅?K。
但問題是,分辨率一上去,視覺token和算力就會(huì)跟著暴漲。
由于Transformer的注意力開銷隨token數(shù)量的平方走,token翻一倍,算力就是四倍。一張8K的圖攤成token,足以把上下文直接撐爆。
面對(duì)這一問題,商湯的解法是用32×32的大patch(普通生圖模型是16×16)來覆蓋住更大的畫面,從而把token量直接砍到四分之一。
不過,patch一大,每個(gè)token要「管」的像素更多,細(xì)節(jié)就容易糊。偏偏交付級(jí)最較真的文字和紋理,全藏在細(xì)節(jié)里。
為此,他們又提出自適應(yīng)的分級(jí)噪聲控制,在細(xì)節(jié)吃緊的地方多注入噪聲、逼模型多花力氣去摳,把丟掉的控制力補(bǔ)了回來。
一來一回,不僅上下文沒爆炸,8K大圖也能穩(wěn)定直出了。
會(huì)生成≠能交付
時(shí)至今日,AI生圖的戰(zhàn)場(chǎng)終于從「誰畫得更好看」,走向了最硬核的「拼交付」。
這條路,Coding已經(jīng)提前替所有人趟明白了——
從嵌進(jìn)IDE的Copilot,到動(dòng)嘴寫需求的Vibe Coding,再到今天自己規(guī)劃、執(zhí)行、驗(yàn)證的Agentic Coding。
變強(qiáng)的從來不只是模型能力,更是能調(diào)用這種能力的人越來越多。從專業(yè)程序員,跨界到產(chǎn)品、設(shè)計(jì),甚至覆蓋了每一個(gè)只要有想法的普通人。
![]()
在徐立看來,多模態(tài)內(nèi)容正在經(jīng)歷完全相同的演進(jìn)邏輯,只是它還卡在半路上。
這個(gè)瓶頸,就是「Reasoning Generation」。
從DALL·E、Midjourney到Nano Banana、GPT Image,AI第一次大規(guī)模解決了「生成美」。
你甚至能用大白話反復(fù)調(diào)它、改它。可一旦丟進(jìn)真實(shí)工作流,毛病立刻現(xiàn)形:局部改對(duì)了、整體崩了;專業(yè)內(nèi)容乍看沒問題、放大全是破綻;反復(fù)幾輪,紋理越改越臟。
最后吐出來的,還是一張沒法接著編輯、沒法直接用的半成品。
歸根結(jié)底,能生成,不等于能交付。可控,也不代表可交付。
![]()
圖像生成這十年,其實(shí)走過兩級(jí)臺(tái)階:先解決了「像」,又解決了「真」,細(xì)節(jié)越來越逼真。
而商湯想踩下的第三級(jí)臺(tái)階,是「美」,即通過專業(yè)級(jí)的設(shè)計(jì)美感,達(dá)到真正的工業(yè)交付標(biāo)準(zhǔn)。
這,正是U1 Pro想踩下去的那一腳。
就像代碼從Vibe Coding邁向Agentic Coding,創(chuàng)作也要從「Vibe Creation」邁向「Agentic Creation」。
不再是碰運(yùn)氣的氛圍感抽卡,而是模型自己不停反思、一步步把活干完。
從一張圖,到一個(gè)世界
但踩下這一腳,還不是U1 Pro的全部野心。
它底下那套「理解生成行動(dòng)」的統(tǒng)一架構(gòu),本就是個(gè)通用底座,視覺創(chuàng)作只是這回「專注做到極致」的第一站。
往后,通用視覺感知、空間智能、具身大腦、城市規(guī)劃、建筑設(shè)計(jì),都在射程里。
剛開源的SenseNova-Vision已經(jīng)露了苗頭。深度、遮擋、鏡面、近大遠(yuǎn)小,這些人類習(xí)以為常的視覺常識(shí),模型開始真正「看懂」了。
對(duì)此,林達(dá)華激動(dòng)地表示,這是他第一次瞄到「視覺涌現(xiàn)」的影子。
再往前,就是他掛在嘴邊的那句Words to Worlds——讓視覺和語言真正在一個(gè)空間里長(zhǎng)到一起。
他相信,語言的「GPT時(shí)刻」2022年底就到了,視覺的那一刻還沒來,而NEO-Unify,就是想給它先搭好地基。
但回到當(dāng)下,U1 Pro想證明的事其實(shí)很樸素:把過去只有少數(shù)專業(yè)人士才握得住的能力,交到更多人手里。
一杯咖啡的時(shí)間,一張能直接拿去印的高清圖。
這一次,「好看」不再是終點(diǎn),「能用」才是。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.