![]()
![]()
AI音樂開始進入“審美競爭”階段。
作者|周悅
編輯|栗子
7月19日,昆侖萬維在2026世界人工智能大會(WAIC 2026)上舉辦了“世界模型與多模態范式躍遷”論壇。
這場論壇的嘉賓橫跨學術、產業和文娛領域。從中國科學院院士周志華、Reactor AI CEO Alberto Taiuti,到清華大學交叉信息研究院助理教授、破殼機器人創始人許華哲、黎曼機器人創始人劉揚,再到黃曉明、王珞丹、《消失的她》導演崔睿、愛奇藝高級副總裁楊海濤和甲子光年創始人兼CEO張一甲,不同背景的嘉賓圍繞技術突破、內容生產和產業落地展開討論。
當天,昆侖萬維發布和升級了三款模型:可交互世界模型Matrix-3.5、AI音樂大模型Mureka V9.5,以及具身智能機器人模型Riemann-1.0,分別覆蓋可交互世界、音樂生成和具身智能。
其中,Mureka V9.5的升級最容易被現場觀眾感知。現場展示的Funk音樂一響,臺下觀眾整齊抬起頭。十幾部手機很快舉了起來,前排還有觀眾跟著節奏用腳打拍子。
Mureka V9.5配樂MV,視頻來源:昆侖萬維
圓桌上,黃曉明談起一次錄歌經歷,AI演唱的Demo“太完美了”,沒有換氣,也沒有呼吸感,聽起來反而“沒有人味”。他提到,真人不必再和AI比誰更完美,獨特的個性和表達才更重要。
![]()
國家一級演員、中國電影家協會副主席黃曉明,圖片來源:昆侖萬維
黃曉明還分享了今早使用Mureka的經歷。他讓模型生成了兩首歌,一首參考楊宗緯《空白格》的抒情氣質,另一首則借鑒他最近喜歡的顏人中,主題是“中年危機”。“還不錯,詞還挺觸動人心的。”他說。
王珞丹則認為,AI可以給自己的想法“增加很多翅膀”,但“決定往哪飛的權利要在我手里”。
![]()
“世界模型與多模態范式躍遷”論壇圓桌討論,圖片來源:昆侖萬維(從左至右分別為:甲子光年創始人張一甲,昆侖萬維董事長兼CEO方漢,中國電影家協會副主席黃曉明,演員王珞丹,愛奇藝高級副總裁楊海濤,青年導演崔睿)
在隨后接受「甲子光年」在內媒體采訪時,昆侖萬維董事長兼CEO方漢反復強調的關鍵詞是“克制”。
這也是Mureka V9.5此次升級的重點。過去,一些AI音樂模型習慣通過增加聲部、加厚音色和持續推高情緒來制造完成感,容易出現人聲被伴奏遮蓋、編曲擁擠、歌曲缺少起伏等問題。
Mureka V9.5沒有繼續增加音樂的復雜度,而是改善人聲、編配和曲風控制,讓生成結果更自然,也更貼合用戶的創作意圖。方漢將這一方向概括為“克制、真實、貼合創作意圖”。
與V9.5同時亮相的,還有基于這一底座的O3音樂推理擴展方案。前者提高生成質量和穩定性,后者通過推理時選優,讓更多作品接近模型的能力上限。
「甲子光年」認為,AI音樂已經跨過“能不能寫歌”的第一道門檻。下一階段的競爭,是模型能否作出更好的音樂選擇。
1.Mureka V9.5,讓AI音樂少一點“AI味”
一些AI音樂模型擅長通過密集聲部和厚重音色制造完成感,容易出現人聲被遮蓋、編曲擁擠和情緒缺少起伏等問題。
Mureka V9.5沒有繼續追求“更滿”,而是把重點放在人聲、編配和情緒之間的關系上。
中文流行歌曲《夜色緩緩》是其中一例。
它的提示詞包括柔和鋼琴、氛圍合成器、漸進式弦樂和貼近演唱的男聲,想要呈現的是“雨夜里未說出口的告別”,憂傷但溫柔,情緒從低聲訴說逐漸走向釋放,又不能顯得過分煽情。
這類歌曲考驗的是模型對分寸的控制。伴奏太重,人聲會被壓住;情緒推進太快,后半段便失去變化;弦樂進入得過早,也容易讓整首歌顯得用力過猛。
從這首Demo呈現的效果看,V9.5試圖讓伴奏、人聲和情緒層次保持更自然的關系。編配既要托住人聲,也要為人聲留出空間。
另一首《Melted Chrome》,重點變成了模型對復雜曲風的理解和還原。
提示詞要求的是迷幻的西海岸G-Funk街頭說唱,并進一步限定了滑動合成器低音、Moog哨音、Talkbox、Rhodes電鋼琴、哇音吉他和復古磁帶質感。鼓點要略微落后于節拍,人聲則要保持沙啞、松弛的質感。
提示詞還明確排除了Trap踩镲、Drill節奏和EDM式落點。模型不僅要識別G-Funk的核心元素,還要理解這些元素如何組合,才能形成低底盤夜間巡游般的迷幻氛圍。
對AI音樂來說,理解“不要什么”,有時和理解“要什么”同樣重要。識別一個曲風標簽并不困難,難的是讓音色、節奏、人聲和整體氛圍始終指向同一種表達。
前兩首作品主要展示V9.5對人聲、編配和曲風的控制,與之同時亮相的O3,則把重點放在全曲結構和情緒推進上。
《誤差》是一首極簡電子與Cosmic Pop風格的無人聲作品。提示詞以晶瑩的合成器脈沖、低頻氛圍和空間混響,描繪一座漂浮在軌道上的空間站,要求整首歌保持冰冷、空曠和緩慢的基調。
《Still in the Room》則轉向Dream Pop。混響吉他、漂浮感男聲、柔和的氛圍合成器,加上溫暖貝斯和松弛鼓組,構成一個獨處于房間中的夜晚。提示詞同時要求作品保留親密感和距離感,讓情緒緩慢展開。
這兩首作品都不依賴密集編配或明顯的副歌爆發,更看重氛圍能否貫穿全曲,以及局部變化是否破壞整體表達。O3所做的,是在V9.5提供的音樂基礎上,進一步檢查和調整這些選擇。
從中文流行到G-Funk,再到極簡電子和Dream Pop,四首Demo分別對應人聲與情緒、曲風控制和全曲一致性。Mureka V9.5展示的變化,不是加入更多聲音,而是讓每一種聲音更好地服務整體表達。
2.V9.5打底,O3提高優質結果的穩定性
Mureka此次升級包含兩個層次。
Mureka V9.5是音樂生成的底座模型,決定人聲、編配、曲風和情緒表達的基礎質量;O3建立在V9.5之上,通過推理階段的持續比較和選優,提高單次生成接近模型能力上限的概率。
簡單來說,V9.5負責抬高模型的基礎水平,O3則盡量減少優質結果對單次采樣運氣的依賴。兩者共同指向一個問題:如何降低AI音樂生成的隨機性。
這也是Mureka V9.5和O3此次最重要的亮點。它想做的不是偶爾生成一首好歌,而是把“好聽”拆解為可評測、可訓練、可部署,并能在推理階段繼續優化的系統能力。
在訓練階段,V9.5通過強化學習,同時改善整體聽感、創作控制和生成穩定性。在MusiCoT音樂思維鏈的基礎上,模型會先確定全曲的結構、曲風和情緒方向,再安排段落推進、樂器進出和強弱變化。
![]()
Mureka V9.5/O3發布,圖片來源:昆侖萬維
這種變化首先體現在結構與編配上。
主旋律需要突出時,其他聲部會相應退后;情緒尚未發展到高潮時,編配也不會提前加碼。所有音樂元素不再各自追求存在感,而是共同服務整首歌的表達。
第二項能力,是對復雜創作意圖的控制。一首歌的主歌、副歌和橋段承擔著不同作用。主歌通常負責敘事,副歌集中釋放情緒,橋段則完成轉折。模型如果只理解單句歌詞,便容易出現歌詞內容與音樂推進脫節。
V9.5需要判斷每段歌詞在全曲中的位置,再安排旋律、節奏和編配的變化。它不僅要把歌詞唱出來,還要讓音樂結構跟隨語義自然推進。
第三項能力,是人聲表達與情緒的匹配。AI人聲是否可信,并不只取決于音準和音質。同一句歌詞,在低聲講述和情緒釋放時,需要采用不同的唱腔和力度;伴奏也要隨之變化,不能始終保持相同的密度。
模型不僅要保證音準和音質,還要處理唱腔、情緒與伴奏之間的關系。例如,演唱方式是否符合歌曲氛圍,伴奏是否給人聲留下足夠空間,人聲的力度能否隨著段落自然變化。
第四項能力,是對復雜創作意圖的控制。用戶輸入的Prompt通常不只包含曲風和樂器,還可能同時涉及演唱方式、情緒變化、段落結構,甚至明確要求避開某些節奏和音色。模型需要判斷這些條件之間的主次,再把它們落實到旋律、節奏、人聲和編配中。
這是V9.5區別于關鍵詞拼接式生成的地方。識別出“G-Funk”“Dream Pop”或“中文流行”等標簽只是第一步,模型還要讓整首歌在音色、節奏、唱腔和整體氛圍上保持一致。
根據昆侖萬維的數據,在歌曲的主觀評分中,V9.5的指令精準度從6.92提高至7.62,旋律、人聲、音質和編曲等維度也有所改善。這說明模型不僅需要生成一首結構完整的歌,還要更準確地理解用戶究竟想創作什么。
![]()
Mureka V9.5等模型生成歌曲的主觀評分,圖片來源:昆侖萬維
底座模型的能力提高后,O3進一步處理生成過程中的偏差。
O3通過test-time scaling擴展MusiCoT的推理過程。模型不會按照最初的選擇一路生成到底,而是在生成過程中比較候選方案,并檢查局部旋律是否仍然服務全曲、編配是否遮蓋人聲、情緒是否提前釋放,以及段落結構是否偏離最初的提示詞。
發現偏差后,模型可以調整后續決策,讓旋律發展、編曲結構和情緒推進逐步回到全曲目標上。
由此,V9.5和O3形成了一條相互銜接的技術路徑:V9.5通過訓練提高底座質量與穩定性,O3再通過推理時優化,提高優質結果出現的概率。
Mureka形成了一條可以隨版本持續迭代的技術路徑,而不是依賴少數Demo或某一次采樣的運氣。
從這個意義上看,Mureka在模型層面的差異,不只是“能不能生成音樂”,而是能否把“好聽”從偶然結果,轉化為可評測、可訓練、可復現,并能在推理階段繼續優化的系統能力。
穩定生成更好的音樂只是第一步。Mureka的完整差異還包括版本化創作工具和平臺分發能力。模型負責提高作品質量,工具承接比較與修改,平臺則連接創作、發布和消費。
3.AI音樂開始進入“審美競爭”階段
過去,AI音樂最先吸引人的,是速度——幾十秒生成一首完整歌曲。但當“會寫歌”逐漸成為基礎能力,行業競爭也開始轉向更難的問題:模型能否理解取舍。
旋律什么時候推進,什么時候留白;什么元素應該保留,什么需要刪掉;同一個創意,能否沿著不同方向繼續發展。下一階段的差距,不只在生成速度,也在音樂判斷和創作控制。
「甲子光年」認為,AI音樂的“審美競爭”,并不是讓模型替用戶決定什么是好音樂,而是讓用戶的取舍和判斷更持續地作用于作品。
多數AI音樂工具仍以“一次生成”為基本單位。結果不滿意,用戶往往只能重新生成,此前滿意的旋律、人聲或段落也可能被全部改寫。
方漢強調,作為模型廠商,他們希望“讓提示詞寫得不好的人,也能做出更好的作品”,把模型的遵從性和易用性繼續往前推,降低普通人的創作門檻。
Mureka希望把創作從一次性生成,轉向版本化工作流。圍繞同一個創意,用戶可以快速生成不同版本,比較旋律、唱腔、編配和結構;滿意的部分可以保留,不合適的部分則可以單獨替換。
在產品層面,Mureka Studio承接了這套工作流。傳統數字音頻工作站需要創作者熟悉軌道、插件、混音和大量參數。Studio試圖把部分操作轉化為更直接的創作指令。
它改變的不只是操作方式,也是人與工具之間的分工。創作者的重心,也由執行具體操作轉向比較方案和作出審美判斷,也就是從“操作DAW”走向“指揮創作”。
對專業音樂人來說,V9.5生成的旋律、編曲和人聲可以成為繼續發展的素材;對普通用戶來說,不熟悉編曲和混音,也可以圍繞一個想法逐步完成作品。音樂由此不再只是供人收聽的內容,也可以用來記錄一段關系、一種情緒或一段記憶。
在產業端,游戲、短劇、影視和有聲內容需要大量穩定、可控的音樂素材。昆侖萬維也將游戲工業化、短劇量產、音樂創作平民化和影視降本增效列為重點落地場景。
Mureka此前已經開放API,服務于短視頻、游戲、播客和影視配樂等場景。 V9.5和O3進一步提高作品質量與生成穩定性后,模型能力也更容易通過Studio和API進入真實的內容生產流程。
Mureka的差異因此不只來自某一次生成效果,而來自模型訓練、推理時選優、版本化創作工具和平臺分發能力的組合。
當“會寫歌”不再稀奇,誰能讓用戶持續比較、修改和使用作品,才可能建立下一階段的優勢。
Mureka V9.5只是昆侖萬維此次WAIC發布中的一個模型,卻提供了一個更容易被感知的觀察窗口。
從Matrix-3.5到Mureka V9.5,再到Riemann-1.0,昆侖萬維試圖連接可交互世界、內容生成和現實行動。對Mureka而言,下一步也不只是生成更多歌曲,而是讓模型、工具與分發共同進入真實的創作流程。
(封面圖及文中視頻、音頻、配圖素材均來自昆侖萬維)
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.