7月20號(hào)我逛阿里云百煉平臺(tái)的模型庫,意外發(fā)現(xiàn)多了兩個(gè)新上線的模型。好奇點(diǎn)進(jìn)去試聽第一句,我直接愣了,還以為后臺(tái)錯(cuò)放了真人配音的成品。以前聽AI配音總覺得那股揮之不去的機(jī)械味兒,怎么躲都躲不開,這次千問真的把AI配音的門檻拉到了新高度。
![]()
現(xiàn)在AI語音合成早就不卷誰吐字更清晰了,大家卷的是能不能像真人一樣,說出帶溫度有情緒的話。這次千問把48kHz采樣率、母語級(jí)方言表達(dá)、高抗噪音色復(fù)刻這些能力全打包開放了,說不準(zhǔn)整個(gè)有聲內(nèi)容行業(yè)的生產(chǎn)邏輯都要被改寫。
很多做音頻內(nèi)容的朋友都懂,以前絕大多數(shù)AI語音合成工具,只能做到整段調(diào)整情緒。你想精準(zhǔn)要求某個(gè)字后加輕笑,某句話前帶上憤怒重音,根本做不到。想要這種細(xì)節(jié)效果,只能導(dǎo)出音頻后打開專業(yè)剪輯軟件逐幀調(diào),磨幾十分鐘才能出一段滿意的成品。
![]()
這次千問直接把情緒控制的粒度下放到了單字級(jí),真的踩中了所有創(chuàng)作者的痛點(diǎn)。用戶可以直接在文本里嵌入抽氣、輕笑這類結(jié)構(gòu)化標(biāo)簽,不用切去音頻編輯軟件,就能精準(zhǔn)卡點(diǎn)生成想要的情緒細(xì)節(jié)。你寫一段科幻劇的沖突臺(tái)詞,在關(guān)鍵質(zhì)問前插個(gè)憤怒標(biāo)簽,生成的音頻自然會(huì)帶逐漸拔高的質(zhì)問感,連呼吸停頓的節(jié)奏都貼得上劇情張力。
哪怕你記不住這些標(biāo)簽的具體寫法也沒關(guān)系,直接輸大白話指令就行。我試了下,讓模型做成帶笑意的小學(xué)一年級(jí)拼音老師,每個(gè)發(fā)音都放慢示范,生成的語音連語調(diào)上揚(yáng)的弧度,都和線下課堂的真實(shí)老師一模一樣。后來我又輸入懸疑旁白的要求,讓它屏住呼吸層層推高緊張感,生成的音頻里,腳步聲臨近的段落語速自然放緩,那種攥緊手心的壓迫感,根本不用后期二次加工。
把專業(yè)音頻師幾小時(shí)的調(diào)試工作,壓縮到幾行文字就能搞定,這才是這次升級(jí)最核心也最香的改變。
以前不少多語種語音模型,碰到小語種或者方言就容易翻車,要么聲調(diào)走形嚴(yán)重,要么字詞發(fā)音帶著明顯的普通話口音,本地人一聽就覺得別扭出戲。千問這次專門給方言模塊加了強(qiáng)化訓(xùn)練階段,避開了通用語音訓(xùn)練磨平方言特征的問題,最終做到20種方言的韻律、聲調(diào)都貼近母語者的表達(dá)習(xí)慣。
你只要輸入一句“輸出上海話”,后續(xù)扔進(jìn)去日常吐槽的文本,就能直接生成地道的滬語口語,連本地人才常用的語氣助詞都拿捏得恰到好處。出海場(chǎng)景這邊,Plus版本覆蓋的16種語言里,10種語言的字詞錯(cuò)誤率拿到行業(yè)第一,全部16種語言的說話人相似度評(píng)測(cè)拿下最優(yōu)成績(jī),之前國產(chǎn)模型表現(xiàn)偏弱的韓語、馬來語,這次提升幅度格外明顯。
Flash版本也拿到了15項(xiàng)說話人相似度評(píng)測(cè)的第二名,兼顧低延時(shí)和高音質(zhì)的特性,剛好適配實(shí)時(shí)交互類場(chǎng)景的需求。
之前不少跨境音頻產(chǎn)品做多語種配音,得找不同國家的真人聲優(yōu)錄制,不僅成本高,項(xiàng)目排期往往要等一兩周。現(xiàn)在用這套模型,幾小時(shí)就能完成全語種版本的內(nèi)容生產(chǎn),效率提升的幅度,直接重構(gòu)了跨境有聲內(nèi)容的生產(chǎn)節(jié)奏。
常規(guī)的聲音復(fù)刻流程,往往要求用戶上傳的參考錄音足夠清晰無雜音,背景里只要有地鐵報(bào)站、咖啡館白噪音這類干擾,復(fù)刻出來的音色就容易走形,連原本的辨識(shí)度都丟了大半。很多創(chuàng)作者想復(fù)刻老有聲書里的主播音色,翻遍素材庫找不到無雜音的純凈片段,只能被迫放棄。
這次千問在訓(xùn)練環(huán)節(jié)加入了大量真實(shí)聲學(xué)環(huán)境仿真樣本,把語音增強(qiáng)能力直接嵌入了聲音復(fù)刻的全流程。模型會(huì)自動(dòng)過濾掉參考音頻里的背景噪聲和混響干擾,精準(zhǔn)提取出說話人本身的音色特征。哪怕你手頭的參考素材是從老里截出來的帶環(huán)境音的片段,也能生成辨識(shí)度足夠高的復(fù)刻語音。
輸出規(guī)格上的升級(jí)也很實(shí)用,音頻采樣率從常見的24kHz升到48kHz,已經(jīng)達(dá)到專業(yè)錄音室母帶級(jí)的采樣標(biāo)準(zhǔn)。單次合成最長(zhǎng)支持3分鐘,完全能覆蓋絕大多數(shù)單段有聲書章節(jié)、短旁白、游戲劇情配音的時(shí)長(zhǎng)需求。首包延時(shí)壓到300ms級(jí)別的Flash版本,還能直接嵌入實(shí)時(shí)語音助手、直播實(shí)時(shí)轉(zhuǎn)配音這類對(duì)低延遲有要求的場(chǎng)景。
放在以前,要做一套帶多語種、多方言版本的情緒化有聲內(nèi)容,你得配齊聲優(yōu)、音頻師、后期剪輯至少三四人的小團(tuán)隊(duì),單人創(chuàng)作者根本扛不住這么高的時(shí)間和人力成本。現(xiàn)在這套能力直接在阿里云百煉開放調(diào)用,哪怕是個(gè)人有聲書博主,花十幾分鐘調(diào)完指令,就能生成媲美專業(yè)工作室出品的配音內(nèi)容。
很多人沒意識(shí)到,AI語音從“能開口說話”進(jìn)化到“會(huì)帶情緒表達(dá)”,本質(zhì)上是把過去只有專業(yè)音頻團(tuán)隊(duì)能掌握的生產(chǎn)工具,下放到了每一個(gè)普通創(chuàng)作者手里。過去你想做方言有聲書,得找地道的本地人錄幾十小時(shí)音,現(xiàn)在對(duì)著文本輸指令就能生成母語級(jí)的地道內(nèi)容,小語種出海的配音成本直接降到了原來的十分之一。
這次登頂全球榜單的Qwen-Audio-3.0-TTS-Plus,它的預(yù)覽版早在一個(gè)月前就摸到過榜單第一的位置。這說明國產(chǎn)語音合成能力的領(lǐng)先,已經(jīng)不是偶然的單次跑分高光,而是全維度能力系統(tǒng)性提升之后的必然結(jié)果。
![]()
接下來的一兩年里,我們會(huì)看到大量過去因?yàn)榕湟舫杀咎邲]法落地的小眾有聲內(nèi)容、方言本地化內(nèi)容、多語種出海內(nèi)容集中爆發(fā)。技術(shù)的終極意義從來不是做出跑分第一的參數(shù),而是讓每一個(gè)普通人腦子里的故事,都能毫無阻礙地用聲音講給全世界聽。原來被卡住的聲音入口,現(xiàn)在正在徹底敞開。
參考資料:人民日?qǐng)?bào) 國產(chǎn)千問語音合成大模型登頂全球評(píng)測(cè)榜單
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.