鳳凰網(wǎng)科技訊 7月20日,阿里千問今日發(fā)布語音合成大模型Qwen-Audio-3.0-TTS,包含面向?qū)崟r交互的Flash版本(首包延時300ms級別)和面向高質(zhì)量生成的Plus版本。官方表示,新模型在細(xì)粒度標(biāo)簽控制、指令遵循、多語種覆蓋及聲學(xué)魯棒性等方面實(shí)現(xiàn)系統(tǒng)性提升。
![]()
在全球第三方權(quán)威榜單Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus斬獲冠軍,Elo評分達(dá)1237。該模型支持在文本中嵌入[gasp]、[giggles]等結(jié)構(gòu)化標(biāo)簽,對語氣、情緒和呼吸細(xì)節(jié)進(jìn)行精準(zhǔn)調(diào)控。音頻輸出從24KHz提升至48KHz,單次語音合成可達(dá)3分鐘。
![]()
模型覆蓋中、英、日、韓、德等16種語言,并支持廣東、重慶、東北、上海、四川、云南等20種方言。配套音色庫將陸續(xù)上架指令風(fēng)格、方言及多語種音色。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.