![]()
如果你經(jīng)常使用 AI 語音助手,大概率也經(jīng)歷過這種令人血壓飆升的時(shí)刻:
你只是稍微停頓一下,AI 就急著打斷你開始輸出;或者一陣環(huán)境噪音,就被它誤判為你已經(jīng)說完。整個(gè)過程的交流就像是在嚴(yán)格遵循「你一句、我一句」的回合制。
![]()
為了解決這個(gè)問題,就在剛剛,OpenAI 正式推出了全新一代語音模型 GPT-Live。正如它的名字一樣,這一次,ChatGPT 的語音功能徹底「活」了過來。
據(jù)官方透露,目前每周有超過 1.5 億人使用 ChatGPT 的語音和聽寫功能來練習(xí)外語、講睡前故事或在通勤時(shí)打發(fā)時(shí)間。而從今天起,這 1.5 億人將迎來一次豆包式的進(jìn)步:
AI 不再是一個(gè)過于冷冰冰的問答機(jī)器,而是一個(gè)會(huì)用「嗯嗯」、「對(duì)啊」來給你墊話,會(huì)在你卡殼時(shí)安靜等待,甚至能在后臺(tái)瘋狂查資料的同時(shí),前臺(tái)還能若無其事陪你閑聊的「超級(jí)助理」。
![]()
告別「回合制」,AI 終于點(diǎn)滿了情商
要理解 GPT-Live 有多強(qiáng),我們得先看看過去的 AI 語音有多「笨」。
在早期(比如初代 ChatGPT Voice),AI 語音采用的是「級(jí)聯(lián)系統(tǒng):你說話 -> 語音轉(zhuǎn)文字 -> 大模型生成文字回復(fù) -> 文字轉(zhuǎn)語音 -> 播放給你聽。信息在三個(gè)模型間來回折騰,不僅慢得讓人抓狂,語氣也十分僵硬。
到了后來的 Advanced Voice Mode(高級(jí)語音模式),OpenAI 弄出了一個(gè)端到端的大模型,直接處理音頻流。延遲確實(shí)低了,但它依然沒有擺脫一個(gè)致命缺陷:回合制。
![]()
它必須死死盯著你的聲音,一旦檢測到「沉默」,就默認(rèn)你閉嘴了,然后立刻開始它的表演。這種基于「靜音檢測」的機(jī)制,導(dǎo)致它極容易被背景噪音誤導(dǎo)。
而 GPT-Live 帶來的底層架構(gòu),叫做「全雙工架構(gòu)(full-duplex)」。
這意味著,它終于可以「邊聽邊說」了。它不再是對(duì)講機(jī),而是一部真正的電話。模型每秒鐘都在做出無數(shù)次交互決策:現(xiàn)在該說話嗎?該繼續(xù)聽嗎?該停頓嗎?還是該打斷用戶?
![]()
落實(shí)到具體的體驗(yàn)上,這種改變是降維打擊級(jí)別的:
學(xué)會(huì)了「墊話」:當(dāng)你在長篇大論時(shí),GPT-Live 不會(huì)一聲不吭,它會(huì)適時(shí)地發(fā)出「mhmm(嗯嗯)」、「got it(懂了)」這樣的語氣詞。這種微小的反饋,能給你提供極大的心理安全感。
懂得了「閉嘴」:如果你對(duì)它說「讓我想一下」,或者在說話中途明顯卡殼,它會(huì)敏銳地捕捉到這種情緒,選擇安靜地等待。
抗干擾能力拉滿:哪怕你走在嘈雜的馬路上,旁邊有人大聲喧嘩,它也能精準(zhǔn)鎖定你的聲音,不再因?yàn)榄h(huán)境噪音而引發(fā)莫名其妙的打斷。
得益于「邊聽邊說」的特性,它甚至能勝任實(shí)時(shí)翻譯:你這邊話音未落,它那邊譯文已經(jīng)跟上,兩種語言可以在同一條對(duì)話里無縫交錯(cuò)。
為了配合這種極致的自然感,OpenAI 甚至將 ChatGPT 里的 9 種專屬音色全部進(jìn)行了重置(Remastered),讓聲音表現(xiàn)力更上一層樓。
前臺(tái)陪聊,后臺(tái)推理
如果說全雙工架構(gòu)只是讓 GPT-Live 變得更好聊,那么它在底層架構(gòu)上的另一次手術(shù),則直接暴露了 OpenAI 對(duì)未來 AI 產(chǎn)品形態(tài)的勃勃野心。
在過去,我們總是希望一個(gè)模型能搞定所有事:既要反應(yīng)快,又要能解微積分。但現(xiàn)實(shí)極其撕裂,「快」和「深」在算力上天然互斥。
于是,OpenAI 在 GPT-Live 上做了一個(gè)極為聰明的決定:解耦(Decoupled)。
GPT-Live 被設(shè)計(jì)成了一個(gè)專門負(fù)責(zé)「前臺(tái)接待」的交互模型,核心任務(wù)就是保持對(duì)話的流暢、自然。
而當(dāng)你的問題需要全網(wǎng)搜索、深度邏輯推理,或者執(zhí)行復(fù)雜的 Agent 任務(wù)時(shí),GPT-Live 會(huì)在后臺(tái)悄悄把任務(wù)「外包」給最新的前沿大模型——首批上線調(diào)用的,正是 GPT-5.5。
最絕妙的地方在于,在 GPT-5.5 吭哧吭哧進(jìn)行復(fù)雜運(yùn)算的時(shí)候,GPT-Live 并沒有閑著。
它會(huì)繼續(xù)用自然的語音和你保持互動(dòng),幫你爭取時(shí)間,直到后臺(tái)把答案推理出來,它再無縫地將結(jié)果融入對(duì)話。你甚至可以根據(jù)需求,選擇 GPT-5.5 的推理力度:想要快,選 Instant(即時(shí));想要它深入思考,選 Medium(中等)或 High(高強(qiáng)度)。
![]()
這套設(shè)計(jì)還埋了一個(gè)長線伏筆:前臺(tái)陪聊和后臺(tái)推理是分開的,意味著后臺(tái)推理模型可以隨時(shí)更換。
OpenAI 明確表示,每當(dāng)新的前沿模型發(fā)布,GPT-Live 背后調(diào)用的模型也會(huì)隨之升級(jí)。如無意外,明天我們就能見到 GPT-5.6 系列模型,GPT-Live 的發(fā)布看起來也是在前哨站。
更換模型后,性能的提升也是顯而易見的,在官方公布的盲測中,測試者與不同模型進(jìn)行了 5 到 10 分鐘的連續(xù)對(duì)話,結(jié)果 GPT-Live-1 以 75.7% 的偏好率碾壓上一代高級(jí)語音模式。
![]()
就連縮水版的 GPT-Live-1 mini 也拿下了 69.2%。在滿分 7 分的「對(duì)話流暢度」評(píng)分上,GPT-Live-1 拿到 4.96 分,而高級(jí)語音模式只有 3.80 分。
而在硬核數(shù)據(jù)上,差距更加懸殊:
GPQA(專家級(jí)物理化學(xué)生物推理):GPT-Live-1 在高強(qiáng)度推理檔位下拿到 84.2% 的準(zhǔn)確率,幾乎是高級(jí)語音模式(45.3%)的兩倍。
![]()
BrowseComp(復(fù)雜網(wǎng)頁搜索與 Agent 能力):這是最夸張的一項(xiàng)。高級(jí)語音模式的準(zhǔn)確率只有可憐的 0.7%,而 GPT-Live-1 最高沖到了 75.2%,直接從「不可用」跨越到了「能干活」。
內(nèi)部 Telecom 測試(多輪擬真電信客服支持):GPT-Live-1 在任務(wù)成功率上同樣全面領(lǐng)先,展示了它作為語音 Agent 處理真實(shí)業(yè)務(wù)的潛力。
![]()
這種前后臺(tái)分離的架構(gòu),不僅解決了「延遲」與「深度」的矛盾,更讓開發(fā)者聞到了巨大的商機(jī)。OpenAI 表示 API 版本即將推出,開發(fā)者和企業(yè)現(xiàn)在已經(jīng)可以填表登記,第一時(shí)間獲取上線通知。
語音不再只是聽覺,更是全新的 OS
除了聽覺上的進(jìn)化,GPT-Live 還推出了視覺卡片。
純語音輸出往往是低效的。現(xiàn)在,當(dāng)你和 GPT-Live 聊天時(shí),遇到適合視覺展示的信息,它會(huì)在屏幕上直接彈出豐富的視覺卡片。
語音不再僅僅是一種輸入方式,它正在成為統(tǒng)領(lǐng)搜索、記憶、圖像識(shí)別和文件處理的超級(jí)入口。
![]()
OpenAI 自己也毫不掩飾這個(gè)野心:官方原話是,這項(xiàng)研究將逐步解鎖用語音完成更復(fù)雜、更長時(shí)程、更具 Agent 屬性的工作。今天它幫你查天氣,明天它可能就在替你打電話辦業(yè)務(wù)。
不過,越像人的 AI,帶來的風(fēng)險(xiǎn)也越大。
在官方的系統(tǒng)卡(System Card)中,OpenAI 花了大量篇幅講述 GPT-Live 的安全性。因?yàn)檎Z音的實(shí)時(shí)性太強(qiáng)了,傳統(tǒng)的「事后屏蔽」根本來不及。
為此,OpenAI 引入了全新的「原生音頻評(píng)估」和「合成數(shù)據(jù)評(píng)估」,專門針對(duì)有害的進(jìn)行了紅藍(lán)對(duì)抗。一旦檢測到模型正在輸出危險(xiǎn)言論,系統(tǒng)可以立刻「把話頭帶偏」轉(zhuǎn)向安全回復(fù),或者在極高風(fēng)險(xiǎn)下直接切斷語音,并為你推送經(jīng)過專家審核的危機(jī)干預(yù)熱線。
此外,針對(duì)未成年人,系統(tǒng)內(nèi)置了家長控制功能(Parental Controls),并在模型底層注入了「適齡行為規(guī)范」。
至于很多人擔(dān)心的「聲音克隆詐騙」,OpenAI 明確表示:GPT-Live 被嚴(yán)格限制為只能使用預(yù)設(shè)音色,絕不提供模仿真人聲音的功能。
更有意思的是,OpenAI 專門建立了一個(gè)長期監(jiān)管機(jī)制,用來研究「情感依賴」。畢竟正如《Her》一般,當(dāng)一個(gè) AI 的聲音如此真實(shí),甚至懂得在你難過時(shí)用溫柔的「嗯嗯」來回應(yīng)你時(shí),人類不可避免地會(huì)對(duì)其產(chǎn)生情感投射。
![]()
目前,GPT-Live 已經(jīng)開始向全球 iOS、Android 和 Web 端用戶推送。Go、Plus 和 Pro 付費(fèi)用戶將默認(rèn)使用滿血版 GPT-Live-1,而免費(fèi)用戶也將體驗(yàn)到 GPT-Live-1 mini 版本。(注意:首發(fā)暫不支持屏幕共享和視頻對(duì)話,需切回老版本使用)。
還有一個(gè)小提醒:GPT-Live 目前只針對(duì) ChatGPT 上最熱門的幾種語言做了優(yōu)化,某些語言下它可能會(huì)帶著一股「外國口音」,甚至偶爾詞不達(dá)意。OpenAI 表示正在加緊補(bǔ)課。
回望過去幾年,我們對(duì) AI 的期待一直在發(fā)生變化。
最初,我們只希望它能聽懂指令,別總是答非所問;后來,我們希望它能幫我們寫代碼、做報(bào)表,成為全能的生產(chǎn)力工具。
但今天,當(dāng) GPT-Live 真真切切地在你耳邊,用略帶停頓的語氣發(fā)出一聲「嗯,我聽著呢」的時(shí)候,你會(huì)突然意識(shí)到:
比起一個(gè)無所不能的神,我們可能更需要的,是一個(gè)永遠(yuǎn)不會(huì)不耐煩、永遠(yuǎn)愿意傾聽、并且真的懂你在說什么的「人」。技術(shù)狂奔的盡頭,終究還是回歸到了人性的慰藉。
附上博客地址:
https://openai.com/index/introducing-gpt-live/
我們正在招募伙伴
簡歷投遞郵箱 hr@ifanr.com
?? 郵件標(biāo)題 「姓名+崗位名稱」(請(qǐng)隨簡歷附上項(xiàng)目/作品或相關(guān)鏈接)
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.