![]()
撰文 | 李信馬
題圖 | AI生圖
《在數(shù)十億個(gè)Agent運(yùn)行之前,亞馬遜先讓Agent學(xué)會(huì)了管庫(kù)存和招人》一文中,亞馬遜云科技(以下簡(jiǎn)稱“AWS”)CEO Matt Garman曾預(yù)測(cè)未來會(huì)有數(shù)十億Agents在各行各業(yè)廣泛運(yùn)行,這樣的前景固然讓人欣喜,但有些冷水也不得不潑。
去年7月,MIT Project NANDA發(fā)布的一份報(bào)告,基于對(duì)300多個(gè)AI項(xiàng)目、52家組織的訪談和153位高管的調(diào)查發(fā)現(xiàn):盡管企業(yè)對(duì)生成式AI(GenAI)投入了300-400億美元,但僅有5%的組織成功實(shí)現(xiàn)了規(guī)模化部署并獲得了顯著財(cái)務(wù)回報(bào)。這種現(xiàn)象被稱為 “GenAI鴻溝”(The GenAI Divide),絕大多數(shù)組織被困在“高采用率、低轉(zhuǎn)化率”的試點(diǎn)階段。
細(xì)分到Agent領(lǐng)域,也存在這樣的鴻溝,Demo效果很好,接入真實(shí)場(chǎng)景就失效,未來假如出現(xiàn)了幾十億個(gè)Agent,其中多少好用能用,其實(shí)也不好說。但問題的根源可能不在于模型不夠強(qiáng),因?yàn)锳gent需要深入具體的業(yè)務(wù)場(chǎng)景,工程問題可能比模型的能力問題更重要。AWS剛剛發(fā)布的《企業(yè)生產(chǎn)級(jí)智能體開發(fā)部署指南》(下文簡(jiǎn)稱“指南”)中提到,傳統(tǒng)軟件工程方法對(duì)Agent失效,源于傳統(tǒng)軟件和Agent間的三個(gè)本質(zhì)差異:
- 非確定性。傳統(tǒng)軟件的運(yùn)行邏輯是確定性的,有一套明確的對(duì)錯(cuò)標(biāo)準(zhǔn)。Agent基于大模型運(yùn)行,輸出具有概率性——同樣輸入不一定產(chǎn)生相同輸出,昨天測(cè)試通過,不意味著今天依然穩(wěn)定。目前沒有任何主流模型提供商承諾完全確定性的輸出。
- Prompt即源代碼。在傳統(tǒng)軟件里,改代碼會(huì)留痕,有版本控制,有靜態(tài)分析工具,但Prompt不會(huì)。自然語(yǔ)言提示詞哪怕只是微調(diào)一個(gè)詞,都可能引發(fā)Agent行為的劇烈波動(dòng),而當(dāng)前行業(yè)沒有成熟的工具來評(píng)估這種改動(dòng)的影響范圍。
- 隱式依賴。Agent對(duì)底層大模型存在隱式依賴——模型提供商在后臺(tái)悄悄升級(jí),代碼一行沒動(dòng),Agent的服務(wù)質(zhì)量可能已經(jīng)變了。
三個(gè)差異疊加導(dǎo)致傳統(tǒng)軟件的評(píng)估測(cè)試體系對(duì)Agent全面失效,進(jìn)而導(dǎo)致企業(yè)Agent在進(jìn)入生產(chǎn)環(huán)節(jié)上陷入停滯。那對(duì)想要靠Agent降本增效的企業(yè)來說,具體該怎么辦?
01、從SDLC到ADLC:評(píng)估是核心
亞馬遜全球副總裁儲(chǔ)瑞松曾提過一個(gè)觀點(diǎn),企業(yè)在構(gòu)建AI Agent時(shí),底層技術(shù)平臺(tái)可以通過采購(gòu)獲得,但評(píng)估標(biāo)準(zhǔn)必須由企業(yè)自主掌控,企業(yè)的核心競(jìng)爭(zhēng)壁壘在于其自有的黃金數(shù)據(jù)集和評(píng)估標(biāo)準(zhǔn)。這一說法有些反常識(shí),模型、基礎(chǔ)設(shè)施、開發(fā)工具都可以靠買(對(duì)絕大多數(shù)企業(yè)來說自研的確也不現(xiàn)實(shí)),為什么評(píng)估標(biāo)準(zhǔn)這樣重要?
回顧下歷史,上世紀(jì)60年代計(jì)算機(jī)科學(xué)快速發(fā)展,催生了最終演變?yōu)镾DLC(軟件開發(fā)生命周期)的生產(chǎn)框架的雛形,SDLC的核心是將開發(fā)工作劃分為需求分析、設(shè)計(jì)、編碼、測(cè)試、部署和維護(hù)等多個(gè)階段,而隨著AI智能體承擔(dān)大量開發(fā)工作,ADLC(Agent Development Lifecycle,Agent開發(fā)生命周期)方法論隨之出現(xiàn),和SDLC最大的區(qū)別是:ADLC是一個(gè)飛輪,不是一條流水線。
ADLC不是走一遍就結(jié)束,而是不斷旋轉(zhuǎn)、持續(xù)迭代,六個(gè)環(huán)節(jié)——定標(biāo)準(zhǔn)、開發(fā)實(shí)現(xiàn)、效果評(píng)估、灰度上線、持續(xù)監(jiān)控、改進(jìn)循環(huán)——會(huì)從最后一個(gè)回流到第一個(gè)環(huán)節(jié),更新評(píng)估標(biāo)準(zhǔn)和基準(zhǔn)數(shù)據(jù)集,如果說傳統(tǒng)軟件是“開發(fā)→測(cè)試→上線”,Agent就是“定標(biāo)準(zhǔn)→開發(fā)→評(píng)估→上線→監(jiān)控→挖失敗→更新標(biāo)準(zhǔn)→再開發(fā)”,評(píng)估是起點(diǎn),也是終點(diǎn)。
![]()
假如你是一家企業(yè)的管理者,想要啟動(dòng)Agent項(xiàng)目,找到了合適的場(chǎng)景,那在啟動(dòng)開發(fā)之前,你需要先定義什么樣的Agent是“好”的。比如智能體定義(它是什么和要做什么)、語(yǔ)氣與個(gè)性(它怎么說話)、工具與參數(shù)定義(它能用什么、怎么用)、基準(zhǔn)數(shù)據(jù)集(什么叫“做好了”)。
在Agent上線后,生產(chǎn)環(huán)境的數(shù)據(jù)必須能持續(xù)回流到評(píng)估體系中,這要求你要建立完善的可觀測(cè)性系統(tǒng)(指南里推薦使用OpenTelemetry),沒有可觀測(cè)性,就沒有持續(xù)評(píng)估,飛輪就轉(zhuǎn)不起來。最后,是讓系統(tǒng)架構(gòu)可被評(píng)估,這是最工程化的一部分,也是評(píng)估能否落地的基礎(chǔ)設(shè)施,指南里推薦三層設(shè)計(jì):認(rèn)證層(確認(rèn)用戶身份)、授權(quán)層即Gateway(控制Agent能做什么)、會(huì)話隔離層(不同用戶之間互不干擾)。
Agent做出來了,怎么判斷它行不行?這是最難回答的問題。從底層大模型到Agent的落地,就像一棵大樹長(zhǎng)出枝葉開花結(jié)果,大模型可能只需要一個(gè)或幾個(gè),但Agent卻千千萬(wàn)萬(wàn)各不相同,而對(duì)Agent的評(píng)估也是如此,每一個(gè)都應(yīng)該有專門的評(píng)估方案,更不能靠“感覺差不多”來上線。
02、評(píng)估方法論:兩根支柱
構(gòu)建過Agent的朋友對(duì)下面的場(chǎng)景可能不陌生:測(cè)試覺得沒問題,但開始接入真實(shí)流量,卻開始“間歇失效”,同一類請(qǐng)求,十次里有一兩次出問題,煩人得很。
對(duì)于Agent來說,能力(capability)與一致性(reliability/consistency)并不是一回事。“能做到”不等于“每次都能做到”,Agent把多步推理、工具調(diào)用、外部狀態(tài)寫入耦合在一起,任何一環(huán)的隨機(jī)性都會(huì)被鏈?zhǔn)椒糯螅荒芸砍梢?guī)模、反復(fù)的評(píng)估去逼近“每次都能做到”。
指南中提出了評(píng)估方法論的“兩根支柱”:支柱一決定評(píng)估的粒度有多深,從只看最終響應(yīng)(黑盒),到看完整執(zhí)行軌跡(玻璃盒),再到看單步細(xì)節(jié)(白盒);支柱二決定每個(gè)分?jǐn)?shù)有多大分量,從機(jī)械可驗(yàn)證(Layer 1),到半客觀(Layer 2),再到默認(rèn)拒評(píng)(Layer 3)。
![]()
黑盒評(píng)估看最終輸出——用戶問了一個(gè)問題,Agent給了一個(gè)回答,對(duì)不對(duì)?玻璃盒評(píng)估看完整軌跡——Agent做了哪些決策、調(diào)用了哪些工具、每一步推理是否合理?白盒評(píng)估則聚焦單步——某一個(gè)工具調(diào)用是否正確、某一段推理是否成立。三種粒度由粗到細(xì)分別回答“結(jié)果對(duì)不對(duì)”、“過程對(duì)不對(duì)”、“每一步對(duì)不對(duì)”,日常開發(fā)以玻璃盒為主,黑盒和白盒作為補(bǔ)充。
三層證據(jù)權(quán)重的第一層是機(jī)械驗(yàn)證,看格式對(duì)不對(duì)、JSON能不能解析等,完全自動(dòng)化,零主觀判斷;第二層是半客觀的pinned評(píng)判,用固定的評(píng)估器和明確的評(píng)分標(biāo)準(zhǔn),對(duì)特定維度打分;第三層是主觀默認(rèn)評(píng)判,沒有固定標(biāo)準(zhǔn),靠人或LLM的判斷力。它們也對(duì)應(yīng)三類打分器,分別是代碼規(guī)則、模型和人工。
兩根支柱互相正交,同一個(gè)粒度上的指標(biāo)可以來自不同證據(jù)層級(jí),反之亦然,像一個(gè)3×3的矩陣,用同一組指標(biāo)既要選粒度、又要選證據(jù)強(qiáng)度。這樣一套組合下來,基本就能對(duì)Agent的輸出結(jié)果進(jìn)行全方位的評(píng)估了。用AWS開發(fā)的客服Agent來舉例子,客服場(chǎng)景最大的風(fēng)險(xiǎn)是意圖識(shí)別出錯(cuò),就是用戶說的和Agent理解的不是一回事,AWS就通過“真實(shí)數(shù)據(jù)+虛擬客戶模擬”的雙軌評(píng)估方法,用較低成本把測(cè)試范圍擴(kuò)展到了各種邊緣場(chǎng)景,既測(cè)了意圖識(shí)別的準(zhǔn)確度,也測(cè)了多輪對(duì)話的連貫性。
![]()
值得一提的是,由于評(píng)估中也會(huì)用到模型自動(dòng)評(píng)估,所以評(píng)估數(shù)據(jù)集的質(zhì)量決定了評(píng)估質(zhì)量的上限,企業(yè)也需要建設(shè)經(jīng)過人工標(biāo)注、經(jīng)過業(yè)務(wù)驗(yàn)證的高質(zhì)量測(cè)試集,這個(gè)數(shù)據(jù)集將是企業(yè)的核心資產(chǎn)。
有關(guān)如何評(píng)估Agent還有很多細(xì)化的維度,而且不同形態(tài)的Agent關(guān)注不同的維度,比如客服Agent看重意圖識(shí)別準(zhǔn)確率和對(duì)話連貫性,工具使用Agent看重工具選擇正確率和參數(shù)準(zhǔn)確性,多Agent協(xié)作系統(tǒng)看重任務(wù)拆分合理性和執(zhí)行穩(wěn)定性,所以就不具體解釋了。
AWS提供的思路和方法論也只是一家之言,如何做好Agent,可能還有其他的路徑和實(shí)踐案例。但有一件事情是確定的:Agent是生產(chǎn)力工具,能不能交付可衡量的業(yè)務(wù)結(jié)果,是判斷它“好不好”的最終標(biāo)準(zhǔn)。
進(jìn)入Agent時(shí)代,想讓Agent真正走進(jìn)生產(chǎn),對(duì)企業(yè)是一場(chǎng)有關(guān)技術(shù)和商業(yè)的新挑戰(zhàn),即使有指南,走不走得通,還得看企業(yè)自己的決心和投入。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.