給大模型訓練算一筆碳賬,似乎已經(jīng)越來越不合時宜。畢竟,隨著推理模型與智能體的爆發(fā),市場的目光早已轉(zhuǎn)向推理側(cè)的成本,認為“訓練成本”已是舊時代的故事;盡管,推理的環(huán)境外部性,更是一筆糊涂賬。
而且有點詭異,美國那里還有人研究和披露,但白宮已經(jīng)不在乎了;中國這里政策很重視,但研究和披露大模型碳足跡的卻不多。
唱反調(diào)的是美國艾倫AI研究所(Ai2)。作為當前開源模型西方陣營的領(lǐng)軍者之一,它用一篇數(shù)據(jù)翔實的論文,給大家上了一課:模型訓練的“碳足跡”不僅沒有過時,而且,過去以“預訓練”為核心、以“最終訓練運行”為主要統(tǒng)計對象的碳核算方法,已經(jīng)落后于模型訓練范式的變化。
![]()
確實如此。Anthropic創(chuàng)始人阿莫迪(Dario Amodei)近期曾粗略地推算,目前,業(yè)界訓練與推理的計算支出,各占一半。這不難理解。大模型的前沿競爭如此慘烈,如果推理支出過多,會阻礙未來的研發(fā)進展;如果訓練支出過多,則無法產(chǎn)生足夠的收入。
試想,谷歌幾個月來連續(xù)簽下幾個天然氣發(fā)電訂單;微軟考慮放棄“按小時匹配清潔能源”的目標;Anthropic接手了xAI燃氣發(fā)電的Colossus 1集群。這些巨頭花了一半的碳排放在模型訓練上。這意味著,一旦它們公開些許模型訓練細節(jié),人們就能順藤摸瓜地反推出其AI業(yè)務碳足跡的大致區(qū)間。
而且,“模型訓練”這個概念本身,也越來越模糊。過去,大模型廠商討論旗下模型“碳足跡”時,往往只聚焦于預訓練階段最后一次完整成功的訓練,即“最終訓練運行”(final training runs)。它既不包含故障中斷的部分,也不包含大量早期實驗性探索。還有部分模型,最終甚至被扼殺在發(fā)布之前,從未為市場知曉。
事實上,就連這種“有限度的披露”,上一次還要追溯到兩年前Meta發(fā)布Llama 3。彼時,AI仍處于“指令模型”時代,訓練流程依然以預訓練為主,微調(diào)為輔。直到半年后,以慢思考著稱的o1才正式發(fā)布,后者確立了強化學習的擴展定律新范式,也徹底改變了訓練的成本結(jié)構(gòu)。
當前的SOTA模型訓練,除了典型的預訓練,還要花費大量的算力在精選數(shù)據(jù)上的中間訓練、長上下文擴展、大規(guī)模合成數(shù)據(jù)生成、有監(jiān)督微調(diào)(SFT)、偏好優(yōu)化(如DPO)以及強化學習(RL)上。預訓練的算力占比正在降低。而且,每一個訓練環(huán)節(jié),都涉及各自的“最終運行”(論文中的final runs)及其早期探索開發(fā)(論文中的development)。這也讓大部分模型訓練的環(huán)境外部性隱入迷霧。
去年年底,艾倫研究所開源了Olmo 3家族。它們包括70億和320億參數(shù)兩款,均分為指令跟隨(Instruct)和推理(Think)變體。它們基于H100集群訓練,總共花費了834萬GPU時;合成數(shù)據(jù)部分則額外基于AMD芯片生成。
![]()
其中,僅有18%的GPU時,用在所謂“最終運行”上。而且,這個比例無論放在過去還是未來,都呈現(xiàn)下降趨勢。
這大致可以與EpochAI今年3月的研究相印證。該機構(gòu)估算,OpenAI、Minimax與智譜的“最終訓練運行”的成本,占總研發(fā)支出的比例,基本上在10%-20%之間;其中,OpenAI僅為9.6%,為三家中最低。這從側(cè)面說明,真正昂貴的,往往不是最后一次成功訓練,而是此前漫長且高失敗率的原創(chuàng)探索。
更值得注意的是,推理模型后訓練的能耗,已經(jīng)遠高于傳統(tǒng)指令模型。
論文顯示,推理模型后訓練的能耗約為指令模型的17倍,主要消耗在強化學習中的“生成軌跡”(rollouts)環(huán)節(jié)。某種程度上,這一過程本身就相當于一次大規(guī)模推理部署。也就是說,后訓練正在“推理化”,而推理本身也開始越來越像訓練的一部分。
艾倫研究所用于訓練Olmo 3家族的數(shù)據(jù)中心,GPU自身能耗占整個IT基礎(chǔ)設(shè)施的比例為57.5%,數(shù)據(jù)中心的能效(PUE)為1.2,當?shù)仉娋W(wǎng)的碳排放強度(CI)為0.332。經(jīng)計算,這組模型的“最終運行”環(huán)節(jié)碳排放為647噸碳當量(tCO?eq);早期探索開發(fā)環(huán)節(jié)為2757噸。此外,獨立于模型“訓練”之外的數(shù)據(jù)合成環(huán)節(jié),碳排放為675噸;構(gòu)建這個集群的硬件制造環(huán)節(jié),經(jīng)攤銷后的隱含排放為172噸。
![]()
換言之,僅僅訓練這一組百億參數(shù)模型,總計就排放了4251噸碳當量。
作為對比,當初Llama-3-8B與Llama-3-70B,Meta自估僅分別為390噸與1900噸。此外,谷歌去年環(huán)境報告披露,2024年基于目標(Ambition-based)的碳排放總量(范圍1、2、3合計)為1150萬噸。不過,考慮到如今前沿模型動輒以萬億參數(shù)規(guī)模計,且迭代頻率越來越高,模型訓練的環(huán)境成本,依然不可小覷。
此外,論文還單獨分析了數(shù)據(jù)中心的水資源消耗問題。該論文的統(tǒng)計口徑,包括了用電側(cè)的冷卻(在該模型訓練中,采用了閉路循環(huán)冷卻,實際消耗約等于0;但對于使用蒸發(fā)冷卻塔的數(shù)據(jù)中心,這部分占比相當高),也包括了發(fā)電側(cè)蒸發(fā)或消耗的水。論文稱,這組模型完整的訓練過程,共消耗15887噸(即15887千升)水,約等于一個美國普通個人140年的用水量。
推理模型已如此,而為智能體優(yōu)化訓練的模型,在后訓練中還會引入更多動作、觀察與推理步驟生成,其消耗甚至可能高出幾個數(shù)量級。若未來進一步出現(xiàn)大模型遞歸迭代訓練與自動化優(yōu)化框架,這種趨勢還會被進一步放大。這意味著,“訓練”與“推理”的邊界正在逐漸消失,模型訓練未來會越來越像一個持續(xù)運行的工業(yè)系統(tǒng)。
因此,論文呼吁行業(yè)在披露模型訓練成本時,不僅報告預訓練成本,也應同步披露后訓練成本;不僅報告“最終運行”,也至少額外給出早期探索開發(fā)階段的“乘數(shù)”。
也許,中國模型廠商也不妨聽聽這一呼吁。
畢竟,美國從政府到科技企業(yè),似乎都已經(jīng)逐漸放棄認真履行各自的碳中和承諾。中國一方面擁有比美國更多仍在進行預訓練競爭的模型廠商,另一方面,其芯片與算力基礎(chǔ)設(shè)施的整體能效又低于美國。此外,中國盡管電力充沛,但綠電資源在時空上的分布并不均衡。
中國依然堅持走向碳中和,AI碳賬單就始終存在。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.