![]()
AI 大模型給人類生活帶來了便利,但其在處理長文本的時候,存在一個被大多數人忽略的代價。當你把一篇十萬字的文檔交給它,僅僅是把所有內容記住這件事就要占用幾十個 G 的顯存。普通顯卡基本裝不下,就算勉強裝下了,推理速度也會慢得讓人無法接受。
近日,英屬哥倫比亞大學和微軟研究院的研究人員研發了一種名為 SeKV 新方法,共同作者之一是武漢大學本科校友、牛津大學博士畢業生、目前在微軟研究院擔任高級研究員的何宇航(音)。
該方法把長文本處理時的顯存占用減少了一半以上,同時模型的回答準確率基本不受影響。在 128K 長度的文本上,顯存占用比完整緩存減少了一半以上。在只使用原來十分之一顯存的條件下,準確率比現有的語義壓縮方法平均提高了接近六個百分點。
更重要的是,本次方法不依賴更貴的硬件,也不需要重新訓練大模型,它只是在現有模型上增加了一個低于萬分之五參數的小模塊,就能實現上述性能。這意味著,假如你手里有一塊 24G 顯存的消費級顯卡,原本跑不動 100K 以上的長文本,用了 SeKV 方法之后可以跑接近 300K。
![]()
(來源:相關論文)
這一方法旨在解決大模型在處理長文本的如下瓶頸,大模型在閱讀文章的時候,會將每一個詞的鍵值對緩存下來,留著生成回答內容的時候反復使用。這個緩存是必要的,沒有它模型就會忘記前面到底讀過了什么。
但是它有一個致命的缺點,它會隨著文本長度發生線性增長。當文章從一萬字變成十萬字,緩存占用也會從幾個 G 變成幾十個 G,而這個增長是乘法式的增長,這就導致顯卡顯存的增長速度遠遠趕不上文本長度的增長速度。
以往的解決辦法大多是在做取舍,有些方法干脆扔掉一部分緩存,只剩下最近出現的內容或者看起來最重要的詞,這樣做確實可以省顯存,但是一旦扔掉了后面就再也找不回來了。
如果你要問的問題恰恰和被扔掉的那段文字有關,這時模型就只能靠猜了。還有一些方法把緩存壓縮成摘要,但是壓縮決策在做完閱讀的那一刻就給框死了,當在后面發現需要細節的時候,就再也解不回來了。
SeKV 換了一條路徑,它是把內容按照語義切分成段落,每個段落只留下一個濃縮的摘要放在顯卡里用于快速檢索,原文的詳細內容被壓縮之后放在了 CPU 內存里,當模型發現某個段落和當前提問有關的時候,它會再從 CPU 里把詳細數據調出來。
這個辦法無需扔掉任何信息,所有的文字依然都在,只不過大部分時間處于壓縮狀態,顯卡里只放著摘要和少數的關鍵錨點。打個比方,很多人都去圖書館借過書,一般書架上只有目錄和索引,為了找到需要的哪一本,有時需要先在圖書館的電腦上查出來位置,有時需要問真人圖書管理員。
在本次方法里,那些語義邊界上的關鍵錨點就像書的封面和標題,永遠擺在了顯眼的位置,這就好比你是去商場里的網紅書店找書,書店為了賣書都會將書封面擺出來,這種情況下自然也就方便找書。
![]()
(來源:相關論文)
把詳細內容壓縮到二十分之一體積但卻不丟失核心信息,依靠的是奇異值分解,這是一種從數據里提取主要特征的數學策略,每一個段落的鍵值矩陣被分解成為三個小矩陣,只留下最重要的幾十個成分。
當需要恢復某個段落的時候,只需要把這三個小矩陣乘回去,就可以得到一個足夠接近原始內容的近似版本。如果你平時也進行內容創作,可能有過把自己的文章鏈接生成一個二維碼的經歷,受眾在需要看內容的時候,用手機掃一下就能看。上述恢復某個段落的過程,和把文章生成二維碼的過程在原理上是一樣的。
在本次研究之中,整個系統僅需要訓練一個很小的路由模塊,由此就能學到如何判斷哪些段落跟當前問題相關,參數數量僅有基礎模型的萬分之五,在八張 A100 顯卡上訓練兩到六個小時就可以完成,還能直接用在現有的大模型上,完全無需重新訓練或者微調。
從實際應用場景來看,這項技術將能帶來以下好處:無論是律師或法務要審閱幾百頁的合同,無論是科研黨要通讀幾十篇論文,亦或是小說迷想讓 AI 幫忙總結一本長篇小說,這些需求將不會在面臨被卡在顯存上的問題,SeKV 為它們提供了一個可行的中間方案,能夠通過犧牲少量精度換取成倍的顯存節省,將這道門檻往下削了一截。
參考資料:
相關論文https://arxiv.org/pdf/2606.31145
https://www.linkedin.com/in/yuhang-he-7b20344b/
排版:胡巍巍
注:封面/首圖由 AI 輔助生成
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.