隨著大型語言模型(LLMs)的發展日新月異,其對運算資源尤其是記憶體的需求也呈爆炸性成長,記憶體瓶頸已成為限制 AI 發展的關鍵挑戰。為此,Google 研究團隊近日發表了一項名為「TurboQuant」的全新免訓練壓縮演算法,宣稱能將大型語言模型的鍵值快取(KV caches)大幅壓縮至僅 3 位元,且不損及模型準確度。這項技術的問世,無疑為當前 AI 運算領域的硬體最佳化帶來了劃時代的解決方案。
現象觀察:AI 運算面臨的記憶體挑戰
首先,我們必須正視當前 AI 產業所面臨的嚴峻現實。大型語言模型在處理複雜任務時,需要不斷擴展的上下文長度來理解與生成內容。然而,隨著上下文長度增加,模型用於儲存先前計算過注意力數據的鍵值快取(KV 快取)所佔用的記憶體空間也隨之暴增。這個現象導致了嚴重的記憶體瓶頸,成為限制 AI 模型規模擴展與部署效率的核心問題。想像一下,當你不斷地往一個水桶裡加水,最終水桶會滿溢,而現在的 AI 模型就像這個不斷加水的過程,記憶體就是那個即將滿溢的水桶。
根據在輝達(Nvidia)H100 GPU 上進行的基準測試結果顯示,採用 4 位元版本的 TurboQuant 在計算注意力對數(attention logits)時,相較於未經量化的 32 位元金鑰,其效能提升了高達 8 倍,同時將 KV 快取記憶體的需求量降低了至少 6 倍。
原因剖析:傳統壓縮技術的局限與瓶頸
其次,過去業界為緩解此記憶體壓力,多半採用傳統的向量量化(vector quantization)方法來縮減快取體積。這種方法雖然能減少整體資料大小,卻非完美無缺。傳統量化技術的運作模式,往往需要額外儲存「量化常數」,這導致每個數值都會產生數個位元的記憶體消耗。當大型語言模型處理超長的上下文時,這些看似微小的額外開銷會不斷複合累加,最終嚴重侵蝕掉量化所帶來的記憶體節省效益。這就好比你為了省錢買了一件打折商品,卻因為額外的運費和稅金,讓實際省下的錢大打折扣。
影響評估:TurboQuant 如何突破現有框架
再者,Google 團隊透過創新的「兩階段處理流程」打造出 TurboQuant 演算法,徹底解決了傳統量化帶來的額外開銷。第一階段引入的 PolarQuant 技術,巧妙地將數據向量從傳統的笛卡爾坐標轉換為極座標,將向量分離成代表大小的半徑與代表方向的角度。有趣的是,在極座標下,角度的分佈具有高度可預測性且非常集中,因此 PolarQuant 能夠直接省略傳統量化器必須執行的、極度消耗運算資源的每區塊正規化步驟,實現零量化常數儲存消耗。第二階段則是一層 1 位元的錯誤修正層,採用名為 Quantized Johnson-Lindenstrauss (QJL) 的演算法,將殘餘的量化誤差投影到較低維度空間,並將每個數值進一步縮減至單一符號位元。此數學轉換幾乎沒有增加任何額外運算成本,同時還能有效消除計算注意力分數時產生的系統性偏差,確保模型的高精準度。
為了驗證其實際效能,Google 團隊以 Gemma 與 Mistral 等開源模型,在多個業界標準的長文本基準測試中進行全面評估,包括 LongBench、Needle In A Haystack 等項目。測試結果顯示,在將 KV 記憶體壓縮至少 6 倍的嚴苛條件下,TurboQuant 在 LongBench 的資訊檢索任務中依然取得了完美的下游分數,甚至在問答、程式碼生成等多元任務上超越了 KIVI 基準線。此外,在向量搜尋領域,TurboQuant 於 GloVe 資料集評測中,即便面對 Product Quantization 和 RabbiQ 等依賴龐大碼本與特定資料集微調的現有基準技術,仍取得了最高的 1@k 召回率。
趨勢預測:無訓練壓縮技術的未來展望
最後,TurboQuant 最具商業價值的優勢在於它完全不需要任何訓練或微調,且在執行時期的資源消耗微乎其微。這意味著該技術能夠非常輕易且無縫地部署於現有的生產級推論系統以及大規模的向量搜尋系統之中。這項突破不僅有望大幅降低 AI 運算的門檻,加速大型語言模型的普及與應用,更預示著未來 AI 硬體最佳化的發展方向將更加注重效率與資源的最小化。我們可以預期,在下個月舉辦的 2026 年國際學習表徵會議(ICLR 2026)上,這項由 Google 研究科學家 Amir Zandieh 與副總裁 Vahab Mirrokni 共同撰寫的論文,將會引發業界的廣泛討論與關注。