Google TurboQuant 技術解析:KV 快取壓縮 6 倍,大摩稱是「另一個 DeepSeek 時刻」

AI 推論成本居高不下的核心瓶頸,究竟在哪裡?答案指向一個技術細節:KV 快取(Key-Value Cache)的記憶體消耗。Google 研究院近期在官方部落格公開了全新壓縮技術「TurboQuant」,宣稱能在不犧牲模型準確度的前提下,將 KV 快取記憶體用量降低至少 6 倍,並在 H100 GPU 上實現最高 8 倍的效能提升。此技術預計於 ICLR 2026 正式發表,已引發業界高度關注,摩根士丹利(Morgan Stanley,大摩)甚至以「另一個 DeepSeek 時刻」來評價其潛在衝擊。

現象觀察:KV 快取為何成為 AI 擴展的最大障礙

要理解 TurboQuant 的意義,必須先釐清 KV 快取在大型語言模型(LLM)中扮演的角色。KV 快取可視為一種高速「數位速查表」,以簡單標籤儲存常用資訊,使電腦能即時存取,而不需反覆搜尋龐大且緩慢的資料庫。隨著模型處理的上下文長度持續增加,KV 快取所佔用的記憶體也呈線性甚至指數級成長,逐漸成為制約 AI 服務規模化部署的關鍵瓶頸。

Google 研究院的研究科學家 Amir Zandieh 與副總裁暨研究員 Vahab Mirrokni 在部落格中指出,高維向量(High-dimensional vectors)雖能捕捉影像特徵、詞語語意等複雜資訊,但其龐大的記憶體消耗正是 KV 快取瓶頸的根源。傳統的「向量量化」(Vector quantization)雖可縮減向量大小,卻往往引入額外的量化參數,導致每個數值反而增加 1 至 2 個 bit,抵銷了原本的壓縮效益——這是一個試圖解決問題、卻製造出另一個問題的典型困境。

「TurboQuant 證明在無需訓練或微調的情況下,可將 KV 鍵值快取量化至僅 3 位元,且不會犧牲模型準確度,同時執行速度還比原始 LLM 更快。」——Google 研究院官方部落格

原因剖析:TurboQuant 如何突破傳統壓縮的限制

TurboQuant 的核心突破在於採用兩階段壓縮流程,整合了 PolarQuantQJL(Quantized Johnson-Lindenstrauss) 兩項關鍵技術,分別負責「高品質壓縮」與「消除隱藏誤差」。

第一階段:PolarQuant 的極座標重新定義壓縮邏輯

PolarQuant 預計於 AISTATS 2026 發表,其核心概念是將向量從傳統的直角座標系(X、Y、Z 標準座標)轉換為「極座標」(Polar coordinates)表示。以日常語言類比:過去描述路徑是「向東走 3 個街區、向北走 4 個街區」,PolarQuant 則改為「以 37 度角走總共 5 個街區」——資訊量相同,但儲存方式截然不同。

這種轉換產生兩類資訊:半徑(代表資料的強度)與角度(代表資料的方向或語意)。由於角度模式具有已知且高度集中的特性,模型不再需要執行昂貴的資料標準化(normalization)步驟。更關鍵的是,當資料映射至固定且可預測的圓形網格時,邊界是已知的,不像傳統方形網格那樣邊界持續變動,因此能徹底消除傳統方法必然承擔的記憶體額外負擔。

第二階段:QJL 演算法的誤差修正機制

QJL 技術採用數學上的 Johnson-Lindenstrauss Transform,能壓縮高維向量的同時保留資料點之間的距離與關係。其做法是將每個向量數值簡化為單一符號位元(+1 或 -1),建立一種高速的資料「速記形式」,且不需要額外記憶體負擔。在 TurboQuant 的流程中,QJL 僅使用極少的剩餘位元(僅 1 bit)對第一階段留下的微小誤差進行修正,扮演「誤差修正器」的角色,消除偏差(bias),從而提升注意力分數(attention score)的計算準確性。

影響評估:實驗數據驗證的六大效益

Google 使用開源大型語言模型 Gemma 與 Mistral,在 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 及 L-Eval 等多個標準長上下文基準測試上進行嚴謹評估。實驗結果顯示,TurboQuant 在「點積失真」(dot product distortion)與「召回率」(recall)兩項核心指標上均達到最佳表現。

  • KV 記憶體用量降低至少 6 倍,在長上下文「大海撈針」任務中達到完美的下游任務表現
  • 執行速度最高提升 8 倍,在 H100 GPU 上,4 位元 TurboQuant 相較於 32 位元未量化鍵值,性能提升最高可達 8 倍
  • 無需訓練或微調,可直接部署於現有 LLM 架構,實作效率極高
  • KV 快取量化至僅 3 位元,且不犧牲模型準確度
  • 在向量搜尋任務中,TurboQuant 持續優於目前最先進的 PQ、RabbiQ 等方法
  • PolarQuant 在長上下文任務中幾乎無精度損失

摩根士丹利(大摩)指出:「TurboQuant 與其說是漸進式優化,不如說是改變 AI 部署的成本曲線。」大摩以『另一個 DeepSeek 時刻』來評價這項技術的潛在衝擊。

趨勢預測:從效率提升到重塑 AI 部署成本曲線

大摩對 TurboQuant 的短期與長期影響提出了具體分析。短期而言,TurboQuant 主要針對推論階段的 KV 快取進行壓縮,對模型權重(GPU/TPU 上的 HBM 使用量)與訓練工作負載並無直接影響。然而,它能讓相同硬體支援 4 至 8 倍更長的上下文,或在不耗盡記憶體的情況下處理更大的批次大小(batch size),本質上是「效率提升」,增加每顆 GPU 的吞吐量,進而降低單次查詢成本。

長期而言,大摩預測將出現「Jevons Paradox」(傑文斯悖論)效應——效率提升反而推動總需求增加。這一邏輯在 AI 領域並非首次出現:當推論成本下降,更多應用場景將變得具備商業可行性,進而帶動整體算力需求的擴張,而非收縮。Google 方面則表示,TurboQuant 除解決 LLM 的 KV 快取瓶頸外,預期還能在極低記憶體使用量、幾乎為零的前處理時間條件下,建立並查詢大規模向量索引,有助於語意搜尋變得更快速且高效。

值得關注的是,目前 NVIDIA 亦已在論文中公開了壓縮 KV 快取的技術 KVTC,Google 的 TurboQuant 與之形成競合態勢。隨著更多科技巨頭投入 KV 快取壓縮技術的研發,AI 推論成本的系統性下降或許將在 2026 年前後成為業界的重要轉折點。

常見問題解答

TurboQuant 是什麼技術?

TurboQuant 是 Google 研究院開發的一種先進量化壓縮演算法,整合 PolarQuant 與 QJL 兩項核心技術,能在不損失準確度的情況下大幅縮減大型語言模型的 KV 快取記憶體用量,特別適用於 KV 快取壓縮與向量搜尋場景,預計於 ICLR 2026 正式發表。

TurboQuant 能達到什麼效能提升?

根據 Google 的實驗數據,TurboQuant 能將 KV 記憶體用量降低至少 6 倍,並在 H100 GPU 上實現最高 8 倍的執行速度提升。此外,它可在無需訓練或微調的情況下,將 KV 快取量化至僅 3 位元,且不犧牲模型準確度。

為什麼大摩稱 TurboQuant 是「另一個 DeepSeek 時刻」?

摩根士丹利認為,TurboQuant 並非漸進式的技術優化,而是從根本上「改變 AI 部署的成本曲線」。若模型能在顯著降低記憶體需求的情況下維持效能,每次查詢的服務成本將大幅下降,進而提升 AI 部署的整體獲利能力,其潛在衝擊類似於 DeepSeek 對 AI 產業的影響。

PolarQuant 與 QJL 分別扮演什麼角色?

PolarQuant 負責第一階段的高品質壓縮,透過將向量轉換為極座標表示,消除傳統壓縮方法的記憶體額外負擔;QJL(Quantized Johnson-Lindenstrauss)則負責第二階段的誤差修正,僅使用 1 bit 的剩餘位元消除第一階段留下的偏差,提升注意力分數的計算準確性。兩者共同構成 TurboQuant 的核心壓縮流程。