WEKA 攜手 NVIDIA STX:解鎖 AI 情境記憶極限,推理成本與輸出效能的革命性突破

在人工智慧技術飛速發展的今日,代理型 AI 應用日益普及,卻也同時面臨著嚴峻的挑戰:高昂的推理成本與受限的記憶體瓶頸,如何有效突破,實現規模化高效運算? 針對此核心議題,人工智慧儲存與記憶體系統公司 WEKA 於 2026 年圖形處理器(GPU)技術大會(GTC 2026)上,正式宣布將其 NeuralMesh 軟體與 NVIDIA STX 參考架構深度整合。此舉旨在透過 WEKA 獨特的 Augmented Memory Grid 記憶體擴展技術,為代理型 AI 工廠提供高吞吐量的情境記憶儲存解決方案,預期將大幅提升每秒 Token 生成量,並顯著降低整體推理成本。

現象觀察:AI 推理效能的瓶頸與挑戰

首先,我們觀察到當前大規模 AI 推理叢集普遍遭遇的「記憶體高牆」現象。隨著 AI 模型日益龐大且複雜,特別是在軟體工程等代理型 AI 應用領域,對情境記憶的需求呈爆炸性增長。然而,GPU 上有限的高頻寬記憶體(HBM)容量,很快便會耗盡,導致關鍵的鍵值(KV)快取被頻繁逐出,進而造成情境資料遺失。這種架構上的效率低下,不僅迫使系統重複執行已完成的工作,更直接推升了推理運算的總體成本,嚴重阻礙了 AI 規模化應用的經濟效益。

為解決此困境,WEKA 與 NVIDIA 聯手推出的解決方案,運用 NVIDIA Vera Rubin NVL72、NVIDIA BlueField-4 及 NVIDIA Spectrum-X 乙太網路等尖端技術。根據 WEKA 的評估,此整合方案預計能將情境記憶體的每秒 Token 生成量提升 4 至 10 倍,同時為 AI 工作負載提供每秒不少於 320 GB 讀取和 150 GB 寫入的吞吐量,其效能表現已超越傳統 AI 儲存平台逾一倍之多。

Firmus 技術長 Daniel Kearney 曾指出:「現實世界的 AI 並非在實驗室執行,而是要面對電力限制、散熱限制,以及源源不絕的工作負載需求。與 NVIDIA AI 基礎建設雙劍合璧之下,WEKA Augmented Memory Grid 可於大規模執行時,實現每秒 Token 數提升 6.5 倍,首個 Token 生成時間(TTFT)加快 4 倍,證明在相同 GPU 配置下,效能可提升至更高層次。」這番話語精準點出了 AI 部署的現實挑戰,也肯定了新技術的實用價值。

原因剖析:情境記憶體為何成為關鍵?

其次,深入剖析當前 AI 推理成本高漲的核心原因,便會發現其癥結點在於缺乏一個高效且共享的鍵值(KV)快取基礎建設。當沒有此類共享機制時,情境資料無法在不同的代理、使用者與會話之間保持活躍與共享。這意味著,每當情境資料被逐出或需跨會話使用時,系統便被迫重新計算,形成不必要的重複勞動。這種重複計算不僅消耗大量運算資源,更導致 Token 吞吐量不穩、效能難以預測,使得推理叢集規模越大,營運成本與複雜度也隨之飆升。

為此,NVIDIA 專為語境記憶而設計的 STX 架構,提供了一套明確的藍圖,旨在直接破解此核心推理瓶頸。WEKA 的 Augmented Memory Grid 正是基於此理念,透過其智慧自適應儲存系統 NeuralMesh,將 KV 快取整合成一個可持久保存且擴展的記憶體池,超越了傳統 GPU 記憶體的限制。這項技術確保了即使在推理工作負載不斷增加的情況下,長情境會話依然能夠穩定運作,並維持高水準的並行處理能力,有效消除了因情境丟失而產生的重複計算負擔。

簡而言之,情境記憶儲存之所以關鍵,是因為它能確保 AI 代理在處理複雜任務時,能「記住」先前的互動與資訊,避免重複計算,從而大幅提升推理效率、穩定效能並降低成本。 這是代理型 AI 工廠實現無縫、高效運作的基石。

影響評估:新架構帶來的效益與變革

再者,WEKA 與 NVIDIA 聯合設計的解決方案,透過基於 NVIDIA STX 架構的 NeuralMesh 軟體,為 AI 雲端服務商、企業及 AI 模型建構者帶來了多重革命性效益。這不僅能讓 GPU 以頂尖效能執行,維持海量 Token 生成,更能顯著提升大規模推理的能源效益與成本效益。具體而言,其優勢可歸納為以下幾點:

  • 使用者體驗大幅躍升: NeuralMesh 上的 Augmented Memory Grid 能將首個 Token 生成時間(TTFT)大幅縮短 4 至 20 倍,確保 AI 代理及應用程式在真實負載下,依然能提供極其迅速的反應,提升互動流暢度。
  • 相同硬體,更高收益: 在無需額外增建基礎建設的前提下,每個 GPU 就能處理多達 6.5 倍的 Token。這代表企業能從現有投資中榨取更多價值,實現更高的運算效率與生產力。
  • 規模擴張,效能恆久: 隨著會話、代理及情境視窗的不斷擴大,Augmented Memory Grid 依然能維持高鍵值(KV)快取命中率。這有效避免了純 DRAM 架構在面對高負載時,因快取溢出而導致的效能急劇下降瓶頸,確保系統穩定可擴展。
  • GPU 原生效率: 透過整合 NVIDIA BlueField-4 資料處理單元(DPU),儲存資料路徑得以從中央處理器(CPU)卸載,讓 GPU 能夠全速運算,從根本上消除輸入/輸出(I/O)瓶頸,極大化 GPU 的潛在效能。

趨勢預測:代理型 AI 的未來與持久化記憶體策略

最後,展望未來,隨著編碼大型語言模型(LLM)技術的持續精進,軟體工程領域對代理型 AI 應用的採納程度正呈現前所未見的增長,進而將生產力提升 100 到 1,000 倍。WEKA 聯合創辦人兼執行長 Liran Zvibel 對此表示:「當編碼助手反覆調用近乎相同的代碼庫及提示詞時,WEKA 的 Augmented Memory Grid 會重複使用已快取的語境,即使語境視窗長度已發展至難以置信,亦不用強制進行冗餘的預填充。這項舉措大幅縮短回應時間,亦讓同一基礎建設上支援的並行使用者數目顯著增加。」

Liran Zvibel 也強調:「WEKA 在一年多前便率先洞悉市場對情境記憶儲存的需求,並於 GTC 2025 推出 Augmented Memory Grid。如今,NVIDIA STX 的出現,為企業打開大門,讓其能在最先進的 NVIDIA Vera Rubin 架構(包括 NVIDIA BlueField-4 及 NVIDIA Spectrum-X 乙太網路)上,執行儲存及記憶體擴展基礎建設。為 NVIDIA STX 在 NeuralMesh 上執行 Augmented Memory Grid,將帶來無與倫比的效能及效率,直接實現顛覆市場的 AI 成本效益。」

今日對記憶體高牆視而不見的企業,日後將會面對更艱難、更昂貴的擴展挑戰。隨著代理型工作負載持續增加,情境視窗不斷擴大,若僅依賴純 DRAM 架構,將面臨成本持續疊加的問題:每新增一個並行使用者或會話,重算開銷、GPU 閒置時間及營運成本便隨之上升。因此,現在就為持久鍵值(KV)快取規劃架構的企業,無疑將比那些等待觀望的競爭對手,取得結構性的成本與效能優勢。WEKA 的 Augmented Memory Grid 現已隨 NeuralMesh 一併正式推出市場,為企業提供應對未來 AI 挑戰的關鍵策略。

建議諮詢專業人士以評估此技術對您特定應用場景的適用性。