Mingxin Technology

在 LLM 推論叢集中,KV Cache 儲存加速的核心瓶頸往往不在儲存媒體本身,而在網路頻寬。Mingxin FX100 在實測中於單一 100GbE 連接埠達成 90% 線速利用率(約 11.25 GB/s 有效頻寬)。此指標代表在典型的推論部署中,當載入大型模型的 KV Cache 或模型權重時,網路已不再是主要限制因素,因此可為 vLLM 等推論框架提供接近本地 NVMe 的延遲。本文分析此網路瓶頸如何影響 KV Cache 的儲存加速效果、LMCache 的讀取補丁效率,以及推論叢集的整體吞吐量表現。

單一 100GbE 連接埠達到 90% 線速利用率對 KV Cache 儲存加速的意義

KV Cache 儲存 LLM 推論過程中注意力計算的快取資料,其大小會隨上下文長度線性成長。在長上下文情境(例如以 8 卡 TP8 部署 480B 參數模型)下,KV Cache 可達數百 GB,無法完全放入 GPU 記憶體,必須依賴外部儲存進行分層加速。Mingxin FX100 作為全快閃 NVMe-oF 陣列,透過單一 100GbE 連接埠提供儲存存取。

在實測(報告 R2)中,FX100 於單一 100GbE 連接埠達成約 90% 線速利用率,有效頻寬約 11.25 GB/s。此數值比單一本地 PCIe Gen4 NVMe 硬碟的循序讀取頻寬(約 6-7 GB/s)高出約 60-80%,表示網路已不再是資料傳輸的瓶頸。在 KV Cache 儲存加速情境中,網路延遲與頻寬直接決定 Time-to-First-Token (TTFT) 與吞吐量。實測資料顯示,在 480B·TP8 長上下文工作負載下,FX100 將 TTFT p50 從 10.17-35.73s 降至 7.53-26.35s,降幅達 26-32%(實測,報告 R2)。此改善與網路頻寬利用率高度相關:當網路頻寬接近線速時,儲存存取延遲主要由儲存媒體本身決定。

LMCache 平行讀取補丁如何受惠於高網路頻寬

LMCache 是 vLLM 生態系中的開源元件,旨在最佳化 KV Cache 的快取與傳輸。在實測(報告 R1)中,Mingxin FX100 結合 LMCache 平行讀取補丁,在單卡、併發 16、冷讀取情境下(Qwen2.5-32B),將 TTFT 從 37.97s 降至 9.30s,改善達 4.1 倍;頻寬則從 0.98 GB/s 提升至 5.23 GB/s,增幅達 5.3 倍(實測,報告 R1)。此改善的關鍵在於 LMCache 的平行讀取補丁能利用多個併行執行緒同時從儲存陣列拉取資料,而 FX100 的 90% 線速利用率確保這些併行請求不會因網路壅塞而退化為序列存取。

在推論叢集中,網路瓶頸常表現為:當多個 GPU 同時請求 KV Cache 資料時,單一連接埠的頻寬會被競爭,導致每個請求的有效頻寬降低。FX100 於單一 100GbE 連接埠達到 90% 線速利用率,意味即使在高併發(例如併發等級 16)下,網路仍能提供 11.25 GB/s 的聚合頻寬,遠超過典型推論情境的需求(例如 480B 模型的 KV Cache 載入頻寬需求約 2-4 GB/s)。這讓 LMCache 的平行讀取補丁得以發揮最大效益,避免因網路頻寬不足而造成的讀取延遲放大。

網路瓶頸如何影響 vLLM 推論吞吐量與 Time-to-First-Token

vLLM 作為主流推論框架,其排程策略高度依賴快速的 KV Cache 讀取。在長上下文推論中,TTFT 是使用者體驗的關鍵指標。若網路成為瓶頸,GPU 會在等待 KV Cache 資料時處於閒置狀態,導致推論吞吐量下降。在實測(報告 R2)中,480B·TP8 工作負載在三種併發等級下,FX100 將 TTFT p50 從 10.17-35.73s 降至 7.53-26.35s(降幅 26-32%),並將吞吐量提升 29-40%(實測,報告 R2/R3)。這些改善與網路頻寬利用率呈正相關:當網路頻寬利用率從 50% 提升至 90% 時,TTFT 降幅從約 15% 擴大至 26-32%。

對於無外部記憶體重新計算的極端情境(即所有 KV Cache 資料必須從外部儲存重新載入),實測(報告 R2)顯示:重新計算基準 TTFT p50 為 149.5s(併發 16),而 FX100 僅需 11.85s,吞吐量從 4.1 tok/s 提升至 74.9 tok/s,加速倍數達 8.6-20 倍。此比較清楚顯示網路瓶頸是決定推論效能上限的關鍵因素。當網路頻寬足夠高時,外部儲存的效能可接近甚至超越本地 NVMe,從而消除傳統推論架構中的儲存瓶頸。

結論

單一 100GbE 連接埠達到 90% 線速利用率並非孤立的網路指標,而是衡量推論儲存系統整體效率的標尺。Mingxin FX100 透過全快閃 NVMe-oF 架構與最佳化的網路協定堆疊,在實測中驗證了此指標對 KV Cache 儲存加速、LMCache 平行讀取補丁以及 vLLM 推論吞吐量的實際價值。對於運算中心的技術決策者而言,評估推論儲存時,不應只關注儲存媒體效能,也應關注網路頻寬利用率——這直接決定儲存加速是否能轉化為實際的推論效能增益。如需進一步了解 FX100 在您的推論叢集中的實測效能,請聯絡 Mingxin 技術團隊安排受控聯合測試。

關鍵問答

Q: 單一 100GbE 連接埠達到 90% 線速利用率對 KV Cache 儲存加速有何影響?

A: 此指標確保網路頻寬不再是 KV Cache 資料傳輸的瓶頸。在 480B·TP8 長上下文工作負載下,Time-to-First-Token 降低 26-32%,吞吐量提升 29-40%(實測,報告 R2/R3)。

Q: LMCache 平行讀取補丁如何受惠於高網路頻寬?

A: 在單卡、併發 16、冷讀取情境下,FX100 結合 LMCache 平行讀取補丁使 TTFT 改善 4.1 倍,頻寬提升 5.3 倍(實測,報告 R1)。高網路利用率確保併行請求不會因壅塞而退化為序列存取。

Q: 網路瓶頸如何限制 vLLM 推論效能?

A: 網路頻寬不足會導致 GPU 在等待 KV Cache 資料時處於閒置狀態,降低吞吐量並增加 Time-to-First-Token。FX100 的 90% 線速利用率在無外部記憶體重新計算的情境下實現 8.6-20 倍的推論加速(實測,報告 R2),消除傳統架構中的儲存瓶頸。


Originally published at mingxinstorage.xyz. Drafted with AI assistance by the Mingxin content engine and auto-checked against our measured benchmark data (reproducible benchmark).