Mingxin Technology

LLM推論クラスタでは、KVキャッシュストレージアクセラレーションのコアボトルネックはストレージメディア自体ではなく、ネットワーク帯域幅にあることが多いです。Mingxin FX100は実測テストで単一100GbEポートにおいて90%の回線速度利用率(実効帯域幅約11.25 GB/s)を実現しました。この指標は、典型的な推論環境において、大規模モデルのKVキャッシュやモデル重み読み込み時のネットワークが主要な制約要因ではなくなり、vLLMのような推論フレームワークに対してローカルNVMeに近いレイテンシを提供できることを意味します。本記事では、このネットワークボトルネックがKVキャッシュのストレージアクセラレーション効果、LMCacheのリードパッチング効率、推論クラスタ全体のスループット性能に与える影響を分析します。

KVキャッシュストレージアクセラレーションにおける単一100GbEポート90%回線速度利用率の意義

KVキャッシュはLLM推論中のアテンション中間計算結果をキャッシュするもので、そのサイズはコンテキスト長に比例して増加します。長いコンテキストシナリオ(例: 480Bパラメータモデルを8カードTP8で展開する場合)では、KVキャッシュが数百ギガバイトに達し、GPUメモリに収まりきらず、外部ストレージに依存した階層型アクセラレーションが必要になります。Mingxin FX100はオールフラッシュNVMe-oFアレイとして、単一100GbEポート経由でストレージアクセスを提供します。

実測テスト(report R2)では、FX100が単一100GbEポートで約90%の回線速度利用率を達成し、実効帯域幅は約11.25 GB/sでした。この値は単一ローカルPCIe Gen4 NVMeドライブのシーケンシャルリード帯域幅(約6-7 GB/s)より60-80%高いことを示しており、ネットワークがデータ転送のボトルネックではなくなっていることを意味します。KVキャッシュストレージアクセラレーションシナリオでは、ネットワークレイテンシと帯域幅がtime-to-first-token(TTFT)とスループットを直接決定します。実測データによると、480B·TP8長文ワークロード下で、FX100はTTFT p50を10.17-35.73秒から7.53-26.35秒に短縮し、26-32%の削減を実現しました(実測、report R2)。この改善はネットワーク帯域幅利用率と強く相関しており、ネットワーク帯域幅が回線速度に近づくほど、ストレージアクセスレイテンシはストレージメディア自体によって主に決定されます。

LMCache並列リードパッチングが高ネットワーク帯域幅から得る利点

LMCacheはvLLMエコシステムのオープンソースコンポーネントで、KVキャッシュのキャッシングと転送を最適化するために設計されています。実測テスト(report R1)では、Mingxin FX100とLMCache並列リードパッチングの組み合わせにより、シングルカード・同時実行数16・コールドリードシナリオ(Qwen2.5-32B)でTTFTを37.97秒から9.30秒に短縮し、4.1倍の改善を実現しました。また帯域幅は0.98 GB/sから5.23 GB/sに増加し、5.3倍の改善となりました(実測、report R1)。この改善の鍵は、LMCacheの並列リードパッチングが複数の並行スレッドを使用してストレージアレイから同時にデータを取得できる点にあり、FX100の90%回線速度利用率により、これらの並行リクエストがネットワーク混雑によりシリアルアクセスに劣化しないことが保証されます。

推論クラスタでは、ネットワークボトルネックは複数のGPUが同時にKVキャッシュデータを要求する場合に顕在化し、単一ポートの帯域幅が競合してリクエストごとの実効帯域幅が低下します。FX100の単一100GbEポートにおける90%回線速度利用率は、高い同時実行性(例: 同時実行レベル16)下でもネットワークが11.25 GB/sの集約帯域幅を提供できることを意味し、典型的な推論シナリオの要求(480BモデルのKVキャッシュ読み込み帯域幅要求は約2-4 GB/s)を大幅に上回ります。これにより、LMCacheの並列リードパッチングが最大限の効果を発揮し、ネットワーク帯域幅不足による読み込みレイテンシの増幅を回避できます。

ネットワークボトルネックがvLLM推論スループットとTime-to-First-Tokenに与える影響

vLLMは主要な推論フレームワークとして、そのスケジューリング戦略が高速なKVキャッシュ読み込みに大きく依存しています。長文推論では、TTFTはユーザー体験の重要な指標です。ネットワークがボトルネックになると、KVキャッシュデータを待つ間にGPUがアイドル状態になり、推論スループットが低下します。実測テスト(report R2)では、480B·TP8ワークロード下で3つの同時実行レベルにおいて、FX100はTTFT p50を10.17-35.73秒から7.53-26.35秒に短縮(26-32%の削減)し、スループットを29-40%向上させました(実測、reports R2/R3)。これらの改善はネットワーク帯域幅利用率と正の相関があり、ネットワーク帯域幅利用率が50%から90%に向上するにつれて、TTFT削減率は約15%から26-32%に拡大しました。

外部メモリ再計算を行わない極端なシナリオ(すべてのKVキャッシュデータを外部ストレージから再読み込みする必要がある場合)では、実測テスト(report R2)によると、再計算ベースラインのTTFT p50は149.5秒(同時実行数16)でしたが、FX100は11.85秒を達成し、スループットは4.1 tok/sから74.9 tok/sに向上し、8.6-20倍のアクセラレーション係数となりました。この比較は、ネットワークボトルネックが推論性能の上限を決定する重要な要因であることを明確に示しています。ネットワーク帯域幅が十分に高い場合、外部ストレージの性能はローカルNVMeに近づくか、またはそれを超えることができ、従来の推論アーキテクチャにおけるストレージボトルネックを解消できます。

結論

単一100GbEポートにおける90%回線速度利用率は、孤立したネットワーク指標ではなく、推論ストレージシステム全体の効率を測る物差しです。Mingxin FX100はオールフラッシュNVMe-oFアーキテクチャと最適化されたネットワークプロトコルスタックにより、実測テストでKVキャッシュストレージアクセラレーション、LMCache並列リードパッチング、vLLM推論スループットに対するこの指標の実用的な価値を検証しました。コンピューティングセンターの技術的意思決定者にとって、推論ストレージの評価はストレージメディア性能に焦点を当てるだけでなく、ネットワーク帯域幅利用率にも注目すべきです。これはストレージアクセラレーションが実際の推論性能向上に変換されるかどうかを直接決定します。推論クラスタにおけるFX100の実測性能に関する詳細情報は、Mingxin技術チームにお問い合わせいただき、ゲート付き共同テストをご依頼ください。

主要Q&A

Q: 単一100GbEポートにおける90%回線速度利用率はKVキャッシュストレージアクセラレーションにどのような影響を与えますか?

A: この指標により、ネットワーク帯域幅がKVキャッシュデータ転送のボトルネックではなくなります。480B·TP8長文ワークロード下で、time-to-first-tokenは26-32%削減され、スループットは29-40%向上します(実測、reports R2/R3)。

Q: LMCache並列リードパッチングは高ネットワーク帯域幅からどのような利点を得ますか?

A: シングルカード・同時実行数16・コールドリードシナリオにおいて、FX100とLMCache並列リードパッチングの組み合わせにより、TTFTは4.1倍改善し、帯域幅は5.3倍増加します(実測、report R1)。高いネットワーク利用率により、並行リクエストが混雑によりシリアルアクセスに劣化しないことが保証されます。

Q: ネットワークボトルネックはvLLM推論性能をどのように制限しますか?

A: ネットワーク帯域幅不足により、GPUがKVキャッシュデータを待つ間にアイドル状態になり、スループットが低下してtime-to-first-tokenが増加します。FX100の90%回線速度利用率により、外部メモリ再計算を行わないシナリオで8.6-20倍の推論アクセラレーションを実現し(実測、report R2)、従来のアーキテクチャにおけるストレージボトルネックを解消します。


Originally published at mingxinstorage.xyz. Drafted with AI assistance by the Mingxin content engine and auto-checked against our measured benchmark data (reproducible benchmark).