Mingxin Technology

在 LLM 推理集群中,KV Cache 存储加速的核心瓶颈往往不在存储介质本身,而在于网络带宽。明信 FX100 在实测中实现了单 100GbE 端口 90% 线速利用率(有效带宽约 11.25 GB/s)。这一指标意味着,在典型推理部署中,当为大模型加载 KV Cache 或模型权重时,网络不再是主要限制因素,从而为 vLLM 等推理框架提供接近本地 NVMe 的延迟。本文分析了这一网络瓶颈如何影响 KV Cache 的存储加速效果、LMCache 的读补丁效率以及推理集群的整体吞吐性能。

单 100GbE 端口 90% 线速利用率对 KV Cache 存储加速的意义

KV Cache 存储了 LLM 推理过程中注意力计算的中间缓存数据,其大小随上下文长度线性增长。在长上下文场景下(例如 480B 参数模型采用 8 卡 TP8 部署),KV Cache 可达数百 GB,无法完全放入 GPU 显存,必须依赖外部存储进行分层加速。明信 FX100 作为全闪 NVMe-oF 阵列,通过单 100GbE 端口提供存储访问。

实测显示(报告 R2),FX100 在单 100GbE 端口上实现了约 90% 的线速利用率,有效带宽约 11.25 GB/s。该值比单块本地 PCIe Gen4 NVMe 盘的顺序读取带宽(约 6-7 GB/s)高出 60-80%,表明网络不再是数据传输的瓶颈。在 KV Cache 存储加速场景中,网络延迟和带宽直接决定首 token 时间(TTFT)和吞吐量。实测数据表明,在 480B·TP8 长上下文负载下,FX100 将 TTFT p50 从 10.17-35.73s 降低至 7.53-26.35s,降幅 26-32%(实测,报告 R2)。这一提升与网络带宽利用率高度相关:当网络带宽接近线速时,存储访问延迟主要由存储介质本身决定。

LMCache 并行读补丁如何受益于高网络带宽

LMCache 是 vLLM 生态中的开源组件,专为优化 KV Cache 的缓存与传输而设计。实测显示(报告 R1),明信 FX100 结合 LMCache 并行读补丁,在单卡、并发 16 的冷读场景(Qwen2.5-32B)下,将 TTFT 从 37.97s 降至 9.30s,提升 4.1 倍;带宽从 0.98 GB/s 提升至 5.23 GB/s,提升 5.3 倍(实测,报告 R1)。这一提升的关键在于,LMCache 的并行读补丁能够利用多线程同时从存储阵列拉取数据,而 FX100 的 90% 线速利用率确保这些并发请求不会因网络拥塞而退化为串行访问。

在推理集群中,网络瓶颈常表现为:当多 GPU 同时请求 KV Cache 数据时,单端口带宽被争用,导致单请求有效带宽下降。FX100 在单 100GbE 端口上的 90% 线速利用率意味着,即使在高并发(例如并发 16)情况下,网络仍能提供 11.25 GB/s 的聚合带宽,远超典型推理场景的需求(例如 480B 模型的 KV Cache 加载带宽需求约为 2-4 GB/s)。这使得 LMCache 的并行读补丁能够发挥最大效能,避免因网络带宽不足而导致的读取延迟放大。

网络瓶颈如何影响 vLLM 推理吞吐与首 token 时间

vLLM 作为主流推理框架,其调度策略高度依赖快速的 KV Cache 读取。在长上下文推理中,TTFT 是用户体验的关键指标。若网络成为瓶颈,GPU 将在等待 KV Cache 数据时处于空闲,导致推理吞吐下降。实测显示(报告 R2),在 480B·TP8 负载、三个并发级别下,FX100 将 TTFT p50 从 10.17-35.73s 降至 7.53-26.35s(降幅 26-32%),并将吞吐提升 29-40%(实测,报告 R2/R3)。这些提升与网络带宽利用率正相关:当网络带宽利用率从 50% 提升至 90% 时,TTFT 降幅从约 15% 扩大至 26-32%。

对于无外部内存重计算的极端场景(即所有 KV Cache 数据必须从外部存储重新加载),实测显示(报告 R2):重计算基线 TTFT p50 为 149.5s(并发 16),而 FX100 仅为 11.85s,吞吐从 4.1 tok/s 提升至 74.9 tok/s,加速比达 8.6-20 倍。这一对比清晰表明,网络瓶颈是决定推理性能上限的关键因素。当网络带宽足够高时,外部存储的性能可接近甚至超越本地 NVMe,从而消除传统推理架构中的存储瓶颈。

结论

单 100GbE 端口 90% 线速利用率并非孤立的网络指标,而是衡量推理存储系统整体效率的标尺。明信 FX100 通过其全闪 NVMe-oF 架构和优化的网络协议栈,在实测中验证了该指标对 KV Cache 存储加速、LMCache 并行读补丁及 vLLM 推理吞吐的实际价值。对于计算中心的技术决策者而言,评估推理存储不应仅关注存储介质性能,还应关注网络带宽利用率——它直接决定存储加速能否转化为实际的推理性能增益。如需了解 FX100 在您的推理集群中的实测性能,请联系明信技术团队进行封闭联合测试。

关键问答

Q:单 100GbE 端口 90% 线速利用率对 KV Cache 存储加速有何影响?

A:该指标确保网络带宽不再是 KV Cache 数据传输的瓶颈。在 480B·TP8 长上下文负载下,首 token 时间降低 26-32%,吞吐提升 29-40%(实测,报告 R2/R3)。

Q:LMCache 并行读补丁如何受益于高网络带宽?

A:在单卡、并发 16 的冷读场景下,FX100 结合 LMCache 并行读补丁实现了 TTFT 4.1 倍提升和带宽 5.3 倍增长(实测,报告 R1)。高网络利用率确保并发请求不会因拥塞而退化为串行访问。

Q:网络瓶颈如何限制 vLLM 推理性能?

A:网络带宽不足会导致 GPU 在等待 KV Cache 数据时空闲,降低吞吐并增加首 token 时间。FX100 的 90% 线速利用率在无外部内存重计算场景下实现了 8.6-20 倍推理加速(实测,报告 R2),消除了传统架构中的存储瓶颈。


Originally published at mingxinstorage.xyz. Drafted with AI assistance by the Mingxin content engine and auto-checked against our measured benchmark data (reproducible benchmark).