AI 原生 KV Cache Storage · 分布式 KV 缓存存储
WQS(WiDE Query Storage)由华瑞指数云(ExponTech)面向大规模 AI 推理场景全栈原生设计:以原生 KV 接口无缝对接 vLLM / SGLang 等主流推理框架,将分布式 KV Cache 存储池作为 GPU HBM 显存的透明扩展层,支持无限容量扩展与集群全局共享,为长上下文、高并发推理提供极致性能的存储底座——以存代算,突破上下文瓶颈。
20x
TTFT 加速(100K 输入实测)
22x
Token 吞吐量提升
<200μs
端到端并发读取时延
97–98%
生产环境缓存命中率
100%
DPU 原生卸载(可选)



