腾讯云 TACO 团队与社区合作开发的分布式 KV Store 与多级缓存管理系统 FlexKV,持续迭代并已被主流推理框架原生集成,专攻长上下文推理中的 KV Cache 管理痛点。项目采用三级缓存架构:CPU 内存作为一级外部缓存、本地 SSD 作为二级持久缓存、可扩展存储作为三级分布式缓存。当 GPU 显存不足时,KV Cache 不必丢弃重算,而是下沉到低成本存储层。
一、与主流框架的深度集成
2026 年 3 月 17 日,FlexKV 正式合并进入 vLLM 官方主干(PR #34328),从 vLLM v0.17.2 起 FlexKVConnectorV1 已内置,无需再手动打 patch;2026 年 3 月 3 日,FlexKV 又正式合并进入 NVIDIA Dynamo(PR #5858),成为 Dynamo 原生支持的 KV Cache Offloading 方案,实现 KV 感知路由与多级缓存卸载联合部署。
此外,2026 年 1 月 28 日集成 Mooncake Transfer Engine,支持基于 RDMA 的高性能跨节点分布式 KVCache 复用;2026 年 1 月新增 TensorRT-LLM 支持(#48),vLLM 和 TRT-LLM 均支持 TP16(#53、#59);2025 年 12 月新增 GPU Direct Storage(GDS)支持(#25),实现 SSD 到 GPU 的直接传输、绕过 CPU。
二、核心模块与工作机制
其核心由三大模块组成:StorageEngine 基于 RadixTree 做前缀匹配的三级缓存;GlobalCacheEngine 作为控制面决定数据搬运方向;TransferEngine 作为数据面,借助 io_uring 实现高性能异步传输,CPU、SSD、云存储间的搬移对主进程完全透明。从 v1.0.0 起,FlexKV 从 client-server 模式升级为可直接调用的库函数,消除了进程间通信开销。
三、性能与应用价值
在长文档、长对话与 Agent 多轮调用场景下,FlexKV 可将首 Token 延迟(TTFT)大幅降低、每分钟请求数(QPM)显著提升。项目以 Apache-2.0 协议开源。长上下文的高效管理直接决定推理成本与吞吐,FlexKV 的开源有望降低长上下文服务的工程门槛,让中小团队也能以低成本承接大模型的「长记忆」需求。