跳到主要内容
平台与基础设施

把长上下文推理的成本结构重做一遍

从 GPU 集群、磁盘级 KV 缓存到多模型网关 —— 我们运营完整的自建推理栈,规模化供给 token。

三件套:集群、缓存、网关

产能来自集群,成本优势来自缓存,可交付性来自网关。

🖥️

GPU 集群

  • A100 级集群已投入生产运行,张量并行(TP8)多卡推理
  • vLLM / SGLang 双栈,多模型服务
  • 长上下文请求持续服务(服务端 400K 级上下文配置;生产建议单请求 ≤100K)
💾

Cascade 磁盘级 KV 缓存

  • 把 KV cache 从显存扩展到 NVMe 与集群存储
  • 缓存匹配命中即跳过重复 prefill —— 省算力、降 TTFT
  • POSIX 与 GDS/NvFile 双存储后端,自动回退
🔀

推理网关

  • 多模型路由与负载感知调度(集群侧)
  • 平台层网关:配额计费、密钥与用户体系
  • 兼容 OpenAI 接口,现有应用可直接接入

Cascade:让 KV 缓存长出显存之外

长上下文的瓶颈不在算力,而在显存 —— Cascade 把冷数据与可复用数据下沉到磁盘与集群。

📉

为什么用磁盘

GPU 显存约 80 GB/卡且极其昂贵;单节点 NVMe 可达数 TB 且成本低一个量级。用少量的存储延迟,换取显存压力的数量级缓解。

🎯

命中即省算力

请求进入时先做前缀匹配:命中的 KV 从存储层直接加载、跳过重复 prefill,TTFT 大幅下降;集群 KV 读写带宽达 20 GB/s(取决于网络设备)。

🔗

跨节点复用

共享缓存池(MVP)让不同节点、不同请求复用同一份 KV —— 同一段上下文只算一次。

公开 Benchmark 快照

数据来自 Cascade 公开 benchmark 文档,可独立复核。

场景指标结果
重复前缀复用(POSIX 后端)TTFT(冷启动 → 缓存命中)8.105s → 0.390s(20.8×)
重复前缀复用(POSIX 后端)缓存命中率96%
A100 验证环境重复请求 TTFT1.704s → 0.199s(8.6×)
存储集群聚合吞吐TB 级
KV 加载 / 写入带宽20 GB/s(取决于网络设备)

* KV 读写带宽取决于网络设备与部署配置;存储吞吐为集群聚合能力。TTFT 与命中率为公开 benchmark 实测,口径与限制条件以 Cascade 仓库文档为准。

想聊聊部署方案或合作?

接入 token 服务、私有化部署模型、或产品落地 —— 欢迎联系我们。