🖥️
GPU 集群
- A100 级集群已投入生产运行,张量并行(TP8)多卡推理
- vLLM / SGLang 双栈,多模型服务
- 长上下文请求持续服务(服务端 400K 级上下文配置;生产建议单请求 ≤100K)
产能来自集群,成本优势来自缓存,可交付性来自网关。
长上下文的瓶颈不在算力,而在显存 —— Cascade 把冷数据与可复用数据下沉到磁盘与集群。
GPU 显存约 80 GB/卡且极其昂贵;单节点 NVMe 可达数 TB 且成本低一个量级。用少量的存储延迟,换取显存压力的数量级缓解。
请求进入时先做前缀匹配:命中的 KV 从存储层直接加载、跳过重复 prefill,TTFT 大幅下降;集群 KV 读写带宽达 20 GB/s(取决于网络设备)。
共享缓存池(MVP)让不同节点、不同请求复用同一份 KV —— 同一段上下文只算一次。
数据来自 Cascade 公开 benchmark 文档,可独立复核。
| 场景 | 指标 | 结果 |
|---|---|---|
| 重复前缀复用(POSIX 后端) | TTFT(冷启动 → 缓存命中) | 8.105s → 0.390s(20.8×) |
| 重复前缀复用(POSIX 后端) | 缓存命中率 | 96% |
| A100 验证环境 | 重复请求 TTFT | 1.704s → 0.199s(8.6×) |
| 存储集群 | 聚合吞吐 | TB 级 |
| KV 加载 / 写入 | 带宽 | 20 GB/s(取决于网络设备) |
* KV 读写带宽取决于网络设备与部署配置;存储吞吐为集群聚合能力。TTFT 与命中率为公开 benchmark 实测,口径与限制条件以 Cascade 仓库文档为准。