跳到主要内容
Token Farm · 模型服务 · AI 产品

Helix

自建推理集群与 KV 缓存基础设施 ——
让长上下文 token 的供给更快、更省、更稳定。

helix · 多 Agent 工作台
Helix Code 多 Agent 工作台展示并行任务执行

Token Farm:自建推理基础设施

从 GPU 集群到磁盘级 KV 缓存,我们把长上下文推理的成本结构重做一遍 —— 让每一个 token 的生产都更便宜。

🖥️

自建 GPU 集群

A100 级集群已投入生产运行;支持 vLLM / SGLang 双栈,长上下文是持续运行的日常负载。

💾

Cascade 磁盘级 KV 缓存

把 KV cache 从显存扩展到 NVMe 与集群存储;缓存复用跳过重复 prefill,长上下文推理的显存占用降低 50–80%(设计目标)。

🔀

推理网关与调度

统一的多模型网关:请求路由、配额计费、密钥与用户体系 —— 把集群产能变成可交付、可计量的 token 供给。

请求接入网关路由与配额KV 缓存匹配(命中即省算力)GPU 集群推理(vLLM / SGLang)流式输出
20.8×
TTFT 加速
公开 benchmark 实测(缓存命中)
96%
缓存命中率
重复前缀复用实测
50–80%
显存节省
设计目标区间
20 GB/s
KV 读写带宽
存储集群支持 TB 级吞吐;取决于网络设备

* 加速比与命中率为公开 benchmark 实测;KV 读写带宽取决于网络设备,存储集群提供 TB 级聚合吞吐。

深入了解平台与基础设施 →

自建与运行模型

从部署、调优到上线 —— 我们在自己的集群上运行完整的模型栈。

🚀

生产运行大模型

DeepSeek V4 Flash 等大模型已在自建集群生产运行,服务端支持 400K 级上下文配置 —— 长上下文是常态负载。

🛠️

全栈推理优化

vLLM / SGLang 双栈;KV 分片、量化部署与分层存储(POSIX / GDS-NvFile)逐项调优,把显存与吞吐同时推向更高。

🔌

多模型接入与切换

统一的模型抽象与策略层:多供应商模型接入、灰度切换与配额管控,一套接口服务所有场景。

推理成本,正在决定 AI 竞争的胜负

Token 正在成为 AI 时代最基础的消耗品,而它的价格由基础设施决定。

📈

推理需求进入指数区间

Agent、长文档、检索与多轮协作成为主流负载 —— 上下文长度与并发量同步暴涨,推理算力成为真正的瓶颈。

💸

成本是竞争的胜负手

模型能力逐渐趋同,长上下文推理的瓶颈从「效果」转向「每 token 成本」;显存是这条链路上最昂贵的资源。

缓存复用是结构性答案

命中的 KV 就是省下的算力。把缓存做成可共享、可调度、可跨节点复用的基础设施,token 成本才能系统性下降。

在基础设施之上,交付两条 Agent 产品线

自研推理栈支撑的 AI 产品:一条服务开发者,一条服务企业。

开发者 · Helix Code

🧩Helix Agent

并行、可观测、长任务的 AI 工程工作流:三层 Multi-Agent 编排、SubAgent 并发执行、上下文缓存与压缩 —— 让长时间的工程任务稳定推进。

并行多 Agent多远端工作区桌面 / 移动 / Web
了解 Helix Code
企业 · Helix Flow

🏢Helix Flow

AI 原生办公协作 + 企业级 Agent 平台:把消息、任务、审批与 AI 助手融入企业日常,支持私有化部署、安全接入与统一治理。

AI 原生办公私有化部署安全与治理
了解 Helix Flow

Helix 的不同之处

为真正在跑工程工作流的团队而设计,而不只是一次性的 chat 补全。

🧠

三层 Multi-Agent 架构

Manager Agent 守住用户意图,Execution Agent 推进执行,SubAgent 深入处理子任务。

并发 Agent 调度

工具调用与 SubAgent 任务并行执行,多模块排查比串行对话循环明显更快。

👁️

可见的 SubAgent 并行视图

主对话继续推进的同时,子任务的状态与结果一目了然。并行不再被隐藏。

📦

缓存 + 压缩的上下文管理

大型工具输出按需缓存与回取,长历史自动压缩,让长会话保持稳定。

🌐

多远端工作区管理

本地项目、远端主机与云端容器统一接入,工作区级隔离,工作流保持一致。

🔧

LSP + Tools + Skill 一体化

代码智能、终端、Git、MCP 工具与 Skill 全部融入同一执行流,从分析到交付不断流。

看 Helix 实战

来自桌面端与移动端应用的真实截图。

想聊聊 Token Farm、模型服务或产品合作?

推理基础设施、模型部署、Agent 产品落地 —— 欢迎联系我们。