LLMPod
私有化部署 · 多集群 GPU 推理

私有化 LLM 推理的基础设施

把自建 GPU 集群变成可调用、可计费、可容灾的推理 API。集群编排、模型部署、路由网关、多租户计费,开箱即用。

$curl -fsSL https://console.llmpod.cn/src/download/install.sh | sh
24 nodes192 GPUs99.97% uptime
Quick Start

一行命令拉起控制面

Install

# 一行安装脚本拉起控制面,自动检查系统依赖与端口要求

$curl -fsSL https://console.llmpod.cn/src/download/install.sh | sh

一体化的推理平台

从 GPU 节点到对外推理 API,一条链路打通。不用再自己粘 Prometheus、vLLM、网关和计费。

Cluster

集群编排

多集群拓扑可视化,节点引导脚本秒级接入。实时 GPU 指标、显存利用率、推理链路一目了然。

192 GPU · 24 节点 · 6 集群
Deploy

模型部署

预检 → 部署 → 日志 → 扩缩容,全生命周期。

Gateway

路由网关

端点定价、failover、权重优先级。

Billing

计费与日志

API Key 预算上限、调用日志、多租户 RBAC。按 token 计费,按租户隔离,调用可追溯。

按 token 计费 · 多租户隔离 · 调用可追溯
How it works

五步从 GPU 到推理 API

  1. 01

    声明集群

    节点列表签发引导命令,GPU 机器执行后自动注册上线。

  2. 02

    上传模型

    HuggingFace / OSS / 本地文件,探测回填信息,分片上传。

  3. 03

    部署预检

    推荐放置 + 显存余量 + 清单校验,确认页一次看清。

  4. 04

    启动推理

    vLLM / SGLang 流水线编排,多副本健康检查就绪。

  5. 05

    发布路由

    对外模型名、按 token 定价、failover,OpenAI 兼容 API。

LLMPOD / CONTROL PLANEconsole.console.llmpod.cn
节点列表 · 注册节点
$ curl -fsSL 'https://api.console.llmpod.cn/agent/install.sh' | sudo bash -s -- \
    --server=api.console.llmpod.cn:8443 \
    --pool=prod-a \
    --token=bt_8f3d…

node-cn-1a 已注册 · 24 GPU · 在线

引导令牌 8h 内可重复使用 · 多台机器复用

模型管理 · 添加模型
Qwen/Qwen2.5-7B-Instruct4.2 / 6.8 GB

清单预检通过 · 探测回填格式与架构

HuggingFace / OSS / 本地文件 · 分片上传 · 断点续传

部署管理 · 确认部署
  • 显存余量(单卡)+18.6 GB
  • 放置规划2 副本 · 4 卡/份
  • 模型清单校验已通过
  • 引擎镜像建议 vllm:0.6.0
部署详情 · 流水线 · vLLM
  • 下载模型14.5 GB
  • 拉取镜像vllm:0.6.0
  • 主节点健康检查通过
  • 工作节点健康检查11 / 12
  • 生成端点—
模型发布 · 路由配置
api.console.llmpod.cn/v1 · OpenAI 兼容
对外模型名
qwen2.5-7b-instruct
定价
输入 ¥2 / 输出 ¥6 每百万 token
failover
最多切换 3 次 · 自动重试
CLUSTER / ONLINE
CURRENT STEP01 · 声明集群
控制台逐步演示05 STEPS / GPU → API
用户反馈

跑在自己 GPU 上的团队怎么说

从 8 卡试点到多机房铺开,下面是几个团队的接入记录。

  • prod-cn-1 · 8 × A100
    三地机房以前全靠脚本加手工台账,换个人接手就说不清哪台卡在跑什么。接入后节点上线就是一条命令,模型从上传到出 API 大约 12 分钟。
    长赢推理平台负责人
    P99 1.42s → 0.61s
  • 灰度发布 · 5% 流量
    最实用的是灰度切流:新模型先接 5% 流量,盯一晚上指标没有异常再放开,不用半夜起来改 nginx 配置。
    白露算法工程负责人
    灰度 5% → 100%
  • 显存预检 · A100 80G
    显存够不够这种问题,文档里直接给公式和 A100 上的实测数字,不用自己拿小模型试半天。预检那一步基本把坑都拦住了。
    砚舟基础设施工程师
    单卡余量 +18.6 GB
  • 私有化 · 全内网
    我们的数据不能出内网,私有化是硬要求。整套控制面装在自己机房,审计日志和调用记录按租户导出,合规那边一次就过了。
    半山技术负责人
    全量内网运行
  • 多租户 · 按 token 计费
    多租户这块省了我们自己造轮子的时间:每个业务线一个 Key、一份预算,超了直接拦,月底不用再对着一堆日志手工拆账。
    拾柒平台架构师
    11 个业务线 · 独立预算
  • 故障切换 · api.console.llmpod.cn
    上周一台节点掉线,网关把流量挪到备用端点,我们是从告警里才知道的,业务侧完全没有感知。
    青崖运维负责人
    failover 3.2s

准备好在自己的 GPU 上跑推理了吗

一行命令接入节点,几分钟内部署模型,立刻对外提供推理 API。