Cluster
集群编排
多集群拓扑可视化,节点引导脚本秒级接入。实时 GPU 指标、显存利用率、推理链路一目了然。
192 GPU · 24 节点 · 6 集群
# 一行安装脚本拉起控制面,自动检查系统依赖与端口要求
$curl -fsSL https://console.llmpod.cn/src/download/install.sh | sh从 GPU 节点到对外推理 API,一条链路打通。不用再自己粘 Prometheus、vLLM、网关和计费。
多集群拓扑可视化,节点引导脚本秒级接入。实时 GPU 指标、显存利用率、推理链路一目了然。
预检 → 部署 → 日志 → 扩缩容,全生命周期。
端点定价、failover、权重优先级。
API Key 预算上限、调用日志、多租户 RBAC。按 token 计费,按租户隔离,调用可追溯。
节点列表签发引导命令,GPU 机器执行后自动注册上线。
HuggingFace / OSS / 本地文件,探测回填信息,分片上传。
推荐放置 + 显存余量 + 清单校验,确认页一次看清。
vLLM / SGLang 流水线编排,多副本健康检查就绪。
对外模型名、按 token 定价、failover,OpenAI 兼容 API。
$ curl -fsSL 'https://api.console.llmpod.cn/agent/install.sh' | sudo bash -s -- \
--server=api.console.llmpod.cn:8443 \
--pool=prod-a \
--token=bt_8f3d…node-cn-1a 已注册 · 24 GPU · 在线
引导令牌 8h 内可重复使用 · 多台机器复用
清单预检通过 · 探测回填格式与架构
HuggingFace / OSS / 本地文件 · 分片上传 · 断点续传
从 8 卡试点到多机房铺开,下面是几个团队的接入记录。
三地机房以前全靠脚本加手工台账,换个人接手就说不清哪台卡在跑什么。接入后节点上线就是一条命令,模型从上传到出 API 大约 12 分钟。
最实用的是灰度切流:新模型先接 5% 流量,盯一晚上指标没有异常再放开,不用半夜起来改 nginx 配置。
显存够不够这种问题,文档里直接给公式和 A100 上的实测数字,不用自己拿小模型试半天。预检那一步基本把坑都拦住了。
我们的数据不能出内网,私有化是硬要求。整套控制面装在自己机房,审计日志和调用记录按租户导出,合规那边一次就过了。
多租户这块省了我们自己造轮子的时间:每个业务线一个 Key、一份预算,超了直接拦,月底不用再对着一堆日志手工拆账。
上周一台节点掉线,网关把流量挪到备用端点,我们是从告警里才知道的,业务侧完全没有感知。