LLMPod

集群管理

多集群、多节点的注册与观测:节点如何接入拓扑、GPU 指标如何采集与展示、异常节点如何摘除与恢复。

本节内容

01

集群与拓扑

多集群建模,层级拓扑可视化,节点与 GPU 的状态机。

一个控制面可以管理多个集群(通常对应多个机房或多个业务环境),每个集群下挂任意数量的 GPU 节点。拓扑视图按「集群 → 节点 → GPU」三层组织,节点与 GPU 各有独立的状态机:注册中、在线、离线、维护中、已摘除。

状态变化全部通过事件流上报,不需要轮询刷新。对节点执行维护操作(重启、下线)会先经历「维护中」过渡态,期间不再向它调度新部署。

02

节点引导

引导脚本的工作原理、离线环境安装、批量接入多节点。

引导命令由三部分组成:控制面地址 --server、目标集群 --pool、一次性引导令牌 --token。令牌默认 8 小时有效,可在控制台随时吊销。同构机器农场可以复用同一条命令做批量接入。

离线环境(无法访问公网)时,可以先在有网的机器上下载离线包,拷贝到节点后以本地模式执行引导,注册流程与在线完全一致。

03

GPU 指标与监控

利用率、显存、温度等关键指标的采集频率与告警阈值。

节点侧按固定频率采集每张 GPU 的利用率、显存占用、显存带宽、温度与功耗,随心跳上报控制面,并在控制台的节点详情与集群大盘中可视化。

可以在集群级别配置告警阈值:利用率持续过低(资源闲置)、显存临近上限(OOM 风险)、温度越界(散热异常)都会触发事件,推送到 WebSocket 事件流与外部 webhook。

04

节点健康检查

心跳与探活机制,节点失联后的自动摘除与恢复流程。

节点与控制面之间维持心跳;连续多个周期无心跳即判定失联,失联节点上的部署实例会被标记为异常,路由网关自动把流量切到健康副本,调用方无感。

节点恢复心跳后,拓扑自动把它注册回原集群,异常标记清除,调度与流量逐步回迁。整个过程不需要人工介入;只有硬件级故障(GPU 掉卡、显存坏块)需要人工确认后手动摘除。

没找到想要的

在社区论坛提问,或直接联系支持团队,多数问题在一个工作日内有回复。