运维指南
日常运维手册:监控大盘怎么读、容量规划怎么做、常见故障的定位与恢复路径。
本节内容
监控大盘
关键 SLI 指标解读,异常模式识别。
大盘核心三个 SLI:请求成功率(按端点)、P95 / P99 延迟、GPU 有效利用率(承接推理的时间占比)。健康状态是「成功率平稳、延迟平稳、利用率随业务量波动」。
典型异常模式:延迟抬升但利用率不涨通常是排队(副本不足);利用率打满且延迟抬升是容量到顶;成功率突降优先看 failover 事件与实例日志。
容量规划
按业务量预估 GPU 需求,规划扩容节奏。
用「每 token 成本 × 业务预估量」反推 GPU 需求:先在小流量下测出单副本吞吐(tokens/s),再按峰值 QPS 与可接受排队深度计算副本数,最后加 20% 余量应对故障转移。
扩容有两条路:加副本(分钟级,吃现有节点余量)与加节点(引导新机器后自动进池)。容量规划建议按周复盘一次大盘数据滚动修正。
故障恢复
节点宕机、实例 OOM、网关超时等常见场景的处理手册。
节点宕机:网关自动摘流量,无需人工;等节点恢复心跳或确认硬件故障后手动摘除,部署副本会由调度器补到其他节点。
实例 OOM:预检通过但仍可能因长上下文触发峰值 OOM。处理路径是看实例日志确认峰值显存,调低并发批大小或升级为更高并行度,必要时扩副本分流。
网关超时:先区分「实例慢」与「网关到实例链路问题」——看调用日志的延迟分布与实例日志的请求到达时间差,前者扩容,后者查网络与 keepalive 配置。
升级与备份
控制面版本升级步骤与配置、元数据备份策略。
控制面升级:拉新版本镜像 / 二进制后滚动重启,节点侧运行时与控制面版本向后兼容,节点不需要同步升级。升级窗口避开业务高峰,操作前先备份元数据库。
备份策略:控制面元数据(集群拓扑、模型清单、部署与端点配置、密钥与计费记录)定期导出;模型文件本身建议在对象存储保留一份源副本,节点上的权重可随时重新分发。