LLMPod

路由网关

把部署好的模型发布为可调用 API:端点绑定、按 token 定价、权重优先级与 failover 策略。

本节内容

01

端点与模型绑定

一个端点聚合多个部署实例,对外暴露统一地址。

端点是调用方看到的唯一稳定地址。一个端点可以聚合同一模型的多个部署实例(跨节点、跨集群),网关按权重把请求分发到健康实例上。

灰度场景下也可以把同一端点同时绑到新旧两个模型部署上,通过权重逐步切流量,完成灰度后解绑旧实例。

02

权重与优先级

按节点性能与成本设置流量权重,让请求优先落到快节点。

每个绑定关系有一个权重值(例如 vllm-primary w:5 / vllm-standby w:3 / tgi-fallback w:2),网关按权重比例分配流量。权重高的实例优先承接请求,权重低的作为缓冲与备份。

权重是纯声明式配置,改完即刻生效,不需要重启网关或实例。

03

failover 与容灾

实例故障时的自动切换与重试语义,保证调用方无感。

实例健康检查失败或节点失联时,网关立即把该实例从分发列表摘除,流量自动落到其余健康实例上;实例恢复后自动回迁。整个过程调用方无感知。

对幂等请求,网关可在失败瞬间对下一权重实例做一次内部重试,进一步屏蔽瞬时抖动;流式请求不重放,直接按上述摘除逻辑切换。

04

端点定价

按 token 计费的定价配置,与租户预算联动。

端点上按输入 / 输出 token 分别配置单价,计费精度与调用日志逐条对应。多租户场景下,每个租户的用量独立结算,API Key 的预算上限耗尽后自动拒绝新请求。

账单明细可在控制台按租户、按端点、按时间窗导出,与自托管成本核算(电费 / 折旧)对账即可得出真实的每 token 成本。

没找到想要的

在社区论坛提问,或直接联系支持团队,多数问题在一个工作日内有回复。