AI Gateway · 生产运行层调研
Higress AI Gateway
Router 决定用谁回答;Gateway 决定如何让回答稳定、安全、可控地发生。
01 / 研究问题
研究问题
模型选定后,如何保证请求稳定、安全、可控、可观察且可扩展地运行?Higress 在五层框架中是 Production Operation Layer,而不是智能选模 Router。
02 / 动手部署
动手部署
通过 Docker 完成本地部署;管理端运行于 localhost:8001,Gateway 调用经由 localhost:8080。公开内容不包含任何真实凭证。
03 / Gateway 架构
Gateway 架构
User Request → Gateway → Authentication → Traffic / Token Control → Provider Selection / Load Balance → Health / Failover → Model → Response → Observability。
04 / 认证与供应商管理
认证与供应商管理
Unified Model Access、API Consumer、Provider Management 与凭证隔离,把多供应商调用转换为一致且可治理的入口。
05 / 负载均衡与故障转移
负载均衡与故障转移
Weighted load balancing、health check、provider failover 与 model fallback 分别覆盖容量分配、健康状态和多层降级。
06 / Token 限流与配额
Token 限流与配额
传统 API 常用 QPS;AI 请求的 Token 消耗差异巨大,因此还需要按 Consumer、IP、Header 或请求参数配置 Token Rate Limit 与 AI Quota。
07 / 可观测性与产品洞察
可观测性与产品洞察
统一观察请求、供应商、回退、Token 与失败原因,才能把智能路由连接到真实生产责任。Gateway 是 Router 价值稳定发生的运行基础。
08 / 原始证据
原始证据
以下截图来自对应原始材料,只保留与当前页面相关的部分。