自适应路由 · 自适应学习与反馈闭环调研
LiteLLM Adaptive Router
Adaptive Router 能做、能跑、能学,但目前仍不是完全成熟的生产标准。
01 / 研究问题与产品设置
研究问题与产品设置
Router 上线后,如何利用真实反馈改变未来选择?研究覆盖 Dashboard、Request Logs、Playground、Virtual Key 与 Model Management,但重点是 v0 / Beta 的 Adaptive Feedback Loop。
02 / 自适应闭环
自适应闭环
Request → Task Classification → Thompson Sampling → Model Selection → Response → Real Feedback → Feedback Attribution → 更新 Request Type × Model Bandit State → 影响下一次选择。
03 / Thompson Sampling
Thompson Sampling
Bandit 在探索与利用之间进行概率选择。反馈不是抽象奖励 Router,而是归因到具体 request type × model 并更新对应状态。
04 / 与 Custom Router 的区别
与 Custom Router 的区别
Not Diamond 是 Evaluation Dataset → Train → Deploy → New Data → Retrain;LiteLLM Adaptive 是 Request → Model → Feedback → Update Bandit → Next Selection Changes。
05 / 闭环实验
闭环实验
动手实验追踪 Feedback Attribution、Bandit State 变化与后续独立请求中的模型偏好,验证最小学习闭环可以实际运行。
06 / 当前限制
当前限制
目前仍属 Beta:Latency 暂未参与评分;Feedback Signal 偏 Regex / English;没有 LLM Judge;每个 request type × model 约最多 200 observations;缺少成熟 decay mechanism,长期稳定性待验证。
07 / 产品机会与洞察
产品机会与洞察
传统 Router 由开发者预设策略;Adaptive Router 开始拥有根据真实使用结果持续修正策略的可能。机会在于更清晰的反馈、可解释状态与生产安全边界。
08 / 原始证据
原始证据
以下截图来自对应原始材料,只保留与当前页面相关的部分。