作品研究发布 · 更新 ·

自适应路由 · 自适应学习与反馈闭环调研

LiteLLM Adaptive Router

Adaptive Router 能做、能跑、能学,但目前仍不是完全成熟的生产标准。

BanditFeedbackAdaptive AI

01 / 研究问题与产品设置

研究问题与产品设置

Router 上线后,如何利用真实反馈改变未来选择?研究覆盖 Dashboard、Request Logs、Playground、Virtual Key 与 Model Management,但重点是 v0 / Beta 的 Adaptive Feedback Loop。

02 / 自适应闭环

自适应闭环

Request → Task Classification → Thompson Sampling → Model Selection → Response → Real Feedback → Feedback Attribution → 更新 Request Type × Model Bandit State → 影响下一次选择。

03 / Thompson Sampling

Thompson Sampling

Bandit 在探索与利用之间进行概率选择。反馈不是抽象奖励 Router,而是归因到具体 request type × model 并更新对应状态。

04 / 与 Custom Router 的区别

与 Custom Router 的区别

Not Diamond 是 Evaluation Dataset → Train → Deploy → New Data → Retrain;LiteLLM Adaptive 是 Request → Model → Feedback → Update Bandit → Next Selection Changes。

05 / 闭环实验

闭环实验

动手实验追踪 Feedback Attribution、Bandit State 变化与后续独立请求中的模型偏好,验证最小学习闭环可以实际运行。

06 / 当前限制

当前限制

目前仍属 Beta:Latency 暂未参与评分;Feedback Signal 偏 Regex / English;没有 LLM Judge;每个 request type × model 约最多 200 observations;缺少成熟 decay mechanism,长期稳定性待验证。

07 / 产品机会与洞察

产品机会与洞察

传统 Router 由开发者预设策略;Adaptive Router 开始拥有根据真实使用结果持续修正策略的可能。机会在于更清晰的反馈、可解释状态与生产安全边界。

08 / 原始证据

原始证据

以下截图来自对应原始材料,只保留与当前页面相关的部分。