知识点发布 ·

AI · 知识点

Reward

Reward:你奖励什么,AI 就会变成什么

RewardAdaptive RouterBanditQualityCostLatencyRouter-R1PILOT

Reward:你奖励什么,AI 就会变成什么

如果说 Benchmark 是 AI 的“考试制度”,那么 Reward 更像 AI 的“利益机制”。

Benchmark 回答的是:

这个系统到底好不好?

Reward 回答的则是:

系统刚才这次选择,到底值不值得以后继续这样做?

所以理解 Reward,其实只需要记住一句话:

Reward,就是告诉机器什么叫“做对了”。

01 / 为什么 Router 特别需要 Reward?

为什么 Router 特别需要 Reward?

假设一个 Router 面前有三个模型。

Model A 很强,但是很贵; Model B 稍微弱一点,但是便宜很多; Model C 最便宜,但复杂问题经常答错。

如果我们告诉 Router:

Reward=QualityReward=Quality

也就是只奖励回答质量,那么结果很简单:

Router 会越来越喜欢最强的模型。

既然用最强模型得到的奖励最高,那为什么还要用便宜模型?

这样一来,Router 虽然存在,但实际上已经失去了意义。

反过来,如果:

Reward=−CostReward=-Cost

也就是只奖励省钱,它又会开始疯狂选择便宜模型。

成本确实降下来了,但回答质量也可能一起下降。

所以一个真正有意义的 Router,要解决的从来不是:

哪个模型最好?

而是:

这道题,到底值得花多少钱去解决?

这就是 Reward 在 Router 里的核心价值。


02 / 最常见的 Reward:质量减成本

最常见的 Reward:质量减成本

目前很多 Router 研究采用的基础思路都很接近:

R=αQ−βCR=\alpha Q-\beta C

不用被公式吓到,它其实就是一句话:

Reward = 回答质量带来的奖励 - 调用模型付出的成本。

其中:

  • Q:回答质量
  • C:调用成本
  • α\alpha:有多重视质量
  • β\beta:有多重视成本

比如:

α=0.8,β=0.2\alpha=0.8,\quad \beta=0.2

就意味着:

我现在明显更在乎答案质量。

而如果变成:

α=0.4,β=0.6\alpha=0.4,\quad \beta=0.6

Router 就会开始更加积极地寻找便宜模型。

BaRP、VDAR-Router 等研究都采用了类似思路。

这件事情真正有意思的地方在于:

Reward 没有一个全行业统一正确的权重。

因为不同业务本来就有不同目标。

医疗问答可能更在意质量。

一个每天处理几百万次请求的客服系统,可能会更加在意成本。

而免费 AI 产品因为用户量巨大,成本甚至可能成为非常重要的限制条件。

所以 Reward 本质上不是一个纯技术问题。

它其实是在把企业的业务目标翻译成数学。


03 / 权重为什么这么重要?

权重为什么这么重要?

假设有两个模型:

A 模型回答质量 95 分,一次调用 1 元。

B 模型回答质量 92 分,一次调用只需要 0.2 元。

如果企业极度追求质量,那么 A 可能更好。

但如果每天需要调用 100 万次呢?

B 只损失了很小一部分质量,却可能节省巨额成本。

于是同样两个模型,因为 Reward 权重不同,Router 最后的选择也完全不同。

这就是为什么:

不存在“最好的 Router”,只有最符合目标的 Router。

你给它什么目标,它就会朝什么方向进化。


04 / Router Reward 现在大概有四条路线

Router Reward 现在大概有四条路线

实际研究当然比下面复杂很多,但从产品角度理解,今天 Router Reward 大致可以归纳成四种思路:

思路简化公式核心想法代表工作
线性权衡R=αQ−βCR=\alpha Q-\beta C质量和成本直接权衡BaRP、VDAR
指数权衡R=Qe−C/λR=Qe^{-C/\lambda}成本越高,质量带来的价值逐渐打折One Head, Many Models
多层 RewardFormat + Quality + Cost不只看结果,还看行为是否符合要求Router-R1
预算约束最大化 Quality,同时 Cost≤BCost\le B钱固定,在预算里做到最好PILOT

虽然公式不同,但它们其实都在解决同一个问题:

如何让 Router 在“更好”和“更便宜”之间做一个合理选择。


05 / Router-R1:Reward 不一定只有质量和成本

Router-R1:Reward 不一定只有质量和成本

Router-R1 提出了一个很有意思的做法。

它不仅奖励最终答案,还会考虑:

格式、结果、成本。

可以简单理解成三个步骤:

第一,先看 Router 有没有按照规则工作。

第二,再看最终答案好不好。

第三,最后再看花了多少钱。

如果 Router 连最基本的输出格式都没有遵守,那么后面的质量和成本奖励甚至都可以失去意义。

这个思路非常像现实企业:

首先不能违规,然后才谈效果,最后再谈效率。

所以 Reward 并不一定只有一个指标。

真正复杂的 AI 系统,Reward 很可能同时包含质量、成本、速度、稳定性、用户反馈,甚至安全要求。


06 / PILOT:也可以不把成本放进 Reward

PILOT:也可以不把成本放进 Reward

还有一种思路我觉得特别符合现实商业世界。

PILOT 没有简单地写:

Reward=Quality−CostReward=Quality-Cost

而是直接说:

预算就这么多,你在预算以内做到最好。

也就是:

max⁡Quality\max Quality

同时满足:

Cost≤BCost\leq B

比如公司直接告诉 Router:

这个 AI 系统一个月最多允许花 50 万。

至于这 50 万里什么时候调用强模型、什么时候调用便宜模型,让 Router 自己决定。

这可能比告诉系统:

“质量权重 0.73,成本权重 0.27”

更加符合真实企业的决策方式。

因为现实中的老板往往不会给你一个复杂数学权重。

他只会告诉你:

预算就这么多,效果给我做到最好。


07 / Reward 真正重要的地方

Reward 真正重要的地方

所以 Reward 最值得理解的,并不是记住某个公式。

真正重要的是:

机器并不知道什么叫“好”。

我们必须先告诉它:

什么值得奖励,什么应该受到惩罚。

奖励准确率,它就会追求准确率。

奖励低成本,它就会寻找便宜模型。

奖励低延迟,它就会选择更快的模型。

奖励用户满意度,它就会开始学习用户偏好。

这也是 Reward 最危险、同时也是最有力量的地方。

因为一个 AI 完全可能非常聪明地优化一个错误目标。

算法决定它怎么学,Reward 决定它值得学什么。

这也是为什么 Reward 和 Benchmark 应该放在一起理解。

Benchmark 是:

我们最终如何判断这个系统有没有变好。

Reward 是:

系统为了变好,应该努力追逐什么。

所以如果一定要用一句话总结:

Benchmark 是 AI 的考试制度,Reward 是 AI 的利益机制。

而 Reward 最值得记住的一句话则是:

你奖励什么,AI 最终就会变成什么。


08 / 参考文献

参考文献

Wei, W., Yang, T., Chen, H., Zhao, Y., Dernoncourt, F., Rossi, R.A. and Eldardiry, H. (2025) ‘Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs’, arXiv preprint arXiv:2510.07429. doi: https://doi.org/10.48550/arXiv.2510.07429

Tang, Y.-C., Hung, J.-C., Peng, W\.-C. and Yen, A.-Z. (2026) ‘VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval’, arXiv preprint arXiv:2607.18098. doi: https://doi.org/10.48550/arXiv.2607.18098

Pulishetty, R. et al. (2025) ‘One Head, Many Models: Cross-Attention Routing for Cost-Aware LLM Selection’, arXiv preprint arXiv:2509.09782. doi: https://doi.org/10.48550/arXiv.2509.09782

Zhang, H., Feng, T. and You, J. (2025) ‘Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning’, Advances in Neural Information Processing Systems. doi: https://doi.org/10.48550/arXiv.2506.09033

Panda, P., Magazine, R., Devaguptapu, C., Takemori, S. and Sharma, V. (2025) ‘Adaptive LLM Routing under Budget Constraints’, Findings of the Association for Computational Linguistics: EMNLP 2025, pp. 23934–23949. doi: https://doi.org/10.18653/v1/2025.findings-emnlp.1301