AI · 知识点
Reward
Reward:你奖励什么,AI 就会变成什么
Reward:你奖励什么,AI 就会变成什么
如果说 Benchmark 是 AI 的“考试制度”,那么 Reward 更像 AI 的“利益机制”。
Benchmark 回答的是:
这个系统到底好不好?
Reward 回答的则是:
系统刚才这次选择,到底值不值得以后继续这样做?
所以理解 Reward,其实只需要记住一句话:
Reward,就是告诉机器什么叫“做对了”。
01 / 为什么 Router 特别需要 Reward?
为什么 Router 特别需要 Reward?
假设一个 Router 面前有三个模型。
Model A 很强,但是很贵; Model B 稍微弱一点,但是便宜很多; Model C 最便宜,但复杂问题经常答错。
如果我们告诉 Router:
也就是只奖励回答质量,那么结果很简单:
Router 会越来越喜欢最强的模型。
既然用最强模型得到的奖励最高,那为什么还要用便宜模型?
这样一来,Router 虽然存在,但实际上已经失去了意义。
反过来,如果:
也就是只奖励省钱,它又会开始疯狂选择便宜模型。
成本确实降下来了,但回答质量也可能一起下降。
所以一个真正有意义的 Router,要解决的从来不是:
哪个模型最好?
而是:
这道题,到底值得花多少钱去解决?
这就是 Reward 在 Router 里的核心价值。
02 / 最常见的 Reward:质量减成本
最常见的 Reward:质量减成本
目前很多 Router 研究采用的基础思路都很接近:
不用被公式吓到,它其实就是一句话:
Reward = 回答质量带来的奖励 - 调用模型付出的成本。
其中:
Q:回答质量C:调用成本- :有多重视质量
- :有多重视成本
比如:
就意味着:
我现在明显更在乎答案质量。
而如果变成:
Router 就会开始更加积极地寻找便宜模型。
BaRP、VDAR-Router 等研究都采用了类似思路。
这件事情真正有意思的地方在于:
Reward 没有一个全行业统一正确的权重。
因为不同业务本来就有不同目标。
医疗问答可能更在意质量。
一个每天处理几百万次请求的客服系统,可能会更加在意成本。
而免费 AI 产品因为用户量巨大,成本甚至可能成为非常重要的限制条件。
所以 Reward 本质上不是一个纯技术问题。
它其实是在把企业的业务目标翻译成数学。
03 / 权重为什么这么重要?
权重为什么这么重要?
假设有两个模型:
A 模型回答质量 95 分,一次调用 1 元。
B 模型回答质量 92 分,一次调用只需要 0.2 元。
如果企业极度追求质量,那么 A 可能更好。
但如果每天需要调用 100 万次呢?
B 只损失了很小一部分质量,却可能节省巨额成本。
于是同样两个模型,因为 Reward 权重不同,Router 最后的选择也完全不同。
这就是为什么:
不存在“最好的 Router”,只有最符合目标的 Router。
你给它什么目标,它就会朝什么方向进化。
04 / Router Reward 现在大概有四条路线
Router Reward 现在大概有四条路线
实际研究当然比下面复杂很多,但从产品角度理解,今天 Router Reward 大致可以归纳成四种思路:
| 思路简化公式核心想法代表工作 | |||
|---|---|---|---|
| 线性权衡 | 质量和成本直接权衡 | BaRP、VDAR | |
| 指数权衡 | 成本越高,质量带来的价值逐渐打折 | One Head, Many Models | |
| 多层 Reward | Format + Quality + Cost | 不只看结果,还看行为是否符合要求 | Router-R1 |
| 预算约束 | 最大化 Quality,同时 | 钱固定,在预算里做到最好 | PILOT |
虽然公式不同,但它们其实都在解决同一个问题:
如何让 Router 在“更好”和“更便宜”之间做一个合理选择。
05 / Router-R1:Reward 不一定只有质量和成本
Router-R1:Reward 不一定只有质量和成本
Router-R1 提出了一个很有意思的做法。
它不仅奖励最终答案,还会考虑:
格式、结果、成本。
可以简单理解成三个步骤:
第一,先看 Router 有没有按照规则工作。
第二,再看最终答案好不好。
第三,最后再看花了多少钱。
如果 Router 连最基本的输出格式都没有遵守,那么后面的质量和成本奖励甚至都可以失去意义。
这个思路非常像现实企业:
首先不能违规,然后才谈效果,最后再谈效率。
所以 Reward 并不一定只有一个指标。
真正复杂的 AI 系统,Reward 很可能同时包含质量、成本、速度、稳定性、用户反馈,甚至安全要求。
06 / PILOT:也可以不把成本放进 Reward
PILOT:也可以不把成本放进 Reward
还有一种思路我觉得特别符合现实商业世界。
PILOT 没有简单地写:
而是直接说:
预算就这么多,你在预算以内做到最好。
也就是:
同时满足:
比如公司直接告诉 Router:
这个 AI 系统一个月最多允许花 50 万。
至于这 50 万里什么时候调用强模型、什么时候调用便宜模型,让 Router 自己决定。
这可能比告诉系统:
“质量权重 0.73,成本权重 0.27”
更加符合真实企业的决策方式。
因为现实中的老板往往不会给你一个复杂数学权重。
他只会告诉你:
预算就这么多,效果给我做到最好。
07 / Reward 真正重要的地方
Reward 真正重要的地方
所以 Reward 最值得理解的,并不是记住某个公式。
真正重要的是:
机器并不知道什么叫“好”。
我们必须先告诉它:
什么值得奖励,什么应该受到惩罚。
奖励准确率,它就会追求准确率。
奖励低成本,它就会寻找便宜模型。
奖励低延迟,它就会选择更快的模型。
奖励用户满意度,它就会开始学习用户偏好。
这也是 Reward 最危险、同时也是最有力量的地方。
因为一个 AI 完全可能非常聪明地优化一个错误目标。
算法决定它怎么学,Reward 决定它值得学什么。
这也是为什么 Reward 和 Benchmark 应该放在一起理解。
Benchmark 是:
我们最终如何判断这个系统有没有变好。
Reward 是:
系统为了变好,应该努力追逐什么。
所以如果一定要用一句话总结:
Benchmark 是 AI 的考试制度,Reward 是 AI 的利益机制。
而 Reward 最值得记住的一句话则是:
你奖励什么,AI 最终就会变成什么。
08 / 参考文献
参考文献
Wei, W., Yang, T., Chen, H., Zhao, Y., Dernoncourt, F., Rossi, R.A. and Eldardiry, H. (2025) ‘Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs’, arXiv preprint arXiv:2510.07429. doi: https://doi.org/10.48550/arXiv.2510.07429
Tang, Y.-C., Hung, J.-C., Peng, W\.-C. and Yen, A.-Z. (2026) ‘VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval’, arXiv preprint arXiv:2607.18098. doi: https://doi.org/10.48550/arXiv.2607.18098
Pulishetty, R. et al. (2025) ‘One Head, Many Models: Cross-Attention Routing for Cost-Aware LLM Selection’, arXiv preprint arXiv:2509.09782. doi: https://doi.org/10.48550/arXiv.2509.09782
Zhang, H., Feng, T. and You, J. (2025) ‘Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning’, Advances in Neural Information Processing Systems. doi: https://doi.org/10.48550/arXiv.2506.09033
Panda, P., Magazine, R., Devaguptapu, C., Takemori, S. and Sharma, V. (2025) ‘Adaptive LLM Routing under Budget Constraints’, Findings of the Association for Computational Linguistics: EMNLP 2025, pp. 23934–23949. doi: https://doi.org/10.18653/v1/2025.findings-emnlp.1301