# 如何挑选最优模型
#### 挑选最优模型
由于强化学习存在奖励作弊和过拟合的风险，最高奖励得分并不总是代表最强的实际业务能力。面对多个模型快照，可参考以下方式挑选最优模型。
表1模型筛选速查表 
| 模型快照特征               | 判断     | 建议                     |
|:---|:---|:---|
| 奖励高+响应长度飙升           | 奖励作弊   | 舍弃                      |
| 奖励高+响应长度正常+位于收敛平台 | 理想快照  | 优先选择                  |
| 奖励高+**验证奖励回落或偏低** | 过拟合风险 | **选择验证奖励较高且稳定的早期快照** |
| Top1奖励+测试表现差        | 奖励规则漏洞 | 舍弃，选择测试表现好的快照           |
| 多个快照验证表现接近         | 均可使用   | 优先选择Step数更少、响应长度更短的早期版本 |
   
请按以下顺序逐步筛选：先用法则一剔除异常快照，再用法则二从剩余快照中锁定收敛区间，最后用法则三进行实际验证。
在快照列表中，请按照以下法则进行初步筛选：
**法则一：警惕奖励作弊，剔除异常模型**
- 观察方法：对比奖励值与响应长度。
- 原理说明：如果一个快照的奖励分极高，但其响应长度相比早期版本显著增长（例如从100Token飙升至800Token），这通常意味着模型发生了奖励作弊现象。模型为了命中正则规则或满足裁判模型的评分标准，学会了输出大量无意义内容。
- 挑选标准：坚决舍弃长度异常飙升的快照。优先选择奖励分高、且响应长度处于业务合理区间的版本。
**法则二：寻找收敛曲线**
- 观察方法：观察奖励曲线的整体趋势。
- 原理说明：训练初期曲线可能剧烈震荡（属于算法在随机探索）。不要选择由于偶然因素产生的孤立高峰快照。
- 挑选标准：在曲线进入高位平台期（即奖励值持续多个Step保持稳定）后，从该区间内挑选一个快照。稳定平台的模型往往比单点高峰模型具备更强的泛化性和稳定性。如配置了验证集，应优先选择验证奖励较高且稳定的快照，而非仅看训练奖励。验证奖励能更准确地反映模型在未参与训练数据上的泛化表现。
**法则三：实际验证排除过拟合模型**
- 观察方法：训练好的模型放在实际Agent中验证，详细说明请参考[快速验证模型效果](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0114.html)。可以从数据集中抽取5\~10条代表性问题，或构造一组边界测试问题，分别用不同快照生成回答，人工评判回答质量。
- 原理说明：如果训练阶段得分较高，实际Agent中改变提问方式后，回答出现劣化，说明模型出现了过拟合。
- 挑选标准：选择训练阶段得分高且实际Agent评测中回答差距小的模型。如多个快照验证表现接近，优先选择Step数更少、响应长度更短的早期版本。
如所有快照均不理想，建议返回检查奖惩规则和数据集质量，参考[步骤二：配置优化方法和奖惩机制](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0107.html)和[步骤三：配置超参数](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0108.html)中的训练异常诊断说明，调整后重新训练。
#### 常见问题
- **为什么系统标记的Top1模型，测试下来反而不好？**
  系统给出的Top 1仅基于"奖惩机制"的数学得分。如果您的奖励规则存在逻辑漏洞，Top 1模型往往只是最擅长"钻漏洞作弊"的版本，而非最聪明的版本。
  
- **训练到最后一步的模型一定是最好的吗？**
  不一定。大模型的强化学习存在"训练坍缩（模式崩溃）"的风险。过度训练会导致模型丧失原本的语言丰富度，往往训练中间阶段的某个版本（Middle Checkpoint）才是综合能力最优的。
  
- **两个模型准确率差不多，怎么选？**
  优先选择Step数更少（更早期） 且 平均响应长度更短 的快照。这通常意味着该模型保留了更多原始基础能力，且输出更加精炼，不易产生幻觉和冗余废话。
  
 
