更新时间:2026-09-14 GMT+08:00
分享

如何挑选最优模型

挑选最优模型

由于强化学习存在奖励作弊和过拟合的风险,最高奖励得分并不总是代表最强的实际业务能力。面对多个模型快照,可参考以下方式挑选最优模型。

表1 模型筛选速查表

模型快照特征

判断

建议

奖励高+响应长度飙升

奖励作弊

舍弃

奖励高+响应长度正常+位于收敛平台

理想快照

优先选择

奖励高+验证奖励回落或偏低

过拟合风险

选择验证奖励较高且稳定的早期快照

Top1奖励+测试表现差

奖励规则漏洞

舍弃,选择测试表现好的快照

多个快照验证表现接近

均可使用

优先选择Step数更少、响应长度更短的早期版本

请按以下顺序逐步筛选:先用法则一剔除异常快照,再用法则二从剩余快照中锁定收敛区间,最后用法则三进行实际验证。

在快照列表中,请按照以下法则进行初步筛选:

法则一:警惕奖励作弊,剔除异常模型

  • 观察方法:对比奖励值与响应长度。
  • 原理说明:如果一个快照的奖励分极高,但其响应长度相比早期版本显著增长(例如从100Token飙升至800Token),这通常意味着模型发生了奖励作弊现象。模型为了命中正则规则或满足裁判模型的评分标准,学会了输出大量无意义内容。
  • 挑选标准:坚决舍弃长度异常飙升的快照。优先选择奖励分高、且响应长度处于业务合理区间的版本。

法则二:寻找收敛曲线

  • 观察方法:观察奖励曲线的整体趋势。
  • 原理说明:训练初期曲线可能剧烈震荡(属于算法在随机探索)。不要选择由于偶然因素产生的孤立高峰快照。
  • 挑选标准:在曲线进入高位平台期(即奖励值持续多个Step保持稳定)后,从该区间内挑选一个快照。稳定平台的模型往往比单点高峰模型具备更强的泛化性和稳定性。如配置了验证集,应优先选择验证奖励较高且稳定的快照,而非仅看训练奖励。验证奖励能更准确地反映模型在未参与训练数据上的泛化表现。

法则三:实际验证排除过拟合模型

  • 观察方法:训练好的模型放在实际Agent中验证,详细说明请参考快速验证模型效果。可以从数据集中抽取5~10条代表性问题,或构造一组边界测试问题,分别用不同快照生成回答,人工评判回答质量。
  • 原理说明:如果训练阶段得分较高,实际Agent中改变提问方式后,回答出现劣化,说明模型出现了过拟合。
  • 挑选标准:选择训练阶段得分高且实际Agent评测中回答差距小的模型。如多个快照验证表现接近,优先选择Step数更少、响应长度更短的早期版本。

如所有快照均不理想,建议返回检查奖惩规则和数据集质量,参考步骤二:配置优化方法和奖惩机制和步骤三:配置超参数中的训练异常诊断说明,调整后重新训练。

常见问题

  • 为什么系统标记的Top1模型,测试下来反而不好?

    系统给出的Top 1仅基于“奖惩机制”的数学得分。如果您的奖励规则存在逻辑漏洞,Top 1模型往往只是最擅长“钻漏洞作弊”的版本,而非最聪明的版本。

  • 训练到最后一步的模型一定是最好的吗?

    不一定。大模型的强化学习存在“训练坍缩(模式崩溃)”的风险。过度训练会导致模型丧失原本的语言丰富度,往往训练中间阶段的某个版本(Middle Checkpoint)才是综合能力最优的。

  • 两个模型准确率差不多,怎么选?

    优先选择Step数更少(更早期) 且 平均响应长度更短 的快照。这通常意味着该模型保留了更多原始基础能力,且输出更加精炼,不易产生幻觉和冗余废话。

相关文档