更新时间:2026-09-14 GMT+08:00
分享

常见问题

训练任务启动后出现类似“Out of Memory (OOM) / 显存溢出”报错

OOM表示当前任务的参数配置超出了计算资源的显存上限。强化学习(GRPO算法)因需要为单个输入同时生成多个输出变体(由分组大小决定),其显存占用通常高于常规微调。

如果出现此类报错,请返回模型参数配置页面,按以下顺序调整:

  1. 调低批大小(例如从16降至8)。
  2. 如果仍报错,请检查训练数据是否包含异常长文本,并配合适当降低“最大训练长度”。
  3. 调低分组大小(例如从4降至2)也可降低显存占用,但会影响GRPO算法的对比效果,建议作为最后手段。

注意:调低“最大训练长度”可能导致模型长篇回答被截断,截断后正则表达式无法匹配完整内容,模型会被误扣分。如需调低最大训练长度,请同步检查数据集中是否存在过长的样本。

训练过程中,奖励值始终维持在0或负数,无上升趋势

奖励值长期无上升趋势说明模型未获取到有效的正向反馈信号,通常由以下三种原因导致:

  • 正则表达式配置错误(最常见):正则规则无法正确匹配模型的输出,或提取出的格式与数据集的参考答案无法对齐。请仔细核对正则捕获组与标准答案的匹配逻辑。
  • 评分标准过于严苛:在生成式奖励中,设置了一票否决的扣分项且极易被触发,导致模型大部分尝试均得0分。
  • 任务难度越界:当前训练的模型如果尺寸较小,而任务难度超过了模型的能力上限,可能造成奖励值持续偏低。例如要求小模型在未配置“思维链格式奖励”的情况下直接输出复杂的工程计算结果,超出了小模型的直接推理能力。

为什么训练后期奖励值较高,但模型实际输出内容不符合逻辑或包含大量无效文本

这是强化学习中典型的“奖励作弊”现象。模型为迎合设定的规则(如正则匹配),可能会通过生成大量无关的冗余文本来强行命中目标格式。

除了奖励值外,参考“响应长度”指标,如果呈指数级异常飙升则可确认发生了“奖励作弊”现象。

当前训练的处理:奖励作弊通常发生在训练后期,前期的快照仍然是正常的。请在“模型快照列表”中,挑选响应长度正常、奖励值处于稳定区间的早期快照进行部署。发现奖励作弊后建议终止训练以节省算力,无需等待训练完成。

下次训练的调整:奖励作弊的根本原因是奖惩规则存在漏洞,模型发现“凑格式”比“答对题”更容易得高分。建议从以下方面调整:

  • 优化正则表达式:在正则末尾添加$锚定符,禁止模型在目标格式后输出多余内容;或在正则中增加长度约束,限制匹配结果的字符范围。
  • 优化评分标准:如果使用生成式奖励,在评分标准中增加针对冗余文本的扣分项,如“回复中包含重复或无意义内容的,扣0.3分”。
  • 调高Step保存频率:增加快照保存密度,确保能捕获到作弊发生前的正常版本。

奖励值曲线在训练过程中出现剧烈震荡

在训练的初期阶段,曲线震荡属于强化学习探索策略的正常现象,代表算法正在尝试不同输出以寻找最优解。

如果曲线直到训练结束仍剧烈震荡且无法收敛,常见原因之一是学习率设置过大。建议在下一次任务中,适当调低学习率参数(例如从0.00005调整为0.00002)。此外,探索过程中的高奖励数据引起的不规则梯度峰值也可能导致震荡,建议同步检查是否存在异常高奖励的样本。

注意:只有在排除了资源瓶颈(OOM)、奖罚规则错误、文本截断、过拟合等其他问题后,才考虑调整学习率。请先确认正则表达式和评分标准配置正确,再调整学习率。

构建优化数据集时,是否需要添加负例(错误示范)数据以提升模型防幻觉能力

不需要。优化数据集中的参考答案字段必须是100%正确的标准答案。

强化学习算法会在训练过程中通过自主生成回答并计算奖励分来进行纠偏(低分即为负反馈)。如果需提升模型的安全性或拒识能力,正确的做法是在问题字段中构造边界、模糊或对抗性输入,并在参考答案字段中提供规范、正确的拒绝文本。

如果训练出的模型效果未达预期,应该按照什么优先级顺序进行排查和优化

建议按照以下优先级进行排查:

  1. 检查数据集质量:确认训练数据集是否覆盖了真实的业务场景分布,问题句式是否单一导致模型死记硬背,参考答案是否存在标注错误。
  2. 检查奖罚机制配置:检查正则表达式是否准确提取了核心字段?是否因为缺失思维链格式约束导致模型逻辑推导能力不足?生成式奖励的评分标准是否设置合理?
  3. 审视模型快照:是否误选了“过拟合”或“奖励作弊”的模型快照。判断方法:过拟合快照的特征是训练奖励极高但实际测试表现差;奖励作弊快照的特征是奖励值高但响应长度异常飙升。请优先选择响应长度正常、训练奖励稳定在高位平台期的快照。
  4. 调整训练超参数:仅在排除以上业务层与规则层问题,且确认为算法收敛异常时,再考虑微调学习率等底层参数。

训练结束后会生成多个模型快照(Checkpoint),是否必须选择最后一个版本

不一定。强化学习在训练中后期可能出现过度拟合现象,导致模型丧失部分泛化能力。

最优的部署版本往往出现在中间某个阶段。在挑选模型时,请综合参考Top 3奖励值的模型,优先选择响应长度较短、并且在实际评估过程中表现好的模型快照。具体挑选方法:先用响应长度排除奖励作弊的快照,再从剩余快照中选择奖励值处于收敛平台期的版本,最后通过实际业务验证确认最终版本。

相关文档