步骤三:配置超参数
前提条件:您已完成步骤一:配置优化对象与模型和步骤二:配置优化方法和奖惩机制。
在完成奖惩机制配置后,需要设置强化学习的超参数,平台已经为您提供了一套最优的默认值。
注意:对于刚接触模型优化功能的用户,在您的第一次训练任务中,强烈建议不要修改任何超参数!请将重心放在前一步的“奖惩机制”和数据集质量上。只有当默认参数训练出的模型不达预期时,才建议参考本节指南进行微调。
为了便于理解与排查问题,将超参数按照以下方式进行了重新划分:基础训练与收敛参数、采样与计算资源控制参数、评估与快照保存参数。
基础训练与收敛参数
此类参数直接决定模型更新权重的幅度和训练周期的长短。
| 参数名称 | 参数含义与作用 | 调整风险与建议 |
|---|---|---|
| 超参数配置 | 包含学习率、动量、正则化等,用于综合优化模型的训练过程。 超参数配置是一个综合性参数的统称。核心代表的是学习率。它控制着模型每次收到奖励反馈后,自我修正权重的“步子大小”。底层优化器会根据这个核心数值,联动处理动量与正则化计算。 | 过大:会导致奖励曲线剧烈震荡,模型无法收敛,甚至出现能力退化。 过小:会导致训练极度缓慢,奖励值长期停滞。 建议保持默认,仅在极特殊情况下微调。 |
| 训练轮数 | 模型遍历完整训练数据集的次数。强化学习不同于SFT微调,极易在多轮训练中产生过度拟合。 | 过大:模型容易死记硬背训练集样本,丧失在真实业务中的泛化能力。一般建议保持为默认值。 如训练后出现过度拟合(快照得分极高但部署测试表现差),建议将训练轮数降低。 |
强化学习容易过拟合。如训练后出现过度拟合现象(快照得分极高但部署测试表现差),建议将训练轮数调低。如默认训练后模型不达预期,请优先检查奖惩机制和数据集质量,而非增加训练轮数。
何时需要对参数进行调整?
- 现象1:奖励值曲线上下剧烈跳动,或者突然断崖式下跌后无法回升,模型输出变乱。
调整建议:模型在寻找最优解时步幅过大,直接跨过了正确的参数区域,导致训练崩溃发散。必须降低学习率。建议将学习率降低至0.00002或0.00001后重新启动训练。
- 现象2:训练正常结束,但奖励值曲线从头到尾几乎是一条水平直线,接入验证后发现模型行为与未训练前毫无区别。
- 优先检查奖励规则(正则表达式、匹配逻辑是否正确);确认规则无误后,再考虑提升学习率或增加训练轮数。
调整建议:学习率过小,或单轮训练不充分。 惩罚信号不足以撼动模型原有的参数权重。优先检查“奖惩机制”的正则是否写错(导致全部得0分)。如果规则无误,可尝试将学习率微调提升至0.0001;或将“训练轮数”增加至2轮。
- 现象3:模型在训练快照中的奖励得分极高(接近满分),但部署回真实Agent测试时,稍微改变一下提问方式,模型就会给出荒谬的回答。
发生了严重的过度拟合。 模型为了迎合数据集,不仅“死记硬背”了答案,还遗忘了基座模型原有的常识认知(灾难性遗忘)。保持“训练轮数”为1。问题的根源往往在数据集本身,请扩充数据集的句式多样性,并确保“学习率”没有被调得过高。训练轮数增加会让模型对数据集的记忆不断加深,加剧过拟合风险;保持单轮次训练可以在一定程度上控制拟合程度,为泛化能力保留空间。此外,“灾难性遗忘”的触发不仅与训练轮数有关,学习率过高同样是重要诱因。
采样与计算资源控制参数
这三个参数共同决定了GRPO算法在训练时的显存消耗量。任意一个参数调大,都会导致资源占用显著上升。
| 参数名称 | 参数含义与作用 | 调整风险与建议 |
|---|---|---|
| 批大小 | 单次梯度更新所使用的样本总数。数值越大,梯度的计算越平滑、训练越稳定,但对显存的占用呈线性增长。 | 如果训练任务启动报错“显存不足/OOM”,必须优先将此值调低至16或8。 |
| 分组大小 | GRPO算法专有采样参数。针对同一个输入问题,模型同时生成多个(此处为4个)不同的候选回答,并在这些回答之间进行内部比较,从而计算相对优势得分。 | 保持默认值能在计算成本和对比效果之间取得最佳平衡。过大将显著增加单步训练耗时。 |
| 最大训练长度 | 输入与输出文本的总Token长度限制。限制每次送入模型的问题和模型输出的文本总和。超出此长度的部分会被系统强制截断。 | 如果业务是长文本生成,答案被截断会导致无法触发格式奖励校验,此时需调大。 该值设置的过大极易引发显存溢出 (OOM)。 |
何时需要对参数进行调整?
- 现象1:任务启动不久直接中断失败,出现类似“Out of Memory (OOM)”或显存溢出的错误。
- 现象2:在进行代码生成或长文档撰写任务时,模型生成的长篇回答总是戛然而止,例如输出JSON时连最后的}括号都没有闭合,或者输出的文本出现了截断。
长度限制设置过小,导致模型的回答被强行截断。 回答不完整会导致后面的正则表达式无法命中,模型会因此无辜被扣分。根据业务文本长度,将“最大训练长度”提升。注意:长度提升会使得显存压力翻倍,必须同步将“批大小”调低,以防止OOM。
- 现象3:任务训练非常稳定且未报错,但耗时极其漫长,可能是显存利用率低导致。
参数设置过于保守,未能充分利用算力。在确认不引发 OOM 的前提下,可尝试将“批大小”提升。这不仅能缩短整体训练时间,还能让单次梯度计算更加准确平滑。
- 现象4:针对极度复杂的逻辑推理任务,模型无论如何训练都无法突破当前的准确率瓶颈。
强化学习过程中,模型基于用户问题生成的多个答案中,可能碰巧都没命中正确的解题路径,导致缺乏正向信号。如果算力资源充足,可尝试将“分组大小”提升至6或8。让模型每次生成更多的回答选项进行比对,增加找到最优解的概率(代价是训练时间将成倍增加)。
评估与快照保存参数
此类参数不影响模型最终的性能,但决定了训练过程的可观测性以及版本管理的粒度。
| 参数名称 | 参数含义与作用 | 调整风险与建议 |
|---|---|---|
| Step保存频率 | 模型权重保存频率。决定了系统在训练过程中为您输出多少个“模型快照 (Snapshot)”。这些快照是后续挑选模型版本的备选库。 | 强化学习极易在训练后期发生“奖励作弊(为迎合奖励规则输出无意义废话)”。如果担心最终模型发生退化,建议调高保存频率(如设置为每2步或每1步保存一次),密集的保存频率允许您随时回滚并部署早期表现正常的模型版本。 |
何时需要对参数进行调整?
- 现象1:发现最终产出的模型发生了“奖励作弊(输出大量凑格式的废话)”,但快照列表中找不到作弊发生前的正常模型版本。
保存间隔过大。 仅在完整训练结束时保存了快照,错过了模型表现最优的中间状态。建议在下次训练前,调高Step保存频率(例如修改为每20步或每50步保存一次)。这样能留下密集的存档点,允许您精准回滚并部署早期表现正常的模型版本。
- 现象2:训练数据集较大(例如包含数千条数据),训练耗时较长,控制台的监控指标迟迟不刷新,无法实时判断训练走向。
按Epoch评估导致反馈周期过长。 系统需要跑完全部数据才会输出一次监控点。弃用默认的Epoch粒度,将Step评估频率与Step保存频率均切换为按Step粒度配置(如设置每100步评估一次)。以此获取密集的监控曲线,如果发现指标异常即可提前中止任务,节省算力。
训练异常诊断与排查说明
在监控训练任务或进行最终评估时,如果您发现模型表现不达预期,可参考以下思路进行排查:
训练正常的判断依据:奖励值曲线应呈稳步上升趋势,响应长度保持相对稳定,未出现异常飙升。
排查总原则:建议按照以下优先级顺序排查,先检查数据集质量,再检查奖罚机制配置,然后审视模型快照选择,最后才考虑调整训练超参数。仅在排除业务层与规则层问题、且确认为算法收敛异常时,才考虑微调学习率等底层参数。
优先级1:排查资源瓶颈
- 问题现象:任务刚启动或运行不久后直接异常中断,出现类似“Out of Memory”、“OOM”或“显存溢出”报错。
- 问题原因:模型参数、批大小与文本长度的乘积超出显存限制。强化学习(GRPO算法)因需要为单个输入同时生成多个输出变体(由分组大小决定),其显存占用通常高于常规微调。
- 调整建议:优先将 批大小减半(例如从16降至8);如果仍报错,请检查训练数据是否包含异常长文本,并配合适当降低“最大训练长度”。
优先级2:排查“奖励作弊”现象
- 问题现象:监控看板上的“奖励值”曲线一路上升(甚至接近满分),但右侧的“响应长度”曲线呈指数级异常飙升。抽查模型输出发现包含了大量凑格式的无意义废话。
- 问题原因:这是强化学习中典型的“奖励作弊”现象。模型为迎合设定的规则(如正则匹配),可能会通过生成大量无关的冗余文本来强行命中目标格式。
- 调整建议:请直接在“模型快照列表”中,挑选早期响应长度正常的模型快照进行部署。在下次训练时,建议优化正则表达式,增加更严厉的格式截断约束。
优先级3:排查奖罚规则有效性
- 问题现象:训练平稳运行,但监控看板上的“奖励值”曲线从头到尾几乎是一条水平直线(一直维持在0或负数),毫无上升趋势。
- 问题原因:奖励值长期无上升趋势说明模型未获取到有效的正向反馈信号,通常由以下三种原因导致。
- 正则表达式配置错误(最常见):正则规则无法正确匹配模型的输出,或提取出的格式与数据集的参考答案无法对齐。请仔细核对正则捕获组与标准答案的匹配逻辑。
- 评分标准过于严苛:在生成式奖励中,设置了一票否决的扣分项且极易被触发,导致模型大部分尝试均得0分。
- 任务难度越界:模型优化训练使用的是小尺寸的模型,如果任务难度超过了模型能力可能造成奖励值低。例如要求小模型在未配置“思维链格式奖励”的情况下直接输出复杂的工程计算结果,超出了小模型的直接推理能力。
- 调整建议:请按上述三种原因逐一排查。校验您的正则表达式是否写错,或者“生成式奖励”的评分标准是否过于严苛。请确保数据集的答案能够被您的正则完美提取。如任务本身超出小模型能力,建议配置“思维链格式奖励”引导模型逐步推理,或简化任务目标。
优先级4:排查文本截断问题
- 问题现象:模型生成的长篇回答(如JSON或文本)总是戛然而止。由于回答不完整,导致正则匹配失败被扣分。
- 问题原因:最大训练长度设置过小,回答被系统强行截断。
- 调整建议:将“最大训练长度”提升。注意:调大长度会使显存压力翻倍,请务必同步调低“批大小”以防触发OOM报错。
优先级5:排查过度拟合
- 问题现象:训练曲线极其漂亮,快照得分极高。但部署到真实Agent测试时,只要用户稍微换一种提问方式,模型就会给出极其荒谬的回答。
- 问题原因:发生了过度拟合。模型通过“死记硬背”记住了训练集,但丧失了基础认知和泛化能力。强化学习在训练中后期可能出现过度拟合现象,最优的部署版本往往出现在中间某个阶段。
- 调整建议:将“训练轮数”降低为1。在挑选模型快照时,请综合参考Top 3奖励值的模型,优先选择响应长度较短、并且在实际评估过程中表现好的模型快照。问题的根源往往在于数据集,请返回准备优化数据集,大幅扩充数据集的句式多样性和边界测试问题。
优先级6:调整学习率
- 问题现象:已确认资源充足、正则无误、数据质量极高,但监控看板上的奖励曲线依然上下剧烈震荡无法收敛,或者缓慢得几乎无法察觉上升。
- 问题原因:底层优化器更新权重的步伐失调。在训练的初期阶段,曲线震荡属于强化学习探索策略的正常现象,代表算法正在尝试不同输出以寻找最优解。如果曲线直到训练结束仍剧烈震荡且无法收敛,通常说明底层的学习率设置过大。
- 调整建议:只有在排除了以上5点后,才考虑微调底层的超参数配置(学习率)。
- 曲线剧烈震荡:步子太大跨过了最优解,将学习率降低至0.00002或更小。
- 曲线缓慢无力:步子太小,可略微提升至0.0001进行尝试。
参数配置完成后,页面将展示当前所有超参数的设定值,请确认与预期一致后再进入下一步:步骤四:绑定数据集、产物路径与委托。