# 步骤三：配置超参数
前提条件：您已完成[步骤一：配置优化对象与模型](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0106.html)和[步骤二：配置优化方法和奖惩机制](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0107.html)。
在完成奖惩机制配置后，需要设置强化学习的超参数，平台已经为您提供了一套最优的默认值。
注意：对于刚接触模型优化功能的用户，在您的第一次训练任务中，强烈建议不要修改任何超参数！请将重心放在前一步的"奖惩机制"和数据集质量上。只有当默认参数训练出的模型不达预期时，才建议参考本节指南进行微调。
为了便于理解与排查问题，将超参数按照以下方式进行了重新划分：**基础训练与收敛参数** 、**采样与计算资源控制参数** 、**评估与快照保存参数**。
#### 基础训练与收敛参数
此类参数直接决定模型更新权重的幅度和训练周期的长短。
表1参数解释 
| 参数名称  | 参数含义与作用                                                                                                                                                 | 调整风险与建议                                                                                                                                                    |
|:---|:---|:---|
| 超参数配置 | 包含学习率、动量、正则化等，用于综合优化模型的训练过程。 超参数配置是一个综合性参数的统称。核心代表的是学习率。它控制着模型每次收到奖励反馈后，自我修正权重的"步子大小"。底层优化器会根据这个核心数值，联动处理动量与正则化计算。 | **过大**：会导致奖励曲线剧烈震荡，模型无法收敛，甚至出现能力退化。 **过小**：会导致训练极度缓慢，奖励值长期停滞。 **建议保持默认，仅在极特殊情况下微调。** |
| 训练轮数 | 模型遍历完整训练数据集的次数。强化学习不同于SFT微调，极易在多轮训练中产生过度拟合。                                                                                                              | **过大**：模型容易死记硬背训练集样本，丧失在真实业务中的泛化能力。一般建议保持为默认值。 如训练后出现过度拟合（快照得分极高但部署测试表现差），建议将训练轮数降低。                                  |
   
![](https://support.huaweicloud.com/ops-agentarts/public_sys-resources/note_3.0-zh-cn.png)
强化学习容易过拟合。如训练后出现过度拟合现象（快照得分极高但部署测试表现差），建议将训练轮数调低。如默认训练后模型不达预期，请优先检查奖惩机制和数据集质量，而非增加训练轮数。
**何时需要对参数进行调整？**
- 现象1：奖励值曲线上下剧烈跳动，或者突然断崖式下跌后无法回升，模型输出变乱。 调整建议：模型在寻找最优解时步幅过大，直接跨过了正确的参数区域，导致训练崩溃发散。必须降低学习率。建议将学习率降低至0.00002或0.00001后重新启动训练。
  
- 现象2：训练正常结束，但奖励值曲线从头到尾几乎是一条水平直线，接入验证后发现模型行为与未训练前毫无区别。
- 优先检查奖励规则（正则表达式、匹配逻辑是否正确）；确认规则无误后，再考虑提升学习率或增加训练轮数。 调整建议：学习率过小，或单轮训练不充分。 惩罚信号不足以撼动模型原有的参数权重。优先检查"奖惩机制"的正则是否写错（导致全部得0分）。如果规则无误，可尝试将学习率微调提升至0.0001；或将"训练轮数"增加至2轮。
  
- 现象3：模型在训练快照中的奖励得分极高（接近满分），但部署回真实Agent测试时，稍微改变一下提问方式，模型就会给出荒谬的回答。 发生了严重的过度拟合。 模型为了迎合数据集，不仅"死记硬背"了答案，还遗忘了基座模型原有的常识认知（灾难性遗忘）。保持"训练轮数"为1。问题的根源往往在数据集本身，请扩充数据集的句式多样性，并确保"学习率"没有被调得过高。训练轮数增加会让模型对数据集的记忆不断加深，加剧过拟合风险；保持单轮次训练可以在一定程度上控制拟合程度，为泛化能力保留空间。此外，"灾难性遗忘"的触发不仅与训练轮数有关，学习率过高同样是重要诱因。
  
 
#### 采样与计算资源控制参数
这三个参数共同决定了GRPO算法在训练时的显存消耗量。任意一个参数调大，都会导致资源占用显著上升。
表2参数解释 
| 参数名称 | 参数含义与作用                                                                 | 调整风险与建议                                                                                      |
|:---|:---|:---|
| 批大小  | 单次梯度更新所使用的样本总数。数值越大，梯度的计算越平滑、训练越稳定，但对显存的占用呈线性增长。                        | 如果训练任务启动报错"显存不足/OOM"，必须优先将此值调低至16或8。                                                            |
| 分组大小  | GRPO算法专有采样参数。针对同一个输入问题，模型同时生成多个（此处为4个）不同的候选回答，并在这些回答之间进行内部比较，从而计算相对优势得分。 | 保持默认值能在计算成本和对比效果之间取得最佳平衡。过大将显著增加单步训练耗时。                                                        |
| 最大训练长度 | 输入与输出文本的总Token长度限制。限制每次送入模型的问题和模型输出的文本总和。超出此长度的部分会被系统强制截断。               | 如果业务是长文本生成，答案被截断会导致无法触发格式奖励校验，此时需调大。 该值设置的过大极易引发显存溢出 (OOM)。 |
   
**何时需要对参数进行调整？**
- 现象1：任务启动不久直接中断失败，出现类似"Out of Memory (OOM)"或显存溢出的错误。 资源参数设置过高。必须降低并发样本数。请优先将"批大小"减半；如果仍出现溢出，需配合调低"最大训练长度"。
  
- 现象2：在进行代码生成或长文档撰写任务时，模型生成的长篇回答总是戛然而止，例如输出JSON时连最后的}括号都没有闭合，或者输出的文本出现了截断。 长度限制设置过小，导致模型的回答被强行截断。 回答不完整会导致后面的正则表达式无法命中，模型会因此无辜被扣分。根据业务文本长度，将"最大训练长度"提升。注意：长度提升会使得显存压力翻倍，必须同步将"批大小"调低，以防止OOM。
  
- 现象3：任务训练非常稳定且未报错，但耗时极其漫长，可能是显存利用率低导致。 参数设置过于保守，未能充分利用算力。在确认不引发 OOM 的前提下，可尝试将"批大小"提升。这不仅能缩短整体训练时间，还能让单次梯度计算更加准确平滑。
  
- 现象4：针对极度复杂的逻辑推理任务，模型无论如何训练都无法突破当前的准确率瓶颈。 强化学习过程中，模型基于用户问题生成的多个答案中，可能碰巧都没命中正确的解题路径，导致缺乏正向信号。如果算力资源充足，可尝试将"分组大小"提升至6或8。让模型每次生成更多的回答选项进行比对，增加找到最优解的概率（代价是训练时间将成倍增加）。
  
 
#### 评估与快照保存参数
此类参数不影响模型最终的性能，但决定了训练过程的可观测性以及版本管理的粒度。
表3参数解释 
| 参数名称     | 参数含义与作用                                                      | 调整风险与建议                                                                                                 |
|:---|:---|:---|
| Step保存频率 | 模型权重保存频率。决定了系统在训练过程中为您输出多少个"模型快照 (Snapshot)"。这些快照是后续挑选模型版本的备选库。 | 强化学习极易在训练后期发生"奖励作弊（为迎合奖励规则输出无意义废话）"。如果担心最终模型发生退化，建议调高保存频率（如设置为每2步或每1步保存一次），密集的保存频率允许您随时回滚并部署早期表现正常的模型版本。 |
   
**何时需要对参数进行调整？**
- 现象1：发现最终产出的模型发生了"奖励作弊（输出大量凑格式的废话）"，但快照列表中找不到作弊发生前的正常模型版本。 保存间隔过大。 仅在完整训练结束时保存了快照，错过了模型表现最优的中间状态。建议在下次训练前，调高Step保存频率（例如修改为每20步或每50步保存一次）。这样能留下密集的存档点，允许您精准回滚并部署早期表现正常的模型版本。
  
- 现象2：训练数据集较大（例如包含数千条数据），训练耗时较长，控制台的监控指标迟迟不刷新，无法实时判断训练走向。 按Epoch评估导致反馈周期过长。 系统需要跑完全部数据才会输出一次监控点。弃用默认的Epoch粒度，将Step评估频率与Step保存频率均切换为按Step粒度配置（如设置每100步评估一次）。以此获取密集的监控曲线，如果发现指标异常即可提前中止任务，节省算力。
  
#### 训练异常诊断与排查说明
在监控训练任务或进行最终评估时，如果您发现模型表现不达预期，可参考以下思路进行排查：
**训练正常的判断依据**：奖励值曲线应呈稳步上升趋势，响应长度保持相对稳定，未出现异常飙升。
**排查总原则** ：建议按照以下优先级顺序排查，先检查数据集质量，再检查奖罚机制配置，然后审视模型快照选择，最后才考虑调整训练超参数。**仅在排除业务层与规则层问题、且确认为算法收敛异常时，才考虑微调学习率等底层参数。**
**优先级1：排查资源瓶颈**
- 问题现象：任务刚启动或运行不久后直接异常中断，出现类似"Out of Memory"、"OOM"或"显存溢出"报错。
- 问题原因：模型参数、批大小与文本长度的乘积超出显存限制。强化学习（GRPO算法）因需要为单个输入同时生成多个输出变体（由分组大小决定），其显存占用通常高于常规微调。
- 调整建议：优先将 批大小减半（例如从16降至8）；如果仍报错，请检查训练数据是否包含异常长文本，并配合适当降低"最大训练长度"。
**优先级2：排查"奖励作弊"现象**
- 问题现象：监控看板上的"奖励值"曲线一路上升（甚至接近满分），但右侧的"响应长度"曲线呈指数级异常飙升。抽查模型输出发现包含了大量凑格式的无意义废话。
- 问题原因：这是强化学习中典型的"奖励作弊"现象。模型为迎合设定的规则（如正则匹配），可能会通过生成大量无关的冗余文本来强行命中目标格式。
- 调整建议：请直接在"模型快照列表"中，挑选早期响应长度正常的模型快照进行部署。在下次训练时，建议优化正则表达式，增加更严厉的格式截断约束。
**优先级3：排查奖罚规则有效性**
- 问题现象：训练平稳运行，但监控看板上的"奖励值"曲线从头到尾几乎是一条水平直线（一直维持在0或负数），毫无上升趋势。
- 问题原因：奖励值长期无上升趋势说明模型未获取到有效的正向反馈信号，通常由以下三种原因导致。
  - 正则表达式配置错误（最常见）：正则规则无法正确匹配模型的输出，或提取出的格式与数据集的参考答案无法对齐。请仔细核对正则捕获组与标准答案的匹配逻辑。
  
  - 评分标准过于严苛：在生成式奖励中，设置了一票否决的扣分项且极易被触发，导致模型大部分尝试均得0分。
  
  - 任务难度越界：模型优化训练使用的是小尺寸的模型，如果任务难度超过了模型能力可能造成奖励值低。例如要求小模型在未配置"思维链格式奖励"的情况下直接输出复杂的工程计算结果，超出了小模型的直接推理能力。
   
- 调整建议：请按上述三种原因逐一排查。校验您的正则表达式是否写错，或者"生成式奖励"的评分标准是否过于严苛。请确保数据集的答案能够被您的正则完美提取。如任务本身超出小模型能力，建议配置"思维链格式奖励"引导模型逐步推理，或简化任务目标。
**优先级4：排查文本截断问题**
- 问题现象：模型生成的长篇回答（如JSON或文本）总是戛然而止。由于回答不完整，导致正则匹配失败被扣分。
- 问题原因：最大训练长度设置过小，回答被系统强行截断。
- 调整建议：将"最大训练长度"提升。注意：调大长度会使显存压力翻倍，请务必同步调低"批大小"以防触发OOM报错。
**优先级5：排查过度拟合**
- 问题现象：训练曲线极其漂亮，快照得分极高。但部署到真实Agent测试时，只要用户稍微换一种提问方式，模型就会给出极其荒谬的回答。
- 问题原因：发生了过度拟合。模型通过"死记硬背"记住了训练集，但丧失了基础认知和泛化能力。强化学习在训练中后期可能出现过度拟合现象，最优的部署版本往往出现在中间某个阶段。
- 调整建议：将"训练轮数"降低为1。在挑选模型快照时，请综合参考Top 3奖励值的模型，优先选择响应长度较短、并且在实际评估过程中表现好的模型快照。问题的根源往往在于数据集，请返回准备优化数据集，大幅扩充数据集的句式多样性和边界测试问题。
**优先级6：调整学习率**
- 问题现象：已确认资源充足、正则无误、数据质量极高，但监控看板上的奖励曲线依然上下剧烈震荡无法收敛，或者缓慢得几乎无法察觉上升。
- 问题原因：底层优化器更新权重的步伐失调。在训练的初期阶段，曲线震荡属于强化学习探索策略的正常现象，代表算法正在尝试不同输出以寻找最优解。如果曲线直到训练结束仍剧烈震荡且无法收敛，通常说明底层的学习率设置过大。
- 调整建议：只有在排除了以上5点后，才考虑微调底层的超参数配置（学习率）。
  - 曲线剧烈震荡：步子太大跨过了最优解，将学习率降低至0.00002或更小。
  
  - 曲线缓慢无力：步子太小，可略微提升至0.0001进行尝试。
   
参数配置完成后，页面将展示当前所有超参数的设定值，请确认与预期一致后再进入下一步：[步骤四：绑定数据集、产物路径与委托](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0109.html)。
