# 监控训练任务
当训练任务启动后，单击任务名称即可进入详情页。详情页可以查看具体的训练任务的优化过程数据、产物数据，以及训练任务配置信息。
图1监控训练任务   
![](https://support.huaweicloud.com/ops-agentarts/zh-cn_image_0000002629722166.png "点击放大")
#### 优化过程解读
"优化过程"区域展示训练过程的实时动态。指标分为3部分，分别为：
- 奖励值（训练）、奖励值（验证）
- 响应长度
- 消耗时间
这3个指标的横轴均为Step。Step是训练进行的最小单位，每更新一次参数即为一个Step。
表1优化过程曲线说明 
| 指标名称    | 横轴 | 含义                                               | 理想趋势                     |
|:---|:---|:---|:---|
| 奖励值（训练）  | Step  | 核心质量指标。代表模型输出符合您设定"奖惩机制"的平均得分。分数越高，代表模型表现越接近您的预期。 | 平滑上升并趋于稳定。              |
| 奖励值（验证） | Step    | 模型在验证集上的平均奖励得分，用于辅助观察模型在未参与训练数据上的表现。仅在配置验证集时展示。    | 与训练奖励整体同向提升，并逐步趋于稳定。      |
| 响应长度     | Step  | 效率与健康指标。代表模型生成回答的平均长度。                            | 波动平稳，不应出现非正常飙升。         |
| 消耗时间    | Step  | 代表模型训练过程中每个Step的总耗时，用于辅助观察模型输出复杂度和推理开销变化。        | 整体平稳，或随训练小幅波动，不应持续异常升高。 |
   
**如何理解奖励值（训练）与奖励值（验证）** **的关系**
当配置了验证集时，建议结合这两条奖励曲线一起观察：
- 奖励值（训练）：反映模型对训练数据的适应情况。
- 奖励值（验证）：反映模型在未参与训练的数据上的泛化表现。
通常有以下几种典型状态：
**状态一：训练奖励和验证奖励同步上升并趋于稳定**
- 现象：奖励值（训练）和奖励值（验证）整体同向提升，二者差距较小，并最终在较高位置趋于稳定。
- 说明：这是较理想的状态，说明模型不仅学会了训练集中的目标行为，也在验证集上表现稳定，泛化能力较好。
**状态二：训练奖励持续升高，但验证奖励长期不上升或明显偏低**
- 现象：奖励值（训练）不断上升，但奖励值（验证）提升有限，甚至长期停留在较低水平。
- 说明：这通常意味着模型对训练集学得较多，但在未参与训练的数据上泛化不足，需要警惕过拟合。此时挑选模型快照时，不能只看训练奖励高低，还应重点参考验证奖励表现。
**状态三：训练奖励继续升高，但验证奖励开始回落**
- 现象：训练后期奖励值（训练）仍在上升，而奖励值（验证）出现下降或明显波动。
- 说明：这通常是过拟合信号。模型开始"过度适应"训练集，而在验证集上的表现反而变差。此时往往应优先关注训练中期、验证奖励较高且稳定的快照。
**状态四：训练奖励和验证奖励都长期停留在低位**
- 现象：两条奖励曲线均长期在 0 分、负分或较低水平附近徘徊。
- 说明：模型未获得有效的正向反馈，通常是奖惩规则配置有误、任务难度过高，或学习率等参数不合适。
**结合奖励值、响应长度、消耗时间综合判断训练效果，常见有以下几种训练状态：**
**状态一：有效收敛（理想情况）**
- 现象： 未配置验证集时：奖励值（训练）持续上升并最终趋于稳定。
  配置验证集时：奖励值（训练）和奖励值（验证）整体同向提升，并在高位保持稳定。
  响应长度保持在合理范围内。
  消耗时间整体平稳。
  
- 说明：模型已经逐步学会了您定义的目标行为，训练状态健康，可以准备在快照列表中挑选该阶段的模型进行部署验证。
**状态二：学习停滞（无效情况）**
- 现象： 奖励值（训练）长期水平，甚至维持在 0 分或负分附近。
  若配置了验证集，奖励值（验证）通常也无明显改善。
  响应长度和消耗时间无明显积极变化。
  
- 说明：模型"学不进去"。通常是因为奖惩规则配置有误（例如正则表达式写错，导致模型始终拿不到正向奖励），或者学习率设置过低。
**状态三：过拟合风险**
- 现象： 奖励值（训练）持续升高。
  奖励值（验证）提升有限、长期偏低，或在训练后期出现回落。
  响应长度与消耗时间未必异常，但训练奖励与验证奖励的差距逐渐扩大。
  
- 说明：模型对训练集适应过强，而在未参与训练的数据上泛化能力不足。此时应重点参考验证奖励较高且稳定的快照，而非单纯选择训练奖励最高的版本。
**状态四：奖励作弊 / 训练坍缩（高风险情况）**
- 现象： 奖励值较高。
  响应长度出现明显飙升。
  消耗时间往往也会同步增长。
  
- 说明：模型可能发生了"奖励作弊"。它找到了规则漏洞，例如通过输出大量冗余文本、重复格式化内容来骗取高分。虽然奖励值看起来很高，但输出结果在真实业务中已不可用。
**如何理解"响应长度"和"消耗时间"的关系**
在多数场景下，响应长度异常升高往往会带来消耗时间上升。因此：
- 如果奖励值升高，同时响应长度和消耗时间都保持平稳，通常说明训练较健康。
- 如果奖励值升高，但响应长度明显变长、消耗时间同步增加，需要警惕模型正在通过冗余输出来"凑分"。
- 如果响应长度不高，但消耗时间持续异常增加，也建议结合实际输出内容排查是否存在推理过程异常复杂、工具调用链路异常等问题。
 
#### 产物列表解读
在曲线图下方的"模型快照列表"中，系统根据您配置的保存频率留存了多个模型版本。列表中各字段含义如下，您可以通过[如何挑选最优模型](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0112.html)详细了解如何挑选最优的模型。
表2产物列表说明 
| 指标/参数项            | 含义                                                      |
|:---|:---|
| 模型快照（Checkpoint） | 系统根据您配置的"Step保存频率"自动保存的模型权重版本。它是模型在某一特定训练时刻备份。          |
| Step            | 该快照产生时所对应的具体步数。                                          |
| Epoch            | 该快照产生时模型对完整数据集的遍历次数（轮数）。                                 |
| 奖励值 (Reward)     | 该快照在当前步数下获得的平均奖励得分。系统会自动标记出Top 3奖励值最高的版本供您参考。              |
| 响应长度 (Length)    | 该快照生成回答的平均长度。用于辅助判断模型是否存在"废话过多"的倾向。                        |
| 操作 (部署并接入)      | 系统会一键部署该版本的模型快照，并自动将其接入到您关联的单智能体/工作流中替换原模型，以便您进行真实的业务评测。 |
   
结合训练曲线图和产物列表，您可以对模型的训练质量做一个初步的判断：
- 奖励值上升后稳定在高位，响应长度波动极小。这是最理想的快照版本。
- 奖励值长期在 0 分或负分徘徊。通常意味着您的"正则表达式"写错了，模型无法获得任何正向激励。
- 奖励值极高，但响应长度异常飙升。模型学会了通过输出大量重复的格式化废话来骗取奖励。
监控指标只是初筛。面对列表中的多个高分快照，具体该如何取舍？如何平衡响应长度与分数？请参考[挑选最优模型](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0111.html)。
#### 训练异常诊断与排查说明
在监控训练任务或进行最终评估时，如果您发现模型表现不达预期，可参考以下思路进行排查：
**训练正常的判断依据**：奖励值曲线应呈稳步上升趋势，响应长度保持相对稳定，未出现异常飙升。
**排查总原则** ：建议按照以下优先级顺序排查，先检查数据集质量，再检查奖罚机制配置，然后审视模型快照选择，最后才考虑调整训练超参数。**仅在排除业务层与规则层问题、且确认为算法收敛异常时，才考虑微调学习率等底层参数。**
**优先级1：排查资源瓶颈**
- 问题现象：任务刚启动或运行不久后直接异常中断，出现类似"Out of Memory"、"OOM"或"显存溢出"报错。
- 问题原因：模型参数、批大小与文本长度的乘积超出显存限制。强化学习（GRPO算法）因需要为单个输入同时生成多个输出变体（由分组大小决定），其显存占用通常高于常规微调。
- 调整建议：优先将 批大小减半（例如从16降至8）；如果仍报错，请检查训练数据是否包含异常长文本，并配合适当降低"最大训练长度"。
**优先级2：排查"奖励作弊"现象**
- 问题现象：监控看板上的"奖励值"曲线一路上升（甚至接近满分），但右侧的"响应长度"曲线呈指数级异常飙升。抽查模型输出发现包含了大量凑格式的无意义废话。
- 问题原因：这是强化学习中典型的"奖励作弊"现象。模型为迎合设定的规则（如正则匹配），可能会通过生成大量无关的冗余文本来强行命中目标格式。
- 调整建议：请直接在"模型快照列表"中，挑选早期响应长度正常的模型快照进行部署。在下次训练时，建议优化正则表达式，增加更严厉的格式截断约束。
**优先级3：排查奖罚规则有效性**
- 问题现象：训练平稳运行，但监控看板上的"奖励值"曲线从头到尾几乎是一条水平直线（一直维持在0或负数），毫无上升趋势。
- 问题原因：奖励值长期无上升趋势说明模型未获取到有效的正向反馈信号，通常由以下三种原因导致。
  - 正则表达式配置错误（最常见）：正则规则无法正确匹配模型的输出，或提取出的格式与数据集的参考答案无法对齐。请仔细核对正则捕获组与标准答案的匹配逻辑。
  
  - 评分标准过于严苛：在生成式奖励中，设置了一票否决的扣分项且极易被触发，导致模型大部分尝试均得0分。
  
  - 任务难度越界：模型优化训练使用的是小尺寸的模型，如果任务难度超过了模型能力可能造成奖励值低。例如要求小模型在未配置"思维链格式奖励"的情况下直接输出复杂的工程计算结果，超出了小模型的直接推理能力。
   
- 调整建议：请按上述三种原因逐一排查。校验您的正则表达式是否写错，或者"生成式奖励"的评分标准是否过于严苛。请确保数据集的答案能够被您的正则完美提取。如任务本身超出小模型能力，建议配置"思维链格式奖励"引导模型逐步推理，或简化任务目标。
**优先级4：排查文本截断问题**
- 问题现象：模型生成的长篇回答（如JSON或文本）总是戛然而止。由于回答不完整，导致正则匹配失败被扣分。
- 问题原因：最大训练长度设置过小，回答被系统强行截断。
- 调整建议：将"最大训练长度"提升。注意：调大长度会使显存压力翻倍，请务必同步调低"批大小"以防触发OOM报错。
**优先级5：排查过度拟合**
- 问题现象：训练曲线极其漂亮，快照得分极高。但部署到真实Agent测试时，只要用户稍微换一种提问方式，模型就会给出极其荒谬的回答。
- 问题原因：发生了过度拟合。模型通过"死记硬背"记住了训练集，但丧失了基础认知和泛化能力。强化学习在训练中后期可能出现过度拟合现象，最优的部署版本往往出现在中间某个阶段。
- 调整建议：将"训练轮数"降低为1。在挑选模型快照时，请综合参考Top 3奖励值的模型，优先选择响应长度较短、并且在实际评估过程中表现好的模型快照。问题的根源往往在于数据集，请返回准备优化数据集，大幅扩充数据集的句式多样性和边界测试问题。
**优先级6：调整学习率**
- 问题现象：已确认资源充足、正则无误、数据质量极高，但监控看板上的奖励曲线依然上下剧烈震荡无法收敛，或者缓慢得几乎无法察觉上升。
- 问题原因：底层优化器更新权重的步伐失调。在训练的初期阶段，曲线震荡属于强化学习探索策略的正常现象，代表算法正在尝试不同输出以寻找最优解。如果曲线直到训练结束仍剧烈震荡且无法收敛，通常说明底层的学习率设置过大。
- 调整建议：只有在排除了以上5点后，才考虑微调底层的超参数配置（学习率）。
  - 曲线剧烈震荡：步子太大跨过了最优解，将学习率降低至0.00002或更小。
  
  - 曲线缓慢无力：步子太小，可略微提升至0.0001进行尝试。
   
参数配置完成后，页面将展示当前所有超参数的设定值，请确认与预期一致后再进入下一步：[步骤四：绑定数据集、产物路径与委托](https://support.huaweicloud.com/ops-agentarts/agentarts_14_0109.html)。
