监控训练任务
当训练任务启动后,单击任务名称即可进入详情页。详情页可以查看具体的训练任务的优化过程数据、产物数据,以及训练任务配置信息。
优化过程解读
“优化过程”区域展示训练过程的实时动态。指标分为3部分,分别为:
- 奖励值(训练)、奖励值(验证)
- 响应长度
- 消耗时间
这3个指标的横轴均为Step。Step是训练进行的最小单位,每更新一次参数即为一个Step。
| 指标名称 | 横轴 | 含义 | 理想趋势 |
|---|---|---|---|
| 奖励值(训练) | Step | 核心质量指标。代表模型输出符合您设定“奖惩机制”的平均得分。分数越高,代表模型表现越接近您的预期。 | 平滑上升并趋于稳定。 |
| 奖励值(验证) | Step | 模型在验证集上的平均奖励得分,用于辅助观察模型在未参与训练数据上的表现。仅在配置验证集时展示。 | 与训练奖励整体同向提升,并逐步趋于稳定。 |
| 响应长度 | Step | 效率与健康指标。代表模型生成回答的平均长度。 | 波动平稳,不应出现非正常飙升。 |
| 消耗时间 | Step | 代表模型训练过程中每个Step的总耗时,用于辅助观察模型输出复杂度和推理开销变化。 | 整体平稳,或随训练小幅波动,不应持续异常升高。 |
如何理解奖励值(训练)与奖励值(验证)的关系
当配置了验证集时,建议结合这两条奖励曲线一起观察:
- 奖励值(训练):反映模型对训练数据的适应情况。
- 奖励值(验证):反映模型在未参与训练的数据上的泛化表现。
通常有以下几种典型状态:
状态一:训练奖励和验证奖励同步上升并趋于稳定
- 现象:奖励值(训练)和奖励值(验证)整体同向提升,二者差距较小,并最终在较高位置趋于稳定。
- 说明:这是较理想的状态,说明模型不仅学会了训练集中的目标行为,也在验证集上表现稳定,泛化能力较好。
状态二:训练奖励持续升高,但验证奖励长期不上升或明显偏低
- 现象:奖励值(训练)不断上升,但奖励值(验证)提升有限,甚至长期停留在较低水平。
- 说明:这通常意味着模型对训练集学得较多,但在未参与训练的数据上泛化不足,需要警惕过拟合。此时挑选模型快照时,不能只看训练奖励高低,还应重点参考验证奖励表现。
状态三:训练奖励继续升高,但验证奖励开始回落
- 现象:训练后期奖励值(训练)仍在上升,而奖励值(验证)出现下降或明显波动。
- 说明:这通常是过拟合信号。模型开始“过度适应”训练集,而在验证集上的表现反而变差。此时往往应优先关注训练中期、验证奖励较高且稳定的快照。
状态四:训练奖励和验证奖励都长期停留在低位
- 现象:两条奖励曲线均长期在 0 分、负分或较低水平附近徘徊。
- 说明:模型未获得有效的正向反馈,通常是奖惩规则配置有误、任务难度过高,或学习率等参数不合适。
结合奖励值、响应长度、消耗时间综合判断训练效果,常见有以下几种训练状态:
状态一:有效收敛(理想情况)
- 现象:
配置验证集时:奖励值(训练)和奖励值(验证)整体同向提升,并在高位保持稳定。
响应长度保持在合理范围内。
消耗时间整体平稳。
- 说明:模型已经逐步学会了您定义的目标行为,训练状态健康,可以准备在快照列表中挑选该阶段的模型进行部署验证。
状态二:学习停滞(无效情况)
- 现象:
若配置了验证集,奖励值(验证)通常也无明显改善。
响应长度和消耗时间无明显积极变化。
- 说明:模型“学不进去”。通常是因为奖惩规则配置有误(例如正则表达式写错,导致模型始终拿不到正向奖励),或者学习率设置过低。
状态三:过拟合风险
- 现象:
奖励值(验证)提升有限、长期偏低,或在训练后期出现回落。
响应长度与消耗时间未必异常,但训练奖励与验证奖励的差距逐渐扩大。
- 说明:模型对训练集适应过强,而在未参与训练的数据上泛化能力不足。此时应重点参考验证奖励较高且稳定的快照,而非单纯选择训练奖励最高的版本。
状态四:奖励作弊 / 训练坍缩(高风险情况)
- 现象:
响应长度出现明显飙升。
消耗时间往往也会同步增长。
- 说明:模型可能发生了“奖励作弊”。它找到了规则漏洞,例如通过输出大量冗余文本、重复格式化内容来骗取高分。虽然奖励值看起来很高,但输出结果在真实业务中已不可用。
如何理解“响应长度”和“消耗时间”的关系
在多数场景下,响应长度异常升高往往会带来消耗时间上升。因此:
- 如果奖励值升高,同时响应长度和消耗时间都保持平稳,通常说明训练较健康。
- 如果奖励值升高,但响应长度明显变长、消耗时间同步增加,需要警惕模型正在通过冗余输出来“凑分”。
- 如果响应长度不高,但消耗时间持续异常增加,也建议结合实际输出内容排查是否存在推理过程异常复杂、工具调用链路异常等问题。
产物列表解读
在曲线图下方的“模型快照列表”中,系统根据您配置的保存频率留存了多个模型版本。列表中各字段含义如下,您可以通过如何挑选最优模型详细了解如何挑选最优的模型。
| 指标/参数项 | 含义 |
|---|---|
| 模型快照(Checkpoint) | 系统根据您配置的“Step保存频率”自动保存的模型权重版本。它是模型在某一特定训练时刻备份。 |
| Step | 该快照产生时所对应的具体步数。 |
| Epoch | 该快照产生时模型对完整数据集的遍历次数(轮数)。 |
| 奖励值 (Reward) | 该快照在当前步数下获得的平均奖励得分。系统会自动标记出Top 3奖励值最高的版本供您参考。 |
| 响应长度 (Length) | 该快照生成回答的平均长度。用于辅助判断模型是否存在“废话过多”的倾向。 |
| 操作 (部署并接入) | 系统会一键部署该版本的模型快照,并自动将其接入到您关联的单智能体/工作流中替换原模型,以便您进行真实的业务评测。 |
结合训练曲线图和产物列表,您可以对模型的训练质量做一个初步的判断:
- 奖励值上升后稳定在高位,响应长度波动极小。这是最理想的快照版本。
- 奖励值长期在 0 分或负分徘徊。通常意味着您的“正则表达式”写错了,模型无法获得任何正向激励。
- 奖励值极高,但响应长度异常飙升。模型学会了通过输出大量重复的格式化废话来骗取奖励。
监控指标只是初筛。面对列表中的多个高分快照,具体该如何取舍?如何平衡响应长度与分数?请参考挑选最优模型。
训练异常诊断与排查说明
在监控训练任务或进行最终评估时,如果您发现模型表现不达预期,可参考以下思路进行排查:
训练正常的判断依据:奖励值曲线应呈稳步上升趋势,响应长度保持相对稳定,未出现异常飙升。
排查总原则:建议按照以下优先级顺序排查,先检查数据集质量,再检查奖罚机制配置,然后审视模型快照选择,最后才考虑调整训练超参数。仅在排除业务层与规则层问题、且确认为算法收敛异常时,才考虑微调学习率等底层参数。
优先级1:排查资源瓶颈
- 问题现象:任务刚启动或运行不久后直接异常中断,出现类似“Out of Memory”、“OOM”或“显存溢出”报错。
- 问题原因:模型参数、批大小与文本长度的乘积超出显存限制。强化学习(GRPO算法)因需要为单个输入同时生成多个输出变体(由分组大小决定),其显存占用通常高于常规微调。
- 调整建议:优先将 批大小减半(例如从16降至8);如果仍报错,请检查训练数据是否包含异常长文本,并配合适当降低“最大训练长度”。
优先级2:排查“奖励作弊”现象
- 问题现象:监控看板上的“奖励值”曲线一路上升(甚至接近满分),但右侧的“响应长度”曲线呈指数级异常飙升。抽查模型输出发现包含了大量凑格式的无意义废话。
- 问题原因:这是强化学习中典型的“奖励作弊”现象。模型为迎合设定的规则(如正则匹配),可能会通过生成大量无关的冗余文本来强行命中目标格式。
- 调整建议:请直接在“模型快照列表”中,挑选早期响应长度正常的模型快照进行部署。在下次训练时,建议优化正则表达式,增加更严厉的格式截断约束。
优先级3:排查奖罚规则有效性
- 问题现象:训练平稳运行,但监控看板上的“奖励值”曲线从头到尾几乎是一条水平直线(一直维持在0或负数),毫无上升趋势。
- 问题原因:奖励值长期无上升趋势说明模型未获取到有效的正向反馈信号,通常由以下三种原因导致。
- 正则表达式配置错误(最常见):正则规则无法正确匹配模型的输出,或提取出的格式与数据集的参考答案无法对齐。请仔细核对正则捕获组与标准答案的匹配逻辑。
- 评分标准过于严苛:在生成式奖励中,设置了一票否决的扣分项且极易被触发,导致模型大部分尝试均得0分。
- 任务难度越界:模型优化训练使用的是小尺寸的模型,如果任务难度超过了模型能力可能造成奖励值低。例如要求小模型在未配置“思维链格式奖励”的情况下直接输出复杂的工程计算结果,超出了小模型的直接推理能力。
- 调整建议:请按上述三种原因逐一排查。校验您的正则表达式是否写错,或者“生成式奖励”的评分标准是否过于严苛。请确保数据集的答案能够被您的正则完美提取。如任务本身超出小模型能力,建议配置“思维链格式奖励”引导模型逐步推理,或简化任务目标。
优先级4:排查文本截断问题
- 问题现象:模型生成的长篇回答(如JSON或文本)总是戛然而止。由于回答不完整,导致正则匹配失败被扣分。
- 问题原因:最大训练长度设置过小,回答被系统强行截断。
- 调整建议:将“最大训练长度”提升。注意:调大长度会使显存压力翻倍,请务必同步调低“批大小”以防触发OOM报错。
优先级5:排查过度拟合
- 问题现象:训练曲线极其漂亮,快照得分极高。但部署到真实Agent测试时,只要用户稍微换一种提问方式,模型就会给出极其荒谬的回答。
- 问题原因:发生了过度拟合。模型通过“死记硬背”记住了训练集,但丧失了基础认知和泛化能力。强化学习在训练中后期可能出现过度拟合现象,最优的部署版本往往出现在中间某个阶段。
- 调整建议:将“训练轮数”降低为1。在挑选模型快照时,请综合参考Top 3奖励值的模型,优先选择响应长度较短、并且在实际评估过程中表现好的模型快照。问题的根源往往在于数据集,请返回准备优化数据集,大幅扩充数据集的句式多样性和边界测试问题。
优先级6:调整学习率
- 问题现象:已确认资源充足、正则无误、数据质量极高,但监控看板上的奖励曲线依然上下剧烈震荡无法收敛,或者缓慢得几乎无法察觉上升。
- 问题原因:底层优化器更新权重的步伐失调。在训练的初期阶段,曲线震荡属于强化学习探索策略的正常现象,代表算法正在尝试不同输出以寻找最优解。如果曲线直到训练结束仍剧烈震荡且无法收敛,通常说明底层的学习率设置过大。
- 调整建议:只有在排除了以上5点后,才考虑微调底层的超参数配置(学习率)。
- 曲线剧烈震荡:步子太大跨过了最优解,将学习率降低至0.00002或更小。
- 曲线缓慢无力:步子太小,可略微提升至0.0001进行尝试。
参数配置完成后,页面将展示当前所有超参数的设定值,请确认与预期一致后再进入下一步:步骤四:绑定数据集、产物路径与委托。