Updated on 2026-08-27 GMT+08:00

HA Configuration Scenarios

This section recommends HA configurations for common scenarios, providing a reference for setting up your HA training jobs.

Table 1 Recommended HA configurations

Scenario

Description

Recommended Configuration

Configuration Combination

Recommendation

Single-node training

Suitable for single-node single-PU and single-node multi-PU training.

  1. Configure the checkpoint save path.
  2. Set up resuming from checkpoint in the training script.
  3. Enable auto restart.
  4. Set a reasonable maximum number of restarts.
  5. Troubleshoot issues via failure log analysis after job failure.

Resumable training

Recommended

Auto restart

Recommended

Job suspension detection

Optional

Restart upon suspension

Optional

Operator re-execution

Usually not needed

Multi-node multi-PU training

Suitable for distributed training and large-scale GPU/NPU training.

  1. Ensure training scripts support checkpoint saving and resumption.
  2. Save checkpoints in reliable shared storage.
  3. Ensure training scripts support repeated launches (i.e., re-entrancy capability).
  4. Enable auto restart.
  5. Enable unconditional auto restart based on service needs.
  6. Enable job suspension detection.
  7. Enable restart upon suspension for training tasks requiring long-term stability.
  8. Monitor job recovery through events, logs, and recovery details.

Resumable training

Required

Auto restart

Recommended

Unconditional auto restart

Recommended

Job suspension detection

Recommended

Restart upon suspension

Recommended

Pod-level rescheduling

Based on resource pool capabilities

Isolated job-level rescheduling

Based on resource pool capabilities

LLM long-term stable training

Suitable for tasks with long durations and large resource scales, such as LLM pre-training, fine-tuning, and reinforcement learning.

  1. Use stable shared storage to save checkpoints.
  2. Periodically save training states including models, optimizers, learning rate schedulers, and random states.
  3. Support automatic recovery from the most recent valid checkpoint.
  4. Enable auto restart and fault recovery.
  5. Enable job suspension detection and restart upon suspension.
  6. Evaluate whether to enable operator re-execution based on hardware scenarios.
  7. Configure logs, events, and failure analysis loops.

Resumable training

Required

Auto restart

Required

Unconditional auto restart

Recommended

Suspension detection

Recommended

Restart upon suspension

Recommended

Operator re-execution

Recommended for specific Ascend supernode scenarios

Log failure analysis

Recommended