更新时间:2026-09-01 GMT+08:00
分享

DP

Diffusion Policy算法不需要基模型输入,直接从数据集训练。仅支持全参数微调(FFT),不支持LORA。

  • conda环境:lerobot
  • 默认超参数:batch_size=32、steps=100000、save_freq=10000、chunk_size=16、n_obs_steps=2、optimizer_lr=1e-4

训练启动命令(FFT)

conda activate lerobot && cd cd /opt/cloud/lerobot_ascend_notebook/lerobot && HF_HOME=${HF_CACHE} HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1 accelerate launch --num_processes=${MA_NUM_GPUS} scripts/train.py --policy.type=diffusion --output_dir=${OUTPUT}/_ckpt --dataset.root=${DATASET} --dataset.repo_id=cloudrobo --policy.push_to_hub=false --wandb.enable=true --wandb.mode=offline

推理部署启动命令

conda activate lerobot && cd /opt/cloud/lerobot_ascend_notebook/lerobot && HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1 python -m scripts.serve_policy --policy_type=diffusion --checkpoint_path=${CHECKPOINT}

相关文档