文档首页/ 魔坊(ModelArts)模型训推平台/ 最佳实践/ 文本和语音生成场景模型训练推理/ Qwen3-Omni模型基于ModelArts轻量算力节点适配NPU推理指导(6.5.911)
更新时间:2026-07-04 GMT+08:00
分享

Qwen3-Omni模型基于ModelArts轻量算力节点适配NPU推理指导(6.5.911)

方案概览

Qwen3-Omni采用了Thinker-Talker混合专家架构,统一了文本、图像、音频和视频的感知与生成,能够生成流畅的文本和自然的实时语音。

本方案介绍如何在ModelArts的轻量算力节点环境中,使用NPU卡对Qwen3-Omni模型进行推理。

资源规格要求

使用轻量算力节点的Snt9b23单机资源。

表1 Snt9b23环境要求

名称

版本

driver

25.2.1

PyTorch

pytorch_2.5.1

获取软件和镜像

表2 获取镜像

分类

名称

获取路径

插件代码包

AscendCloud-AIGC-xxx.zip

文件名中的xxx表示具体的时间戳,以包名发布的实际时间为准。

获取路径:Support-E,在此路径中查找下载ModelArts 6.5.911.3版本。

说明:

如果上述软件获取路径打开后未显示相应的软件信息,说明您没有下载权限,请联系您所在企业的华为方技术支持下载获取。

基础镜像

Snt9b23:西南-贵阳一:

swr.cn-southwest-2.myhuaweicloud.com/atelier/pytorch_ascend:pytorch_2.5.1-cann_8.2.rc2-py_3.11-hce_2.0.2509-aarch64-snt9b23-20251106111344-87d9583

从SWR拉取。

约束限制

  • 本文档适配ModelArts 6.5.911版本,请参考表2获取配套版本的软件包和镜像,请严格遵照版本配套关系使用本文档。
  • 确保容器可以访问公网。

步骤一:准备环境

  1. 请参考轻量算力节点资源开通,购买轻量算力节点资源,并确保机器已开通,密码已获取,能通过SSH登录,不同机器之间网络互通。

    当容器需要提供服务给多个用户,或者多个用户共享使用该容器时,应限制容器访问Openstack的管理地址(169.254.169.254),以防止容器获取宿主机的元数据。具体操作请参见禁止容器获取宿主机元数据

  2. SSH登录机器后,检查NPU设备状态。运行如下命令,返回NPU设备信息。
    npu-smi info                    # 在每个实例节点上运行此命令可以看到NPU卡状态
    npu-smi info -l | grep Total    # 在每个实例节点上运行此命令可以看到总卡数

    如出现错误,可能是机器上的NPU设备没有正常安装,或者NPU镜像被其他容器挂载。请先正常安装驱动和固件,或释放被挂载的NPU。

  3. 检查docker是否安装。
    docker -v   #检查docker是否安装

    如尚未安装,运行以下命令安装docker。

    yum install -y docker-engine.aarch64 docker-engine-selinux.noarch docker-runc.aarch64
  4. 配置IP转发,用于容器内的网络访问。执行以下命令查看net.ipv4.ip_forward配置项的值,如果为1,可跳过此步骤。
    sysctl -p | grep net.ipv4.ip_forward
    如果net.ipv4.ip_forward配置项的值不为1,执行以下命令配置IP转发。
    sed -i 's/net\.ipv4\.ip_forward=0/net\.ipv4\.ip_forward=1/g' /etc/sysctl.conf
    sysctl -p | grep net.ipv4.ip_forward

因训练过程中使用磁盘空间大,建议挂载1T以上磁盘。

步骤二:获取基础镜像

建议使用官方提供的镜像部署服务。镜像地址{image_url}参见表2

docker pull {image_url}

步骤三:启动容器镜像(Snt9b23)

  1. Snt9b23启动容器镜像。启动前请先按照参数说明修改${}中的参数。
    export work_dir="自定义挂载的工作目录"
    export container_work_dir="自定义挂载到容器内的工作目录"
    export container_name="自定义容器名称"
    export image_name="镜像名称或ID"
    // 启动一个容器去运行镜像 
    docker run -itd \
        --network=host \
        --privileged \
        --device=/dev/davinci_manager \
        --device=/dev/devmm_svm \
        --device=/dev/hisi_hdc \
        --shm-size=256g \
        -v /usr/local/dcmi:/usr/local/dcmi \
        -v /usr/local/Ascend/driver:/usr/local/Ascend/driver \
        -v /var/log/npu/:/usr/slog \
        -v /usr/local/sbin/npu-smi:/usr/local/sbin/npu-smi \
        -v ${work_dir}:${container_work_dir} \
        --name ${container_name} \
        ${image_name} \
        /bin/bash
  2. Snt9b23需要使用root权限进入容器中。
    docker exec -itu root ${container_name} bash

步骤四:安装依赖和软件包

安装依赖。
git config --global http.sslVerify false

git clone https://github.com/huggingface/transformers
cd transformers/
git checkout e20df45bf676d80bdddb9757eeeafe6c0c81ecfa
pip install .
cd ..
pip install accelerate==1.10.1
pip install qwen-omni-utils -U
sed -i '/next_token_logits = outputs.logits/s/\.to/.to("cpu").to/g' /home/ma-user/anaconda3/envs/PyTorch-2.5.1/lib/python3.11/site-packages/transformers/generation/utils.py

步骤五:准备模型权重

  1. 安装modelscope库。
    cd /home/ma-user/
    pip install -U modelscope
  2. 下载权重。
    mkdir -p /home/ma-user/weights
    sed -i '553s/^.*$/        verify = False/' /home/ma-user/anaconda3/envs/PyTorch-2.5.1/lib/python3.11/site-packages/requests/adapters.py
    modelscope download --model Qwen/Qwen3-Omni-30B-A3B-Instruct --local_dir ./weights/Qwen3-Omni-30B-A3B-Instruct
    sed -i '553s/^.*$//' /home/ma-user/anaconda3/envs/PyTorch-2.5.1/lib/python3.11/site-packages/requests/adapters.py

步骤六:推理执行

  1. 将下列代码保存在/home/ma-user/目录下,使用vim /home/ma-user/run.py命令进入文档。
    import soundfile as sf
    import torch
    import torch_npu
    from transformers import Qwen3OmniMoeForConditionalGeneration, Qwen3OmniMoeProcessor
    from qwen_omni_utils import process_mm_info
    MODEL_PATH = "./weights/Qwen3-Omni-30B-A3B-Instruct"
    model = Qwen3OmniMoeForConditionalGeneration.from_pretrained(
        MODEL_PATH,
        dtype="auto",
        device_map="auto",
        attn_implementation="sdpa",
    )
    processor = Qwen3OmniMoeProcessor.from_pretrained(MODEL_PATH)
    conversation = [
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Direct output the following english text: Time waits for no one. Treasure every moment you have."}
            ],
        },
    ]
    # Set whether to use audio in video
    USE_AUDIO_IN_VIDEO = True
    # Preparation for inference
    text = processor.apply_chat_template(conversation, add_generation_prompt=True, tokenize=False)
    audios, images, videos = process_mm_info(conversation, use_audio_in_video=USE_AUDIO_IN_VIDEO)
    inputs = processor(text=text,
                       audio=audios,
                       images=images,
                       videos=videos,
                       return_tensors="pt",
                       padding=True,
                       use_audio_in_video=USE_AUDIO_IN_VIDEO)
    inputs = inputs.to(model.device).to(model.dtype)
    # Inference: Generation of the output text and audio
    text_ids, audio = model.generate(**inputs,
                                        speaker="Ethan",
                                        thinker_return_dict_in_generate=True,
                                        thinker_max_new_tokens=1024,   # 此参数可选,影响输出文字的长度,默认值1024
                                        talker_max_new_tokens=4096,   # 此参数可选,影响输出语音的长度,默认值4096
                                        use_audio_in_video=USE_AUDIO_IN_VIDEO)
    
    text = processor.batch_decode(text_ids.sequences[:, inputs["input_ids"].shape[1]:],
                                    skip_special_tokens=True,
                                    clean_up_tokenization_spaces=False)
    print(text)
    if audio is not None:
        sf.write(
            "output.wav",
            audio.reshape(-1).detach().cpu().numpy(),
            samplerate=24000,
        )

    将上段代码复制到文档编辑里,按ESC退出编辑,再按:wq退出并保存文档。

  2. 设置推理使用卡数及推理。
    export ASCEND_RT_VISIBLE_DEVICES=0,1 # 选取当前没有被占用的卡
    export TASK_QUEUE_ENABLE=2
    python run.py

相关文档