更新时间:2026-08-10 GMT+08:00
分享

查看Aura作业监控

在运维场景中,您可以通过可视化界面查看AuraJob和AuraJobV2端点下作业的整体运行情况和单个作业的详细监控信息,实时掌握作业执行状态,合理规划资源配置,保障业务稳定运行。

查看作业数监控(AuraJob和AuraJobV2)

您可以查看AuraJob和AuraJobV2端点下所有作业的运行情况。

  1. 登录AI DataLake管理控制台
  2. 在页面左上角切换至对应的工作空间。
  3. 在左侧导航栏选择“引擎端点 > 多模数据引擎Aura”,在端点列表中单击运行作业的端点名称进入概览页面。
  4. 选择“监控”页签,即可查看Aura端点下的作业数运行情况。

    单击指标右上角的,可以查看指标的详细信息。
    表1 AuraJob端点监控指标

    指标名称

    监控指标

    单位

    指标说明

    成功作业数

    JOB_SUCCEED_COUNT

    Count

    当前端点已运行成功的作业数统计。

    失败作业数

    JOB_FAILED_COUNT

    Count

    当前端点运行失败的作业数统计。

    排队中作业数

    JOB_PENDING_COUNT

    Count

    当前端点中正在排队的作业数统计。

    已取消作业数

    JOB_CANCELED_COUNT

    Count

    当前端点中已取消的作业数统计。

  5. 您可以通过筛选周期和刷新频率,查看监控数据。

    • 周期:支持通过近1小时、近6小时、近1天、近7天、近30天的维度查看所选时间段的监控数据,您也可以自定义周期,但最长是30天。
      设置监控数据统计周期后,您可以在界面右上角选择“按分钟”、“按小时”或“按天”的维度查看图表,图表数据会按照所选聚合粒度计算平均值呈现。
      • 监控数据统计周期为近1小时/6小时,监控图表内的数据周期最小为1分钟。
      • 监控数据统计周期为近1天/7天,监控图表内的数据周期最小为1小时,图表不支持按分钟呈现。
      • 监控数据统计周期为近30天,监控图表内的数据周期最小为1天,图表不支持按分钟或者按小时呈现。
      • 自定义监控数据统计周期最大选择30天,超过1天时监控图表内的数据周期最小为1小时,超过7天时监控图表内的数据周期最小为1天。
    • 刷新频率:可按需选择手动刷新、1分钟和5分钟。

查看单个作业监控(AuraJob)

您可以通过以下两种方式查看AuraJob端点下某个作业的监控数据,仅支持查看已运行的作业监控详细信息。

  1. 登录AI DataLake管理控制台
  2. 在页面左上角切换至对应的工作空间。
  3. 进入作业监控页面。

    • 方式一:从作业运行历史查看
      1. 在左侧导航栏选择“作业运行历史”,单击“多模数据引擎 Aura”。
      2. 在想要查看监控的运行作业的“操作”列中,单击“作业监控”页签,查看Aura端点作业监控指标。
    • 方式二:从端点详情查看
      1. 在左侧导航栏选择“引擎端点 > 多模数据引擎Aura”,在端点列表中单击运行作业的端点名称进入概览页面。
      2. 单击“作业运行历史”页签,在运行作业的“操作”列中,单击“作业监控”,查看Aura端点作业监控指标。

        您也可以单击“监控”页签,在“作业监控”区域,查看Aura端点作业监控指标。

  4. 查看作业监控指标。

    表2 AuraJob端点作业监控指标

    分类

    指标名称

    单位

    说明

    CPU指标

    CPU使用率

    %

    该指标用于统计测量对象的CPU使用率。

    CPU使用量

    vCPU

    该指标用于统计测量对象的CPU使用量。

    内存指标

    内存使用率

    %

    该指标用于统计测量对象已使用内存占申请的内存总量的百分比。

    内存使用量

    GiB

    该指标用于统计测量对象实际已经使用的内存。

    GPU指标

    GPU使用率

    %

    该指标用于统计测量对象的GPU使用率。

    显存使用率

    %

    该指标用于统计测量对象已使用的显存占显存容量的百分比。

    显存使用量

    MiB

    该指标用于统计测量对象已使用的显存。

    NPU指标

    NPU使用率

    %

    该指标用于统计测量对象的NPU使用率。

    NPU存储使用率

    %

    该指标用于统计测量对象已使用的NPU存储占NPU存储容量的百分比。

    NPU存储使用量

    MiB

    该指标用于统计测量对象已使用的NPU存储。

  5. 运维人员可以通过配置监控数据统计周期来查看作业的资源使用情况。系统支持自定义作业监控数据统计周期。默认选中时间为作业的“提交时间”到“结束时间”(如果作业尚未结束,则到当前时间),根据该时间范围,需要设置数据粒度。设置监控数据统计周期后,可以在界面右上角选择“按分钟”、“按小时”或“按天”的维度查看图表,图表数据会按照所选聚合粒度计算平均值呈现。

    • 监控数据统计周期为近1小时/6小时,监控图表内的数据周期最小为1分钟。
    • 监控数据统计周期为近1天/7天,监控图表内的数据周期最小为1小时,图表不支持按分钟呈现。
    • 监控数据统计周期为近30天,监控图表内的数据周期最小为1天,图表不支持按分钟或者按小时呈现。
    • 自定义监控数据统计周期最大选择30天,超过1天时监控图表内的数据周期最小为1小时,超过7天时监控图表内的数据周期最小为1天。

查看单个作业监控(AuraJobV2)

您可以查看AuraJobV2端点下某个作业的运行的作业监控和算子监控的详细信息。

约束与限制

支持的语句

不支持的语句

  • insert into/insert into select
  • create table as
  • select
  • explain/explain performance
  • create schema/table/view/function
  • drop schema/table/view/function
  • alter table
  • describe
  • truncate
  • show/set
  • analyze
  • SELECT VERSION()
  • SELECT name,setting from pg_settings
  • SELECT count(*) from pg_settings
  • SELECT pg_client_encoding()
  • SELECT current_schema()

操作步骤

  1. 登录AI DataLake管理控制台
  2. 在页面左上角切换至对应的工作空间。
  3. 进入“作业运行详情”面板页面。

    • 方式一:从作业运行历史查看
      1. 在左侧导航栏选择“作业开发 > 作业运行历史”,单击“多模数据引擎 Aura”。
      2. 在作业列表上方选择“AuraJobV2”,然后单击作业ID或者在目标作业的“操作”列中的“查看详情”。
    • 方式二:从端点详情查看
      1. 在左侧导航栏选择“引擎端点 > 多模数据引擎Aura”,在端点列表中单击运行作业的端点名称进入概览页面。
      2. 单击“作业运行历史”页签,然后单击作业ID或者在目标作业的“操作”列中单击“查看详情”。

  4. 在“作业运行详情”面板中,单击“作业监控”页签。
  5. 在“SQL语句”后的下拉框中,选择SQL语句后,查看作业监控的详细信息。

    • CN:协调节点(Coordinator Node),负责接收来自应用的访问请求,并向客户端返回执行结果;负责分解任务,并调度任务在各分片上并行执行。
    • DN:数据节点(Data Node),负责存储业务数据、执行数据查询任务以及向CN返回执行结果。
    表3 AuraJobV2端点作业监控信息

    参数

    单位

    说明

    Schema名称

    -

    SQL语句运行时的Schema名称。

    语句起始时间

    -

    SQL语句开始执行的时间。

    预计语句运行时长 (ms)

    ms

    SQL语句从开始到结束的预估总耗时,只有运行中的SQL语句显示此参数。

    语句运行时长 (ms)

    ms

    SQL语句从开始到结束的总耗时。

    预计语句剩余运行时长 (ms)

    ms

    SQL语句预估的剩余运行时长,只有运行中的SQL语句显示此参数。

    语句运行状态

    -

    SQL语句运行的状态。

    启动CN时长 (ms)

    ms

    CN启动任务的时间。

    创建会话时长 (ms)

    ms

    建立数据库会话连接的时间。

    语句加入任务队列时长 (ms)

    ms

    SQL语句进入执行队列的时间。

    语句排队时长 (ms)

    ms

    SQL语句在队列中等待执行的时间。

    语句写结果集时长 (ms)

    ms

    将SQL语句结果写入结果集的时间。

    执行前解析时长 (ms)

    ms

    SQL语句语法解析和语义分析的时间。

    预计内存 (MB)

    MB

    SQL语句执行过程中预估的内存使用量。

    DN下盘倾斜率 (%)

    %

    DN节点上不同磁盘间的数据分布不均匀程度。

    DN时长偏斜百分比 (%)

    %

    各DN节点执行时长的不均衡程度。

    DN下盘写磁盘总量 (MB)

    MB

    DN节点所有下盘写入到本地磁盘的写入总量。

    所有DN最大峰值内存 (MB)

    MB

    所有DN节点中最高的峰值内存。

    所有DN平均峰值内存 (MB)

    MB

    所有DN节点峰值内存的平均值。

    OBS IO请求平均延迟 (us)

    us

    访问OBS对象存储的I/O请求平均响应时间。

    OBS IO请求延迟大于1秒次数

    访问OBS对象存储的I/O请求延迟大于1秒的次数。

    CN下盘写OBS总量 (MB)

    MB

    CN节点所有下盘写入到OBS对象存储的写入总量。

    OBS IO请求延迟大于10秒次数

    访问OBS对象存储的I/O请求延迟大于10秒的次数。

    磁盘缓存命中率 (%)

    %

    数据库读取的数据从本地磁盘缓存中读取的比例。

    查询计划

    -

    数据库执行SQL语句前生成的执行步骤。

    报错信息

    -

    语句运行的报错信息,只有报错才会显示此参数。

  6. 在“算子监控”区域,查看算子的监控信息,包括算子的名称、已处理/预估行数、状态、执行时长(ms)、执行进度、该节点被执行次数和开始时间等信息。

    • 您可以在搜索框中输入算子名称,筛选查看某个算子的监控信息。
    • 您可以单击自定义显示列,默认不显示并行度、内存使用峰值 (Min-Max)(MB)、内存平均使用峰值 (MB)、内存使用倾斜百分比、下盘数据量 (Min-Max)(MB)和下盘平均数据量 (MB)。

    算子监控功能仅统计作业运行中的监控数据,作业运行结束则不统计,监控数据将会在作业结束后5分钟后自动删除。

相关文档