更新时间:2026-07-09 GMT+08:00
分享

AI DataLake版本说明

本节内容介绍了AI DataLake当前提供的各引擎版本配套关系和特性说明。

各引擎版本支持情况

AI DataLake当前提供的各引擎版本配套关系和特性说明如表1所示。

表1 各引擎版本支持情况

引擎

版本

版本特性说明

多模数据引擎Aura(AuraJobV2)

3.5.0

多模数据引擎AuraJobV2版本特性说明

AI计算引擎Ray

2.54.0

AI计算引擎Ray 2.54.0版本特性说明

批处理引擎Spark

4.0.0

批处理引擎Spark 4.0.0版本特性说明

流处理引擎Flink

公测期间暂不开放

不涉及

多模数据引擎Aura 3.5.0版本特性说明

表2 多模数据引擎AuraJobV2版本特性说明

主要功能/特性

说明

AuraJobV2端点管理

  • 支持预留资源模式与混合资源模式:
    • 预留资源:适合负载稳定、持续运行的业务场景,如生产项目、关键任务。
    • 混合模式:兼顾效率与突发场景,适用于日常有稳定负载且存在突发波峰波谷的场景。
  • 支持创建ARM类型的通算工作组,支持复用智算CPU资源。
  • 支持新增、删除工作组;支持修改工作组资源规格、配额、镜像。
  • 支持查看已经提交、运行结束的会话、及会话详细信息,支持停止会话。
  • 支持查看已经提交、运行结束的作业,及作业详细信息,支持取消作业。
  • 支持查看作业历史监控信息,支持运行时算子监控。
  • 支持运行日志对接LTS在租户侧查看。

基于Aura DataFrame的多模处理

基于Aura DataFrame SDK的多模处理,支持异构算力、流水线执行、并发动态自适应调整等能力,提供更好的性能。

  • 支持常见的Python DataFrame SDK。
  • 支持Python UDF(Scalar UDF、向量化UDF、Class UDF)、UDTF、UDAF。
  • UDF支持RuntimeEnv的环境隔离能力。
  • UDF执行支持CPU、GPU、NPU异构算力,支持灵活声明资源规格。
  • 通过UDF算子化技术,支持UDF算子的异构pipeline执行,显著提升性能。
  • 支持设置UDF级别的亲和调度策略。
  • 支持语句级和算子级的性能数据实时观测。

计算资源统一调度

提供对CPU、GPU、NPU等异构计算资源的统一管理与调度能力,用户可通过任务声明式配置,将不同计算密集型负载分配至最优硬件资源。

自定义镜像管理

提供通过自定义Aura镜像创建Aura端点并运行Dataframe作业,用户可在AI DataLake提供的Aura基础镜像之上,通过Dockerfile集成自研算法库、系统依赖包或特定版本的Python库,构建符合业务场景的个性化运行环境。

集群弹性扩缩容

根据端点任务负载情况,在预置的工作组资源最小值和最大值之间进行自动伸缩。

原生API兼容,零代码迁移

AuraJobV2 兼容SQL语法,提供JDBC驱动支持。

数据格式

  • 支持Images、Video、Audio多模格式读写。
  • 支持Lance、Iceberg V2/V3、Parquet、CSV、TEXT多种开放文件格式读写。

生态配套

  • 兼容Python 3.10/3.11版本
  • Iceberg 1.10.0版本
  • Parquet 17.0.0版本
  • ORC 1.8.5版本
表3 多模数据引擎AuraJob版本特性说明

主要功能/特性

说明

AuraJob端点

  • 预留资源:适合负载稳定、持续运行的业务场景,如生产项目、关键任务。
  • 混合模式:兼顾效率与突发场景,适用于日常有稳定负载,有突发的波峰波谷的场景。

计算资源统一调度

提供对CPU、GPU、NPU等异构计算资源的统一管理与调度能力,用户可通过任务声明式配置,将不同计算密集型负载分配至最优硬件资源。

支持资源弹性扩缩容

根据Job的任务数量能在资源规格配置的最小值与最大值之间自动伸缩。

支持挂载临时存储

临时存储用于作业运行过程中的临时下盘和缓存,可存储中间结果、模型文件等非持久化数据。

自定义镜像管理

支持基于自定义镜像运行,兼容已有程序,无需代码改造。

提供端点监控和作业监控

  • 端点监控:实时掌握AuraJob端点的资源使用情况。
  • 作业监控:实时掌握AuraJob端点的作业运行的详情信息,包括CPU使用率、CPU使用量等监控指标。

提供LTS日志记录与查询

将Job标准输出日志自动投递到LTS,系统将自动完成日志的实时采集、查询和分析,从而简化日志管理流程,提高问题定位和故障排查的效率,同时确保日志数据的安全隔离,满足多租户场景下的安全与合规要求。

AI计算引擎Ray 2.54.0版本特性说明

表4 AI计算引擎Ray版本特性说明

主要功能/特性

说明

RayCluster端点

  • 提供预留资源模式,允许用户为关键计算任务预先锁定资源,确保作业调度时资源可用且不被抢占。
  • 提供在线扩缩容,基于Head-Worker架构组建RayCluster端点,通过修改端点配置信息,实现在线增删Workergroups。

RayJob端点

提供三种资源模式,适配多样化Ray工作负载。

  • 预留资源保障长稳作业
  • 混合模式兼顾效率与突发
  • 按需弹性实现秒级扩容

计算资源统一调度

提供对CPU、GPU、NPU等异构计算资源的统一管理与调度能力,用户可通过任务声明式配置,将不同计算密集型负载分配至最优硬件资源。

自定义Ray镜像管理

支持通过自定义Ray镜像创建RayCluster或RayJob端点并运行Ray作业。

您可以在AI DataLake提供的Ray基础镜像之上,通过Dockerfile集成内部算法库、系统依赖包或特定版本的Python库,构建符合业务场景的个性化运行环境。

Ray集群弹性扩缩容

提供Worker Autoscaling,Worker数量弹性范围可配置,集群将根据当前任务队列长度和资源负载情况,在预置的最小值与最大值之间自动伸缩Worker数量。

原生Ray API兼容,零代码迁移

提供与开源Ray 2.54.0版本完全一致的API接口和行为语义,用户无需修改任何业务代码或工作流,即可将现有Ray应用无缝迁移至AI DataLake平台。

数据格式

  • 支持Audio、Images、Video、WebDataset多模态数据读取,Images多模态数据写入。
  • 支持CSV、JSON传统数据读写。

生态配套

兼容Python 3.10/3.11版本

批处理引擎Spark 4.0.0版本特性说明

表5 批处理引擎Spark版本特性说明

主要功能/特性

说明

Spark端点

提供三种资源模式,适配多样化Spark工作负载。

  • 预留资源:适合负载稳定、持续运行的业务场景,如生产项目、关键任务。
  • 混合模式:兼顾效率与突发场景,适用于日常有稳定负载,有突发的波峰波谷的场景。
  • 按需弹性:实现秒级扩容,适合短期或偶发性的业务需求,如开发测试或临时任务。

SparkSQL

  • 支持SQL UDF,支持纯SQL定义函数体,优化器可直接内联展开并参与全局优化。
  • 支持表函数返回多行。

SparkJob

  • PySpark支持原生可视化API,Python Data Source API。
  • 改进查询优化器并优化执行引擎,强化多级算子下推与动态分区裁剪能力。
  • 增强内存管理机制,提升资源利用效率并降低内存溢出风险。

计算资源统一调度

提供对CPU资源的统一管理与调度能力。

Spark集群弹性扩缩容

Spark SQL可根据当前任务排队数量,在预置的最小值与最大值之间自动伸缩executor数量。

原生Spark兼容,零代码迁移

提供与开源Spark 4.0.0 版本部分兼容的API接口和行为语义。

详情请参见Spark语法参考

数据格式

支持Iceberg V2、Iceberg V3、Parquet、CSV、TEXT传统湖仓格式读写。

生态配套

  • Python 3.9版本
  • JDK 21版本
  • Scala 2.13版本
  • Iceberg 1.10.0版本

相关文档