文档首页/ 智能数据湖 AI DataLake/ 版本规划/ AI DataLake 26.7.0 版本说明
更新时间:2026-08-24 GMT+08:00
分享

AI DataLake 26.7.0 版本说明

本节内容介绍了AI DataLake 26.7.0版本中各引擎版本配套关系和特性说明。

各引擎版本支持情况

AI DataLake当前提供的各引擎版本配套关系和特性说明如表1所示。

表1 各引擎版本支持情况

引擎

版本

版本特性说明

多模数据引擎Aura

3.7.0

多模数据引擎Aura 3.7.0版本特性说明

AI计算引擎Ray

2.54.0

AI计算引擎Ray 2.54.0版本特性说明

批处理引擎Spark

4.0.3

批处理引擎Spark 4.0.3版本特性说明

流处理引擎Flink

公测期间暂不开放

不涉及

多模数据引擎Aura 3.7.0版本特性说明

表2 多模数据引擎AuraJobV2版本特性说明

主要功能/特性

说明

Lance表数据治理能力

支持对Lance表执行vacuum和compaction操作,帮助用户清理过期数据文件、合并小文件,优化存储空间利用率和查询性能。

算子异步执行与结果追踪

算子后端运行异步化,支持通过SDK查看算子执行状态与结果,避免长时间运行阻塞主流程,提升开发效率。

Lance表全文检索能力

支持为Lance表创建全文检索倒排索引,并基于索引执行FTS(Full Text Search)查询,实现高效的文本检索与匹配。

标签管理

AuraJobV2端点新增支持标签管理,可以通过标签对资源进行分类管理。

数据格式

  • 支持Images、Video、Audio多模格式读写。
  • 支持Lance、Iceberg V2/V3、Parquet、CSV、TEXT多种开放文件格式读写。

生态配套

  • Python 3.10、Python 3.11版本
  • Iceberg 1.10.0版本
  • Parquet 17.0.0版本
  • ORC 1.8.5版本
表3 多模数据引擎AuraJob版本特性说明

主要功能/特性

说明

资源标签管理

工作空间、计算资源池、端点新增标签配置功能,对接TMS(标签管理服务),支持为关键资源对象绑定标签键值对,实现资源的分类标识、快速筛选与统一管理,便于用户按业务维度进行资源归属划分、成本归集与批量运维操作。

AI计算引擎Ray 2.54.0版本特性说明

表4 AI计算引擎Ray版本特性说明

主要功能/特性

说明

RayCluster端点

  • RayCluster端点新增支持配置GCS高可用

    GCS是Ray集群的元数据管理组件,负责维护集群状态。开启高可用后,GCS可通过Redis备份并恢复元数据,即使GCS节点发生故障,集群仍可正常运行,避免单点故障导致整个集群不可用。

  • RayCluster端点新增支持Dashboard功能

    提供Ray集群可视化管理界面,支持查看作业执行状态、资源使用情况、任务及Actor运行详情和日志信息,便于监控集群运行状况和排查问题。

  • RayCluster端点新增支持Flow Insight

    Flow Insight是专为解决Ray分布式应用“黑盒”问题设计的可视化分析工具,通过全局调用追踪和数据流监控系统行为,支持性能瓶颈诊断和Ray应用优化。可通过开关启用或禁用,存储复用History Server路径。

  • RayCluster端点新增支持Ray History Server服务化

    提供历史任务执行信息的事后查看能力,作业运行结束后仍可回溯查看任务执行详情,高效定位作业失败原因。

  • RayCluster端点新增支持配置IAM委托

    委托给该端点的权限,会在运行时自动换取凭证并刷新至Ray集群。用户可在Ray集群中使用该委托凭证调用对应服务(如OBS、LakeFormation等)。

  • 标签管理

    RayCluster端点新增支持标签管理,可以通过标签对资源进行分类管理。

RayJob端点

  • RayJob端点新增支持Dashboard功能

    提供Ray集群可视化管理界面,支持查看作业执行状态、资源使用情况、任务及Actor运行详情和日志信息,便于监控集群运行状况和排查问题。

  • RayJob端点新增支持Flow Insight

    Flow Insight是专为解决Ray分布式应用"黑盒"问题设计的可视化分析工具,通过全局调用追踪和数据流监控系统行为,支持性能瓶颈诊断和Ray应用优化。可通过开关启用或禁用,存储复用History Server路径。

  • RayJob端点新增支持Ray History Server服务化

    提供历史任务执行信息的事后查看能力,作业运行结束后仍可回溯查看任务执行详情,高效定位作业失败原因。

  • 标签管理

    RayJob端点新增支持标签管理,可以通过标签对资源进行分类管理。

LakeFormation元数据适配

RayCluster端点和RayJob端点新增支持适配LakeFormation Dataset(Volume)元数据能力。Ray集群可对接LakeFormation元数据,实现与数据湖元数据的统一管理,作业可直接访问已注册的数据集。

原生Ray API兼容,零代码迁移

提供与开源Ray 2.54.0版本完全一致的API接口和行为语义,用户无需修改任何业务代码或工作流,即可将现有Ray应用无缝迁移至AI DataLake平台。

数据格式

  • 支持Audio、Images、Video、WebDataset多模态数据读取,Images多模态数据写入。
  • 支持CSV、JSON传统数据读写。

生态配套

兼容Python 3.10、Python 3.11版本

批处理引擎Spark 4.0.3版本特性说明

表5 批处理引擎Spark版本特性说明

主要功能/特性

说明

Spark端点

  • 支持OBS路径鉴权

    LakeFormation支持基于OBS路径的细粒度鉴权,确保数据访问的安全性与合规性。

  • 支持自定义镜像

    Spark端点新增支持镜像管理。SparkSQL端点仅支持选择预置镜像。SparkJob端点支持选择预置镜像和自定义镜像。

  • 支持标签管理

    Spark端点新增支持标签管理,可以通过标签对资源进行分类管理。

原生Spark兼容

提供与开源Spark 4.0.3版本部分兼容的API接口和行为语义。

详情请参见Spark语法参考

数据格式

支持Iceberg V2、Iceberg V3、Parquet、CSV、TEXT传统湖仓格式读写。

生态配套

  • Python 3.9版本
  • JDK 21版本
  • Scala 2.13版本
  • Iceberg 1.10.0版本

相关文档