
# AI DataLake 26.7.0 版本说明
本节内容介绍了AI DataLake 26.7.0版本中各引擎版本配套关系和特性说明。
#### 各引擎版本支持情况
AI DataLake当前提供的各引擎版本配套关系和特性说明如[表1]所示。
 表1各引擎版本支持情况 
| 引擎         | 版本       | 版本特性说明                                                                     |
|:---|:---|:---|
| 多模数据引擎Aura | 3.7.0    | [多模数据引擎Aura 3.7.0版本特性说明] |
| AI计算引擎Ray  | 2.54.0   | [AI计算引擎Ray 2.54.0版本特性说明]  |
| 批处理引擎Spark | 4.0.3    | [批处理引擎Spark 4.0.3版本特性说明] |
| 流处理引擎Flink | 公测期间暂不开放 | 不涉及                                                                        |
   
 #### 多模数据引擎Aura 3.7.0版本特性说明
表2多模数据引擎AuraJobV2版本特性说明 
| 主要功能/特性      | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                         |
|:---|:---|
| Lance表数据治理能力 | 支持对Lance表执行vacuum和compaction操作，帮助用户清理过期数据文件、合并小文件，优化存储空间利用率和查询性能。                                                                                                                                                                                                                                                                                                                                                                                                                          |
| 算子异步执行与结果追踪  | 算子后端运行异步化，支持通过SDK查看算子执行状态与结果，避免长时间运行阻塞主流程，提升开发效率。                                                                                                                                                                                                                                                                                                                                                                                                                                          |
| Lance表全文检索能力 | 支持为Lance表创建全文检索倒排索引，并基于索引执行FTS（Full Text Search）查询，实现高效的文本检索与匹配。                                                                                                                                                                                                                                                                                                                                                                                                                           |
| 标签管理         | AuraJobV2端点新增支持标签管理，可以通过标签对资源进行分类管理。                                                                                                                                                                                                                                                                                                                                                                                                                                                       |
| 数据格式         | - 支持Images、Video、Audio多模格式读写。  - 支持Lance、Iceberg V2/V3、Parquet、CSV、TEXT多种开放文件格式读写。                                                                                                                                                                               |
| 生态配套         | - Python 3.10、Python 3.11版本  - Iceberg 1.10.0版本  - Parquet 17.0.0版本  - ORC 1.8.5版本   |
   
表3多模数据引擎AuraJob版本特性说明 
| 主要功能/特性 | 说明                                                                                                      |
|:---|:---|
| 资源标签管理  | 工作空间、计算资源池、端点新增标签配置功能，对接TMS（标签管理服务），支持为关键资源对象绑定标签键值对，实现资源的分类标识、快速筛选与统一管理，便于用户按业务维度进行资源归属划分、成本归集与批量运维操作。 |
   
 #### AI计算引擎Ray 2.54.0版本特性说明
表4AI计算引擎Ray版本特性说明 
| 主要功能/特性            | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                        |
|:---|:---|
| RayCluster端点       | - **RayCluster** **端点新增支持配置GCS高可用** GCS是Ray集群的元数据管理组件，负责维护集群状态。开启高可用后，GCS可通过Redis备份并恢复元数据，即使GCS节点发生故障，集群仍可正常运行，避免单点故障导致整个集群不可用。   - **RayCluster端点新增支持Dashboard功能** 提供Ray集群可视化管理界面，支持查看作业执行状态、资源使用情况、任务及Actor运行详情和日志信息，便于监控集群运行状况和排查问题。   - **RayCluster端点新增支持Flow Insight** Flow Insight是专为解决Ray分布式应用"黑盒"问题设计的可视化分析工具，通过全局调用追踪和数据流监控系统行为，支持性能瓶颈诊断和Ray应用优化。可通过开关启用或禁用，存储复用History Server路径。   - **RayCluster端点新增支持Ray History Server服务化** 提供历史任务执行信息的事后查看能力，作业运行结束后仍可回溯查看任务执行详情，高效定位作业失败原因。   - **RayCluster端点新增支持配置IAM委托** 委托给该端点的权限，会在运行时自动换取凭证并刷新至Ray集群。用户可在Ray集群中使用该委托凭证调用对应服务（如OBS、LakeFormation等）。   - **标签管理** RayCluster端点新增支持标签管理，可以通过标签对资源进行分类管理。    |
| RayJob端点           | - **RayJob端点新增支持Dashboard功能** 提供Ray集群可视化管理界面，支持查看作业执行状态、资源使用情况、任务及Actor运行详情和日志信息，便于监控集群运行状况和排查问题。   - **RayJob端点新增支持Flow Insight** Flow Insight是专为解决Ray分布式应用"黑盒"问题设计的可视化分析工具，通过全局调用追踪和数据流监控系统行为，支持性能瓶颈诊断和Ray应用优化。可通过开关启用或禁用，存储复用History Server路径。   - **RayJob端点新增支持Ray History Server服务化** 提供历史任务执行信息的事后查看能力，作业运行结束后仍可回溯查看任务执行详情，高效定位作业失败原因。   - **标签管理** RayJob端点新增支持标签管理，可以通过标签对资源进行分类管理。                                                                                                                                                                                                                                                                                                                                                                                                                                               |
| LakeFormation元数据适配 | RayCluster端点和RayJob端点新增支持适配LakeFormation Dataset（Volume）元数据能力。Ray集群可对接LakeFormation元数据，实现与数据湖元数据的统一管理，作业可直接访问已注册的数据集。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                     |
| 原生Ray API兼容，零代码迁移  | 提供与开源Ray 2.54.0版本完全一致的API接口和行为语义，用户无需修改任何业务代码或工作流，即可将现有Ray应用无缝迁移至AI DataLake平台。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           |
| 数据格式               | - 支持Audio、Images、Video、WebDataset多模态数据读取，Images多模态数据写入。  - 支持CSV、JSON传统数据读写。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                |
| 生态配套               | 兼容Python 3.10、Python 3.11版本                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                               |
   
 #### 批处理引擎Spark 4.0.3版本特性说明
表5批处理引擎Spark版本特性说明 
| 主要功能/特性   | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                |
|:---|:---|
| Spark端点   | - **支持OBS路径鉴权** LakeFormation支持基于OBS路径的细粒度鉴权，确保数据访问的安全性与合规性。   - **支持自定义镜像** Spark端点新增支持镜像管理。SparkSQL端点仅支持选择预置镜像。SparkJob端点支持选择预置镜像和自定义镜像。   - **支持标签管理** Spark端点新增支持标签管理，可以通过标签对资源进行分类管理。    |
| 原生Spark兼容 | 提供与开源Spark 4.0.3版本部分兼容的API接口和行为语义。 详情请参见[Spark语法参考](https://support.huaweicloud.com/sqlref-spark-aidatalake/aidatalake_063_0001.html)。                                                                                                                                                                                                                                                                                                                                 |
| 数据格式      | 支持Iceberg V2、Iceberg V3、Parquet、CSV、TEXT传统湖仓格式读写。                                                                                                                                                                                                                                                                                                                                                                                                                                                                 |
| 生态配套      | - Python 3.9版本  - JDK 21版本  - Scala 2.13版本  - Iceberg 1.10.0版本                                            |
   
