本节内容介绍了AI DataLake 26.7.0版本中各引擎版本配套关系和特性说明。
各引擎版本支持情况
AI DataLake当前提供的各引擎版本配套关系和特性说明如表1所示。
多模数据引擎Aura 3.7.0版本特性说明
表2 多模数据引擎AuraJobV2版本特性说明 | 主要功能/特性 | 说明 |
| Lance表数据治理能力 | 支持对Lance表执行vacuum和compaction操作,帮助用户清理过期数据文件、合并小文件,优化存储空间利用率和查询性能。 |
| 算子异步执行与结果追踪 | 算子后端运行异步化,支持通过SDK查看算子执行状态与结果,避免长时间运行阻塞主流程,提升开发效率。 |
| Lance表全文检索能力 | 支持为Lance表创建全文检索倒排索引,并基于索引执行FTS(Full Text Search)查询,实现高效的文本检索与匹配。 |
| 标签管理 | AuraJobV2端点新增支持标签管理,可以通过标签对资源进行分类管理。 |
| 数据格式 | - 支持Images、Video、Audio多模格式读写。
- 支持Lance、Iceberg V2/V3、Parquet、CSV、TEXT多种开放文件格式读写。
|
| 生态配套 | - Python 3.10、Python 3.11版本
- Iceberg 1.10.0版本
- Parquet 17.0.0版本
- ORC 1.8.5版本
|
表3 多模数据引擎AuraJob版本特性说明 | 主要功能/特性 | 说明 |
| 资源标签管理 | 工作空间、计算资源池、端点新增标签配置功能,对接TMS(标签管理服务),支持为关键资源对象绑定标签键值对,实现资源的分类标识、快速筛选与统一管理,便于用户按业务维度进行资源归属划分、成本归集与批量运维操作。 |
AI计算引擎Ray 2.54.0版本特性说明
表4 AI计算引擎Ray版本特性说明 | 主要功能/特性 | 说明 |
| RayCluster端点 | - RayCluster端点新增支持配置GCS高可用
GCS是Ray集群的元数据管理组件,负责维护集群状态。开启高可用后,GCS可通过Redis备份并恢复元数据,即使GCS节点发生故障,集群仍可正常运行,避免单点故障导致整个集群不可用。 - RayCluster端点新增支持Dashboard功能
提供Ray集群可视化管理界面,支持查看作业执行状态、资源使用情况、任务及Actor运行详情和日志信息,便于监控集群运行状况和排查问题。 - RayCluster端点新增支持Flow Insight
Flow Insight是专为解决Ray分布式应用“黑盒”问题设计的可视化分析工具,通过全局调用追踪和数据流监控系统行为,支持性能瓶颈诊断和Ray应用优化。可通过开关启用或禁用,存储复用History Server路径。 - RayCluster端点新增支持Ray History Server服务化
提供历史任务执行信息的事后查看能力,作业运行结束后仍可回溯查看任务执行详情,高效定位作业失败原因。 - RayCluster端点新增支持配置IAM委托
委托给该端点的权限,会在运行时自动换取凭证并刷新至Ray集群。用户可在Ray集群中使用该委托凭证调用对应服务(如OBS、LakeFormation等)。 - 标签管理
RayCluster端点新增支持标签管理,可以通过标签对资源进行分类管理。 |
| RayJob端点 | - RayJob端点新增支持Dashboard功能
提供Ray集群可视化管理界面,支持查看作业执行状态、资源使用情况、任务及Actor运行详情和日志信息,便于监控集群运行状况和排查问题。 - RayJob端点新增支持Flow Insight
Flow Insight是专为解决Ray分布式应用"黑盒"问题设计的可视化分析工具,通过全局调用追踪和数据流监控系统行为,支持性能瓶颈诊断和Ray应用优化。可通过开关启用或禁用,存储复用History Server路径。 - RayJob端点新增支持Ray History Server服务化
提供历史任务执行信息的事后查看能力,作业运行结束后仍可回溯查看任务执行详情,高效定位作业失败原因。 - 标签管理
RayJob端点新增支持标签管理,可以通过标签对资源进行分类管理。 |
| LakeFormation元数据适配 | RayCluster端点和RayJob端点新增支持适配LakeFormation Dataset(Volume)元数据能力。Ray集群可对接LakeFormation元数据,实现与数据湖元数据的统一管理,作业可直接访问已注册的数据集。 |
| 原生Ray API兼容,零代码迁移 | 提供与开源Ray 2.54.0版本完全一致的API接口和行为语义,用户无需修改任何业务代码或工作流,即可将现有Ray应用无缝迁移至AI DataLake平台。 |
| 数据格式 | - 支持Audio、Images、Video、WebDataset多模态数据读取,Images多模态数据写入。
- 支持CSV、JSON传统数据读写。
|
| 生态配套 | 兼容Python 3.10、Python 3.11版本 |
批处理引擎Spark 4.0.3版本特性说明
表5 批处理引擎Spark版本特性说明 | 主要功能/特性 | 说明 |
| Spark端点 | - 支持OBS路径鉴权
LakeFormation支持基于OBS路径的细粒度鉴权,确保数据访问的安全性与合规性。 - 支持自定义镜像
Spark端点新增支持镜像管理。SparkSQL端点仅支持选择预置镜像。SparkJob端点支持选择预置镜像和自定义镜像。 - 支持标签管理
Spark端点新增支持标签管理,可以通过标签对资源进行分类管理。 |
| 原生Spark兼容 | 提供与开源Spark 4.0.3版本部分兼容的API接口和行为语义。 详情请参见Spark语法参考。 |
| 数据格式 | 支持Iceberg V2、Iceberg V3、Parquet、CSV、TEXT传统湖仓格式读写。 |
| 生态配套 | - Python 3.9版本
- JDK 21版本
- Scala 2.13版本
- Iceberg 1.10.0版本
|