最新动态

更新时间:2026/08/21 GMT+08:00
分享

本文介绍了智能数据湖 AI DataLake各特性版本的功能发布和对应的文档动态,欢迎体验。

2026年07月

2026年07月31日

序号

功能名称

功能描述

阶段

相关文档

1

多模数据引擎Aura

AuraJobV2:

  • 支持对Lance表执行vacuum和compaction操作,帮助用户清理过期数据文件、合并小文件,优化存储空间利用率和查询性能。

  • 支持为Lance表创建全文检索倒排索引,并基于索引执行FTS(Full Text Search)查询,实现高效的文本检索与匹配。

  • 设置Lance运行时缓存相关的参数,包括是否开启内部线程池、线程池大小、线程池队列大小、线程池读写超时时间等参数。

  • 支持查看AuraJobV2端点下的SQL会话信息和SQL运行情况,如果不再需要某个会话,可以关闭会话,及时释放资源。

  • 支持查看AuraJobV2端点监控和作业监控

公测

Lance on Aura DDL语法说明

Lance表使用索引

Python UDF

会话管理

2

AI计算引擎Ray

  • RayCluster端点新增支持配置GCS高可用,开启高可用后,GCS可通过Redis备份并恢复元数据,即使GCS节点发生故障,集群仍可正常运行,避免单点故障导致整个集群不可用。

  • RayCluster端点新增支持配置委托,委托给该端点的权限,会在运行时自动换取凭证并刷新至Ray集群。您可在Ray集群中使用该委托凭证调用对应服务(如OBS、LakeFormation等)。

  • RayCluster和RayJob端点新增支持Dashboard功能,提供Ray集群可视化管理界面,支持查看作业执行状态、资源使用情况、任务及Actor运行详情和日志信息,便于监控集群运行状况和排查问题。

  • RayCluster和RayJob端点新增支持Flow Insight,Flow Insight是专为解决Ray分布式应用“黑盒”问题设计的可视化分析工具,通过全局调用追踪和数据流监控系统行为,支持性能瓶颈诊断和Ray应用优化。可通过开关启用或禁用,存储复用History Server路径。

  • RayCluster和RayJob端点新增支持Ray History Server服务化,提供历史任务执行信息的事后查看能力,作业运行结束后仍可回溯查看任务执行详情,高效定位作业失败原因。

公测

创建Ray引擎端点

查看Ray Dashboard

使用History Server查看历史作业

查看Flow Insight视图

3

批处理引擎Spark

  • Spark端点新增支持镜像管理。SparkSQL端点仅支持选择预置镜像。SparkJob端点支持选择预置镜像和自定义镜像。

  • Spark端点新增支持标签管理,可以通过标签对资源进行分类管理。

  • LakeFormation支持基于OBS路径的细粒度鉴权,确保数据访问的安全性与合规性。

公测

创建Spark引擎端点

Spark SQL场景的LakeFormation授权

4

标签管理

  • 对接TMS,支持通过TMS统一管理标签及按标签查询资源列表与数量。
  • 支持为工作空间、计算资源池和端点添加标签、修改标签和删除标签。
  • 支持按标签键值筛选资源列表,查询资源详情时自动展示关联标签。

公测

管理AI DataLake标签

5

镜像管理

优化使用AI DataLake镜像,提供完整的自定义镜像使用流程。

公测

使用AI DataLake镜像

6

LakeFormation元数据管理

  • 优化创建LakeFormation元数据,提供完整使用LakeFormation的流程。

  • 优化查看LakeFormation元数据,支持通过AI DataLake和LakeFormation两种方式查看元数据详情。

公测

创建LakeFormation元数据

查看LakeFormation元数据

7

权限与委托

  • 新增权限与委托概述,系统地介绍IAM授权与委托的区别及适用场景。

  • 新增IAM授权类型和使用场景,支持角色与策略授权和身份策略授权两种类型,并提供对比说明。

  • 新增对接LakeFormation场景授权操作说明,针对不同引擎提供对应的授权操作指引。

公测

AI DataLake权限与委托

2026年06月

2026年06月30日

序号

功能名称

功能描述

阶段

相关文档

1

多模数据引擎Aura

AuraJobV2:

  • 支持创建ARM类型的通算工作组,支持复用智算CPU资源。
  • 支持新增、删除工作组,支持修改工作组资源规格、配额、镜像。
  • 支持查看已经提交、运行结束的会话、及会话详细信息,支持停止会话。
  • 支持查看已经提交、运行结束的作业,及作业详细信息,支持取消作业。
  • 支持查看作业历史监控信息,支持运行时算子监控。
  • 支持运行日志对接LTS在租户侧查看。

公测

修改/删除Aura引擎端点

查看Aura端点监控

查看作业监控

使用LTS管理AI DataLake作业日志

2

AI计算引擎Ray

  • 支持创建RayJob端点。

  • 支持查看RayJob端点的作业监控信息。

  • 支持通过API的方式提交RayJob作业。

公测

创建RayJob端点

查看Ray端点作业监控信息

基于RayJob Data的数据处理

3

批处理引擎Spark

  • 资源模式新增支持预留资源和混合模式。
  • 支持查看Spark UI。
  • 支持查看作业性能指标。
  • 支持查看Spark端点的资源及作业监控信息。
  • 支持本地UDF。
  • 支持Iceberg幂等性。
  • 支持Native加速。
  • 支持对接LakeFormation Catalog权限体系,实现行列级数据访问控制与精细化权限管理,同时支持外部表与内部表的统一管理。

公测

查看Spark UI

查看Spark端点的资源及作业监控信息

Spark Native算子优化

Spark对接LakeFormation数据权限管理

4

自定义镜像

  • 支持查看预置镜像。

  • 支持注册自定义镜像。

  • 支持查询和管理自定义镜像。

  • 支持镜像版本管理。

公测

管理AI DataLake镜像

5

资源监控

  • 支持查看计算资源池的实时运行状态,包括CPU、内存、NPU和GPU的使用率。

  • 支持查看存储资源的实时运行状态,包括客户端连接数、IOPS、带宽、容量和Inode使用情况。

公测

监控AI DataLake计算资源池

监控AI DataLake存储资源

2026年04月

2026年04月30日

序号

功能名称

功能描述

阶段

相关文档

1

首次发布

智能数据湖(AI DataLake)是华为云构建的企业级多模态智能数据分析与管理平台,为您提供构建AI时代数据基础设施的完整能力。提供多模数据引擎AuraAI计算引擎Ray批处理引擎Spark流处理引擎Flink四大核心计算引擎,聚焦多模数据处理、异构算力混合调度,开放湖仓处理,构建新一代多模湖仓架构,促进Data+AI协同创新。

公测期间未开放流处理引擎Flink

公测

什么是AI DataLake

AI DataLake产品优势

AI DataLake产品功能

相关文档