更新时间:2026-08-06 GMT+08:00
分享

创建LakeFormation元数据

LakeFormation是企业级一站式湖仓构建服务,提供元数据统一管理能力。AI DataLake通过对接LakeFormation实现元数据管理和数据访问控制,因此在提交AI DataLake作业前,需要先完成LakeFormation的实例创建、元数据构建和权限配置,并在AI DataLake侧绑定实例和创建端点,打通两者之间的数据链路。本节操作介绍配置AI DataLake与LakeFormation数据连接的完整流程。

使用流程

图1 LakeFormation使用流程
  1. 创建LakeFormation实例,搭建元数据管理与服务载体。
  2. 创建LakeFormation元数据,包括创建OBS并行文件系统和元数据对象(Catalog/数据库/表),为AI DataLake提供数据存储和数据资产目录。
  3. 已有外部元数据时,迁移元数据到LakeFormation。
  4. 配置LakeFormation数据访问权限,授权AI DataLake服务或用户访问元数据资源。
  5. 创建AI DataLake工作空间,绑定LakeFormation实例,建立业务隔离环境。
  6. 创建端点并选择委托,建立AI DataLake与LakeFormation之间的访问连接。
  7. 基于已配置的元数据和权限进行作业开发。

步骤1:创建LakeFormation实例

LakeFormation实例是元数据管理与服务的基础载体,AI DataLake后续需要绑定该实例才能访问元数据。创建LakeFormation实例操作步骤如下。
  1. 登录LakeFormation管理控制台。
  2. 单击页面右上角“立即购买”或“购买实例”,进入实例购买页面。

    首次创建实例时界面显示“立即购买”,如果界面已有LakeFormation实例则显示为“购买实例”。

  3. 按需配置LakeFormation实例参数,完成实例创建。

详情请参考创建LakeFormation实例

LakeFormation提供实例的配置、扩容、删除等基本功能,帮助您便捷地进行实例管理,加速实现数据湖承载的业务的规划和部署。详情请参考管理LakeFormation实例

步骤2:创建LakeFormation元数据

  • 由于Spark集群启动时默认会校验default数据库,请先在LakeFormation页面的当前Catalog下创建名为"default"的数据库并指定合法OBS路径,否则可能导致Spark启动失败。
  • Spark引擎不支持读取大写名称的Catalog、数据库、表、列和函数。
  1. LakeFormation元数据映射的数据文件和目录存储在OBS中。在创建LakeFormation元数据之前,需要提前创建数据存储使用的OBS并行文件系统。

    具体操作,请参见创建并行文件系统

  2. OBS存储准备完成后,通过创建元数据对象(包括Catalog、数据库、数据表等),提供统一的元数据管理能力,帮助用户构建结构化数据资产目录,提升数据治理效率。

    详情请参考创建LakeFormation元数据

步骤3:迁移元数据至LakeFormation

如果您已有外部元数据,可以将其迁移至LakeFormation,并将数据存储在OBS中,实现元数据的统一管理、数据的集中存储和全生命周期管理。迁移完成后,AI DataLake即可通过绑定的LakeFormation实例访问这些元数据。

详情请参考迁移元数据至LakeFormation

步骤4:配置LakeFormation数据访问权限

LakeFormation作为元数据与权限统一管理服务,负责对数据目录、数据库和表进行细粒度权限隔离。创建元数据后,需要为用户或委托配置数据访问权限,确保AI DataLake作业能够正常访问所需的元数据和数据资源。

对接LakeFormation场景的权限管理分为两个层面:

  1. LakeFormation的IAM云服务授权/委托:授权IAM用户或用户组使用LakeFormation服务的权限,或通过委托授权AI DataLake云服务代替您访问LakeFormation。IAM授权的具体操作请参考创建用户并授权使用LakeFormation
  2. LakeFormation的资源授权:在LakeFormation管理控制台对特定资源(Catalog、数据库、表、列和函数等)进行授权,控制用户或委托可以访问哪些具体元数据。例如,用户A可能只能访问table_1,用户B可能只能访问table_2。详情请参考配置LakeFormation元数据权限

步骤5:AI DataLake工作空间绑定LakeFormation实例

工作空间是AI DataLake提供的独立数据分析工作环境,用于隔离不同业务、部门或项目的资源与权限。创建工作空间时需绑定已创建的LakeFormation实例,绑定后AI DataLake可查看该实例中的元数据,为后续作业开发提供数据基础。

绑定LakeFormation实例规则:

  • 一个工作空间只能绑定一个LakeFormation实例。
  • 不同工作空间可以绑定同一个LakeFormation实例。
  • 工作空间创建后,不支持切换绑定的LakeFormation实例。

详情请参考创建工作空间

步骤6:创建端点并选择委托

端点是AI DataLake引擎的入口,通过端点可以提交数据处理和分析作业。完成LakeFormation权限配置后,在创建端点时需选择对应的委托,授权AI DataLake服务以您的身份访问LakeFormation云服务资源,从而建立AI DataLake与LakeFormation之间的访问连接。

详情请参考创建自定义委托

步骤7:作业开发

完成以上步骤后,AI DataLake与LakeFormation之间的元数据链路和权限链路已全部打通。当端点创建成功并变为"运行中"状态时,您即可基于已配置的元数据和权限进行作业开发。

详情请参考在DataArts Studio创建并开发作业

相关文档