
# 创建LakeFormation元数据
LakeFormation是企业级一站式湖仓构建服务，提供元数据统一管理能力。AI DataLake通过对接LakeFormation实现元数据管理和数据访问控制，因此在提交AI DataLake作业前，需要先完成LakeFormation的实例创建、元数据构建和权限配置，并在AI DataLake侧绑定实例和创建端点，打通两者之间的数据链路。本节操作介绍配置AI DataLake与LakeFormation数据连接的完整流程。
#### 使用流程
图1LakeFormation使用流程   
![](https://support.huaweicloud.com/usermanual-aidatalake/zh-cn_image_0000002658291076.png "点击放大")
1. 创建LakeFormation实例，搭建元数据管理与服务载体。
2. 创建LakeFormation元数据，包括创建OBS并行文件系统和元数据对象（Catalog/数据库/表），为AI DataLake提供数据存储和数据资产目录。
3. 已有外部元数据时，迁移元数据到LakeFormation。
4. 配置LakeFormation数据访问权限，授权AI DataLake服务或用户访问元数据资源。
5. 创建AI DataLake工作空间，绑定LakeFormation实例，建立业务隔离环境。
6. 创建端点并选择委托，建立AI DataLake与LakeFormation之间的访问连接。
7. 基于已配置的元数据和权限进行作业开发。
 
#### 步骤1：创建LakeFormation实例
LakeFormation实例是元数据管理与服务的基础载体，AI DataLake后续需要绑定该实例才能访问元数据。创建LakeFormation实例操作步骤如下。
1. 登录LakeFormation管理控制台。
2. 单击页面右上角"立即购买"或"购买实例"，进入实例购买页面。 首次创建实例时界面显示"立即购买"，如果界面已有LakeFormation实例则显示为"购买实例"。
   
3. 按需配置LakeFormation实例参数，完成实例创建。
 
详情请参考[创建LakeFormation实例](https://support.huaweicloud.com/usermanual-lakeformation/lakeformation_03_00007.html)。
![](https://support.huaweicloud.com/usermanual-aidatalake/public_sys-resources/note_3.0-zh-cn.png)
LakeFormation提供实例的配置、扩容、删除等基本功能，帮助您便捷地进行实例管理，加速实现数据湖承载的业务的规划和部署。详情请参考[管理LakeFormation实例](https://support.huaweicloud.com/usermanual-lakeformation/lakeformation_03_00006.html)。
#### 步骤2：创建LakeFormation元数据
![](https://support.huaweicloud.com/usermanual-aidatalake/public_sys-resources/caution_3.0-zh-cn.png)
- 由于Spark集群启动时默认会校验default数据库，请先在LakeFormation页面的当前Catalog下创建名为"default"的数据库并指定合法OBS路径，否则可能导致Spark启动失败。
- Spark引擎不支持读取大写名称的Catalog、数据库、表、列和函数。
 
1. LakeFormation元数据映射的数据文件和目录存储在OBS中。在创建LakeFormation元数据之前，需要提前创建数据存储使用的OBS并行文件系统。 
   具体操作，请参见[创建并行文件系统](https://support.huaweicloud.com/usermanual-obs/obs_13_0002.html)。
   
   
2. OBS存储准备完成后，通过创建元数据对象（包括Catalog、数据库、数据表等），提供统一的元数据管理能力，帮助用户构建结构化数据资产目录，提升数据治理效率。 
   详情请参考[创建LakeFormation元数据](https://support.huaweicloud.com/usermanual-lakeformation/lakeformation_03_00042.html)。
   
   
 
#### 步骤3：迁移元数据至LakeFormation
如果您已有外部元数据，可以将其迁移至LakeFormation，并将数据存储在OBS中，实现元数据的统一管理、数据的集中存储和全生命周期管理。迁移完成后，AI DataLake即可通过绑定的LakeFormation实例访问这些元数据。
详情请参考[迁移元数据至LakeFormation](https://support.huaweicloud.com/usermanual-lakeformation/lakeformation_03_00032.html)
#### 步骤4：配置LakeFormation数据访问权限
LakeFormation作为元数据与权限统一管理服务，负责对数据目录、数据库和表进行细粒度权限隔离。创建元数据后，需要为用户或委托配置数据访问权限，确保AI DataLake作业能够正常访问所需的元数据和数据资源。
对接LakeFormation场景的权限管理分为两个层面：
1. **LakeFormation的IAM云服务授权/委托** ：授权IAM用户或用户组使用LakeFormation服务的权限，或通过委托授权AI DataLake云服务代替您访问LakeFormation。IAM授权的具体操作请参考[创建用户并授权使用LakeFormation](https://support.huaweicloud.com/usermanual-lakeformation/lakeformation_03_00004.html)。
2. **LakeFormation的资源授权** ：在LakeFormation管理控制台对特定资源（Catalog、数据库、表、列和函数等）进行授权，控制用户或委托可以访问哪些具体元数据。例如，用户A可能只能访问table_1，用户B可能只能访问table_2。详情请参考[配置LakeFormation元数据权限](https://support.huaweicloud.com/usermanual-lakeformation/lakeformation_03_00014.html)。
 
#### 步骤5：AI DataLake工作空间绑定LakeFormation实例
工作空间是AI DataLake提供的独立数据分析工作环境，用于隔离不同业务、部门或项目的资源与权限。创建工作空间时需绑定已创建的LakeFormation实例，绑定后AI DataLake可查看该实例中的元数据，为后续作业开发提供数据基础。
绑定LakeFormation实例规则：
- 一个工作空间只能绑定一个LakeFormation实例。
- 不同工作空间可以绑定同一个LakeFormation实例。
- 工作空间创建后，不支持切换绑定的LakeFormation实例。
详情请参考[创建工作空间](https://support.huaweicloud.com/usermanual-aidatalake/aidatalake_01_0001.html)。
#### 步骤6：创建端点并选择委托
端点是AI DataLake引擎的入口，通过端点可以提交数据处理和分析作业。完成LakeFormation权限配置后，在创建端点时需选择对应的委托，授权AI DataLake服务以您的身份访问LakeFormation云服务资源，从而建立AI DataLake与LakeFormation之间的访问连接。
详情请参考[创建自定义委托](https://support.huaweicloud.com/usermanual-aidatalake/aidatalake_01_0078.html)。
#### 步骤7：作业开发
完成以上步骤后，AI DataLake与LakeFormation之间的元数据链路和权限链路已全部打通。当端点创建成功并变为"运行中"状态时，您即可基于已配置的元数据和权限进行作业开发。
详情请参考[在DataArts Studio创建并开发作业](https://support.huaweicloud.com/usermanual-aidatalake/aidatalake_01_0051.html#aidatalake_01_0051__section359917548184)。
