MRS Iceberg数据源
本数据集成服务全面支持华为云大数据MRS Iceberg产品,支持MRS Iceberg主流版本,可满足不同用户在多种部署环境下的数据同步需求。
使用前准备及限制
- 网络要求
MRS Iceberg数据源必须与CDM网络进行通讯,以确保数据传输的顺畅性。详情请参见网络打通。
- 权限要求
- Iceberg读写权限
- 读权限:如果需要从Iceberg读取数据,需要为数据集成服务的IAM用户或用户组授予Iceberg的只读权限,如MRS ReadOnlyAccess系统策略,或者根据具体需求创建自定义策略,授予如SELECT等读取相关操作的权限。
- 写权限:如果需要向Iceberg写入数据,除了上述OBS权限外,还需要为数据集成服务的IAM用户或用户组授予Iceberg的写入权限,如MRS CommonOperations或MRS FullAccess系统策略,或者创建自定义策略,授予如INSERT INTO TABLE、CREATE TABLE等写入相关操作的权限。
- OBS权限(存算分析场景):当MRS Iceberg开启存算分析,数据集成服务将与OBS进行读写文件交互,需要拥有OBS文件的读写权限。
- 访问端口放通:在配置MRS Iceberg数据源时,需要确保以下端口在安全组或自有网络已经放通,以供数据集成服务访问MRS使用。
表1 各服务端口说明 服务
端口类型
端口号
用途
Spark
TCP
22550
Spark JDBC Thrift端口,用于Spark客户端与Spark服务器之间的通信。
MRS
Manager
TCP
28443
下载MRS集群配置。
20009
CAS认证端口。
20029
Manager与其他组件之间的通信和管理操作。
KDC
TCP&&UDP
21730
Kerberos认证使用。
21731
Kerberos认证使用。
HDFS
TCP
8020
HDFS NameNode服务端口。
Hive
TCP
10000
HiveServer服务端口,用于客户端与HiveServer之间的通信。
9083
Hive Metastore服务端口,用于存储和管理Hive的元数据信息。
Zookeeper
TCP
2181
Zookeeper服务端口,用于客户端与Zookeeper集群之间的通信。
JobGateway
TCP
29974
JobBalancer服务端口,用于客户端与JobBalancer之间的通信。
- Iceberg读写权限
支持的数据类型
数据集成读取MRS Iceberg依赖Spark读取能力支持以下字段:
| 类别 | 字段类型 | MRS Iceberg 读取 | MRS Iceberg写入 |
|---|---|---|---|
| 字符串类 | STRING | √ | √ |
| 整数类 | INTEGER | √ | √ |
| LONG | √ | √ | |
| 浮点类 | FLOAT | √ | √ |
| DOUBLE | √ | √ | |
| DECIMAL | √ | √ | |
| 日期时间类 | DATE | √ | √ |
| TIMESTAMP | √ | √ | |
| TIMESTAMP_NTZ | √ | √ | |
| 布尔型 | BOOLEAN | √ | √ |
| 二进制 | BINARY | √ | √ |
| 复杂类型 | ARRAY | √ | x |
| MAP | √ | x | |
| STRUCT | x | x |
支持的迁移场景
数据集成离线同步支持以下三种同步方式,以满足不同数据迁移场景的需求:
需要注意的是,分库分表与整库迁移能力会根据不同region的上线支持情况有所不同,具体支持情况以页面为准。以下是针对MRS Iceberg的支持迁移场景概览:
| 支持迁移场景 | 单表读取 | 单表写入 | 分库分表读取 | 分库分表写入 | 整库读取 | 整库写入 |
|---|---|---|---|---|---|---|
| 是否支持 | √ | √ | x | √ | x | x |
创建数据集成离线作业
在DataArts Studio数据开发中新建MRS Iceberg集成作业,详情请参见新建离线处理集成作业。