配置Hudi目的端参数
由于MRS Spark JDBC Server不支持拦截已提交的SQL,当Hudi连接采用JDBC模式时,作业停止后已提交的SQL可能无法被取消。
| 类别 | 配置项 | 配置说明 | 推荐配置 |
|---|---|---|---|
| 基本参数 | 数据库名称 | 输入或选择写入数据的数据库名称。单击输入框后面的按钮可进入数据库选择界面。 | dbadmin |
| 表名 | 单击输入框后面的按钮可进入表的选择界面。 该参数支持配置为时间宏变量,且一个路径名中可以有多个宏定义变量。使用时间宏变量和定时任务配合,可以实现定期同步新增数据,详细说明请参见使用时间宏变量完成增量同步。 说明: 如果配置了时间宏变量,通过DataArts Studio数据开发调度CDM迁移作业时,系统会将时间宏变量替换为“数据开发作业计划启动时间-偏移量”,而不是“CDM作业实际启动时间-偏移量”。 | cdm | |
| 自动建表模式 | 是否自动创建Hudi表。
| 不存在时创建 | |
| 写入模式 | 数据写入模式。
| LOAD | |
| 分区 | 写入模式为TRUNCATE+LOAD或INSERT_OVERWRITE时显示该参数。 分区信息,表为分区表的时候,写数据的时候,可以选择需要写入的分区数据。 | year=2020,location=sun | |
| 运行队列 | 指定请求参数--queue的值,决定spark任务提交到哪个队列运行。 | default | |
| 高级属性 | sql执行参数 | 写hudi时,支持spark参数配置,此处填入的参数将会在请求体中以"--conf"参数形式添加,同时也支持Spark Driver、Executor相关配置参数。 | --driver-memory=2G,--executor-memory=2G,--driver-cores=1,--executor-cores=1,--num-executors=2 |
| 入库时间字段 | 将一个字段标记为入库时间字段,自动建表时将此字段自动加到建表语句中,写入Hudi时将把此字段的值替换为当前时间。所选字段必须为timestamp类型。 | - | |
| 写入参数 | 在执行Spark SQL往hudi插入数据前,通过set语法设置参数,从而控制spark的写入行为。 | hoodie.combine.before.upsert | |
| Compaction模式 | 配置Compaction的执行方式,此参数仅对MOR表生效。
| 异步Compaction |