计算
弹性云服务器 ECS
Flexus云服务
裸金属服务器 BMS
弹性伸缩 AS
镜像服务 IMS
专属主机 DeH
函数工作流 FunctionGraph
云手机服务器 CPH
Huawei Cloud EulerOS
网络
虚拟私有云 VPC
弹性公网IP EIP
虚拟专用网络 VPN
弹性负载均衡 ELB
NAT网关 NAT
云专线 DC
VPC终端节点 VPCEP
云连接 CC
企业路由器 ER
企业交换机 ESW
全球加速 GA
安全与合规
安全技术与应用
Web应用防火墙 WAF
企业主机安全 HSS
云防火墙 CFW
安全云脑 SecMaster
DDoS防护 AAD
数据加密服务 DEW
数据库安全服务 DBSS
云堡垒机 CBH
数据安全中心 DSC
云证书管理服务 CCM
边缘安全 EdgeSec
态势感知 SA
威胁检测服务 MTD
CDN与智能边缘
内容分发网络 CDN
CloudPond云服务
智能边缘云 IEC
迁移
主机迁移服务 SMS
对象存储迁移服务 OMS
云数据迁移 CDM
迁移中心 MGC
大数据
MapReduce服务 MRS
数据湖探索 DLI
表格存储服务 CloudTable
云搜索服务 CSS
数据接入服务 DIS
数据仓库服务 GaussDB(DWS)
数据治理中心 DataArts Studio
数据可视化 DLV
数据湖工厂 DLF
湖仓构建 LakeFormation
企业应用
云桌面 Workspace
应用与数据集成平台 ROMA Connect
云解析服务 DNS
专属云
专属计算集群 DCC
IoT物联网
IoT物联网
设备接入 IoTDA
智能边缘平台 IEF
用户服务
账号中心
费用中心
成本中心
资源中心
企业管理
工单管理
国际站常见问题
ICP备案
我的凭证
支持计划
客户运营能力
合作伙伴支持计划
专业服务
区块链
区块链服务 BCS
Web3节点引擎服务 NES
解决方案
SAP
高性能计算 HPC
视频
视频直播 Live
视频点播 VOD
媒体处理 MPC
实时音视频 SparkRTC
数字内容生产线 MetaStudio
存储
对象存储服务 OBS
云硬盘 EVS
云备份 CBR
存储容灾服务 SDRS
高性能弹性文件服务 SFS Turbo
弹性文件服务 SFS
云硬盘备份 VBS
云服务器备份 CSBS
数据快递服务 DES
专属分布式存储服务 DSS
容器
云容器引擎 CCE
容器镜像服务 SWR
应用服务网格 ASM
华为云UCS
云容器实例 CCI
管理与监管
云监控服务 CES
统一身份认证服务 IAM
资源编排服务 RFS
云审计服务 CTS
标签管理服务 TMS
云日志服务 LTS
配置审计 Config
资源访问管理 RAM
消息通知服务 SMN
应用运维管理 AOM
应用性能管理 APM
组织 Organizations
优化顾问 OA
IAM 身份中心
云运维中心 COC
资源治理中心 RGC
应用身份管理服务 OneAccess
数据库
云数据库 RDS
文档数据库服务 DDS
数据管理服务 DAS
数据复制服务 DRS
云数据库 GeminiDB
云数据库 GaussDB
分布式数据库中间件 DDM
数据库和应用迁移 UGO
云数据库 TaurusDB
人工智能
人脸识别服务 FRS
图引擎服务 GES
图像识别 Image
内容审核 Moderation
文字识别 OCR
AI开发平台ModelArts
图像搜索 ImageSearch
对话机器人服务 CBS
华为HiLens
视频智能分析服务 VIAS
语音交互服务 SIS
应用中间件
分布式缓存服务 DCS
API网关 APIG
微服务引擎 CSE
分布式消息服务Kafka版
分布式消息服务RabbitMQ版
分布式消息服务RocketMQ版
多活高可用服务 MAS
事件网格 EG
企业协同
华为云会议 Meeting
云通信
消息&短信 MSGSMS
云生态
合作伙伴中心
云商店
开发者工具
SDK开发指南
API签名指南
Terraform
华为云命令行工具服务 KooCLI
其他
产品价格详情
系统权限
管理控制台
客户关联华为云合作伙伴须知
消息中心
公共问题
开发与运维
应用管理与运维平台 ServiceStage
软件开发生产线 CodeArts
需求管理 CodeArts Req
部署 CodeArts Deploy
性能测试 CodeArts PerfTest
编译构建 CodeArts Build
流水线 CodeArts Pipeline
制品仓库 CodeArts Artifact
测试计划 CodeArts TestPlan
代码检查 CodeArts Check
代码托管 CodeArts Repo
云应用引擎 CAE
开天aPaaS
云消息服务 KooMessage
云手机服务 KooPhone
云空间服务 KooDrive
本文导读

展开导读

步骤2:数据集成

更新时间:2024-12-11 GMT+08:00

OBS数据迁移到DWS

  1. 登录CDM管理控制台。单击左侧导航上的“集群管理”,进入集群管理界面。

    或参考访问DataArts Studio实例控制台登录DataArts Studio管理控制台。在DataArts Studio控制台首页,选择对应工作空间的“数据集成”模块,进入CDM首页。

    图1 集群列表
    说明:

    “创建来源”列仅通过DataArts Studio服务进入数据集成界面可以看到。

  2. 进入DataArts Studio数据集成主页面,单击操作列的“作业管理”。

    图2 作业管理

  3. 在作业管理界面,选择“连接管理 - 新建连接”,进入创建连接页面。
  4. 在创建连接页面,选择“对象存储服务(OBS)”,新建CDM到OBS的连接,数据连接名称为“obs_link”

    表1 OBS连接的参数

    参数名

    说明

    取值样例

    名称

    连接的名称,根据连接的数据源类型,用户可自定义便于记忆、区分的连接名。

    obs_link

    OBS终端节点

    终端节点(Endpoint)即调用API的请求地址,不同服务不同区域的终端节点不同。您可以通过以下方式获取OBS桶的Endpoint信息:

    OBS桶的Endpoint,可以进入OBS控制台概览页,单击桶名称后查看桶的基本信息获取。

    说明:
    • CDM集群和OBS桶不在同一个Region时,不支持跨Region访问OBS桶。
    • 作业运行中禁止修改密码或者更换用户。在作业运行过程中修改密码或者更换用户,密码不会立即生效且作业会运行失败。

    obs.myregion.mycloud.com

    端口

    数据传输协议端口,https是443,http是80。

    443

    OBS桶类型

    用户下拉选择即可,一般选择为“对象存储”。

    对象存储

    访问标识(AK)

    AK和SK分别为登录OBS服务器的访问标识与密钥。

    您需要先创建当前账号的访问密钥,并获得对应的AK和SK。

    您可以通过如下方式获取访问密钥。
    1. 登录控制台,在用户名下拉列表中选择“我的凭证”。
    2. 进入“我的证”页面,选择访问密钥 > 新增访问密钥,如图3所示。
      图3 单击新增访问密钥
    3. 单击“确定”,根据浏览器提示,保存密钥文件。密钥文件会直接保存到浏览器默认的下载文件夹中。打开名称为“credentials.csv”的文件,即可查看访问密钥(Access Key Id和Secret Access Key)。
      说明:
      • 每个用户仅允许新增两个访问密钥。
      • 为保证访问密钥的安全,访问密钥仅在初次生成时自动下载,后续不可再次通过管理控制台界面获取。请在生成后妥善保管。

    -

    密钥(SK)

    -

    连接属性

    可选参数,单击“显示高级属性”后显示。

    自定义连接属性,单击“添加”可增加多个属性。

    只支持配置connectionTimeout,socketTimeout和idleConnectionTime。

    常见配置举例如下:

    • socketTimeout: Socket层传输数据的超时时间,单位为毫秒。
    • connectionTimeout: 建立HTTP/HTTPS连接的超时时间,单位为毫秒。

    -

    图4 创建OBS连接

  5. 在创建连接页面,选择“数据仓库服务(DWS)”,新建CDM到DWS的连接,数据连接名称为“dws_link”

    表2 DWS连接参数

    参数名

    说明

    取值样例

    名称

    连接的名称,根据连接的数据源类型,用户可自定义便于记忆、区分的连接名。

    dws_link

    数据库服务器

    单击输入框后的“选择”,可获取用户的DWS实例列表。

    -

    端口

    配置为要连接的数据库的端口。DWS数据库端口默认为8000。

    8000

    数据库名称

    配置为要连接的数据库名称。

    demo

    用户名

    待连接数据库的用户。该数据库用户需要有数据表的读写权限,以及对元数据的读取权限。

    dbadmin

    密码

    用户密码。

    -

    使用Agent

    是否选择通过Agent从源端提取数据。

    图5 创建DWS连接

  6. CDM到OBS和DWS的连接创建成功后,单击“表/文件迁移”,再单击“新建作业”

    图6 新建作业

  7. 按照如下步骤完成作业参数的配置。

    1. 图7所示,配置作业名为movies_obs2dws,配置源端作业参数,然后配置目的端作业参数。
      说明:

      在本示例中,目的端作业参数“导入开始前”配置为“清除全部数据”,表示每次作业运行都会先清空数据再导入。在实际业务中,请视情况而定,需谨慎设置,以免造成数据丢失。

      图7 作业配置
    2. 在源端、目的作业配置区域,单击“显示高级属性”,在“高级属性”中,系统提供了默认值,请根据实际业务数据的格式设置各项参数。
      例如,本例中根据数据源准备中的样例数据格式,源端高级属性需注意以下参数的设置,其他参数均保留默认值即可,如图8所示。目的端高级属性无需配置。
      • 字段分隔符:默认值为逗号,本示例需要保留默认值。
      • 使用包围符:由于IMDbURL有的原始数据中包含“,”,需要修改默认值为“是”
      • 前N行为标题行:默认值为“否”,本示例首行是标题行,修改默认值为“是”标题行数配置为1。
      图8 源端高级属性

    3. 单击“下一步”后,请参考以下说明配置字段映射,如图9所示,配置完成后,单击“下一步”

      字段映射:在本示例中,由于数据迁移的目标表字段顺序和原始数据的字段顺序是一样的,因此这里不需要调整字段映射的顺序。

      如果目标表字段顺序和原始数据不一致,请一一将源字段指向含义相同的目的字段。请将鼠标移至某一个字段的箭头起点,当光标显示为“+”的形状时,按住鼠标,将箭头指向相同含义的目的字段,然后松开鼠标。

      图9 字段映射
    4. 根据需要配置任务的重试和定时执行、高级属性等。在本示例中仅需将“是否写入脏数据”设置为“是”,其他配置项保持默认即可。
      图10 任务配置

      单击“显示高级属性”,可配置“抽取并发数”以及“是否写入脏数据”,如图10所示。

      • 抽取并发数:设置同时执行的抽取任务数。并发抽取数取值范围为1-1000,若配置过大,则以队列的形式进行排队。
        CDM迁移作业的抽取并发量,与集群规格和表大小有关。
        • 按集群规格建议每1CUs(1CUs=1核4G)配置为4。
        • 表每行数据大小为1MB以下的可以多并发抽取,超过1MB的建议单线程抽取数据。
      • 是否写入脏数据:建议配置为“是”,然后参考图10配置相关参数。脏数据是指与目的端字段不匹的数据,该数据可以被记录到指定的OBS桶中。用户配置脏数据归档后,正常数据可以写入目的端,迁移作业不会因脏数据中断。

        在本示例中,“OBS桶”配置为在数据源准备中创建的桶“fast-demo”,您需要前往OBS控制台,在桶中创建一个目录,例如err_data,然后再将“脏数据目录”配置为该目录。

  8. 单击“保存并运行”完成作业的创建。

    返回“表/文件迁移”页面后,可在作业列表中查看到新建的作业。

    图11 迁移作业运行结果

  9. 参考步骤6~步骤8,再新建名为ratings_obs2dws的迁移作业,将ratings.csv数据迁移到DWS的ratings_item表中。待作业运行成功后,数据迁移结束。

    图12 数据迁移结果

  10. 数据迁移结束后,您也可以跳转到数据开发页面,新建一个DWS SQL脚本,并分别执行以下SQL语句检查DWS中的movies_item和ratings_item表数据是否符合预期。

    • 查看movies_item表数据:
      SET SEARCH_PATH TO dgc;
      SELECT * FROM movies_item;
    • 查看ratings_item表数据:
      SET SEARCH_PATH TO dgc;
      SELECT * FROM ratings_item;
    图13 查看DWS表数据

我们使用cookie来确保您的高速浏览体验。继续浏览本站,即表示您同意我们使用cookie。 详情

文档反馈

文档反馈

意见反馈

0/500

标记内容

同时提交标记内容