文档首页> 数据复制服务 DRS> 实时同步> 入云> 将MySQL同步到GaussDB(DWS)
更新时间:2022-05-20 GMT+08:00
分享

将MySQL同步到GaussDB(DWS)

支持的源和目标数据库

表1 支持的数据库

源数据库

目标数据库

  • 本地自建MySQL数据库
  • ECS自建MySQL数据库
  • 其他云上MySQL数据库
  • RDS for MySQL
  • GaussDB(DWS)集群

前提条件

  • 已登录数据复制服务控制台。
  • 账户余额大于等于0元。
  • 满足实时同步支持的数据库类型和版本,详情请参见支持的数据库
  • 当用户创建DRS任务使用的是子帐号时,请先确认已添加过委托。创建委托方法,可参考委托管理

使用建议

  • DRS任务启动和全量数据同步阶段,请不要在源数据库执行DDL操作,否则可能导致任务异常。
  • 为保证同步前后数据一致性,确保同步期间目标数据库无业务写入。
  • 数据库同步与环境多样性和人为操作均有密切关系,为了确保同步的平顺,建议您在进行正式的数据库同步之前进行一次演练,可以帮助您提前发现问题并解决问题。
  • 基于以下原因,建议您在启动任务时选择“稍后启动”功能,将启动时间设置在业务低峰期,相对静止的数据可以有效提升一次性同步成功率,避免同步对业务造成性能影响。
    • 在网络无瓶颈的情况下,全量同步会对源数据库增加约50MB/s的查询压力,以及占用2~4个CPU。
    • 同步无主键表时,为了确保数据一致性,会存在3s以内的单表级锁定。
    • 正在同步的数据被其他事务长时间锁死,可能导致读数据超时。
    • 由于MySQL固有特点限制,CPU资源紧张时,存储引擎为Tokudb的表,读取速度可能下降至10%。
    • DRS并发读取数据库,会占用大约6-10个session连接数,需要考虑该连接数对业务的影响。
    • 全量阶段读取表数据时,特别是大表的读取,可能会阻塞业务上对大表的独占锁操作。
    • 更多DRS对数据库的影响,可参考DRS对源数据库和目标数据库有什么影响
  • 数据对比

    建议您结合数据对比的“稍后启动”功能,选择业务低峰期进行数据对比,以便得到更为具有参考性的对比结果。由于同步具有轻微的时差,在数据持续操作过程中进行对比任务,可能会出现少量数据不一致对比结果,从而失去参考意义。

使用须知

在创建同步任务前,请务必阅读以下使用须知。

表2 使用须知

类型名称

使用和操作限制

数据库权限设置

  • 源数据库账号需要具备如下权限:SELECT、SHOW VIEW、EVENT、LOCK TABLES、REPLICATION SLAVE、REPLICATION CLIENT。
  • 目标数据库账号必须具有每张表的如下权限:INSERT、SELECT、UPDATE、DELETE、CONNECT、CREATE、REFERENCES。

同步对象约束

  • 支持表、索引、约束(主键、空、非空)的同步,不支持视图、外键、存储过程、触发器、函数、事件、虚拟列、唯一约束、唯一索引的同步。
  • 全量同步支持comment,增量不支持。
  • 不支持的数据类型有:xml、json、geometry、point、lineString、polygon、geometrycollection、multipoint、multilinestring、multipolygon。
  • 不支持非MyISAM和非InnoDB表的同步。

源数据库要求

  • MySQL源数据库的binlog日志必须打开,且binlog日志格式必须为Row格式。
  • 在磁盘空间允许的情况下,建议源数据库binlog保存时间越长越好,建议为3天。
  • 源数据库expire_logs_days参数值为0,可能会导致同步失败。
  • 必须设置MySQL源数据库的server-id,server-id的取值范围在2-4294967296之间。
  • 源数据库中的库名、表名不能包含:.<'>`/\"以及非ASCII字符。

目标数据库要求

  • 目标数据库实例的运行状态必须正常。
  • 目标数据库实例必须有足够的磁盘空间。
  • 目标数据库的时区设置必须与源数据库一致。

操作须知

  • 若专属计算集群不支持4vCPU/8G或以上规格实例,则无法创建同步任务。
  • 相互关联的数据对象要确保同时同步,避免因关联对象缺失,导致同步失败。常见的关联关系:索引引用表等。
  • 不支持外键级联操作。
  • 不支持源数据库进行恢复操作。
  • 不支持强制清理binlog,否则会导致同步任务失败。
  • 不建议在数据库中使用非精确数值类型做主键,该特性影响 DRS 增量场景下对 UPDATE、DELETE语句的同步,导致任务失败。
  • 如果无主键表中包含大字段(blob、text、clob、nclob、bytea),增量同步阶段存在大字段数据不一致的可能性。
  • 源库为RDS for MySQL实例时,不支持带有TDE特性并建立具有加密功能表。
  • 源库为RDS for MySQL实例时,支持源端多张表对GaussDB(DWS)一张表的映射。详细操作可参考创建MySQL到GaussDB(DWS)同步任务
  • 如果源库MySQL不支持TLS1.2协议,或者为版本较低的自建库(低于5.6.46或在5.7-5.7.28之间),如果不支持TLS1.2协议,需提交运维申请才能使用SSL测试连接。
  • 网络中断在30秒内恢复的,不影响实时同步,如果超过30秒,则会导致同步任务失败。
  • 索引同步不区分索引类型,同步到目标数据库都是默认的索引类型。
  • 目标数据库与源数据库字符集不一致可能会导致同步后数据不一致或者同步失败。
  • 数据类型不兼容时,可能引起同步失败。
  • 支持目标数据库中的表比源数据库多列场景,但是需要避免以下场景可能导致的任务失败。
    • 目标端多的列要求非空且没有默认值,源端insert数据,同步到目标端后多的列为null,不符合目标端要求。
    • 目标端多的列设置固定默认值,且有唯一约束。源端insert多条数据后,同步到目标端后多的列为固定默认值,不符合目标端要求。
  • 实时同步过程中,若源库为RDS时,支持修改端口,修改之后同步任务失败,需要通过重试后继续进行同步。
  • 实时同步过程中,若源库为非RDS时,不支持修改端口。
  • 实时同步过程中,不支持IP、账号、密码修改。
  • 增量同步过程中,支持部分DDL操作。DRS不再对增量的DDL做转换,MySQL的DDL将原样在GaussDB(DWS)里执行,可参考GaussDB(DWS)里可直接执行的MySQL语法的DDL
    • 不支持 DROP_DATABASE、DROP_TABLE、TRUNCATE_TABLE、CREATE_VIEW、DROP_VIEW。
    • 支持创建表,例如 :
      create table `ddl_test` (id int, c1 varchar(25), primary key(id));
      create table `ddl_test_gho` like `ddl_test`;
    • 支持表的重命名,源表和目标表必须都在对象选择里面,例如:
      rename table `ddl_test` to `ddl_test_new`;
    • 支持表字段的增和改,不支持删列,例如:
      alter table `ddl_test` add column `c2` varchar(25); 
      alter table `ddl_test` modify column `c1` varchar(50);
      alter table `ddl_test` alter c1 set default 'xxx';
    • 支持修改表索引,例如:
      alter table `ddl_test` drop primary key; 
      alter table `ddl_test` add primary key(id); 
      alter table `ddl_test` add index  `ddl_test_uk`(id);
      alter table `ddl_test` drop index `ddl_test_uk`;
      说明:

      alter table `ddl_test` add primary key(id)仅支持首列为主键列的同步。

    • 表级同步支持增加列、修改列、增加主键和普通索引。多对一情况下执行colunm重命名操作,必须停业务操作,不然会有数据不一致的风险,例如:
      alter table `ddl_test` modify column `c1` varchar(50);
    • 库级同步支持新建表、rename表、增加列、修改列、增加主键和普通索引。
    • 新增和修改表名、列名、索引名时不能超出63字符,否则任务会失败。
    • 源库无主键表增加主键的时候,必须含有第一列,否则任务会失败。
  • 增量同步过程中,库级同步不支持Online DDL,表级同步目前只支持阿里云DMS产生的Online DDL。
  • 建议将expire_log_day参数设置在合理的范围,确保恢复时断点处的binlog尚未过期,以保证服务中断后的顺利恢复。
  • 源端同步的表如果有AUTO_INCREMENT属性,结束任务时,DRS会自动刷新同步表的序列整型列所对应的GaussDB(DWS)自增列(sequence)起始值,刷新值为该列的最大值+10000。

操作步骤

本小节以RDS for MySQL到GaussDB(DWS)多对一场景的实时同步为示例,介绍如何使用数据复制服务配置实时同步任务。

  1. 在“实时同步管理”页面,单击“创建同步任务”。
  2. 在“同步实例”页面,填选区域、任务名称、描述、同步实例信息,单击“下一步”。

    图1 同步任务信息
    表3 任务和描述

    参数

    描述

    区域

    当前所在区域,可进行切换。

    任务名称

    任务名称在4-50位之间,必须以字母开头,不区分大小写,可以包含字母、数字、中划线或下划线,不能包含其他的特殊字符。

    描述

    描述不能超过256位,且不能包含! = < > & ' " \ 特殊字符。

    图2 同步实例信息
    表4 同步实例信息

    参数

    描述

    数据流动方向

    选择“入云”

    源数据库引擎

    选择“MySQL”

    目标数据库引擎

    选择“GaussDB(DWS)”

    网络类型

    此处以“VPC网络”为示例。目前支持可选“公网网络”“VPC网络”“VPN、专线网络”

    目标数据库实例

    可用的GaussDB(DWS)实例。

    同步实例所在子网

    请选择同步实例所在的子网。也可以单击“查看子网”,跳转至“网络控制台”查看实例所在子网帮助选择。

    默认值为当前所选数据库实例所在子网,请选择有可用IP地址的子网。为确保同步实例创建成功,仅显示已经开启DHCP的子网。

    同步模式

    可选“全量+增量”、“全量”和“增量”三种模式,此处以“全量+增量”为示例。

    • 全量+增量

      该模式为数据持续性实时同步,通过全量过程完成目标端数据库的初始化后,增量同步阶段通过解析日志等技术,将源端和目标端数据保持数据持续一致。

      说明:

      选择“全量+增量”同步模式,增量同步可以在全量同步完成的基础上实现数据的持续同步,无需中断业务,实现同步过程中源业务和数据库继续对外提供访问。

    • 全量

      该模式为数据库一次性同步,适用于可中断业务的数据库同步场景,全量同步将用户选择的数据库对象和数据一次性同步至目标端数据库。

    • 增量

      该模式通过解析日志等技术,将源端产生的增量数据持续同步至目标端数据库。

    企业项目

    对于已成功关联企业项目的用户,仅需在“企业项目”下拉框中选择目标项目。

    如果需要自定义企业项目,请前往项目管理服务进行创建。关于如何创建项目,详见《项目管理用户指南》。

    标签

    • 可选配置,对同步任务的标识。使用标签可方便管理您的任务。每个任务最多支持10个标签配额。
    • 任务创建成功后,您可以单击任务名称,在“标签”页签下查看对应标签。关于标签的详细操作,请参见标签管理

  3. 在“源库及目标库”页面,同步实例创建成功后,填选源库信息和目标库信息,单击“源库和目标库”处的“测试连接”,分别测试并确定与源库和目标库连通后,勾选协议,单击“下一步”

    图3 源库信息
    表5 源库信息

    参数

    描述

    源库类型

    源数据库类型,可选“ECS自建库”和“RDS实例”,此处以“RDS实例”为示例。

    数据库实例名称

    选择待同步的RDS实例。

    数据库用户名

    源数据库的用户名。

    数据库密码

    源数据库的用户名所对应的密码。

    源数据库的数据库用户名和密码,会被系统加密暂存,直至删除该任务后自动清除。

    图4 目标库信息
    表6 目标库信息

    参数

    描述

    数据库实例名称

    默认为创建同步任务时选择的GaussDB(DWS)实例,不可进行修改。

    数据库用户名

    目标数据库对应的数据库用户名。

    数据库密码

    数据库用户名和密码将被系统加密暂存,直至该任务删除后清除。

  4. “设置同步”页面,选择同步对象类型和同步对象。单击“下一步”

    图5 同步模式
    表7 同步模式和对象

    参数

    描述

    流速模式

    流速模式支持限速和不限速,默认为不限速。

    • 限速

      自定义的最大同步速度,全量同步过程中的同步速度将不会超过该速度。

      当流速模式选择了“限速”时,你需要通过流速设置来定时控制同步速度。流速设置通常包括限速时间段和流速大小的设置。默认的限速时间段为全天限流,您也可以根据业务需求自定义时段限流。自定义的时段限流支持最多设置3个定时任务,每个定时任务之间不能存在交叉的时间段,未设定在限速时间段的时间默认为不限速。

      流速的大小需要根据业务场景来设置,不能超过9999MB/s。

      图6 设置流速模式
    • 不限速
      对同步速度不进行限制,通常会最大化使用源数据库的出口带宽。该流速模式同时会对源数据库造成读消耗,消耗取决于源数据库的出口带宽。比如源数据库的出口带宽为100MB/s,假设高速模式使用了80%带宽,则同步对源数据库将造成80MB/s的读操作IO消耗。
      说明:
      • 限速模式只对全量阶段生效,增量阶段不生效。
      • 您也可以在创建任务后修改流速模式。具体方法请参见修改流速模式

    同步对象类型

    可选同步表结构、同步数据、同步索引,根据实际需求进行选择要同步内容。

    • 同步数据为必选项。
    • 选择同步表结构的时候目标库不能有同名的表。
    • 不选同步表结构的时候目标库必须有相应的表,且要保证表结构与所选表结构相同。

    增量阶段冲突策略

    该冲突策略特指增量同步中的冲突处理策略,全量阶段的冲突默认忽略。

    启动位点

    步骤2的同步模式选择“增量”时可见,增量同步的启动位点,任务的源库日志从位点后开始获取(不含当前启动位点)。

    通过show master status命令获取源库位点,根据提示分别填写File、Position、Executed_Gtid_Set(如果未开gtid_mode,无需填写Executed_Gtid_Set)。

    数据同步拓扑

    数据同步功能支持多种同步拓扑,您可以根据业务需求规划您的同步实例。数据同步拓扑说明可参考数据同步拓扑介绍

    说明:

    “数据同步拓扑”选择目前仅支持白名单用户,需要提交工单申请才能使用。您可以在管理控制台右上角,选择“工单 > 新建工单”,完成工单提交。

    增量支持DDL

    用户根据需求选择增量同步的DDL类型,不同链路支持的DDL类型以显示为准。

    • 一对一、一对多场景:如果业务上认为源和目标应该使用保持严格一致,那么高危类DDL也应该勾选并同步。如果业务上确定某个高危DDL不应该发生,则可以不勾选同步高危类DDL,这样DRS将拦截过滤这个DDL,从而起到保护目标数据的作用。但需要知晓,过滤DDL的附带问题是可能导致同步失败,例如过滤删列动作。
    • 多对一数据聚合场景:最佳方式是推荐只选择同步加列DDL,其他大部分DDL同步都可能因目标表修改而导致数据不一致或多对一中其他任务失败的情况发生。
    说明:

    “增量支持DDL”功能目前仅支持白名单用户,需要提交工单申请才能使用。您可以在管理控制台右上角,选择“工单 > 新建工单”,完成工单提交。

    同步对象

    可选表级同步、库级同步、导入对象文件,您可以根据业务场景选择对应的数据进行同步。

    • 选择数据的时候支持搜索,以便您快速选择需要的数据库对象。
    • 可以使用对象名映射功能进行源数据库和目标数据库中的同步对象映射,具体操作可参考对象名映射
    • 如果有切换源数据库的操作,请在选择同步对象前单击右上角的,以确保待选择的对象为最新源数据库对象。
    • 选择“导入对象文件”,具体步骤和说明可参考导入同步对象

    在选择同步对象阶段可通过设置映射关系,实现多张表对一张表的同步。

    1. 在同步对象右侧已选对象框中,选择需要进行映射的表,单击“编辑”按钮。
    2. “编辑库名和表名”的弹出框中,填写新的数据库名和新表名,单击“是”,修改后的名称即为保存在目标数据库中的库名。
      图7 编辑库名和表名
    3. 文件导入对象也支持多张表对一张表的映射,由于消息体限制最多导入10000个表(表名长度过长或者规则过长也会影响导入数量)。
      • 使用多对一操作时,需要使用数据加工的附加列操作来避免数据冲突。
      • 源库和目标库多对一的表的结构要一致。

  5. “数据加工”页面,可对需要加工的表对象进行数据过滤或添加附加列,,单击“下一步”

    • 如果需要设置数据过滤,选择“数据过滤”,设置相关过滤规则。
    • 如果需要设置添加附加列,选择“附加列”,单击“操作”列的“添加”,选填需要添加的列名和操作类型信息。

      相关操作可参考数据加工

    图8 数据加工

  6. “预检查”页面,进行同步任务预校验,校验是否可进行实时同步。

    • 查看检查结果,如有不通过的检查项,需要修复不通过项后,单击“重新校验”按钮重新进行任务预校验。

      预检查不通过项处理建议请参见《数据复制服务用户指南》中的“预检查不通过项修复方法”。

    • 预检查完成后,且所有检查项结果均通过时,单击“下一步”
      图9 预检查

      所有检查项结果均通过时,若存在请确认项,需要阅读并确认详情后才可以继续执行下一步操作。

  7. “任务确认”页面,设置同步任务的启动时间、任务异常通知设置、SMN主题、时延阈值、任务异常自动结束时间,并确认同步任务信息无误后,勾选协议,单击“启动任务”,提交同步任务。

    图10 任务启动设置
    表8 任务启动设置

    参数

    描述

    启动时间

    同步任务的启动时间可以根据业务需求,设置为“立即启动”或“稍后启动”。

    说明:

    预计同步任务启动后,会对源数据库和目标数据库的性能产生影响,建议选择业务低峰期,合理设置同步任务的启动时间。

    任务异常通知设置

    该项为可选参数,开启之后,选择对应的SMN主题。当同步任务状态异常时,系统将发送通知。

    SMN主题

    “任务异常通知设置”项开启后可见,需提前在SMN上申请主题并添加订阅。

    SMN主题申请和订阅可参考《消息通知服务用户指南》

    时延阈值

    在增量同步阶段,源数据库和目标数据库之间的同步有时会存在一个时间差,称为时延,单位为秒。

    时延阈值设置是指时延超过一定的值后(时延阈值范围为0—3600s),DRS可以发送告警通知。告警通知将在时延稳定超过设定的阈值6min后发送,避免出现由于时延波动反复发送告警通知的情况。

    说明:
    • 当时延阈值设置为0时,不会发送通知给收件人。
    • 首次进入增量同步阶段,会有较多数据等待同步,存在较大的时延,属于正常情况,不在此功能的监控范围之内。
    • 设置时延阈值之前,需要设置任务异常通知。

    任务异常自动结束时间(天)

    设置任务异常自动结束天数,输入值必须在14-100之间,默认值14。

    说明:

    异常状态下的任务仍然会计费,而长时间异常的任务无法续传和恢复。设置任务异常自动结束天数后,异常且超时的任务将会自动结束,以免产生不必要的费用。

  8. 同步任务提交后,您可在“管理”页面,查看并管理自己的任务。

    • 您可查看任务提交后的状态,状态请参见任务状态说明
    • 在任务列表的右上角,单击刷新列表,可查看到最新的任务状态。

分享:

    相关文档

    相关产品

close