更新时间:2026-07-28 GMT+08:00
分享

预写式日志

预写式日志(Write Ahead Log,缩写为WAL,也称为Xlog)是一种用于保证数据可靠性和系统可恢复性的技术。其核心思想是:在对数据文件进行修改之前,必须先将这些修改的操作记录写入日志文件,并将日志文件刷新到持久化存储器中。在系统崩溃时,可以使用WAL日志对集群进行恢复操作。WAL日志记录的详细程度分为几个级别,由GUC参数wal_level控制。

原理

  • 日志运行机制

    GaussDB启动时,会分配一段内存用来缓存数据库运行期间生成的日志,这个缓冲区大小由参数wal_buffers控制。要确保事务的持久化,Wal_buffers中的日志就需要落盘。

    WAL日志会在以下两种情况下写硬盘:

    • Commit事务提交时。系统会调用fdatasync函数,将wal_buffers中的WAL数据写入WAL日志文件(wal_sync_method可控制commit时调用的函数,默认为fdatasync)。
    • walWriter定期写。walWriter进程会定期将wal_buffers中的WAL数据写入WAL日志文件。wal_writer_delay参数用来控制walwriter进程工作的时间间隔,默认200ms。如果时间过长可能造成WAL缓冲区的内存不足,时间过短会引起WAL不断写入,增加磁盘I/O负担。
  • 日志文件存储路径
    路径为数据目录/pg_xlog。
    • CN的WAL日志存储路径为 /<cn数据目录>/pg_xlog。单个WAL日志文件的大小默认为16MB,通过参数wal_segment_size设置,一般不做调整。
      gaussdb=# SHOW wal_segment_size;
      wal_segment_size
      -----------------
      16MB
      (1 row)
    • 以一个DN为例,数据目录可以通过如下命令查询。其中/opt/gaussdb/data/dn/db_6001代表集群节点的数据目录,当前节点的Xlog日志存放在 /opt/gaussdb/data/dn/db_6001/pg_xlog目录。
      $ cm_ctl query -Cvd
      [   CMServer State   ]
      
      node               instance                           state
      -------------------------------------------------------------
      1  192.168.10.182 1    /opt/gaussdb/data/cm/cm_server Primary
      
      [    Cluster State   ]
      
      cluster_state   : Normal
      redistributing  : No
      balanced        : Yes
      current_az      : AZ_ALL
      
      [   Datanode State   ]
      
      node               instance                           state
      -------------------------------------------------------------
      1  192.168.10.182 6001 /opt/gaussdb/data/cm/cm_server Primary
  • 日志文件命名格式

    日志文件以段文件的形式存储的,每个段为16MB,并分割成若干页,每页8KB。一个段文件的名称由24个十六进制组成,对WAL日志的命名由如下部分组成:时间线+日志文件标号+日志文件段标号,请参考表1

    日志文件的段标号上限为FF,若有下一个WAL日志文件,需要将文件标号+1,段标号归零,例如0000000100000000000000FF的后一个文件为000000010000000100000000。时间线由1开始,日志文件标号和日志文件的段标号由0开始。

    表1 WAL日志文件命名规范

    字段名称

    字段含义

    timeline

    时间线。取值范围:8位16进制数字。

    wal_file_num

    日志文件标号。取值范围:8位16进制数字。

    wal_segment_num

    日志文件段标号。取值范围:8位16进制数字。

    典型的WAL日志文件名如下所示,每个WAL日志文件大小均为16MB。

    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 11  12:33 0000000100000001000000F2
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 11  18:10 0000000100000001000000F3
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 11  22:18 0000000100000001000000F4
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 03:58 0000000100000001000000F5
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 07:59 0000000100000001000000F6
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 13:45 0000000100000001000000F7
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 17:30 0000000100000001000000F8
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 23:10 0000000100000001000000F9
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 03:10 0000000100000001000000FA
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 08:39 0000000100000001000000FB
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 12:43 0000000100000001000000FC
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 17:08 0000000100000001000000FD
    -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 16:32 0000000100000001000000FE

    WAL日志文件名的数字一般情况下是顺序增长使用的(要把所有可用数字都用光也需要非常长的时间),但也存在循环使用的情况。

  • 日志内容说明

    WAL日志的内容取决于记录事务的类型,在系统崩溃时可以利用WAL日志进行恢复。默认配置下,GaussDB每次启动时会先读取WAL日志进行恢复。

  • 日志使用场景
    • 数据库崩溃恢复:数据库意外崩溃时,因为Xlog日志中已经完整记录了数据库的变化,在数据库重启后就可以通过回放checkpoint之后的Xlog日志,把之前修改过的数据页面(记录在Xlog里,但是还没有来得及修改数据文件)落盘,确保数据的完整性。这个过程是在数据库启动后自动完成的。
    • 主备DN数据同步:GaussDB的备DN通过接收来自主DN的Xlog,然后应用Xlog来达到主备一致。主数据库和备数据库之间的数据同步也可以通过Xlog来实现。
    • 数据库备份恢复:用GaussRoach对GaussDB做备份时,不仅要复制数据文件,还需要备份期间产生的Xlog,才能构成一个完整的备份。使用全量备份或增量备份+Xlog,可以做到指定时间点的恢复,即恢复到全量备份之后的指定时间点(即PITR:Point-In-Time Recovery)。
    • 逻辑复制:逻辑复制工具,如DRS,是通过对Xlog的解析来获取数据流并进行增量数据同步的。
  • Xlog的回收

    数据库运行期间,会持续生成Xlog日志,GaussDB通过checkpoint机制来进行Xlog日志清理(通常被称为Xlog回收)。Xlog日志回收相关参数请参见表2,相关参数说明及参数设置方式请参见《参考》中“数据库运行参数说明”章节。

    表2 Xlog日志回收相关参数

    参数名称

    参数说明

    checkpoint_timeout

    设置自动检查点之间的最长时间。在上一次自动检查点后,多长时间必须做下一次自动检查点,默认值为15min。如果在两次自动检查点期间堆积的Xlog日志数量大于checkpoint_segments设置的值,也会触发一次自动检查点。

    checkpoint_segments

    设置checkpoint_timeout周期内所保留WAL日志文件的最大数量。每个日志文件大小为16MB。

    enable_incremental_checkpoint

    增量检查点开关,默认值为on。

    incremental_checkpoint_timeout

    开启增量检查点开关(enable_incremental_checkpoint)之后,设置自动检查点之间的最长时间。

    默认值为1min。即每分钟会启动一次增量检查点,同样会检查是否有Xlog需要清理。

    wal_keep_segments

    Xlog日志文件的数量,设置“pg_xlog”目录下保留日志文件的最小数量。备机通过获取主机的Xlog日志进行流复制。默认值为128。一般情况下,数据库在执行checkpoint时,会检查当前的pg_xlog目录下的Xlog数量是否大于wal_keep_segments设置的值, 如果数量大于wal_keep_segments值,就从旧的一端开始清理,保留wal_keep_segments设定数量的Xlog日志。

    enable_xlog_prune

    设置在任一备机断连时,主机是否根据Xlog日志的大小超过参数max_size_for_xlog_prune的值而回收日志,on为开启。在备机断联时,为确保主备DN间Xlog日志是连续的,将不对Xlog日志进行清理。但是,如果开启enable_xlog_prune,且Xlog堆积的容量大于max_size_for_xlog_prune指定的值,一般为256GB,同样会触发Xlog日志清理。

    max_size_for_xlog_prune

    在备机故障时主机保留的Xlog最大数量。在enable_xlog_prune打开时生效,工作机制如下:
    1. replconninfo系列guc参数配置的所有备机都连接主机时,则该参数不生效。
    2. replconninfo系列guc参数配置的备机断连时,则该参数生效。当主机Xlog日志量大于该参数值,会强制回收。例外:在同步提交模式下(即synchronous_commit参数不是local/off时),如果存在连接中的备机,则主机会考虑保留多数派备机中最小日志接受位置以后的日志,这种情况下,保留的日志可能多于max_size_for_xlog_prune参数值。
    3. 若存在build中的备机,则该参数不生效,主机日志会全量保留,防止build操作期间由于日志被回收引发的失败。

示例

  • 查询单个WAL日志文件大小:
    gaussdb=# SHOW wal_segment_size;
    wal_segment_size
    -----------------
    16MB
    (1 row)
  • 查询WAL日志数据目录:
    $ cm_ctl query -Cvd
    [   CMServer State   ]
    
    node               instance                           state
    -------------------------------------------------------------
    1  192.168.10.182  1   /opt/gaussdb/data/cm/cm_server Primary
    
    [    Cluster State   ]
    
    cluster_state   : Normal
    redistributing  : No
    balanced        : Yes
    current_az      : AZ_ALL
    
    [   Datanode State   ]
    
    node               instance                          state
    ----------------------------------------------------------------------
    1  192.168.10.182  6001 /opt/gaussdb/data/dn/dn_6001 P Primary Normal

相关文档