
# 预写式日志
预写式日志（Write Ahead Log，缩写为WAL，也称为Xlog）是一种用于保证数据可靠性和系统可恢复性的技术。其核心思想是：在对数据文件进行修改之前，必须先将这些修改的操作记录写入日志文件，并将日志文件刷新到持久化存储器中。在系统崩溃时，可以使用WAL日志对集群进行恢复操作。WAL日志记录的详细程度分为几个级别，由GUC参数wal_level控制。
#### 原理
- 日志运行机制 GaussDB启动时，会分配一段内存用来缓存数据库运行期间生成的日志，这个缓冲区大小由参数wal_buffers控制。要确保事务的持久化，Wal_buffers中的日志就需要落盘。
  WAL日志会在以下两种情况下写硬盘：
  - Commit事务提交时。系统会调用fdatasync函数，将wal_buffers中的WAL数据写入WAL日志文件（wal_sync_method可控制commit时调用的函数，默认为fdatasync）。
  
  - walWriter定期写。walWriter进程会定期将wal_buffers中的WAL数据写入WAL日志文件。wal_writer_delay参数用来控制walwriter进程工作的时间间隔，默认200ms。如果时间过长可能造成WAL缓冲区的内存不足，时间过短会引起WAL不断写入，增加磁盘I/O负担。
   
- 日志文件存储路径
  路径为数据目录/pg_xlog。
  - CN的WAL日志存储路径为 /\<cn数据目录\>/pg_xlog。单个WAL日志文件的大小默认为16MB，通过参数wal_segment_size设置，一般不做调整。
    ```
    gaussdb=# SHOW wal_segment_size;
    wal_segment_size
    -----------------
    16MB
    (1 row)
    ```
    
  
  - 以一个DN为例，数据目录可以通过如下命令查询。其中/opt/gaussdb/data/dn/db_6001代表集群节点的数据目录，当前节点的Xlog日志存放在 /opt/gaussdb/data/dn/db_6001/pg_xlog目录。
    ```
    $ cm_ctl query -Cvd
    [   CMServer State   ]
    node               instance                           state
    -------------------------------------------------------------
    1  192.168.10.182 1    /opt/gaussdb/data/cm/cm_server Primary
    [    Cluster State   ]
    cluster_state   : Normal
    redistributing  : No
    balanced        : Yes
    current_az      : AZ_ALL
    [   Datanode State   ]
    node               instance                           state
    -------------------------------------------------------------
    1  192.168.10.182 6001 /opt/gaussdb/data/cm/cm_server Primary
    ```
    
    
- 日志文件命名格式 日志文件以段文件的形式存储的，每个段为16MB，并分割成若干页，每页8KB。一个段文件的名称由24个十六进制组成，对WAL日志的命名由如下部分组成：时间线+日志文件标号+日志文件段标号，请参考[表1]。
  日志文件的段标号上限为FF，若有下一个WAL日志文件，需要将文件标号+1，段标号归零，例如0000000100000000000000FF的后一个文件为000000010000000100000000。时间线由1开始，日志文件标号和日志文件的段标号由0开始。
   表1WAL日志文件命名规范 
  | 字段名称            | 字段含义                   |
  |:---|:---|
  | timeline        | 时间线。取值范围：8位16进制数字。     |
  | wal_file_num    | 日志文件标号。取值范围：8位16进制数字。  |
  | wal_segment_num | 日志文件段标号。取值范围：8位16进制数字。 |
     
  典型的WAL日志文件名如下所示，每个WAL日志文件大小均为16MB。
  ```
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 11  12:33 0000000100000001000000F2
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 11  18:10 0000000100000001000000F3
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 11  22:18 0000000100000001000000F4
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 03:58 0000000100000001000000F5
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 07:59 0000000100000001000000F6
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 13:45 0000000100000001000000F7
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 17:30 0000000100000001000000F8
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 12 23:10 0000000100000001000000F9
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 03:10 0000000100000001000000FA
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 08:39 0000000100000001000000FB
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 12:43 0000000100000001000000FC
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 17:08 0000000100000001000000FD
  -rW----- 1 gaussdb d gaussdb d 16777216 Jun 13 16:32 0000000100000001000000FE
  ```
  ![](https://support.huaweicloud.com/distributed-devg-v10-gaussdb/public_sys-resources/note_3.0-zh-cn.png)
  WAL日志文件名的数字一般情况下是顺序增长使用的（要把所有可用数字都用光也需要非常长的时间），但也存在循环使用的情况。
  
- 日志内容说明 WAL日志的内容取决于记录事务的类型，在系统崩溃时可以利用WAL日志进行恢复。默认配置下，GaussDB每次启动时会先读取WAL日志进行恢复。
  
- 日志使用场景
  - 数据库崩溃恢复：数据库意外崩溃时，因为Xlog日志中已经完整记录了数据库的变化，在数据库重启后就可以通过回放checkpoint之后的Xlog日志，把之前修改过的数据页面（记录在Xlog里，但是还没有来得及修改数据文件）落盘，确保数据的完整性。这个过程是在数据库启动后自动完成的。
  
  - 主备DN数据同步：GaussDB的备DN通过接收来自主DN的Xlog，然后应用Xlog来达到主备一致。主数据库和备数据库之间的数据同步也可以通过Xlog来实现。
  
  - 数据库备份恢复：用GaussRoach对GaussDB做备份时，不仅要复制数据文件，还需要备份期间产生的Xlog，才能构成一个完整的备份。使用全量备份或增量备份+Xlog，可以做到指定时间点的恢复，即恢复到全量备份之后的指定时间点（即PITR：Point-In-Time Recovery）。
  
  - 逻辑复制：逻辑复制工具，如DRS，是通过对Xlog的解析来获取数据流并进行增量数据同步的。
   
- Xlog的回收 数据库运行期间，会持续生成Xlog日志，GaussDB通过checkpoint机制来进行Xlog日志清理（通常被称为Xlog回收）。Xlog日志回收相关参数请参见[表2]，相关参数说明及参数设置方式请参见《参考》中"数据库运行参数说明"章节。
   表2Xlog日志回收相关参数 
  | 参数名称                           | 参数说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           |
  |:---|:---|
  | checkpoint_timeout             | 设置自动检查点之间的最长时间。在上一次自动检查点后，多长时间必须做下一次自动检查点，默认值为15min。如果在两次自动检查点期间堆积的Xlog日志数量大于checkpoint_segments设置的值，也会触发一次自动检查点。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                              |
  | checkpoint_segments            | 设置checkpoint_timeout周期内所保留WAL日志文件的最大数量。每个日志文件大小为16MB。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                          |
  | enable_incremental_checkpoint  | 增量检查点开关，默认值为on。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                |
  | incremental_checkpoint_timeout | 开启增量检查点开关（enable_incremental_checkpoint）之后，设置自动检查点之间的最长时间。 默认值为1min。即每分钟会启动一次增量检查点，同样会检查是否有Xlog需要清理。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                             |
  | wal_keep_segments              | Xlog日志文件的数量，设置"pg_xlog"目录下保留日志文件的最小数量。备机通过获取主机的Xlog日志进行流复制。默认值为128。一般情况下，数据库在执行checkpoint时，会检查当前的pg_xlog目录下的Xlog数量是否大于wal_keep_segments设置的值， 如果数量大于wal_keep_segments值，就从旧的一端开始清理，保留wal_keep_segments设定数量的Xlog日志。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                               |
  | enable_xlog_prune              | 设置在任一备机断连时，主机是否根据Xlog日志的大小超过参数max_size_for_xlog_prune的值而回收日志，on为开启。在备机断联时，为确保主备DN间Xlog日志是连续的，将不对Xlog日志进行清理。但是，如果开启enable_xlog_prune，且Xlog堆积的容量大于max_size_for_xlog_prune指定的值，一般为256GB，同样会触发Xlog日志清理。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                            |
  | max_size_for_xlog_prune        | 在备机故障时主机保留的Xlog最大数量。在enable_xlog_prune打开时生效，工作机制如下： 1. replconninfo系列guc参数配置的所有备机都连接主机时，则该参数不生效。  2. replconninfo系列guc参数配置的备机断连时，则该参数生效。当主机Xlog日志量大于该参数值，会强制回收。例外：在同步提交模式下（即synchronous_commit参数不是local/off时），如果存在连接中的备机，则主机会考虑保留多数派备机中最小日志接受位置以后的日志，这种情况下，保留的日志可能多于max_size_for_xlog_prune参数值。  3. 若存在build中的备机，则该参数不生效，主机日志会全量保留，防止build操作期间由于日志被回收引发的失败。   |
     
  
 
#### 示例
- 查询单个WAL日志文件大小：
  ```
  gaussdb=# SHOW wal_segment_size;
  wal_segment_size
  -----------------
  16MB
  (1 row)
  ```
  
- 查询WAL日志数据目录：
  ```
  $ cm_ctl query -Cvd
  [   CMServer State   ]
  node               instance                           state
  -------------------------------------------------------------
  1  192.168.10.182  1   /opt/gaussdb/data/cm/cm_server Primary
  [    Cluster State   ]
  cluster_state   : Normal
  redistributing  : No
  balanced        : Yes
  current_az      : AZ_ALL
  [   Datanode State   ]
  node               instance                          state
  ----------------------------------------------------------------------
  1  192.168.10.182  6001 /opt/gaussdb/data/dn/dn_6001 P Primary Normal
  ```
  
 
