更新时间:2026-08-17 GMT+08:00
分享

Paimon

Apache Paimon是一种流批统一的数据湖存储格式,旨在构建实时湖仓一体架构,支持使用Flink和Spark进行流批处理操作。Apache Paimon创新性地将湖存储格式与LSM(Log-Structured Merge-Tree)技术结合起来,使得湖架构支持实时流式更新能力;其优势在于低延迟、强一致性和易扩展性。

  • 读/写:Paimon支持多种方式的数据读/写和OLAP查询。对于读操作,支持从历史快照读取(批模式)、从最新偏移量读取(流模式)或以混合模式读取增量快照。对于写操作,支持从数据库的更改日志(CDC)流式同步或从离线数据批量插入/覆盖。
  • 生态系统:除了Apache Flink,Paimon还支持其他计算引擎(例如Apache Hive、Apache Spark和Trino)进行读取。
  • 内部:在底层Paimon将列式文件存储在文件系统/对象存储中。文件的元数据存储在清单文件中,提供大规模存储和Data Skipping功能。对于主键表,使用LSM树结构来支持大量数据更新和高性能查询。

Paimon关键技术

  • 高效存储:支持低成本存储(基于HDFS/OBS的列式存储),以列式文件格式存储数据,支持data skipping功能,提高查询性能。
  • 完善的数据湖管理能力:Apache Paimon提供了完整的数据湖能力,包括ACID、Schema Evolution、版本回溯、Tag、Branch等。
  • 高效写入与查询:采用LSM-Tree技术,支持高吞吐写入和低延迟查询。
  • 多引擎支持:除了与Apache Flink的深度集成,Apache Paimon还支持Spark、Hive、HetuEngine等计算引擎,提供灵活的数据读写能力。

更多介绍请参考Apache Paimon

相关文档