Apache Paimon は、高スループットの書き込みと低レイテンシーのクエリをサポートする、ストリームとバッチが統合されたレイクストレージフォーマットです。Flink、Spark、Hive、Trino などの E-MapReduce コンピューティングエンジンは Apache Paimon と緊密に統合されており、HDFS または OSS 上にデータレイクストレージを構築し、データレイク分析を行うことができます。
Apache Paimon は、以下のコア機能を提供します。
-
HDFS または OSS 上の低コストで軽量なデータレイクストレージサービス
-
ストリームモードとバッチモードの両方で、大規模データセットの読み書き
-
分単位から秒単位のデータ鮮度でバッチおよび OLAP クエリ
-
増分データの消費と生成、および従来のデータウェアハウスとストリーミングデータウェアハウスのストレージレイヤーとしての機能
-
ストレージコストとダウンストリームシステムの計算負荷を削減するデータ事前集約
-
履歴データバージョンをクエリするためのタイムトラベル
-
効率的なデータフィルタリング
-
テーブルのスキーマ進化
詳細については、「Apache Paimon」をご参照ください。