Apache Paimon は、高スループットの書き込みと低レイテンシーのクエリをサポートする、ストリームとバッチを統合したデータレイクストレージフォーマットです。Flink、Spark、Hive、Trino などの E-MapReduce コンピューティングエンジンは Paimon とシームレスに統合されており、HDFS または OSS 上にデータレイクストレージを構築してデータレイク分析を行うことができます。
Apache Paimon は、次のようなコア機能を提供します。
-
HDFS または OSS 上の低コストで軽量なデータレイクストレージサービス。
-
ストリームモードとバッチモードの両方での大規模データセットの読み書き。
-
データの鮮度が数分から数秒のバッチおよび OLAP クエリ。
-
増分データの消費と生成により、従来型およびストリーミングデータウェアハウスの両方のストレージレイヤーとして機能。
-
データ事前集約により、ストレージコストとダウンストリームシステムの計算負荷を削減。
-
タイムトラベルによる履歴データバージョンのクエリ。
-
効率的なデータフィルタリング。
-
テーブルのスキーマ進化。
詳細については、「Apache Paimon」をご参照ください。