すべてのプロダクト
Search
ドキュメントセンター

Realtime Compute for Apache Flink:Paimon ストリーミングレイクハウスアーキテクチャソリューションの選定

最終更新日:Aug 14, 2026

Apache Paimon は、ストリーム処理とバッチ処理を統合するレイクハウスストレージフォーマットです。LSM ツリー (ログ構造化マージツリー) 技術に基づいて構築された Paimon は、整合性のある読み取りと高いスループットにより、レイク層にリアルタイム更新セマンティクスを提供します。Realtime Compute for Apache Flink で Paimon テーブルを使用して、Object Storage Service (OSS) などのクラウドストレージ上にストリーミングレイクハウスを構築できます。

Paimon は、単一のストレージフォーマットを通じて、ストリーム処理には Apache Flink、バッチ処理には Apache Spark と統合します。主な機能は次のとおりです:

  • リアルタイムデータインジェスト:MySQL CDC などのデータベース変更ストリームから数千万件のレコードをインジェストし、スキーマ変更の自動同期と低レイテンシーを実現します。

  • ストリーム処理とバッチ処理の統合:Spark では有界バッチソースとして、Flink では無界変更ログストリームとして同じ Paimon テーブルを読み取ることができ、フォーマット変換は不要です。

  • 幅広いエコシステム連携:Paimon テーブルを、データの複製なしに Realtime Compute for Apache Flink、E-MapReduce (Spark、StarRocks、Hive、Trino)、および MaxCompute に接続します。

  • 低レイテンシーOLAPクエリ:削除ベクトルとプライマリキーインデックスにより、ストリーミング、バッチ、オンライン分析処理 (OLAP) のワークロードにおいて、クエリのレイテンシーを分単位に維持します。

完全な仕様については、「Apache Paimon」をご参照ください。

使用方法

Paimon の使用開始

Paimon カタログの作成

Paimon カタログは、OSS などの外部システムに保存されている Paimon テーブル用の中央レジストリです。他の Alibaba Cloud サービスは、同じカタログを通じてテーブルにアクセスします。カタログは、以下のいずれかの方法で設定できます:

Paimon テーブルの作成

Paimon テーブルへのデータ書き込み

Paimon テーブルからのデータ消費

  • バッチモードまたはストリーミングモードで Paimon テーブルからデータをクエリまたは消費します。詳細については、「Paimonテーブルからのデータ消費」をご参照ください。ストリーミングモードでプライマリキーテーブルからデータを消費するには、まず チェンジログプロデューサー を設定する必要があります。

  • Paimon テーブルのコンシューマーオフセットを設定します。詳細については、「指定されたオフセットからのデータ消費」をご参照ください。

  • Paimon テーブルのコンシューマーオフセットを保存するか、アクティブなコンシューマーによってまだ参照されている期限切れのスナップショットファイルを保持します。詳細については、「コンシューマーIDの指定」をご参照ください。

  • バッチジョブを実行して、特定のスナップショットから Paimon テーブルの履歴状態を読み取ります。詳細については、「バッチタイムトラベル」をご参照ください。

Paimon テーブルのメンテナンス