AnalyticDB とは
AnalyticDB は、Alibaba Cloud が提供するクラウドネイティブなリアルタイムデータウェアハウスです。オンライン トランザクション処理 (OLTP) データベースやログファイルなどのソースからリアルタイムでデータインジェストを行い、ペタバイト規模のデータを数秒で分析できます。AnalyticDB は、クラウドネイティブなストレージとコンピューティングの分離アーキテクチャを採用しています。このアーキテクチャにより、ストレージの従量課金、コンピューティングリソースのエラスティックスケーリング、オフライン処理とオンライン分析のリソース分離が可能になります。この設計により、企業はデータ処理効率を向上させ、コストを管理し、システムの安定性を確保できます。AnalyticDB は、MySQL、PostgreSQL、および Spark のエコシステムと互換性があります。
AnalyticDB には、AnalyticDB for MySQL と AnalyticDB for PostgreSQL の 2 つのエンジンがあります。
|
比較項目 |
AnalyticDB for MySQL |
AnalyticDB for PostgreSQL |
|
|
エコシステム |
MySQL との高い互換性 Spark との高い互換性 |
PostgreSQL との 100% の互換性 Oracle との高い互換性 |
|
|
エディション |
|
|
|
|
アーキテクチャ |
ストレージとコンピューティングの分離アーキテクチャ |
||
|
拡張性 |
共通機能 |
垂直スケーリング 水平スケーリング |
|
|
相違点 |
マルチクラスターモデルによるリソースの自動スケーリングをサポート MIN-MAX モデルによる時間ベースおよび自動エラスティックスケーリングをサポート |
スケジュールタスクによるスケジュールされた自動スケーリングをサポート サーバーレスモデルによるオンデマンドの自動スケーリングをサポート |
|
|
主な機能 |
共通機能 |
AISearch 全文検索インデックス オフラインバッチ処理 リアルタイムマテリアライズドビュー |
|
|
相違点 |
データレイク Spark オフライン処理 クエリパフォーマンスのインテリジェントな診断とチューニング |
検索拡張生成 (RAG) アプリケーション 時空間分析 |
|
|
シナリオ |
共通機能 |
リアルタイムデータウェアハウス リアルタイムログ分析 ビジネスインテリジェンス (BI) レポート |
|
|
相違点 |
プレシジョンマーケティング 複数ソースにまたがるフェデレーテッド分析 ビッグデータのストレージと分析 オフラインデータの高速化 他のデータレイクまたはデータウェアハウスサービス (Databricks、Athena、セルフマネージド Spark、Presto など) からの移行 |
大規模言語モデル (LLM) アプリケーションを構築するためのワンストップソリューション エンタープライズ専用のナレッジベース 地理情報システム (GIS) 時空間ビッグデータ分析 オフラインとオンラインの統合データ分析 他のクラウドデータウェアハウスサービス (Greenplum、Redshift、Synapse、Snowflake、BigQuery など) からの移行 |
|
|
顧客の業界 |
ゲーム、小売、自動車 |
小売、e コマース、教育 |
|
|
コスト削減 |
共通機能 |
データストレージ料金は実際のデータ量に基づきます。 ホットデータとコールドデータの階層型ストレージにより、ストレージコストを削減します。 予測可能なビジネスのピークと谷に基づいてリソースを自動的にスケールアップまたはスケールダウンします。これにより、ピークトラフィック時に十分なリソースを確保し、ピーク後のリソースの無駄を防ぎます。 |
|
|
相違点 |
実際のビジネスワークロードに基づいてリソースを自動的にスケールアップまたはスケールダウンします。 |
必要に応じてインスタンスを手動で開始または一時停止します。 |
|
AnalyticDB for MySQL の紹介
データソース
APS データパイプラインは、データベース、ログ、ビッグデータシステムからワンクリックで低コストにデータをインジェストする方法を提供します。
ストレージレイヤー + コンピューティングレイヤー
自己開発の Xihe コンピューティングエンジンと Xuanwu ストレージエンジンをサポートしています。また、オープンソースの Spark コンピューティングエンジンと Hudi ストレージエンジンも統合しています。これらのオープンソースエンジンは、より広範なデータ分析シナリオをサポートします。自己開発エンジンとオープンソースエンジン間の相互アクセスが可能で、より統合されたエクスペリエンスを提供します。
-
ストレージレイヤー:フルデータの単一コピーで、オフラインとオンライン両方のシナリオに対応できます。
オンライン分析シナリオではパフォーマンス向上のために高性能なストレージメディアが必要ですが、オフラインシナリオではストレージコスト削減のために低コストのストレージメディアが必要です。これらの異なるニーズに対応するため、まずフルデータのコピーを低コストかつ高スループットなストレージメディアに保存します。これにより、低コストのオフライン処理シナリオでこのデータを直接読み書きでき、データストレージとデータ I/O のコストを削減し、高スループットを確保します。次に、リアルタイムデータを別のストレージ I/O ノード (EIU) に保存し、行レベルのリアルタイムパフォーマンスを保証します。フルデータ上にインデックスを構築し、キャッシングを使用してデータアクセスを高速化します。この設計は、高性能なオンライン分析シナリオに対応し、数百ミリ秒の応答時間を実現します。
-
コンピューティングレイヤー:Xihe コンピューティングエンジンが計算モードをインテリジェントに選択し、オープンソースの Spark コンピューティングエンジンがさまざまなシナリオのニーズに対応します。
Xihe コンピューティングエンジンは、超並列処理 (MPP) モードとバルク同期的並列 (BSP) モードの両方を提供します。MPP モードはストリーム処理モデルであり、低コストで高スループットのオフライン処理シナリオには適していません。BSP モードは、有向非巡回グラフ (DAG) を使用してタスクを分割し、バッチでスケジュールします。このアプローチは、限られたリソースで大規模なデータ計算をサポートし、計算データをディスクに書き込むことができます。Xihe コンピューティングエンジンには自動切り替え機能が含まれています。MPP モードのクエリが指定時間内に完了しない場合、システムは自動的に BSP モードに切り替えて実行します。
オープンソースの Spark コンピューティングエンジンは、より複雑なオフライン処理や機械学習シナリオに対応できます。Spark コンピューティングレイヤーとストレージレイヤーは相互接続されており、コンピューティングレイヤーのリソースを使用してストレージレイヤーのデータを処理できます。これにより、Spark リソースグループの作成と設定が簡素化されます。
アクセスレイヤー
アクセスレイヤーは、統一された課金単位、統一されたメタデータと権限、統一された開発言語、統一された伝送リンクを提供することで、開発効率を向上させます。
AnalyticDB for MySQL の製品エディション (Enterprise Edition、) の詳細については、「製品エディション」をご参照ください。
AnalyticDB for PostgreSQL の紹介
AnalyticDB for PostgreSQL には、ストレージ弾力性モードと Serverless という 2 つの製品形態があります。ストレージ弾力性モードは、ECS と ESSD クラウドディスクをベースにした MPP を採用した Shared-Nothing アーキテクチャを使用します。Serverless は、ECS、ローカルキャッシュ、および OSS リモートストレージをベースにした、ストレージとコンピューティングの分離アーキテクチャである Shared-Storage アーキテクチャを使用します。
AnalyticDB for PostgreSQL のインスタンスは、1 つのコーディネーターノード (マスターノードとも呼ばれる) と複数のワーカーノード (セグメントノードとも呼ばれる) で構成されます。コーディネーターノードはメタデータと負荷分散を管理します。ワーカーノードはデータ処理を担当し、高いクエリパフォーマンスを実現するために Orca オプティマイザ、独自の Laser 実行エンジン、Beam ストレージエンジンを含みます。IMV リアルタイムマテリアライズドビューコンポーネントと組み合わせることで、AnalyticDB for PostgreSQL はリアルタイムデータウェアハウスを構築します。ワーカーノードにアタッチされた ESSD クラウドディスクはホットデータを保存し、コールドデータは OSS に保存されます。このホットデータとコールドデータの階層型ストレージにより、クエリパフォーマンスとストレージコストのバランスを取ります。AnalyticDB for PostgreSQL は、ストレージとコンピューティングの分離アーキテクチャを採用しています。ワーカーノードのコンピューティングリソースは、パフォーマンスとリソース使用率を最適化するための柔軟なスケーリングをサポートしています。ただし、ストレージリソースはスケールアウトのみをサポートし、スケールインはサポートしていません。この設計により、データ量が増加するにつれてストレージ容量を柔軟に拡張できる一方、データ耐久性とシステムの安定性を確保します。