すべてのプロダクト
Search
ドキュメントセンター

E-MapReduce:EMR Serverless StarRocks とは

最終更新日:Jul 14, 2026

E-MapReduce (EMR) Serverless StarRocks は、Alibaba Cloud が提供するフルマネージドの StarRocks サービスです。EMR コンソールから StarRocks インスタンスを作成し、インスタンスとデータを管理できます。クラスターの構成、運用、スケーリングをお客様自身で行う必要はありません。

StarRocks の概要

StarRocks は、高速でリアルタイムかつ効率的な多次元データ分析のために設計された分析データベースです。超並列処理 (MPP) アーキテクチャに、ベクトル化実行エンジン、コストベースオプティマイザー (CBO)、インテリジェントなマテリアライズドビュー、リアルタイムに更新可能なカラムナストレージエンジンを組み合わせています。StarRocks は MySQL プロトコルと互換性があるため、任意の MySQL クライアントや一般的な BI ツールから直接接続できます。水平スケーリングに対応しており、高可用性と高信頼性を実現するよう設計されています。

StarRocks は次の分析シナリオに適しています:

  • リアルタイムデータウェアハウス :トランザクションデータベースの変更を数秒で同期し、最新データをクエリします

  • オンライン分析処理 (OLAP) :多次元レポート、セルフサービスダッシュボード、アドホッククエリを実行します

  • データレイク分析 :Apache Hive、Apache Iceberg、Apache Hudi、Delta Lake のデータを移行せずにクエリします

コア機能

MPP フレームワーク

StarRocks は、各クエリを物理的な計算ユニットに分割し、専用の CPU とメモリを持つマシン間で並列実行します。クラスターをスケールアウトすると、単一クエリのパフォーマンスもそれに合わせてスケールします。

ベクトル化実行エンジン

ベクトル化実行エンジンは、すべての演算子、関数、スキャンおよびフィルタリングモジュール、インポートおよびエクスポートモジュールを CPU レベルで最適化します。単一命令複数データ (SIMD) 命令を使用して、クロックサイクル当たりに処理できるデータ量を増やします。標準データセットでのベンチマークでは、演算子全体のパフォーマンスが 3~10 倍向上することが示されています。

このエンジンには Operation on Encoded Data も含まれており、デコードせずにエンコードされた文字列に対して直接、結合、集計、式演算子を実行します。これにより SQL 実行の複雑さが低減され、クエリ速度が 2 倍以上向上します。

コンピューティングとストレージの分離

StarRocks 3.0 で導入されたコンピューティングとストレージの分離アーキテクチャは、コンピューティングをストレージから切り離し、それぞれを独立してスケールできるようにします。コンピュートノードは数秒でスケールし、コンピューティングとストレージを同時に増やす必要がある場合に発生する過剰プロビジョニングを解消します。

ストレージ層は、ほぼ無制限の容量を持つさまざまなオブジェクトストレージサービスを使用し、Hadoop 分散ファイルシステム (HDFS) と互換性があります。コンピューティングとストレージの分離アーキテクチャは、コンピューティングとストレージの統合アーキテクチャと機能面で同等です。データ更新、データレイク分析、マテリアライズドビューによる高速化はいずれも同様に動作します。データ書き込みとホットデータのクエリ性能も、2 つのアーキテクチャでほぼ同等です。

コストベースオプティマイザー

複雑な複数テーブルの結合クエリでは、有効な実行計画の数がテーブル数に対して指数関数的に増加するため、最適な計画選択は NP 困難になります。StarRocks CBO は、ベクトル化実行エンジン向けにカスタマイズされた cascades ライクなアーキテクチャを採用しています。次をサポートします:

  • 共通部分式の再利用とサブクエリのクエリ書き換え

  • Lateral Join と Join Reorder

  • 分散結合の実行ポリシー選択

  • 低カーディナリティ辞書エンコーディングの最適化

CBO は 99 個すべての TPC-DS SQL ステートメントをサポートします。

リアルタイムカラムナストレージエンジン

StarRocks はデータをカラム形式で格納することで、圧縮率を向上させ、ディスク I/O を削減し、一部の列のみを読み取るクエリを高速化します。これは OLAP ワークロードで一般的なパターンです。StarRocks は数秒でデータをロードでき、ほぼリアルタイムのデータ処理機能を提供します。

ストレージエンジンは、データのインポートに対して ACID (原子性、一貫性、独立性、永続性) を保証します。バッチインポートは原子的に成功または失敗し、同時実行されるトランザクションはスナップショットアイソレーションの恩恵を受けます。また、部分更新とアップサートをサポートし、読み取り時の sort-and-merge のオーバーヘッドを回避するために、Delete-and-Insert モードの主キーインデックスを使用します。セカンダリインデックスは、高スループットのデータ更新シナリオに対応します。

インテリジェントなマテリアライズドビュー

StarRocks のマテリアライズドビューは自動的に動作します:

  • 自動同期 :ソーステーブルのデータが変更されると、対応するマテリアライズドビューが変更を検知し、リアルタイムで更新を適用して、データの一貫性を維持します

  • 透過的なクエリ書き換え :クエリ計画時に、StarRocks がマテリアライズドビューでクエリを高速化できるかどうかを検知し、クエリを自動的に書き換えます。アプリケーションの変更は不要です

  • バックグラウンドでのライフサイクル管理 :手動介入なしでマテリアライズドビューを作成および削除できます。システムがバックグラウンドで処理します

  • ETL の置き換え :マテリアライズドビューを使用して、データをその場で変換および処理し、従来の ETL (抽出、変換、ロード) パイプラインと上流の前処理を置き換えます

データレイク分析

外部カタログを使用してデータレイクを直接クエリできます。データ移行は不要です。StarRocks は次をサポートします:

  • テーブル形式 :Apache Hive、Apache Iceberg、Apache Hudi、Delta Lake

  • ファイル形式 :Parquet、ORC、CSV

  • ストレージサービス :HDFS、Amazon Simple Storage Service (S3)、Object Storage Service (OSS)

このモデルでは、データレイクが BI、AI、アドホッククエリ、レポーティングのワークロードにおける信頼できる唯一の情報源 (SSOT) として機能し、StarRocks はベクトル化実行エンジンと CBO を使用してコンピューティングと分析を担います。

Serverless StarRocks による追加機能

StarRocks をお客様自身で運用する場合は、クラスターのプロビジョニング、バージョンアップグレードの計画、セキュリティ設定、システム監視が必要です。EMR Serverless StarRocks は、こうした運用オーバーヘッドを解消します:

  • クラスター管理不要 :本サービスはフルマネージドであり、運用保守は不要です。クラスターサイジング、セットアップ、継続的なチューニングを省略できます

  • 可視化されたインスタンス管理 :EMR コンソールからインスタンスを管理し、運用保守タスクを実行できます

  • 可視化された監視 :組み込みの監視機能と運用保守ダッシュボードを提供します

  • 自動バージョンアップグレード :StarRocks のメジャーおよびマイナーバージョンが自動的にアップグレードされます

  • EMR StarRocks Manager によるエンタープライズグレードの管理

    • セキュリティ :ユーザーと権限を管理します

    • 診断分析 :低速な SQL クエリを特定し、視覚的なツールで SQL 実行を分析します

    • データ管理 :データベース、テーブル、パーティション、シャード、タスクを参照して、運用保守を効率化します

  • AI+OLAP (Beta) :OLAP 分析ワークフローで SQL から大規模言語モデルを呼び出します。単一の SQL ステートメントで、データ処理、分析、AI 推論をエンドツーエンドで実行します