すべてのプロダクト
Search
ドキュメントセンター

Hologres:データレイクの高速化

最終更新日:Aug 23, 2026

Hologres は、外部テーブルを使用して Object Storage Service (OSS) に格納されたデータの読み取りと書き込みを高速化し、クエリ効率を向上させ、データ処理を簡素化します。

背景情報

オブジェクトストレージの成熟に伴い、データレイクソリューションはクラウドネイティブアーキテクチャへと移行しています。Alibaba Cloud のレイクハウスアーキテクチャでは、OSS が統合データレイクストレージとして機能し、安全でコスト効率が高く、信頼性が高く、スケーラブルな基盤を提供します。

リアルタイムデータレイクソリューションは、レイクハウスアーキテクチャ内でのストリーミングおよびリアルタイムデータ処理に焦点を当てています。Hologres は、リアルタイムの書き込み、更新、分析をサポートします。Data Lake Formation (DLF)、Hive Metastore Server (HMS)、OSS、および各種エコシステム機能と統合することで、Hologres は外部テーブルを使用して、データ移行なしで OSS 内のデータの読み取りと書き込みを高速化します。外部テーブルはデータを格納せずにフィールドをマッピングするため、開発および運用保守コストを削減し、データサイロを解消します。

次の表に、リアルタイムデータレイクソリューションで使用される Alibaba Cloud サービスの一覧を示します。

サービス

説明

参照

DLF

クラウドデータレイクおよびレイクハウスを構築するためのフルマネージドサービスです。DLF は、一元化されたメタデータ管理、一元化された権限とセキュリティ管理、および便利なデータインジェストと探索機能を提供します。

Data Lake Formation (DLF) 1.0 とは

HMS

Apache Hive のコアコンポーネントであり、Hive および Spark テーブルのメタデータ (ストレージの場所、テーブルスキーマ、テーブル名、列名、データ型、パーティション情報など) を管理します。HMS は Hive および Spark データクエリをサポートします。

Hive Metastore Server

OSS

OSS は、DLF におけるクラウドデータレイクの統合ストレージです。大量のデータとあらゆる種類のファイルを格納できる、安全でコスト効率が高く、信頼性の高いサービスです。OSS は 99.9999999999% のデータの耐久性を提供し、データレイクストレージの事実上の標準となっています。

OSS とは

OSS-HDFS (JindoFS) は、Hadoop エコシステムの計算エンジンと統合されたクラウドネイティブデータレイクストレージサービスです。HDFS API および POSIX と完全に互換性があり、Hive / Spark ベースの ETL ワークロードにおいて、ネイティブ OSS を上回るパフォーマンスを発揮します。

OSS-HDFS とは

アーキテクチャ

次の図は、推奨される Hologres データレイクアーキテクチャを示しています。データの収集とストレージから管理と活用まで、データのライフサイクル全体をカバーし、柔軟な自動スケーリングを備えたエンドツーエンドのレイクハウスソリューションを提供します。

image

統合メタデータ管理

  • DLF および HMS メタデータサービスをサポートします。

  • 外部データベースを使用した外部カタログへのワンクリックマッピングをサポートします。

  • データレイク内のメタデータ変更の自動検出と更新をサポートします。

  • DDL ステートメントを使用したデータレイク内のデータベースとテーブルの作成をサポートします。Paimon に対応しています。

統合コンピューティングリソースと利用パターン

  • レイクハウスデータの階層化と処理に Dynamic Table を使用します。

  • データレイク内のデータの高性能 OLAP 分析と書き戻しをサポートします。

  • リソースの弾力性と分離のために仮想ウェアハウスインスタンスを使用します。

  • 所有コストゼロで従量課金のサーバーレスタスクをサポートします。

  • 主要な BI ツールと統合します。

オープンレイクハウスフォーマットのサポート

  • Paimon、Iceberg、Hudi、Delta、ORC、Parquet レイクテーブルのクエリ高速化をサポートします。

  • Paimon、Iceberg、ORC、Parquet フォーマットでの書き戻しをサポートします。

注意事項

Hologres は、外部データソースをマッピングするための次の方法を提供します。

マッピング方法

構文

説明

サポートされるデータソース

バージョン要件

シナリオ

CREATE EXTERNAL DATABASE

Hologres インスタンス上に外部データベースを作成し、外部データソースからメタデータを読み込みます。これにより、レイクハウスアーキテクチャにおける内部データと外部データの一元管理が可能になります。

  • DLF 1.0

  • DLF 2.0

  • MaxCompute

V3.0

外部データソースのカタログからデータベース全体とそのすべてのテーブルを Hologres にマッピングします。

FOREIGN TABLE

IMPORT FOREIGN SCHEMA

Hologres スキーマ内に複数の外部テーブルを一度に作成し、外部データソースからテーブルを自動的にマッピングします。

  • DLF 1.0

  • DLF 2.0

  • HMS

  • MaxCompute

  • Hologres

V0.8

外部データソースのデータベースまたはスキーマ内のすべてのテーブルを Hologres スキーマにマッピングします。

CREATE FOREIGN TABLE

Hologres 内に外部テーブルを手動で作成し、外部データソースからテーブルまたは特定のフィールドをマッピングします。

  • DLF 1.0

  • DLF 2.0

  • HMS

  • MaxCompute

  • Hologres

V0.8

特定のテーブルまたはフィールドを Hologres にマッピングします。

テーブルフォーマットとファイルフォーマット

テーブルフォーマット

テーブルフォーマット

サポートされるバージョン

サポートされる圧縮方式

Hudi

Hologres V1.3 以降でデータ読み取りをサポート

  • UNCOMPRESSED

  • GZIP

  • SNAPPY

  • BROTLI

  • LZ4

  • ZSTD

  • LZ4_RAW

  • None

  • ZLIB

Delta Lake

Hologres V1.3 以降でデータ読み取りをサポート

  • UNCOMPRESSED

  • GZIP

  • SNAPPY

  • BROTLI

  • LZ4

  • ZSTD

  • LZ4_RAW

Apache Paimon

  • Hologres V2.1 以降でデータ読み取りをサポート

  • Hologres V3.0 以降で、DLF 2.0 ベースのレイクテーブルからのデータ読み取りおよび Apache Paimon 追加専用テーブルへのデータ書き込みをサポート

  • PARQUET

    • UNCOMPRESSED

    • SNAPPY

    • GZIP

    • LZO

    • BROTLI

    • LZ4

    • ZSTD

  • ORC

    • NONE

    • ZLIB

    • SNAPPY

    • LZO

    • LZ4

Iceberg

Hologres V3.0 で、DLF 1.0 および HMS ベースの V1 および V2 の Iceberg テーブルからのデータ読み取りをサポート

  • PARQUET

    • UNCOMPRESSED

    • SNAPPY

    • GZIP

    • LZO

    • BROTLI

    • LZ4

    • ZSTD

  • ORC

    • NONE

    • ZLIB

    • SNAPPY

    • LZO

    • LZ4

ファイルフォーマット

ファイルフォーマット

サポートされるバージョン

サポートされる圧縮方式

CSV

Hologres V1.3 以降でデータ読み取りと書き込みをサポート

COMPRESSION_CODEC

  • BZip2Codec

  • DefaultCodec

  • GzipCodec

  • SnappyCodec

Parquet

Hologres V1.3 以降でデータ読み取りと書き込みをサポート

  • UNCOMPRESSED

  • GZIP

  • SNAPPY

  • BROTLI

  • LZ4

  • ZSTD

  • LZ4_RAW

ORC

Hologres V1.3 以降でデータ読み取りと書き込みをサポート

  • None

  • ZLIB

  • SNAPPY

SequenceFile

Hologres V1.3 以降でデータ読み取りと書き込みをサポート

  • COMPRESSION_CODEC

    • BZip2Codec

    • DefaultCodec

    • GzipCodec

    • SnappyCodec

  • COMPRESSION_TYPE

    • NONE

    • RECORD

    • BLOCK

データ型のマッピング

DLF から Hologres へのデータ型のマッピングについては、「データ型の概要」をご参照ください。

機能概要

  • Hologres V1.1 以降では、OSS から ORC、Parquet、CSV、SequenceFile データを読み取ることができます。Hologres V1.3 以降では、これらのフォーマットのデータを OSS に書き込むことができ、また OSS 内の Apache Hudi または Delta Lake テーブルを読み取ることができます。

    説明

    Hologres インスタンスのバージョンは、Hologres コンソールのインスタンス詳細ページで確認できます。インスタンスのバージョンが V1.1 より前の場合は、コンソールでアップグレードするか、Hologres DingTalk グループにお問い合わせください。手動でアップグレードする場合は、「インスタンスのアップグレード」をご参照ください。DingTalk グループに参加するには、「Hologres のオンラインサポートを受ける」をご参照ください。

  • Hologres V1.3.25 以降では、DLF マルチカタログ機能により、テスト、開発、および部門間のインスタンスでメタデータを分離し、ビジネスのセキュリティを確保します。詳細については、「Catalog」をご参照ください。

  • Hologres V1.3.26 以降では、OSS-HDFS 内のデータの読み取りと書き込みが可能です。Hologres は Hadoop エコシステムの計算エンジンと統合され、OSS-HDFS 内のデータのリアルタイム分析を高速化し、ビッグデータおよび AI ワークロード向けのデータレイク間の連合クエリをサポートします。

  • Hologres V2.1.0 以降では、Apache Paimon 外部テーブルを読み取ることができます。Apache Paimon は、ストリーミングおよびバッチ処理のための統合レイクストレージプラットフォームであり、高スループットの書き込みと低レイテンシのクエリをサポートし、データレイクでのリアルタイムデータフローを実現します。ユーザーは Apache Paimon を使用して、リアルタイムおよびオフラインのデータレイク処理を統合できます。詳細については、「Apache Paimon」をご参照ください。

  • Hologres V2.2 以降では、新しい外部テーブルアーキテクチャにより、HQE が SSD ベースのキャッシュ高速化により ORC および Parquet ファイルを直接読み取り、パフォーマンスが 5 倍以上向上します。HMS を使用して OSS および OSS-HDFS 内のデータにアクセスできます。詳細については、「Hive Metastore を使用した OSS データへのアクセス (ベータ版)」をご参照ください。

    説明

    Hologres インスタンスが V2.1 以前の場合は、Hologres テクニカルサポートにお問い合わせの上、アップグレードしてください。

  • Hologres V3.0 以降では、次の機能が追加されました。

    • 外部データベースは、DLF および MaxCompute データソースのカタログレベルのメタデータマッピングをサポートし、データレイクのメタデータとデータ管理機能を向上させます。詳細については、「CREATE EXTERNAL DATABASE」をご参照ください。

    • 外部スキーマおよび外部テーブルにより、DLF カタログ内にデータベースとテーブルを作成し、集約されたデータの書き戻しを行うことができます。詳細については、「CREATE EXTERNAL SCHEMA」および「CREATE EXTERNAL TABLE」をご参照ください。

    • レイクとウェアハウス間のデータ転送のための Apache Paimon 追加専用テーブルへの高性能書き込みに対応。

    • Paimon 削除ベクトル最適化により、コンパクション前に大量の削除が発生した場合のクエリパフォーマンスが向上します。

    • 再構築された Delta Lake リーダーにより、読み取りパフォーマンスが大幅に向上します。

    • Iceberg ベースのデータレイク読み取りにより、データレイクエコシステムが拡張されます。

    • HMS メタデータマッピングにより、EMR クラスター内のデータクエリが高速化されます。詳細については、「HMS を使用した OSS データレイクへのアクセス (ベータ版)」をご参照ください。

    • セキュリティの強化:DLF 2.0 でのアクセスでは、デフォルトでサービスリンクロールが使用され、オプションで RAM ロールによるアクセスも使用できます。