Data Lake Formation

安全なデータレイクを効率的に構築するエンドツーエンドソリューション

クラウドネイティブなデータレイクフレームワークの主要コンポーネント

データレイクは、ビッグデータと AI コンピューティングに使用される一元化リポジトリです。構造化データと非構造化データをあらゆる規模で保存できます。Data Lake Formation (DLF) は、クラウドネイティブなデータレイクフレームワークの主要コンポーネントです。DLF を使用すると、クラウドネイティブなデータレイクを簡単に構築できます。さまざまなコンピューティングエンジンとシームレスに統合し、データレイク内のメタデータを一元的に管理してエンタープライズクラスの権限を制御できます。

⢠容易なデータ収集:構造化データ、半構造化データ、非構造化データを体系的に収集し、大規模データストレージに対応します。
⢠柔軟なアーキテクチャ:コンピューティングとストレージを分離したアーキテクチャを採用しています。低コストでオンデマンドにリソースを計画でき、変化するビジネス要件に対応するデータ処理効率を実現します。
⢠容易なデータ管理:統合データストレージを使用し、コールドデータとホットデータを個別に保存してデータのライフサイクルを管理します。クラスター間のデータコピー失敗などの運用保守上の課題を解決します。
⢠容易な価値抽出:さまざまなデータコンピューティングおよび分析プラットフォームに接続します。データサイロの課題を解決し、ビジネス価値に関するインサイトを提供します。

機能

  • データインジェスト

    多様なデータタイプとインジェストチャネルに対応。
    データを一元的にクレンジングできます。

  • メタデータサービス

    インテリジェントなメタデータディスカバリー
    さまざまなデータソースからメタデータを収集し、一元管理を実現します。

  • 権限管理

    エンタープライズクラスのデータ権限管理
    データベース、テーブル、フィールド単位で権限を設定できます。

  • マルチエンジンアクセス

    複数のアップストリームコンピューティングエンジンにアクセス
    エンドツーエンドのデータレイクソリューションを構築できます。

  • オープンエコシステム

    Hive メタストア互換
    複数のプログラミング言語で API を提供し、容易に統合できます。

  • データアクセラレーション

    JindoFS ベースのデータアクセラレーション
    高パフォーマンスでデータレイク分析を加速します。

シナリオ

シナリオ

典型的なシナリオ

Alibaba Cloud のビッグデータエコシステム (E-MapReduce、Realtime Compute for Apache Flink、Data Lake Analytics (DLA) など) 上にデータ処理・分析プラットフォームを構築する必要があります。
ストレージとコンピューティングリソースのスケールアウトが増加するデータ量に追いつかず、コスト最適化が求められます。
異なるストレージシステムのメタデータ管理が困難です。

メリット

  • メタデータ管理
    DLF は複数のエンジンからメタデータを自動検出・収集し、一元的に管理してデータサイロの課題を解消します。

    プロフェッショナルサービス
    Alibaba Cloud のビッグデータチームがエキスパートレベルのサービスを提供します。

シナリオ

典型的なシナリオ

ビッグデータのシナリオでは、多くの場合、データレイクアーキテクチャまたはデータウェアハウスアーキテクチャが使用されます。

メリット:
データレイクアーキテクチャを使用すると、基盤となるファイルストレージシステムが開放され、柔軟なデータインジェストが可能になります。
データウェアハウスアーキテクチャを使用すると、データ処理効率、大規模データ管理、セキュリティ、コンプライアンスに関するエンタープライズクラスの要件を満たせます。

ビジネスの発展に対応するには、データレイクとデータウェアハウスの統合が必要です。DLF と Alibaba Cloud のデータウェアハウス (MaxCompute、Hologres、AnalyticDB for MySQL など) を活用してデータレイクハウスを構築できます。データレイクハウスは、データレイクとウェアハウス間でデータとコンピューティングリソースを動的に転送し、完全なビッグデータエコシステムを実現します。

メリット

  • 運用保守不要
    DLF はフルマネージドサービスを提供します。数回のクリックでクラウド上にデータレイクを構築できます。

    高セキュリティ
    DLF は統一された権限管理システムで、データベース、テーブル、カラム単位の権限を制御します。

シナリオ

典型的なシナリオ


大量のさまざまなタイプの OSS データを多次元で照会・分析する必要があります。たとえば、リアルタイム分析、OLAP クエリ、ビジネスシステムへの結果出力などです。
データクエリ時、データレイクはクラウド上の複数のコンピューティングエンジンにアクセスできます。すべてのデータをクエリシステムに転送する必要はありません。

メリット

  • リアルタイムデータインジェスト
    DLF はデータをリアルタイムでデータレイクに取り込み、ビジネスの即時性を確保します。

    メタデータの自動検出
    DLF がデータの取得、オーケストレーション、分析用準備を自動で実行します。複雑な手動操作は不要です。

シナリオ

典型的なシナリオ

機械学習やディープラーニングのシナリオでは、データレイクが必要です。
機械学習のシナリオでは、大量のデータ、モデルトレーニングの遅延、アルゴリズム精度の低下といった課題が発生します。データレイクは成熟した機械学習プラットフォームと接続し、GPU リソースを動的に調整してコストを削減できる必要があります。

メリット

  • 使いやすさ
    DLF は Machine Learning Platform for AI (PAI) とシームレスに統合し、さまざまな API を提供します。

    統一データクレンジング
    DLF はデータレイクへのインジェスト前にデータのクレンジングと正規化を行い、PAI を使用した後続の分析を支援します。

業界シナリオ

オンライン教育

1 億人以上のユーザーを持つオンライン教育プラットフォーム

お客様の課題
教材、アプリケーションログ、学習サンプルなどのデータを一元的に保存・管理する必要があります。
オンライン教育のさまざまなシナリオで、教材再生、オフライン分析、機械学習を実装する必要があります。

お客様のメリット
DLF は OSS や多数のコンピューティングエンジンと接続でき、さまざまな分析要件に対応します。

オンラインゲーム

アジアを代表するインタラクティブエンターテインメント企業

お客様の課題
ゲームの難易度調整、アイテムドロップ率の引き下げ、リソース生産率の引き上げのためにデータ分析が必要です。これによりゲーム体験を向上させ、プレイヤーの継続率を高めます。
クラウドリソースを動的にスケールおよびアップグレードする必要があります。リソースの弾力性を確保するため、コンピューティングとストレージを分離するアーキテクチャが求められます。

お客様のメリット
DLF は、コンピューティングとストレージを分離したクラウド上のデータレイク構築を支援します。さらに、リアルタイムコンピューティングや分析エンジンとの連携により、ビジネスをリアルタイムに調整できます。

インタラクティブエンターテインメント ニューメディア

月間アクティブユーザー 1 億人以上のインターネットニューメディアプラットフォーム

お客様の課題
複数のストレージシステムのメタデータを一元的に管理する必要があります。ビジネス拡大のためにデータ共有と分析が求められます。

お客様のメリット
DLF を使用すると、異なるストレージシステムのメタデータを一元的に管理できます。DLF のメタデータディスカバリーサービスにより、データベースや Object Storage Service (OSS) バケットからデータを収集しカタログ化できます。

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.