クラウドネイティブなデータレイクフレームワークの主要コンポーネント
データレイクは、ビッグデータと AI コンピューティングに使用される一元化リポジトリです。構造化データと非構造化データをあらゆる規模で保存できます。Data Lake Formation (DLF) は、クラウドネイティブなデータレイクフレームワークの主要コンポーネントです。DLF を使用すると、クラウドネイティブなデータレイクを簡単に構築できます。さまざまなコンピューティングエンジンとシームレスに統合し、データレイク内のメタデータを一元的に管理してエンタープライズクラスの権限を制御できます。
⢠容易なデータ収集:構造化データ、半構造化データ、非構造化データを体系的に収集し、大規模データストレージに対応します。
⢠柔軟なアーキテクチャ:コンピューティングとストレージを分離したアーキテクチャを採用しています。低コストでオンデマンドにリソースを計画でき、変化するビジネス要件に対応するデータ処理効率を実現します。
⢠容易なデータ管理:統合データストレージを使用し、コールドデータとホットデータを個別に保存してデータのライフサイクルを管理します。クラスター間のデータコピー失敗などの運用保守上の課題を解決します。
⢠容易な価値抽出:さまざまなデータコンピューティングおよび分析プラットフォームに接続します。データサイロの課題を解決し、ビジネス価値に関するインサイトを提供します。
機能
シナリオ
シナリオ
典型的なシナリオ
Alibaba Cloud のビッグデータエコシステム (E-MapReduce、Realtime Compute for Apache Flink、Data Lake Analytics (DLA) など) 上にデータ処理・分析プラットフォームを構築する必要があります。
ストレージとコンピューティングリソースのスケールアウトが増加するデータ量に追いつかず、コスト最適化が求められます。
異なるストレージシステムのメタデータ管理が困難です。
メリット
-
メタデータ管理
DLF は複数のエンジンからメタデータを自動検出・収集し、一元的に管理してデータサイロの課題を解消します。
プロフェッショナルサービス
Alibaba Cloud のビッグデータチームがエキスパートレベルのサービスを提供します。
シナリオ
典型的なシナリオ
ビッグデータのシナリオでは、多くの場合、データレイクアーキテクチャまたはデータウェアハウスアーキテクチャが使用されます。
メリット:
データレイクアーキテクチャを使用すると、基盤となるファイルストレージシステムが開放され、柔軟なデータインジェストが可能になります。
データウェアハウスアーキテクチャを使用すると、データ処理効率、大規模データ管理、セキュリティ、コンプライアンスに関するエンタープライズクラスの要件を満たせます。
ビジネスの発展に対応するには、データレイクとデータウェアハウスの統合が必要です。DLF と Alibaba Cloud のデータウェアハウス (MaxCompute、Hologres、AnalyticDB for MySQL など) を活用してデータレイクハウスを構築できます。データレイクハウスは、データレイクとウェアハウス間でデータとコンピューティングリソースを動的に転送し、完全なビッグデータエコシステムを実現します。
メリット
-
運用保守不要
DLF はフルマネージドサービスを提供します。数回のクリックでクラウド上にデータレイクを構築できます。
高セキュリティ
DLF は統一された権限管理システムで、データベース、テーブル、カラム単位の権限を制御します。
シナリオ
典型的なシナリオ
大量のさまざまなタイプの OSS データを多次元で照会・分析する必要があります。たとえば、リアルタイム分析、OLAP クエリ、ビジネスシステムへの結果出力などです。
データクエリ時、データレイクはクラウド上の複数のコンピューティングエンジンにアクセスできます。すべてのデータをクエリシステムに転送する必要はありません。
メリット
-
リアルタイムデータインジェスト
DLF はデータをリアルタイムでデータレイクに取り込み、ビジネスの即時性を確保します。
メタデータの自動検出
DLF がデータの取得、オーケストレーション、分析用準備を自動で実行します。複雑な手動操作は不要です。
シナリオ
典型的なシナリオ
機械学習やディープラーニングのシナリオでは、データレイクが必要です。
機械学習のシナリオでは、大量のデータ、モデルトレーニングの遅延、アルゴリズム精度の低下といった課題が発生します。データレイクは成熟した機械学習プラットフォームと接続し、GPU リソースを動的に調整してコストを削減できる必要があります。
メリット
-
使いやすさ
DLF は Machine Learning Platform for AI (PAI) とシームレスに統合し、さまざまな API を提供します。
統一データクレンジング
DLF はデータレイクへのインジェスト前にデータのクレンジングと正規化を行い、PAI を使用した後続の分析を支援します。
業界シナリオ
オンライン教育
1 億人以上のユーザーを持つオンライン教育プラットフォーム
お客様の課題
教材、アプリケーションログ、学習サンプルなどのデータを一元的に保存・管理する必要があります。
オンライン教育のさまざまなシナリオで、教材再生、オフライン分析、機械学習を実装する必要があります。
お客様のメリット
DLF は OSS や多数のコンピューティングエンジンと接続でき、さまざまな分析要件に対応します。
オンラインゲーム
アジアを代表するインタラクティブエンターテインメント企業
お客様の課題
ゲームの難易度調整、アイテムドロップ率の引き下げ、リソース生産率の引き上げのためにデータ分析が必要です。これによりゲーム体験を向上させ、プレイヤーの継続率を高めます。
クラウドリソースを動的にスケールおよびアップグレードする必要があります。リソースの弾力性を確保するため、コンピューティングとストレージを分離するアーキテクチャが求められます。
お客様のメリット
DLF は、コンピューティングとストレージを分離したクラウド上のデータレイク構築を支援します。さらに、リアルタイムコンピューティングや分析エンジンとの連携により、ビジネスをリアルタイムに調整できます。
インタラクティブエンターテインメント ニューメディア
月間アクティブユーザー 1 億人以上のインターネットニューメディアプラットフォーム
お客様の課題
複数のストレージシステムのメタデータを一元的に管理する必要があります。ビジネス拡大のためにデータ共有と分析が求められます。
お客様のメリット
DLF を使用すると、異なるストレージシステムのメタデータを一元的に管理できます。DLF のメタデータディスカバリーサービスにより、データベースや Object Storage Service (OSS) バケットからデータを収集しカタログ化できます。
