Innovation Motive Force behind Data Lake 3.0 Cost Reduction and Efficiency Enhancement
2022 年 3 月 31 日、Alibaba Cloud Global Data Lake Summit において、Alibaba Cloud は「Data Lake 3.0」の大規模アップグレード計画を「レイク管理、レイクストレージ、レイクコンピューティング」の 3 つの側面から発表しました。200 日以上をかけて準備されたクラウドハビタットカンファレンスにおいて、Alibaba Cloud Storage のデータレイクへのアクセス能力がさらに向上しました。
データレイクは、さまざまな種類のデータを一元化する統合ストレージプラットフォームであり、スケーラブルな容量とスループットを提供し、幅広いデータソースをカバーし、複数のコンピューティングエンジンや分析エンジンがデータに直接アクセスすることをサポートします。細粒度の権限付与や監査などの機能を実現し、データ分析、機械学習、データアクセス、管理などをサポートします。
データレイクを企業のデータストレージと管理のソリューションとして選択する企業が増加しており、同時にデータレイクの適用範囲も拡大しています。各業界でクラウド上にデータレイクを構築し、初期のシンプルな分析から、インターネット検索の最適化や詳細な分析、そして近年の大規模 AI トレーニングに至るまで、すべてデータレイクアーキテクチャを基盤としています。
1、ストレージとコンピューティングの分離、データのホット/コールド階層化のインテリジェント化
現在、クラウド上のデータレイク規模が 100 PB を超える Alibaba Cloud の顧客が多数存在し、データレイクベースのデータ分析アーキテクチャが今後の避けられないトレンドであることが予測されます。では、なぜこのようなアーキテクチャが必要なのでしょうか。
Alibaba Group の研究員で Alibaba Cloud Intelligence のシニアプロダクトディレクターである Alex Chen 氏は、その理由について、企業は常にデータを生成し続けており、そのデータを分析して価値を引き出す必要があるからだと考えています。データ分析はリアルタイム分析と探索的分析に分けられます。リアルタイム分析は既知のデータを使って既知の質問に答えるものです。探索的分析は既知のデータを使って未知の質問に答えるものであり、事前にすべてのデータを保存する必要があり、それに伴うストレージコストが増加します。
ストレージコストを削減するため、Alibaba Cloud はストレージとコンピューティングを分離するアーキテクチャを採用し、それぞれを独立してスケーリングできるようにしました。データはデータレイクに格納され、コンピューティングエンジンは必要に応じて拡張できます。このデカップリングにより、コスト効率を最大化できます。Alibaba Cloud Object Storage Service (OSS) はデータレイクの統合ストレージレイヤーとして、多様なビジネスアプリケーションやコンピューティング分析プラットフォームとの接続をサポートします。
クラウドハビタットカンファレンスにおいて、Alibaba Cloud Storage はオブジェクトストレージ OSS のディープコールドアーカイブストレージを正式に発表しました。これは 0.0075 元 / GB / 月という業界最低コストのクラウドストレージタイプです。最終アクセス時刻に基づくライフサイクルルールを使用することで、サーバー側で最終アクセス時刻に応じてホットデータとコールドデータを自動的に識別し、データの階層化ストレージを実現できます。バケット内に多数のオブジェクトがある場合でも、各オブジェクトとファイルに対して最終更新日時または最終アクセス日時を基準に個別にライフサイクル管理を実行できます。
OSS のアーカイブストレージまたはコールドアーカイブストレージのオブジェクトは、復元 (Restore) 操作後にのみ読み取ることができます。アーカイブタイプのオブジェクトの復元には通常数分かかります。コールドアーカイブタイプのオブジェクトの復元は、復元の優先度に応じて通常数時間かかり、ユーザーにとって大きな負担となります。
ユーザーがアーカイブストレージ/コールドアーカイブストレージを直接読み取れるようにするため、オブジェクトストレージ OSS はアーカイブ直接読み取り機能を追加し、復元なしでデータに直接アクセスできるようになりました。同時に、データライフサイクル管理ポリシーと OSS ディープコールドアーカイブストレージを活用したコスト削減と効率化により、データレイク全体のコストを 95% 削減できます。
2、マルチプロトコル互換、1 つのデータで複数のアプリケーションをサポート
AI、IoT、クラウドネイティブ技術の発展に伴い、非構造化データ処理の需要がますます高まっています。クラウド上のオブジェクトストレージを統合ストレージとして使用する傾向が顕著になっています。Hadoop システムは徐々に HDFS から S3 や OSS などのクラウドストレージへと移行し、統合ストレージのためのデータレイクシステムとして進化しています。現在、データレイクは 3.0 時代に突入しています。ストレージ面では、オブジェクトストレージを中心にマルチプロトコルの完全互換と統合メタデータ管理を実現。管理面では、レイクストレージ + コンピューティングに対応したワンストップのレイク構築と管理により、インテリジェントな「レイク構築」と「レイクガバナンス」を実現しています。
Alibaba Cloud Intelligence のシニアプロダクトエキスパートである Peng Yaxiong 氏は、Data Lake 3.0 アーキテクチャが HDFS と完全に互換性のあるサービス機能を提供すると指摘しています。ユーザーはメタデータ管理クラスターを構築することなく、自作の HDFS からデータレイクアーキテクチャへ簡単に移行できます。同時に、ネイティブでマルチプロトコルアクセス機能と複数メタデータの統合管理を備え、HDFS とオブジェクトストレージの基盤層のシームレスな統合を実現し、複数のエコシステム間でデータを効率的かつ一様に流入、管理、使用でき、ユーザーのビジネスイノベーションの加速を支援します。100 Gbps / PB の読み書き能力により、データ処理効率をさらに向上できます。
データ分析アーキテクチャのエンジンは進化を続けています。AI や自動運転のシナリオでは、1 つのデータを複数のアプリケーションで共有する必要があります。クラウドデータレイクの統合ストレージ基盤として、OSS は低コストで信頼性の高い大容量データストレージを提供します。ファイルストレージ CPFS とオブジェクトストレージ OSS は深い統合を実現しています。推論やシミュレーションなどの高性能な操作が必要な場合、CPFS は OSS 内のデータへの高速アクセスと分析を実現し、オンデマンドのデータフローとブロックレベルの Lazyload を実現します。
さらに、ファイルストレージ CPFS は POSIX クライアントまたは NFS クライアントを通じたファイルシステムのマウントとアクセスをサポートし、これら 2 種類のクライアント間の相互アクセスをサポートすることで、大量の小さなファイルにも圧迫感なくアクセスできます。
3、クラウドとオンプレミスの接続、ビジネスの俊敏性とイノベーション
クラウドコンピューティングの活発な発展に伴い、IT システムインフラの多くがクラウドに移行し、データは企業のデータセンターから離れた場所に存在するようになりました。統計によると、データの 80% はデータセンター外部で生成されています。このため、企業データは RESTful API、HTTP、または VPN を通じて、自社のデータセンターまたはクラウドへ転送できます。
データレイクを構築する際は、まず DLF を使ってデータレイクを構築し、データ入力とメタデータ管理を完了します。次に Simple Log Service (SLS) を使ってグローバルデータをデータレイク内の OSS へリアルタイムで配信し、OSS の機能を最大限に活用してデータのホット/コールド階層化を実現することで、データレイクソリューション全体としてコスト削減と効率化を達成できます。
データ管理を容易にするため、クラウドとオンプレミスデータセンターには統一された名前空間だけでなく、データの相互運用性も必要です。データの連携が実現されれば、コンピューティング能力をオンラインからクラウドへいつでも移行でき、オンデマンドで分散配置できます。もちろん、これらを実現する前提は、従来のアプリケーションと新しいアプリケーション (IoT、ビッグデータ、AI) のデータを統合できることです。ハイブリッドクラウド IT アーキテクチャによるシームレスなクラウドデプロイは、既に企業アプリケーションの新たな標準となっています。ハイブリッドクラウドストレージはオンプレミスデータセンターとパブリッククラウドを結ぶブリッジとなり、データレイク全体の計画に不可欠な要素となっています。
データレイクは将来を見据えたビッグデータアーキテクチャです。ファイルとオブジェクトを統合し、ホットデータとコールドデータをインテリジェントに階層化し、クラウドとオンプレミス間のデータを連携できるデータレイクこそが、将来性の広いデータレイクです。現在、Alibaba Cloud Data Lake 3.0 ソリューションはインターネット、金融、教育、ゲームなどの最先端技術分野で実装されており、AI、IoT、自動運転など大量のデータを扱うシナリオの業界で広く活用されています。今後、Alibaba Cloud はパートナー企業と協力し、クラウドネイティブなデータレイクをより多くの企業に浸透させ、デジタルイノベーションの推進を支援していきます。
データレイクは、さまざまな種類のデータを一元化する統合ストレージプラットフォームであり、スケーラブルな容量とスループットを提供し、幅広いデータソースをカバーし、複数のコンピューティングエンジンや分析エンジンがデータに直接アクセスすることをサポートします。細粒度の権限付与や監査などの機能を実現し、データ分析、機械学習、データアクセス、管理などをサポートします。
データレイクを企業のデータストレージと管理のソリューションとして選択する企業が増加しており、同時にデータレイクの適用範囲も拡大しています。各業界でクラウド上にデータレイクを構築し、初期のシンプルな分析から、インターネット検索の最適化や詳細な分析、そして近年の大規模 AI トレーニングに至るまで、すべてデータレイクアーキテクチャを基盤としています。
1、ストレージとコンピューティングの分離、データのホット/コールド階層化のインテリジェント化
現在、クラウド上のデータレイク規模が 100 PB を超える Alibaba Cloud の顧客が多数存在し、データレイクベースのデータ分析アーキテクチャが今後の避けられないトレンドであることが予測されます。では、なぜこのようなアーキテクチャが必要なのでしょうか。
Alibaba Group の研究員で Alibaba Cloud Intelligence のシニアプロダクトディレクターである Alex Chen 氏は、その理由について、企業は常にデータを生成し続けており、そのデータを分析して価値を引き出す必要があるからだと考えています。データ分析はリアルタイム分析と探索的分析に分けられます。リアルタイム分析は既知のデータを使って既知の質問に答えるものです。探索的分析は既知のデータを使って未知の質問に答えるものであり、事前にすべてのデータを保存する必要があり、それに伴うストレージコストが増加します。
ストレージコストを削減するため、Alibaba Cloud はストレージとコンピューティングを分離するアーキテクチャを採用し、それぞれを独立してスケーリングできるようにしました。データはデータレイクに格納され、コンピューティングエンジンは必要に応じて拡張できます。このデカップリングにより、コスト効率を最大化できます。Alibaba Cloud Object Storage Service (OSS) はデータレイクの統合ストレージレイヤーとして、多様なビジネスアプリケーションやコンピューティング分析プラットフォームとの接続をサポートします。
クラウドハビタットカンファレンスにおいて、Alibaba Cloud Storage はオブジェクトストレージ OSS のディープコールドアーカイブストレージを正式に発表しました。これは 0.0075 元 / GB / 月という業界最低コストのクラウドストレージタイプです。最終アクセス時刻に基づくライフサイクルルールを使用することで、サーバー側で最終アクセス時刻に応じてホットデータとコールドデータを自動的に識別し、データの階層化ストレージを実現できます。バケット内に多数のオブジェクトがある場合でも、各オブジェクトとファイルに対して最終更新日時または最終アクセス日時を基準に個別にライフサイクル管理を実行できます。
OSS のアーカイブストレージまたはコールドアーカイブストレージのオブジェクトは、復元 (Restore) 操作後にのみ読み取ることができます。アーカイブタイプのオブジェクトの復元には通常数分かかります。コールドアーカイブタイプのオブジェクトの復元は、復元の優先度に応じて通常数時間かかり、ユーザーにとって大きな負担となります。
ユーザーがアーカイブストレージ/コールドアーカイブストレージを直接読み取れるようにするため、オブジェクトストレージ OSS はアーカイブ直接読み取り機能を追加し、復元なしでデータに直接アクセスできるようになりました。同時に、データライフサイクル管理ポリシーと OSS ディープコールドアーカイブストレージを活用したコスト削減と効率化により、データレイク全体のコストを 95% 削減できます。
2、マルチプロトコル互換、1 つのデータで複数のアプリケーションをサポート
AI、IoT、クラウドネイティブ技術の発展に伴い、非構造化データ処理の需要がますます高まっています。クラウド上のオブジェクトストレージを統合ストレージとして使用する傾向が顕著になっています。Hadoop システムは徐々に HDFS から S3 や OSS などのクラウドストレージへと移行し、統合ストレージのためのデータレイクシステムとして進化しています。現在、データレイクは 3.0 時代に突入しています。ストレージ面では、オブジェクトストレージを中心にマルチプロトコルの完全互換と統合メタデータ管理を実現。管理面では、レイクストレージ + コンピューティングに対応したワンストップのレイク構築と管理により、インテリジェントな「レイク構築」と「レイクガバナンス」を実現しています。
Alibaba Cloud Intelligence のシニアプロダクトエキスパートである Peng Yaxiong 氏は、Data Lake 3.0 アーキテクチャが HDFS と完全に互換性のあるサービス機能を提供すると指摘しています。ユーザーはメタデータ管理クラスターを構築することなく、自作の HDFS からデータレイクアーキテクチャへ簡単に移行できます。同時に、ネイティブでマルチプロトコルアクセス機能と複数メタデータの統合管理を備え、HDFS とオブジェクトストレージの基盤層のシームレスな統合を実現し、複数のエコシステム間でデータを効率的かつ一様に流入、管理、使用でき、ユーザーのビジネスイノベーションの加速を支援します。100 Gbps / PB の読み書き能力により、データ処理効率をさらに向上できます。
データ分析アーキテクチャのエンジンは進化を続けています。AI や自動運転のシナリオでは、1 つのデータを複数のアプリケーションで共有する必要があります。クラウドデータレイクの統合ストレージ基盤として、OSS は低コストで信頼性の高い大容量データストレージを提供します。ファイルストレージ CPFS とオブジェクトストレージ OSS は深い統合を実現しています。推論やシミュレーションなどの高性能な操作が必要な場合、CPFS は OSS 内のデータへの高速アクセスと分析を実現し、オンデマンドのデータフローとブロックレベルの Lazyload を実現します。
さらに、ファイルストレージ CPFS は POSIX クライアントまたは NFS クライアントを通じたファイルシステムのマウントとアクセスをサポートし、これら 2 種類のクライアント間の相互アクセスをサポートすることで、大量の小さなファイルにも圧迫感なくアクセスできます。
3、クラウドとオンプレミスの接続、ビジネスの俊敏性とイノベーション
クラウドコンピューティングの活発な発展に伴い、IT システムインフラの多くがクラウドに移行し、データは企業のデータセンターから離れた場所に存在するようになりました。統計によると、データの 80% はデータセンター外部で生成されています。このため、企業データは RESTful API、HTTP、または VPN を通じて、自社のデータセンターまたはクラウドへ転送できます。
データレイクを構築する際は、まず DLF を使ってデータレイクを構築し、データ入力とメタデータ管理を完了します。次に Simple Log Service (SLS) を使ってグローバルデータをデータレイク内の OSS へリアルタイムで配信し、OSS の機能を最大限に活用してデータのホット/コールド階層化を実現することで、データレイクソリューション全体としてコスト削減と効率化を達成できます。
データ管理を容易にするため、クラウドとオンプレミスデータセンターには統一された名前空間だけでなく、データの相互運用性も必要です。データの連携が実現されれば、コンピューティング能力をオンラインからクラウドへいつでも移行でき、オンデマンドで分散配置できます。もちろん、これらを実現する前提は、従来のアプリケーションと新しいアプリケーション (IoT、ビッグデータ、AI) のデータを統合できることです。ハイブリッドクラウド IT アーキテクチャによるシームレスなクラウドデプロイは、既に企業アプリケーションの新たな標準となっています。ハイブリッドクラウドストレージはオンプレミスデータセンターとパブリッククラウドを結ぶブリッジとなり、データレイク全体の計画に不可欠な要素となっています。
データレイクは将来を見据えたビッグデータアーキテクチャです。ファイルとオブジェクトを統合し、ホットデータとコールドデータをインテリジェントに階層化し、クラウドとオンプレミス間のデータを連携できるデータレイクこそが、将来性の広いデータレイクです。現在、Alibaba Cloud Data Lake 3.0 ソリューションはインターネット、金融、教育、ゲームなどの最先端技術分野で実装されており、AI、IoT、自動運転など大量のデータを扱うシナリオの業界で広く活用されています。今後、Alibaba Cloud はパートナー企業と協力し、クラウドネイティブなデータレイクをより多くの企業に浸透させ、デジタルイノベーションの推進を支援していきます。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
