EMR Spark on ACK Product Introduction
オープンソースビッグデータコミュニティ & Alibaba Cloud EMR シリーズ第 6 回ライブ放送
テーマ:EMR Spark on ACK のプロダクトデモとベストプラクティス
講師:Shi Lei、Alibaba Cloud EMR チームの技術エキスパート
コンテンツ構成:
• 雲源バイオケミカルの課題と Alibaba の取り組み
• Spark コンテナ化スキーム
• プロダクト概要とデモ
ライブ再生:記事下部の QR コードをスキャンしてピングループに参加し、再生を視聴するか、リンク https://developer.aliyun.com/live/246868 にアクセスしてください。
1. 雲源バイオケミカルの課題と Alibaba の取り組み
ビッグデータ技術の発展動向
雲源バイオケミカルが直面する課題
ストレージとコンピューティングの分離
オブジェクトストレージベースの HCFS ファイルシステムの構築方法
• 既存の HDFS との完全互換
• HDFS と同等のパフォーマンス、コスト削減
シャッフル
ACK での異種混在モデルの解決方法
• 異種混在モデルにはローカルディスクがない
• コミュニティ [SPARK-25299] の議論により、Spark の動的リソース対応が業界の共通認識に
キャッシュ
クロスデータセンターおよび専用回線ハイブリッドクラウドの効果的なサポート方法
• コンテナ内でのキャッシュシステムのサポートが必要
ACK スケジューリング
スケジューリングのパフォーマンスボトルネックの解決方法
• YARN と同等のパフォーマンス
• 多階層キュー管理
その他
• ピークシフトスケジューリング
• Yarn on ACK ノード間のリソース相互認識
Alibaba の取り組み - EMR on ACK
全体構成の概要
• データ開発クラスター / スケジューリングプラットフォームを通じて異なる実行プラットフォームに投入
• ピークシフトスケジューリングで、ビジネスのピーク・オフピーク戦略に応じて調整
• クラウドネイティブデータレイクアーキテクチャで、ACK の高い伸縮性を活用
• 専用回線によるクラウド上とクラウド外のハイブリッドスケジューリング
• ACK による異種混在クラスターの管理で、優れた柔軟性を発揮
2. Spark コンテナ化スキーム
スキーム概要
RSS Q&A
1. Remote Shuffle Service が必要な理由は?
• RSS により、Spark ジョブで Executor Pod にクラウドディスクをマウントする必要がなくなります。クラウドディスクのマウントはスケーラビリティや大規模な本番運用に不利です。
• クラウドディスクのサイズを事前に決定できません。大きすぎると無駄になり、小さすぎると失敗します。RSS はストレージとコンピューティングの分離シナリオに特化して設計されています。
• Executor はシャッフルデータを RSS システムに書き込み、RSS がデータを管理します。アイドル時に Executor をリサイクルできます。[SPARK-25299]
• 動的リソースを完全にサポートでき、データスキューによるロングテールタスクが Executor リソースの解放を妨げることを回避できます。
2. RSS のパフォーマンス、コスト、スケーラビリティは?
• RSS はシャッフルに特化して深く最適化されており、ストレージとコンピューティングの分離シナリオおよび K8s の弾力シナリオに特化して設計されています。
• シャッフルフェッチステージでは、リデュースステージでのランダム読み取りをシーケンシャル読み取りに変更でき、ジョブの安定性とパフォーマンスを大幅に向上させます。
• 元の K8s クラスター内のディスクを直接デプロイに使用でき、シャッフル用に追加のクラウドディスクを追加する必要がありません。コスト効率に優れ、デプロイ方法も柔軟です。
Spark Shuffle
• numMapper * numReducer 個のブロックを生成
• シーケンシャル書き込み、ランダム読み取り
• 書き込み時にスピル発生
• 単一コピー、データ損失時にステージの再計算が必要
EMR Remote Shuffle Service
• 追加書き込みとシーケンシャル読み取り
• 書き込み時にスピルなし
• 2 コピー、メモリへのコピー
• レプリカはイントラネット経由でバックアップされ、パブリック帯域幅は不要
RSS TeraSort ベンチマーク
• 注:10 TB TeraSort を例にとると、シャッフルボリュームは圧縮後約 5.6 TB です。RSS シナリオでは、シャッフル読み取りがシーケンシャル読み取りに変更されるため、この規模のジョブのパフォーマンスが大幅に向上することがわかります。
テーマ:EMR Spark on ACK のプロダクトデモとベストプラクティス
講師:Shi Lei、Alibaba Cloud EMR チームの技術エキスパート
コンテンツ構成:
• 雲源バイオケミカルの課題と Alibaba の取り組み
• Spark コンテナ化スキーム
• プロダクト概要とデモ
ライブ再生:記事下部の QR コードをスキャンしてピングループに参加し、再生を視聴するか、リンク https://developer.aliyun.com/live/246868 にアクセスしてください。
1. 雲源バイオケミカルの課題と Alibaba の取り組み
ビッグデータ技術の発展動向
雲源バイオケミカルが直面する課題
ストレージとコンピューティングの分離
オブジェクトストレージベースの HCFS ファイルシステムの構築方法
• 既存の HDFS との完全互換
• HDFS と同等のパフォーマンス、コスト削減
シャッフル
ACK での異種混在モデルの解決方法
• 異種混在モデルにはローカルディスクがない
• コミュニティ [SPARK-25299] の議論により、Spark の動的リソース対応が業界の共通認識に
キャッシュ
クロスデータセンターおよび専用回線ハイブリッドクラウドの効果的なサポート方法
• コンテナ内でのキャッシュシステムのサポートが必要
ACK スケジューリング
スケジューリングのパフォーマンスボトルネックの解決方法
• YARN と同等のパフォーマンス
• 多階層キュー管理
その他
• ピークシフトスケジューリング
• Yarn on ACK ノード間のリソース相互認識
Alibaba の取り組み - EMR on ACK
全体構成の概要
• データ開発クラスター / スケジューリングプラットフォームを通じて異なる実行プラットフォームに投入
• ピークシフトスケジューリングで、ビジネスのピーク・オフピーク戦略に応じて調整
• クラウドネイティブデータレイクアーキテクチャで、ACK の高い伸縮性を活用
• 専用回線によるクラウド上とクラウド外のハイブリッドスケジューリング
• ACK による異種混在クラスターの管理で、優れた柔軟性を発揮
2. Spark コンテナ化スキーム
スキーム概要
RSS Q&A
1. Remote Shuffle Service が必要な理由は?
• RSS により、Spark ジョブで Executor Pod にクラウドディスクをマウントする必要がなくなります。クラウドディスクのマウントはスケーラビリティや大規模な本番運用に不利です。
• クラウドディスクのサイズを事前に決定できません。大きすぎると無駄になり、小さすぎると失敗します。RSS はストレージとコンピューティングの分離シナリオに特化して設計されています。
• Executor はシャッフルデータを RSS システムに書き込み、RSS がデータを管理します。アイドル時に Executor をリサイクルできます。[SPARK-25299]
• 動的リソースを完全にサポートでき、データスキューによるロングテールタスクが Executor リソースの解放を妨げることを回避できます。
2. RSS のパフォーマンス、コスト、スケーラビリティは?
• RSS はシャッフルに特化して深く最適化されており、ストレージとコンピューティングの分離シナリオおよび K8s の弾力シナリオに特化して設計されています。
• シャッフルフェッチステージでは、リデュースステージでのランダム読み取りをシーケンシャル読み取りに変更でき、ジョブの安定性とパフォーマンスを大幅に向上させます。
• 元の K8s クラスター内のディスクを直接デプロイに使用でき、シャッフル用に追加のクラウドディスクを追加する必要がありません。コスト効率に優れ、デプロイ方法も柔軟です。
Spark Shuffle
• numMapper * numReducer 個のブロックを生成
• シーケンシャル書き込み、ランダム読み取り
• 書き込み時にスピル発生
• 単一コピー、データ損失時にステージの再計算が必要
EMR Remote Shuffle Service
• 追加書き込みとシーケンシャル読み取り
• 書き込み時にスピルなし
• 2 コピー、メモリへのコピー
• レプリカはイントラネット経由でバックアップされ、パブリック帯域幅は不要
RSS TeraSort ベンチマーク
• 注:10 TB TeraSort を例にとると、シャッフルボリュームは圧縮後約 5.6 TB です。RSS シナリオでは、シャッフル読み取りがシーケンシャル読み取りに変更されるため、この規模のジョブのパフォーマンスが大幅に向上することがわかります。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
