Best Practices for Spark Big Data Processing
オープンソースビッグデータコミュニティ - Alibaba Cloud EMR シリーズライブ配信 フェーズ 11
主題: Spark ビッグデータ処理ベストプラクティス
講師: Jian Feng, Alibaba Cloud EMR データ開発プラットフォーム責任者
コンテンツフレームワーク:
・ビッグデータ概要
・技術初心者からの脱却方法
・Spark SQL 学習フレームワーク
・EMR Studio でのビッグデータベストプラクティス
ライブ再生: 記事下部の QR コードをスキャンして DingTalk グループに参加して再生を視聴するか、次のリンクにアクセスしてください https://developer.aliyun.com/live/247072
1. ビッグデータ概要
・ビッグデータ処理 ETL (データ -> データ)
・ビッグデータ分析 BI (データ -> ダッシュボード)
・機械学習 AI (データ -> モデル)
2. 技術初心者からの脱却方法
技術初心者とは?
・表面的な理解だけで、本質を理解していない
たとえば、他の人の Spark コードを参照するだけで、Spark の内部メカニズムを知らず、Spark ジョブのチューニング方法を知らない状態
技術初心者からの脱却のための処方箋
・動作メカニズムを理解する
・設定方法を学ぶ
・ログの確認方法を学ぶ
動作メカニズムを理解する: Spark SQL アーキテクチャ
設定方法を学ぶ: Spark App の設定方法
・ドライバーの設定
・spark.driver.memory
・spark.driver.cores
・エグゼキュータの設定
・spark.executor.memory
・spark.executor.cores
・ランタイムの設定
・spark.files
・spark.jars
・DAE の設定
・…..........
リファレンスサイト: https://spark.apache.org/docs/latest/configuration.html
ログの確認方法を学ぶ: Spark ログ
3. Spark SQL 学習フレームワーク
Spark SQL 学習フレームワーク (グラフィックス/ジオメトリと連動)
1. 行の選択
2. 列の選択
3. 列の変換
4. グループ化 / 集約
5. 結合
Spark SQL 実行計画
1. Spark SQL - Where
2. Spark SQL - Group By
3. Spark SQL - Order by
4. EMR Studio 実践
EMR Studio の特徴:
・オープンソースコンポーネントとの互換性
・複数のクラスターへの接続サポート
・複数のコンピューティングエンジンへの適応
・インタラクティブ開発 + ジョブスケジューリングのシームレスな連携
・多様なビッグデータアプリケーションシナリオに対応
・コンピューティングとストレージの分離
1. オープンソースコンポーネントとの互換性
・EMR Studio は、オープンソースソフトウェア Apache Zeppelin、Jupyter Notebook、Apache Airflow をベースに最適化と拡張が施されています。
2. 複数のクラスターへの接続サポート
・1 つの EMR Studio から複数の EMR コンピューティングクラスターに接続できます。コンピューティングクラスターを簡単に切り替え、異なるクラスターにジョブを送信して実行できます。
3. 複数のコンピューティングエンジンへの適応
・Hive、Spark、Flink、Presto、Impala、Shell などの複数のコンピューティングエンジンに複雑な設定なしで自動適応し、複数のコンピューティングエンジンが連携して動作します。
4. インタラクティブ開発 + ジョブスケジューリングのシームレスな連携
Notebook + Airflow: 開発と本番環境のスケジューリングをシームレスに連携
・インタラクティブ開発モードでは、オペレーションの正確性を素早く検証できます。
・Airflow で Notebook ジョブをスケジューリングすることで、開発環境と本番環境の一貫性を最大限に確保し、開発と本番環境の差異に起因する問題を防止します。
5. 多様なビッグデータアプリケーションシナリオに対応
・ビッグデータ処理 ETL
・インタラクティブなデータ分析
・機械学習
・リアルタイムコンピューティング
6. コンピューティングとストレージの分離
・すべてのデータは OSS に保存されます。これには以下が含まれます:
・ユーザーの Notebook コード
・スケジューリングジョブのログ
・クラスターが破棄された場合でも、クラスターを再構築してデータを簡単に復元できます。
主題: Spark ビッグデータ処理ベストプラクティス
講師: Jian Feng, Alibaba Cloud EMR データ開発プラットフォーム責任者
コンテンツフレームワーク:
・ビッグデータ概要
・技術初心者からの脱却方法
・Spark SQL 学習フレームワーク
・EMR Studio でのビッグデータベストプラクティス
ライブ再生: 記事下部の QR コードをスキャンして DingTalk グループに参加して再生を視聴するか、次のリンクにアクセスしてください https://developer.aliyun.com/live/247072
1. ビッグデータ概要
・ビッグデータ処理 ETL (データ -> データ)
・ビッグデータ分析 BI (データ -> ダッシュボード)
・機械学習 AI (データ -> モデル)
2. 技術初心者からの脱却方法
技術初心者とは?
・表面的な理解だけで、本質を理解していない
たとえば、他の人の Spark コードを参照するだけで、Spark の内部メカニズムを知らず、Spark ジョブのチューニング方法を知らない状態
技術初心者からの脱却のための処方箋
・動作メカニズムを理解する
・設定方法を学ぶ
・ログの確認方法を学ぶ
動作メカニズムを理解する: Spark SQL アーキテクチャ
設定方法を学ぶ: Spark App の設定方法
・ドライバーの設定
・spark.driver.memory
・spark.driver.cores
・エグゼキュータの設定
・spark.executor.memory
・spark.executor.cores
・ランタイムの設定
・spark.files
・spark.jars
・DAE の設定
・…..........
リファレンスサイト: https://spark.apache.org/docs/latest/configuration.html
ログの確認方法を学ぶ: Spark ログ
3. Spark SQL 学習フレームワーク
Spark SQL 学習フレームワーク (グラフィックス/ジオメトリと連動)
1. 行の選択
2. 列の選択
3. 列の変換
4. グループ化 / 集約
5. 結合
Spark SQL 実行計画
1. Spark SQL - Where
2. Spark SQL - Group By
3. Spark SQL - Order by
4. EMR Studio 実践
EMR Studio の特徴:
・オープンソースコンポーネントとの互換性
・複数のクラスターへの接続サポート
・複数のコンピューティングエンジンへの適応
・インタラクティブ開発 + ジョブスケジューリングのシームレスな連携
・多様なビッグデータアプリケーションシナリオに対応
・コンピューティングとストレージの分離
1. オープンソースコンポーネントとの互換性
・EMR Studio は、オープンソースソフトウェア Apache Zeppelin、Jupyter Notebook、Apache Airflow をベースに最適化と拡張が施されています。
2. 複数のクラスターへの接続サポート
・1 つの EMR Studio から複数の EMR コンピューティングクラスターに接続できます。コンピューティングクラスターを簡単に切り替え、異なるクラスターにジョブを送信して実行できます。
3. 複数のコンピューティングエンジンへの適応
・Hive、Spark、Flink、Presto、Impala、Shell などの複数のコンピューティングエンジンに複雑な設定なしで自動適応し、複数のコンピューティングエンジンが連携して動作します。
4. インタラクティブ開発 + ジョブスケジューリングのシームレスな連携
Notebook + Airflow: 開発と本番環境のスケジューリングをシームレスに連携
・インタラクティブ開発モードでは、オペレーションの正確性を素早く検証できます。
・Airflow で Notebook ジョブをスケジューリングすることで、開発環境と本番環境の一貫性を最大限に確保し、開発と本番環境の差異に起因する問題を防止します。
5. 多様なビッグデータアプリケーションシナリオに対応
・ビッグデータ処理 ETL
・インタラクティブなデータ分析
・機械学習
・リアルタイムコンピューティング
6. コンピューティングとストレージの分離
・すべてのデータは OSS に保存されます。これには以下が含まれます:
・ユーザーの Notebook コード
・スケジューリングジョブのログ
・クラスターが破棄された場合でも、クラスターを再構築してデータを簡単に復元できます。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
