Best Practices for Spark Big Data Processing

オープンソースビッグデータコミュニティ - Alibaba Cloud EMR シリーズライブ配信 フェーズ 11

主題: Spark ビッグデータ処理ベストプラクティス

講師: Jian Feng, Alibaba Cloud EMR データ開発プラットフォーム責任者

コンテンツフレームワーク:

・ビッグデータ概要

・技術初心者からの脱却方法

・Spark SQL 学習フレームワーク

・EMR Studio でのビッグデータベストプラクティス

ライブ再生: 記事下部の QR コードをスキャンして DingTalk グループに参加して再生を視聴するか、次のリンクにアクセスしてください https://developer.aliyun.com/live/247072

1. ビッグデータ概要

・ビッグデータ処理 ETL (データ -> データ)

・ビッグデータ分析 BI (データ -> ダッシュボード)

・機械学習 AI (データ -> モデル)

2. 技術初心者からの脱却方法

技術初心者とは?

・表面的な理解だけで、本質を理解していない

たとえば、他の人の Spark コードを参照するだけで、Spark の内部メカニズムを知らず、Spark ジョブのチューニング方法を知らない状態

技術初心者からの脱却のための処方箋

・動作メカニズムを理解する

・設定方法を学ぶ

・ログの確認方法を学ぶ

動作メカニズムを理解する: Spark SQL アーキテクチャ

設定方法を学ぶ: Spark App の設定方法

・ドライバーの設定

・spark.driver.memory

・spark.driver.cores

・エグゼキュータの設定

・spark.executor.memory

・spark.executor.cores

・ランタイムの設定

・spark.files

・spark.jars

・DAE の設定

・…..........



リファレンスサイト: https://spark.apache.org/docs/latest/configuration.html

ログの確認方法を学ぶ: Spark ログ

3. Spark SQL 学習フレームワーク

Spark SQL 学習フレームワーク (グラフィックス/ジオメトリと連動)

1. 行の選択

2. 列の選択

3. 列の変換

4. グループ化 / 集約

5. 結合

Spark SQL 実行計画

1. Spark SQL - Where

2. Spark SQL - Group By

3. Spark SQL - Order by

4. EMR Studio 実践

EMR Studio の特徴:

・オープンソースコンポーネントとの互換性

・複数のクラスターへの接続サポート

・複数のコンピューティングエンジンへの適応

・インタラクティブ開発 + ジョブスケジューリングのシームレスな連携

・多様なビッグデータアプリケーションシナリオに対応

・コンピューティングとストレージの分離

1. オープンソースコンポーネントとの互換性

・EMR Studio は、オープンソースソフトウェア Apache Zeppelin、Jupyter Notebook、Apache Airflow をベースに最適化と拡張が施されています。

2. 複数のクラスターへの接続サポート

・1 つの EMR Studio から複数の EMR コンピューティングクラスターに接続できます。コンピューティングクラスターを簡単に切り替え、異なるクラスターにジョブを送信して実行できます。

3. 複数のコンピューティングエンジンへの適応

・Hive、Spark、Flink、Presto、Impala、Shell などの複数のコンピューティングエンジンに複雑な設定なしで自動適応し、複数のコンピューティングエンジンが連携して動作します。

4. インタラクティブ開発 + ジョブスケジューリングのシームレスな連携

Notebook + Airflow: 開発と本番環境のスケジューリングをシームレスに連携

・インタラクティブ開発モードでは、オペレーションの正確性を素早く検証できます。

・Airflow で Notebook ジョブをスケジューリングすることで、開発環境と本番環境の一貫性を最大限に確保し、開発と本番環境の差異に起因する問題を防止します。

5. 多様なビッグデータアプリケーションシナリオに対応

・ビッグデータ処理 ETL

・インタラクティブなデータ分析

・機械学習

・リアルタイムコンピューティング

6. コンピューティングとストレージの分離

・すべてのデータは OSS に保存されます。これには以下が含まれます:

・ユーザーの Notebook コード

・スケジューリングジョブのログ

・クラスターが破棄された場合でも、クラスターを再構築してデータを簡単に復元できます。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.