すべてのプロダクト
Search
ドキュメントセンター

E-MapReduce:ノートブック開発のクイックスタート

最終更新日:Jun 23, 2026

EMR Serverless Spark は、ノートブックを使用したインタラクティブな開発をサポートしています。このトピックでは、ノートブックの作成、実行、管理の方法について説明します。

前提条件

操作手順

ステップ 1:テストファイルの準備

ノートブックタスクをすぐに開始できるように、このクイックスタートでは、次のステップで使用できるテストファイルをダウンロード用に提供しています。

employee.csv をクリックしてテストファイルをダウンロードします。

説明

employee.csv ファイルには、従業員の名前、部署、給与のリストが含まれています。

ステップ 2:テストファイルのアップロード

データファイル (employee.csv) を Object Storage Service (OSS) コンソールにアップロードします。詳細については、「ファイルのアップロード」をご参照ください。

ステップ 3:ノートブックの開発と実行

  1. EMR Serverless Spark ページで、左側のナビゲーションウィンドウにある Development をクリックします。

  2. ノートブックを作成します。

    1. Development タブで、image アイコンをクリックします。

    2. 表示されたダイアログボックスで名前を入力し、タイプとして [インタラクティブな開発] > [ノートブック] を選択してから、OK をクリックします。

  3. 右上隅で、実行中のノートブックセッションインスタンスを選択します。

    ドロップダウンリストから Create Notebook Session を選択して、ノートブックセッションインスタンスを作成することもできます。ノートブックセッションの詳細については、「ノートブックセッションの管理」をご参照ください。

    説明

    複数のノートブックで単一のセッションインスタンスとそのリソースを共有できるため、ノートブックごとに個別のインスタンスを作成する必要はありません。

  4. データを処理し、可視化します。

    PySpark

    1. 新しいノートブックの Python セルに次のコードをコピーします。

      # 簡単な DataFrame を作成します。OSS パスをステップ 2 でアップロードしたファイルのパスに置き換えます。
      df = spark.read.option("delimiter", ",").option("header", True).csv("oss://path/to/file")
      # DataFrame の最初の数行を表示します。
      df.show(5)
      # 簡単な集約操作を実行します:各部門の給与総額を計算します。
      sum_salary_per_department = df.groupBy("department").agg({"salary": "sum"}).show()
    2. Execute All Cells をクリックしてノートブックを実行します。

      セルの横にある image アイコンをクリックして、単一のセルを実行することもできます。

      # 簡単な DataFrame を作成します。OSS パスをステップ 2 でアップロードしたファイルのパスに置き換えます。
      df = spark.read.option("delimiter", ",").option("header", True).csv("oss://<yourBucketName>/<path>/employee.csv")
      # DataFrame の最初の数行を表示します。
      df.show(5)
      +-------------+----------+------+
      |employee_name|department|salary|
      +-------------+----------+------+
      |        James|     Sales|  3000|
      |      Michael|     Sales|  4600|
      |       Robert| Marketing|  4100|
      |        Maria|   Finance|  3000|
      |        James|     Sales|  3000|
      +-------------+----------+------+
      only showing top 5 rows
      # 簡単な集約操作を実行します:各部門の給与総額を計算します。
      sum_salary_per_department = df.groupBy("department").agg({"salary": "sum"}).show()
      +----------+-----------+
      |department|sum(salary)|
      +----------+-----------+
      |     Sales|    12600.0|
      |   Finance|     6900.0|
      | Marketing|    10400.0|
      +----------+-----------+
    3. (任意) Spark UI を表示します。

      セッションのドロップダウンリストで、現在のノートブックセッションインスタンスの image アイコンにカーソルを合わせ、Spark UI をクリックして Spark ジョブに関する情報を表示します。

    可視化

    説明

    ノートブックセッションには、matplotlib、numpy、pandas ライブラリがプリインストール済みです。別のサードパーティのライブラリを使用する必要がある場合は、「ノートブックでサードパーティの Python ライブラリを使用する」をご参照ください。

    1. matplotlib ライブラリを使用してデータを可視化します。

      import matplotlib.pyplot as plt
      l = sc.parallelize(range(20)).collect()
      plt.plot(l)
      plt.ylabel('some numbers')
      plt.show()
    2. Execute All Cells をクリックしてノートブックを実行します。

      セルの横にある image アイコンをクリックして、単一のセルを実行することもできます。

      pip install matplotlib

      インストール出力:

      Looking in indexes: http://mirrors.cloud.aliyuncs.com/pypi/simple
      Collecting matplotlib
      import matplotlib.pyplot as plt
      l = sc.parallelize(range(20)).collect()
      plt.plot(l)
      plt.ylabel('some numbers')
      plt.show()

      コードが実行されると、Y 軸に「some numbers」というラベルが付いた折れ線グラフが表示されます。

ステップ 4:ノートブックの公開

  1. 実行が完了したら、右上隅の Publish をクリックします。

  2. [公開] ダイアログボックスで、必須の詳細情報を入力し、OK をクリックしてノートブックを新しいバージョンとして保存します。