すべてのプロダクト
Search
ドキュメントセンター

Elastic Compute Service:Hadoop 環境の構築

最終更新日:Aug 27, 2026

Elastic Compute Service (ECS) Linux インスタンスに分散型または疑似分散型の Hadoop クラスターをデプロイし、ビッグデータの保存と処理を行います。

背景情報

Apache Hadoop は、コンピュータークラスター間で大規模なデータセットを分散処理するためのフレームワークです。単一のサーバーから数千台のマシンまで拡張でき、各マシンがローカルでの計算とストレージを提供します。Hadoop はアプリケーション層で障害を検出し、処理することで、ハードウェアの冗長性に依存することなく高可用性を実現します。

Hadoop のコアコンポーネントは、Hadoop 分散ファイルシステム (HDFS) と MapReduce です:

  • HDFS:アプリケーションデータを保存および読み取りするための分散ファイルシステムです。

  • MapReduce:タスクを Map フェーズと Reduce フェーズに分割し、タスクスケジューラ (JobTracker) を使用してクラスターノード間で実行する分散コンピューティングフレームワークです。

機能

疑似分散モード

完全分散モード

ノード数

単一ノード。すべてのサービスが 1 台のマシンで実行されます。

複数ノード。サービスが複数のマシンに分散されます。

リソース使用率

単一マシンのリソースを使用します。

複数のマシンのコンピューティングリソースとストレージリソースを活用します。

フォールトトレランス

低。単一障害点により、クラスター全体が利用できなくなります。

高。データレプリケーションと高可用性構成をサポートします。

シナリオ

  • 開発とテスト

  • 学習とトレーニング

  • 小規模プロジェクト

  • 本番環境

  • 高可用性とフォールトトレランスのシナリオ

  • マルチユーザーとマルチタスク

  • 大規模なデータの保存と処理

クイックデプロイ

[今すぐ実行] をクリックして Terraform Explorer を開き、Terraform コードを表示および実行して、ECS インスタンス上に Hadoop 環境を自動的に構築します。

前提条件

お使いの ECS インスタンスは、次の要件を満たす必要があります:

環境

要件

インスタンス

疑似分散

1 台のインスタンス

分散

3 台以上のインスタンス

説明

インスタンスを、[高可用性] 戦略を使用するデプロイメントセットに追加して、可用性を向上させ、クラスター管理を簡素化します。

オペレーティングシステム

Linux

パブリック IP アドレス

インスタンスにパブリック IP アドレスが割り当てられているか、Elastic IP アドレス (EIP) が関連付けられています。

インスタンスのセキュリティグループ

ポート 22、443、8088 (Hadoop YARN Web UI)、および 9870 (Hadoop NameNode Web UI) でのインバウンドトラフィックを許可してください。

説明

分散デプロイの場合、ポート 9868 (Hadoop SecondaryNameNode Web UI) でのトラフィックも許可してください。

セキュリティグループルールの管理をご参照ください。

Java Development Kit (JDK)

このトピックでは Hadoop 3.2.4 と Java 8 を使用します。他のバージョンについては、Hadoop Java のバージョンをご参照ください。

Hadoop バージョン

Java バージョン

Hadoop 3.3

Java 8 および Java 11

Hadoop 3.0.x~3.2.x

Java 8

Hadoop 2.7.x~2.10.x

Java 7 および Java 8

操作手順

分散

説明

Hadoop をデプロイする前に、ノードを計画してください。この例では 3 つのインスタンスを使用します:hadoop001マスターノード、hadoop002hadoop003ワーカーノードです。

機能コンポーネント

hadoop001

hadoop002

hadoop003

HDFS

  • NameNode

  • DataNode

DataNode

  • SecondaryNameNode

  • DataNode

YARN

NodeManager

  • ResourceManager

  • NodeManager

NodeManager

ステップ 1:JDK のインストール

重要

すべてのノードに JDK をインストールしてください。

  1. 一般ユーザーとして ECS インスタンスに接続します。

    Workbench を使用して Linux インスタンスに接続をご参照ください。

    重要

    Hadoop コミュニティは、セキュリティと権限の問題から、root ユーザーとして Hadoop を実行することを推奨していません。ecs-user などの root 以外のユーザーを使用してください。

  2. JDK 1.8 インストールパッケージをダウンロードします。

    wget https://download.java.net/openjdk/jdk8u41/ri/openjdk-8u41-b04-linux-x64-14_jan_2020.tar.gz
  3. JDK 1.8 インストールパッケージを展開します。

    tar -zxvf openjdk-8u41-b04-linux-x64-14_jan_2020.tar.gz
  4. JDK インストールフォルダーを移動して名前を変更します。

    この例では、JDK インストールフォルダーの名前を java8 に変更します。別の名前を使用することもできます。

    sudo mv java-se-8u41-ri/ /usr/java8
  5. Java 環境変数を設定します。

    JDK インストールフォルダーの名前を変更した場合は、次のコマンドの java8 を実際の名前で置き換えてください。

    sudo sh -c "echo 'export JAVA_HOME=/usr/java8' >> /etc/profile"
    sudo sh -c 'echo "export PATH=\$PATH:\$JAVA_HOME/bin" >> /etc/profile'
    source /etc/profile
  6. JDK がインストールされていることを確認します。

    java -version

    次の出力は、インストールが成功したことを示します。

    [ecs-user@hadoop001 ~]$ java -version
    openjdk version "1.8.0_41"
    OpenJDK Runtime Environment (build 1.8.0_41-b04)
    OpenJDK 64-Bit Server VM (build 25.40-b25, mixed mode)

ステップ 2:パスワードレス SSH ログインの設定

重要

この操作をすべてのインスタンスで実行してください。

パスワードレス SSH ログインを設定すると、ノードがパスワード認証なしで接続できるようになり、クラスター管理が簡素化されます。

  1. ホスト名とホスト解決を設定します。

    sudo vim /etc/hosts

    すべてのインスタンスの <プライマリプライベート IP アドレス> <ホスト名> 情報を /etc/hosts ファイルに追加します。例:

    <プライマリプライベート IP アドレス> hadoop001
    <プライマリプライベート IP アドレス> hadoop002
    <プライマリプライベート IP アドレス> hadoop003
  2. 公開キーと秘密キーを作成します。

    ssh-keygen -t rsa
    [ecs-user@hadoop001 ~]$ ssh-keygen -t rsa
    Generating public/private rsa key pair.
    Enter file in which to save the key (/home/ecs-user/.ssh/id_rsa):
    Enter passphrase (empty for no passphrase):
    Enter same passphrase again:
    Your identification has been saved in /home/ecs-user/.ssh/id_rsa.
    Your public key has been saved in /home/ecs-user/.ssh/id_rsa.pub.
    The key fingerprint is:
    SHA256:xxx                    ecs-user@hadoop001
    The key's randomart image is:
    +---[RSA 3072]----+
    |    .E            |
    |     o            |
    |                  |
    | o .    .         |
    |  o + .           |
    |   ++oo S .       |
    |  o..* + o o      |
    | o.o* o   o +     |
    |+=**.O .   o      |
    |=BB*O=*o          |
    +----[SHA256]------+
  3. ssh-copy-id <ホスト名> を実行し、ホスト名を正しい名前に置き換えます。例:

    hadoop001 で、ssh-copy-id hadoop001ssh-copy-id hadoop002ssh-copy-id hadoop003 を実行します。各コマンドの後、yes と入力し、対応するインスタンスのパスワードを入力します。

    ssh-copy-id hadoop001
    ssh-copy-id hadoop002
    ssh-copy-id hadoop003

    出力が次のようになれば、パスワードレスログインの設定は完了です。

    [ecs-user@hadoop001 ~]$ ssh-copy-id hadoop002
    /usr/bin/ssh-copy-id: INFO: Source of key(s) to be installed: "/home/ecs-user/.ssh/id_rsa.pub"
    The authenticity of host 'hadoop002 (172.20.153.127)' can't be established.
    ECDSA key fingerprint is SHA256:xxx.
    Are you sure you want to continue connecting (yes/no/[fingerprint])? yes
    /usr/bin/ssh-copy-id: INFO: attempting to log in with the new key(s), to filter out any that are already installed
    /usr/bin/ssh-copy-id: INFO: 1 key(s) remain to be installed -- if you are prompted now it is to install the new keys
    ecs-user@hadoop002's password:
    
    Number of key(s) added: 1
    
    Now try logging into the machine

ステップ 3:Hadoop のインストール

重要

すべてのインスタンスで次のコマンドを実行してください。

  1. Hadoop インストールパッケージをダウンロードします。

    wget http://mirrors.cloud.aliyuncs.com/apache/hadoop/common/hadoop-3.2.4/hadoop-3.2.4.tar.gz
  2. Hadoop インストールパッケージを /opt/hadoop に展開します。

    sudo tar -zxvf hadoop-3.2.4.tar.gz -C /opt/
    sudo mv /opt/hadoop-3.2.4 /opt/hadoop
  3. Hadoop 環境変数を設定します。

    sudo sh -c "echo 'export HADOOP_HOME=/opt/hadoop' >> /etc/profile"
    sudo sh -c "echo 'export PATH=\$PATH:/opt/hadoop/bin' >> /etc/profile"
    sudo sh -c "echo 'export PATH=\$PATH:/opt/hadoop/sbin' >> /etc/profile"
    source /etc/profile
  4. yarn-env.sh および hadoop-env.sh 設定ファイルを変更します。

    sudo sh -c 'echo "export JAVA_HOME=/usr/java8" >> /opt/hadoop/etc/hadoop/yarn-env.sh'
    sudo sh -c 'echo "export JAVA_HOME=/usr/java8" >> /opt/hadoop/etc/hadoop/hadoop-env.sh'
  5. Hadoop がインストールされていることを確認します。

    hadoop version

    次の出力は、インストールが成功したことを示します。

    [ecs-user@hadoop001 ~]$ hadoop version
    Hadoop 3.2.4
    Source code repository Unknown -r 7e5d998xxx
    Compiled by ubuntu on 2022-07-12T11:58Z
    Compiled with protoc 2.5.0
    From source with checksum ee031cxxx
    This command was run using /opt/hadoop/share/hadoop/common/hadoop-common-3.2.4.jar

ステップ 4:Hadoop の設定

重要

すべてのノードで Hadoop 設定ファイルを変更してください。

  1. Hadoop 設定ファイル core-site.xml を変更します。

    1. ファイルを開いて編集します。

      sudo vim /opt/hadoop/etc/hadoop/core-site.xml
    2. <configuration></configuration> ノードに、次の内容を挿入します。

         <!--NameNode のアドレスを指定-->
         <property>
               <name>fs.defaultFS</name>
               <value>hdfs://hadoop001:8020</value>
         </property>
         <!--Hadoop によって生成されたファイルを保存するディレクトリを指定-->
         <property>
               <name>hadoop.tmp.dir</name>
               <value>/opt/hadoop/data</value>
         </property>
         <!--HDFS Web ログインの静的ユーザーを hadoop として設定-->
         <property>
                <name>hadoop.http.staticuser.user</name>
                <value>hadoop</value>
         </property>
  2. Hadoop 設定ファイル hdfs-site.xml を変更します。

    1. ファイルを開いて編集します。

      sudo vim /opt/hadoop/etc/hadoop/hdfs-site.xml
    2. <configuration></configuration> ノードに、次の内容を挿入します。

          <!-- NameNode Web エンドポイント -->
          <property>
              <name>dfs.namenode.http-address</name>  
              <value>hadoop001:9870</value>
          </property>
          <!-- Secondary NameNode Web エンドポイント -->
          <property>
              <name>dfs.namenode.secondary.http-address</name>
              <value>hadoop003:9868</value>
          </property>
  3. Hadoop 設定ファイル yarn-site.xml を変更します。

    1. ファイルを開いて編集します。

      sudo vim /opt/hadoop/etc/hadoop/yarn-site.xml
    2. <configuration></configuration> ノードに、次の内容を挿入します。

           <!--NodeManager がデータを取得する方法は shuffle-->
           <property>
      	 <name>yarn.nodemanager.aux-services</name>
      	 <value>mapreduce_shuffle</value>
           </property>
      
          <!--YARN (ResourceManager) のアドレスを指定-->     
          <property>
      	 <name>yarn.resourcemanager.hostname</name>
      	 <value>hadoop002</value>
          </property> 
          
          <!--NodeManager がコンテナに渡すことができる環境変数のホワイトリストを指定-->
          <property>
          	<name>yarn.nodemanager.env-whitelist</name>
          	<value>JAVA_HOME,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_CONF_DIR,CLASSPATH_PREPEND_DISTCACHE,HADOOP_YARN_HOME,HADOOP_MAPRED_HOME</value>
          </property>
  4. Hadoop 設定ファイル mapred-site.xml を変更します。

    1. ファイルを開いて編集します。

      sudo vim /opt/hadoop/etc/hadoop/mapred-site.xml
    2. <configuration></configuration> ノードに、次の内容を挿入します。

         <!--Hadoop に YARN 上で MapReduce (MR) を実行するように指示-->
         <property>
      	 <name>mapreduce.framework.name</name>
      	 <value>yarn</value>
         </property>
  5. Hadoop 設定ファイル workers を変更します。

    1. ファイルを開いて編集します。

      sudo vim /opt/hadoop/etc/hadoop/workers
    2. workers ファイルに、インスタンス情報を挿入します。

      hadoop001
      hadoop002
      hadoop003

ステップ 5:Hadoop の起動

  1. namenode をフォーマットします。

    警告

    初回起動時にのみ、3 つすべてのインスタンスで namenode をフォーマットしてください。

    hadoop namenode -format
  2. Hadoop を起動します。

    重要
    • Hadoop コミュニティは、セキュリティと権限の問題から、root ユーザーとして Hadoop を実行することを推奨していません。ecs-user などの root 以外のユーザーを使用してください。

    • root として Hadoop を実行する必要がある場合は、次の設定ファイルを変更する前に、アクセス制御モデルと関連するリスクを理解してください。

      注:root として Hadoop を実行すると、データ侵害、root 権限を取得できるマルウェアに対する脆弱性の増加、予期しない権限の問題など、深刻なセキュリティリスクが生じます。詳細については、「Hadoop の公式ドキュメント」をご参照ください。

    root ユーザーで Hadoop サービスを起動できるように、設定ファイルを変更します。

    次の設定ファイルは通常 /opt/hadoop/sbin ディレクトリにあります。

    1. start-dfs.sh および stop-dfs.sh ファイルに、次のパラメーターを追加します。

      HDFS_DATANODE_USER=root
      HADOOP_SECURE_DN_USER=hdfs
      HDFS_NAMENODE_USER=root
      HDFS_SECONDARYNAMENODE_USER=root
    2. start-yarn.sh および stop-yarn.sh ファイルに、次のパラメーターを追加します。

      YARN_RESOURCEMANAGER_USER=root
      HADOOP_SECURE_DN_USER=yarn
      YARN_NODEMANAGER_USER=root
    1. hadoop001start-dfs.sh を実行して HDFS サービスを開始します。

      このスクリプトは NameNode、SecondaryNameNode、DataNode を起動します。

      start-dfs.sh

      jps の出力が次のようになれば、HDFS は実行されています。

      [ecs-user@hadoop003 ~]$ jps
      1347 SecondaryNameNode
      2260 Jps
      1256 DataNode
      
      [ecs-user@hadoop002 ~]$ jps
      3538 Jps
      1307 DataNode
      
      [ecs-user@hadoop001 ~]$ jps
      1589 NameNode
      1750 DataNode
      2844 Jps
    2. hadoop002start-yarn.sh を実行して YARN サービスを開始します。

      このスクリプトは ResourceManager を起動し、workers ファイルで定義されたすべてのワーカーノードで NodeManager を起動します。

      start-yarn.sh

      YARN が実行されている場合、出力は次のようになります。

      [ecs-user@hadoop002 ~]$ start-yarn.sh
      Starting resourcemanager
      Starting nodemanagers
  3. 3 つすべてのノードで起動したプロセスを表示します。

    jps

    起動したプロセスは次のとおりです。

    [ecs-user@hadoop003 ~]$ jps
    1347 SecondaryNameNode
    1256 DataNode
    1481 NodeManager
    1759 Jps
    
    [ecs-user@hadoop002 ~]$ jps
    2192 Jps
    1686 NodeManager
    1499 ResourceManager
    1307 DataNode
    
    [ecs-user@hadoop001 ~]$ jps
    2355 Jps
    1589 NameNode
    1750 DataNode
    2073 NodeManager
  4. ブラウザで http://<hadoop002 ECS インスタンスのパブリック IP アドレス>:8088 と入力して、YARN Web UI にアクセスします。

    クラスターのリソース使用状況、MapReduce ジョブのステータス、キュー情報を確認できます。

    重要

    セキュリティグループでポート 8088 のインバウンドトラフィックを許可する必要があります。そうしないと、Web UI にアクセスできません。セキュリティグループルールの追加をご参照ください。

    [All Applications] ページには、クラスターメトリックが表示されます:[Active Nodes] は 3、[Total Resources]memory:24GB, vCores:24、スケジューラタイプは [Capacity Scheduler] であり、現在送信または実行中のアプリケーションはありません。

  5. ブラウザで http://<hadoop001 ECS インスタンスのパブリック IP アドレス>:9870 と入力して NameNode Web UI にアクセスし、http://<hadoop003 ECS インスタンスのパブリック IP アドレス>:9868 と入力して SecondaryNameNode Web UI にアクセスします。

    HDFS のステータス、クラスターのヘルス状態、アクティブなノード、NameNode のログを確認できます。

    次のページが表示されれば、分散環境の構築は完了です。

    重要

    セキュリティグループでポート 9870 のインバウンドトラフィックを許可する必要があります。そうしないと、Web UI にアクセスできません。セキュリティグループルールの追加をご参照ください。

    正常にアクセスすると、NameNode Web UI に [Overview] ページが表示されます。ページのタイトルには、NameNode が active 状態であることが示されます。[Summary] セクションには、「Security is off」や「Safemode is off」など、クラスターのセキュリティとランタイムステータスが表示されます。その下には、クラスターのストレージ容量と使用状況 (例:Configured Capacity、DFS Used、DFS Remaining) が表示されます。

疑似分散

ステップ 1:JDK のインストール

  1. 一般ユーザーとして ECS インスタンスに接続します。

    Workbench を使用して Linux インスタンスに接続をご参照ください。

    重要

    Hadoop コミュニティは、セキュリティと権限の問題から、root ユーザーとして Hadoop を実行することを推奨していません。ecs-user などの root 以外のユーザーを使用してください。

  2. JDK 1.8 インストールパッケージをダウンロードします。

    wget https://download.java.net/openjdk/jdk8u41/ri/openjdk-8u41-b04-linux-x64-14_jan_2020.tar.gz
  3. JDK 1.8 インストールパッケージを展開します。

    tar -zxvf openjdk-8u41-b04-linux-x64-14_jan_2020.tar.gz
  4. JDK インストールフォルダーを移動して名前を変更します。

    この例では、JDK インストールフォルダーの名前を java8 に変更します。別の名前を使用することもできます。

    sudo mv java-se-8u41-ri/ /usr/java8
  5. Java 環境変数を設定します。

    JDK インストールフォルダーの名前を変更した場合は、次のコマンドの java8 を実際の名前で置き換えてください。

    sudo sh -c "echo 'export JAVA_HOME=/usr/java8' >> /etc/profile"
    sudo sh -c 'echo "export PATH=\$PATH:\$JAVA_HOME/bin" >> /etc/profile'
    source /etc/profile
  6. JDK がインストールされていることを確認します。

    java -version

    次の出力は、インストールが成功したことを示します。

    [ecs-user@hadoop001 ~]$ java -version
    openjdk version "1.8.0_41"
    OpenJDK Runtime Environment (build 1.8.0_41-b04)
    OpenJDK 64-Bit Server VM (build 25.40-b25, mixed mode)

ステップ 2:パスワードレス SSH ログインの設定

説明

単一ノードでもパスワードレス SSH ログインが必要です。そうしないと、NameNode と DataNode の起動時に権限拒否エラーが発生します。

  1. 公開キーと秘密キーを作成します。

    ssh-keygen -t rsa
    [ecs-user@hadoop001 ~]$ ssh-keygen -t rsa
    Generating public/private rsa key pair.
    Enter file in which to save the key (/home/ecs-user/.ssh/id_rsa):
    Enter passphrase (empty for no passphrase):
    Enter same passphrase again:
    Your identification has been saved in /home/ecs-user/.ssh/id_rsa.
    Your public key has been saved in /home/ecs-user/.ssh/id_rsa.pub.
    The key fingerprint is:
    SHA256:xxx ecs-user@hadoop001
    The key's randomart image is:
    +---[RSA 3072]----+
    |    .E            |
    |     o            |
    | o .   .          |
    | o +  .           |
    |  ++oo S .        |
    | o..* + o o       |
    | o.o* o   o +     |
    |+=**.O .   o      |
    |=BB*O-*o          |
    +----[SHA256]-----+
  2. 公開キーを authorized_keys ファイルに追加します。

    cd .ssh
    cat id_rsa.pub >> authorized_keys

ステップ 3:Hadoop のインストール

  1. Hadoop インストールパッケージをダウンロードします。

    wget http://mirrors.cloud.aliyuncs.com/apache/hadoop/common/hadoop-3.2.4/hadoop-3.2.4.tar.gz
  2. Hadoop インストールパッケージを /opt/hadoop に展開します。

    sudo tar -zxvf hadoop-3.2.4.tar.gz -C /opt/
    sudo mv /opt/hadoop-3.2.4 /opt/hadoop
  3. Hadoop 環境変数を設定します。

    sudo sh -c "echo 'export HADOOP_HOME=/opt/hadoop' >> /etc/profile"
    sudo sh -c "echo 'export PATH=\$PATH:/opt/hadoop/bin' >> /etc/profile"
    sudo sh -c "echo 'export PATH=\$PATH:/opt/hadoop/sbin' >> /etc/profile"
    source /etc/profile
  4. yarn-env.sh および hadoop-env.sh 設定ファイルを変更します。

    sudo sh -c 'echo "export JAVA_HOME=/usr/java8" >> /opt/hadoop/etc/hadoop/yarn-env.sh'
    sudo sh -c 'echo "export JAVA_HOME=/usr/java8" >> /opt/hadoop/etc/hadoop/hadoop-env.sh'
  5. Hadoop がインストールされていることを確認します。

    hadoop version

    次の出力は、インストールが成功したことを示します。

    [ecs-user@hadoop001 ~]$ hadoop version
    Hadoop 3.2.4
    Source code repository Unknown -r 7e5d998xxx
    Compiled by ubuntu on 2022-07-12T11:58Z
    Compiled with protoc 2.5.0
    From source with checksum ee031cxxx
    This command was run using /opt/hadoop/share/hadoop/common/hadoop-common-3.2.4.jar

ステップ 4:Hadoop の設定

  1. Hadoop 設定ファイル core-site.xml を変更します。

    1. ファイルを開いて編集します。

      sudo vim /opt/hadoop/etc/hadoop/core-site.xml
    2. <configuration></configuration> ノードに、次の内容を挿入します。

          <property>
              <name>hadoop.tmp.dir</name>
              <value>file:/opt/hadoop/tmp</value>
              <description>一時ファイルを保存する場所</description>
          </property>
          <property>
              <name>fs.defaultFS</name>
              <value>hdfs://localhost:9000</value>
          </property>
  2. Hadoop 設定ファイル hdfs-site.xml を変更します。

    1. ファイルを開いて編集します。

      sudo vim /opt/hadoop/etc/hadoop/hdfs-site.xml
    2. <configuration></configuration> ノードに、次の内容を挿入します。

          <property>
              <name>dfs.replication</name>
              <value>1</value>
          </property>
          <property>
              <name>dfs.namenode.name.dir</name>
              <value>file:/opt/hadoop/tmp/dfs/name</value>
          </property>
          <property>
              <name>dfs.datanode.data.dir</name>
              <value>file:/opt/hadoop/tmp/dfs/data</value>
          </property>

ステップ 5:Hadoop の起動

  1. namenode をフォーマットします。

    hadoop namenode -format
  2. Hadoop を起動します。

    重要
    • Hadoop コミュニティは、セキュリティと権限の問題から、root ユーザーとして Hadoop を実行することを推奨していません。ecs-user などの root 以外のユーザーを使用してください。

    • root として Hadoop を実行する必要がある場合は、次の設定ファイルを変更する前に、アクセス制御モデルと関連するリスクを理解してください。

      注:root として Hadoop を実行すると、データ侵害、root 権限を取得できるマルウェアに対する脆弱性の増加、予期しない権限の問題など、深刻なセキュリティリスクが生じます。詳細については、「Hadoop の公式ドキュメント」をご参照ください。

    root ユーザーで Hadoop サービスを起動できるように、設定ファイルを変更します。

    次の設定ファイルは通常 /opt/hadoop/sbin ディレクトリにあります。

    1. start-dfs.sh および stop-dfs.sh ファイルに、次のパラメーターを追加します。

      HDFS_DATANODE_USER=root
      HADOOP_SECURE_DN_USER=hdfs
      HDFS_NAMENODE_USER=root
      HDFS_SECONDARYNAMENODE_USER=root
    2. start-yarn.sh および stop-yarn.sh ファイルに、次のパラメーターを追加します。

      YARN_RESOURCEMANAGER_USER=root
      HADOOP_SECURE_DN_USER=yarn
      YARN_NODEMANAGER_USER=root
    1. HDFS サービスを開始します。

      このスクリプトは NameNode、SecondaryNameNode、DataNode を起動します。

      start-dfs.sh

      HDFS が実行されている場合、出力は次のようになります。

      [ecs-user@hadoop001 ~]$ start-dfs.sh
      Starting namenodes on [localhost]
      Starting datanodes
      Starting secondary namenodes [hadoop001]
    2. YARN サービスを開始します。

      このスクリプトは ResourceManager、NodeManager、および ApplicationHistoryServer を起動します。

      start-yarn.sh

      YARN が実行されている場合、出力は次のようになります。

      [ecs-user@hadoop001 ~]$ start-yarn.sh
      Starting resourcemanager
      Starting nodemanagers
  3. 起動したプロセスを表示します。

    jps

    起動したプロセスは次のとおりです。

    [ecs-user@hadoop001 ~]$ jps
    13648 NameNode
    14513 NodeManager
    13811 DataNode
    14024 SecondaryNameNode
    14298 ResourceManager
    14861 Jps
  4. ブラウザで http://<ECS インスタンスのパブリック IP アドレス>:8088 と入力して、YARN Web UI にアクセスします。

    クラスターのリソース使用状況、MapReduce ジョブのステータス、キュー情報を確認できます。

    重要

    セキュリティグループでポート 8088 のインバウンドトラフィックを許可する必要があります。そうしないと、Web UI にアクセスできません。セキュリティグループルールの追加をご参照ください。

    正常にアクセスすると、ページに [All Applications] の概要が表示されます。[Cluster Metrics] では、[Active Nodes] が 1、[Total Resources] が memory:8GB, vCores:8 となっており、YARN ResourceManager が正常に実行されていることを示しています。

  5. ブラウザで http://<ECS インスタンスのパブリック IP アドレス>:9870 と入力して、NameNode Web UI にアクセスします。

    HDFS のステータス、クラスターのヘルス状態、アクティブなノード、NameNode のログを確認できます。

    正常にアクセスすると、NameNode Web UI が表示され、疑似分散環境が構築されたことを確認できます。

    重要

    セキュリティグループでポート 9870 のインバウンドトラフィックを許可する必要があります。そうしないと、Web UI にアクセスできません。セキュリティグループルールの追加をご参照ください。

関連操作

スナップショット整合性グループの作成

分散 Hadoop の場合、スナップショット整合性グループを使用して、クラスター全体のデータ整合性を確保します。詳細については、「スナップショット整合性グループの作成」をご参照ください。

Hadoop 関連の操作

HDFS の操作については、「一般的な HDFS コマンド」をご参照ください。

関連ドキュメント