このトピックでは、Linux オペレーティングシステムで CPFS-POSIX クライアントまたは CPFS-NFS クライアントを使用してクラウド並列ファイルストレージ (CPFS) ファイルシステムのマウントに失敗した場合の一般的な問題と解決策について説明します。
概要
POSIX クライアントのマウントポイント
POSIX クライアントのマウントポイントを作成する際に「insufficient inventory」エラーが返された場合の対処法
POSIX クライアントのマウントポイントを作成する際に「insufficient vSwitch IPs」エラーが返された場合の対処法
CPFS-POSIX クライアントのマウント
CPFS ファイルシステムをマウントする際に「unsupported OS for 'X86_64' architecture」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に「make sure kernel-devel version is consistent with kernel」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に「ssh: connect to host A port 22: Connection timed out」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に「cpfs.sh is running already」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に「connect to host B port 22: Connection timed out」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に「[FATAL] B: Could not connect to B via ssh」エラーが返された場合の対処法
cpfs add コマンドを使用して CPFS ファイルシステムをマウントする際に YUM リポジトリのエラーが発生した場合の対処法
CPFS-NFS クライアントのマウント
CPFS のスケールアウト
POSIX クライアントのマウントポイントを作成する際に「insufficient inventory」エラーが返された場合の対処法
現象:
CPFS コンソールでファイルシステムの POSIX クライアントのマウントポイントを作成する際に、次のエラーが報告されます:insufficient inventory in the specified zone。
原因:
POSIX マウントポイントを作成すると、CPFS はご利用の Alibaba Cloud アカウントで 3 つの従量課金制 Elastic Compute Service (ECS) インスタンス (ecs.g*.large) を自動的に作成します。これらのインスタンスは、CPFS-POSIX クライアントクラスターの管理に使用されます。POSIX クライアントのマウントポイントを作成する際は、ご利用の Alibaba Cloud アカウントが正常な状態であり、ECS インスタンスを購入できることを確認してください。
ソリューション:
ECS コンソールにログインし、[インスタンス作成ページ]に移動して、必須の ECS インスタンスタイプの在庫を確認できます。これにより、指定したインスタンスタイプの在庫不足によるマウントポイント作成の失敗を回避できます。
POSIX クライアントのマウントポイントを作成する際に「insufficient vSwitch IPs」エラーが返された場合の対処法
現象:
CPFS コンソールでファイルシステムの POSIX クライアントのマウントポイントを作成する際に、次のエラーが返されます:insufficient vSwitch IPs。
原因:
CPFS ファイルシステムのストレージノードは、POSIX クライアントのマウントポイントで指定された vSwitch から割り当てられた IP を使用する必要があります。各ストレージノードは 1 つの IP を占有します。CPFS ファイルシステムのストレージノードが占有する IP の最大数は 160 です。
ソリューション:
VPC コンソールにログインして、ターゲット VPC 配下の vSwitch で利用可能な IP の数を確認できます。vSwitch に十分な利用可能な IP があることを確認してください。
POSIX クライアントのマウントポイントを作成できない理由
CPFS コンソールで作成したばかりのマウントポイントが見つからない場合は、ご利用の Alibaba Cloud アカウントに支払い遅延がないか確認してください。ご利用の Alibaba Cloud アカウントに支払い遅延がある場合、CPFS ファイルシステムのマウントポイントを作成できません。アカウントにチャージしてから、再度 CPFS ファイルシステムのマウントポイントの作成を試みてください。
1 つの ECS インスタンスにマウントできる CPFS ファイルシステムの数は?
1 つの ECS インスタンスには、最大で 1 つの CPFS ファイルシステムをマウントできます。
CPFS ファイルシステムをマウントする際に「unsupported OS for 'X86_64' architecture」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これは CPFS ファイルシステムがコンピューティングノードのオペレーティングシステムをサポートしていないことを示します。コンピューティングノードのスペックを変更してください。CPFS クライアントがサポートするオペレーティングシステムについては、「制限事項」をご参照ください。
[ FATAL ] You cannot add cpfs-client-001 node because it has an unsupported OS for 'X86_64' architecture.CPFS ファイルシステムをマウントする際に「make sure kernel-devel version is consistent with kernel」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これは ECS インスタンスに kernel-devel または kernel-headers パッケージがインストールされていないか、インストールされているパッケージのバージョンに互換性がないことを示します。
No package kernel-devel-3.10.0-957.21.3.el7.x86_64 available.
Error: Nothing to do
please make sure kernel-devel version is consistent with kernel次のコマンドを実行して、ECS インスタンスのパッケージのインストール状況を確認します。
rpm -qa | grep kernel-devel-`uname -r`出力が空の場合、ECS インスタンス上のパッケージは正しくインストールされていません。ECS インスタンスにパッケージを再インストールしてください。詳細については、「ステップ 1: 環境の準備」をご参照ください。
CPFS ファイルシステムをマウントする際に「ssh: connect to host A port 22: Connection timed out」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これは ECS インスタンスとファイルシステム間のネットワークが切断されていることを示します。
====> start check ssh
try ssh root@a.b.c.d by /root/.ssh/id_rsa.pub
ssh: connect to host a.b.c.d port 22: Connection timed out次の考えられる原因を確認し、問題の解決を試みてください:
考えられる原因 | ソリューション |
ECS インスタンス (a.b.c.d) と POSIX クライアント管理ノード (qr-001) 間のネットワークが切断されている | ネットワーク接続を確認し、マウントコマンドを再度実行します。 |
ECS インスタンス (a.b.c.d) が qr-sg セキュリティグループに追加されていない | セキュリティグループの構成を確認し、再試行します。詳細については、「セキュリティグループの設定」をご参照ください。 |
ECS インスタンス (a.b.c.d) と CPFS マウントポイントが同じ VPC にない | マウントポイントと同じ VPC 内の ECS インスタンスを選択して、マウント操作を実行します。 |
ECS インスタンス (a.b.c.d) の IP が存在しない | ECS インスタンスのステータスを確認します。 |
CPFS ファイルシステムをマウントする際に「not active on:<hostname>」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これは CPFS ファイルシステムが ECS インスタンスで起動できないことを示します。
[ WARN ] GPFS is not active on: hostname. Consult the install toolkit logs for possible errors
during install. The GPFS service can also be started manually by running GPFS command
'mmstartup -N Node[,Node...]'
[ FATAL ] GPFS NOT ACTIVE次の考えられる原因を確認し、問題の解決を試みてください:
ECS インスタンスのセキュリティグループが正しく構成されていないか、インスタンスが qr-sg セキュリティグループに追加されていません。詳細については、「セキュリティグループの設定」をご参照ください。
CPFS ファイルシステムは、ECS インスタンスに 4 GB 以上のメモリを必要とします。ECS インスタンスのメモリが不足している場合、エラーが返されます。ECS インスタンスのメモリを確認してください。
CPFS ファイルシステムをマウントする際に「Command failed」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これは ECS インスタンスの使用可能なメモリが 4 GB 未満であることを示します。ECS インスタンスのメモリをスペックアップし、cpfs add ip コマンドを再度実行してファイルシステムをマウントしてください。
[ WARN ] GPFS is not active on: hostname. Consult the install toolkit logs for possible errors
during install. The GPFS service can also be started manually by running GPFS command
'mmstartup -N Node[,Node...]'
[ FATAL ] GPFS NOT ACTIVECPFS ファイルシステムをマウントする際に「cpfs.sh is running already」エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これはマウントまたはアンマウントのタスクがすでに実行中であることを示します。しばらく待ってから再試行してください。
cpfs.sh is running already, pid: xyzCPFS ファイルシステムをマウントする際に「connect to host B port 22: Connection timed out」エラーが返された場合の対処法
ECS インスタンス A が CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これは現在の CPFS ファイルシステムクラスターに異常なステータスの ECS インスタンス B が存在することを示します。
# cpfs add A
connect to host B port 22: Connection timed out
B hostname is invalid
Failed to add node.次の方法を参照して ECS インスタンス B のトラブルシューティングと修正を行い、再度マウント操作を試みてください。
管理ノード qr-001 で mmgetstate -a を実行して、ECS インスタンス B が正常なステータス (active は正常なステータスを示します) であるかどうかを確認します。
インスタンス B が正常な状態である場合は、チケットを起票して CPFS チームに連絡し、さらなるトラブルシューティングを依頼してください。
インスタンス B が異常なステータスの場合、インスタンスを引き続き使用するかどうかを判断します。
このインスタンスの使用を継続したい場合は、チケットを起票して CPFS チームに連絡し、インスタンスステータスの修復を依頼してください。
インスタンスが不要になった場合は、
mmdelnode -N <id> --forceコマンドを実行してノード情報をクリアします。mmdelnode -N iZuf61mhwoc9flkufs0**** --force Do you want to continue? (yes/no) yes mmdelnode: [W] Could not cleanup the following unreached nodes: iZuf61mhwoc9flkufs0**** mmdelnode: Command successfully completed mmdelnode: Propagating the cluster configuration data to all affected nodes. This is an asynchronous process.クリーンアップ後、インスタンス B のホスト情報を /etc/hosts から削除します。コマンド内の
iZuf61mhwoc9flkufs0****は、対象の ECS インスタンスの ID です。
CPFS ファイルシステムをマウントする際に「[FATAL] B: Could not connect to B via ssh」エラーが返された場合の対処法
ECS インスタンス A が CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これは現在の CPFS ファイルシステムクラスターにインストールが中断され、残存構成が存在する ECS インスタンス B があることを示します。
[ FATAL ] ssh: connect to host B port 22: Connection timed out
[ FATAL ] B: Could not connect to B via ssh.バージョン 2.2.0 未満
ECS インスタンス B の残存構成情報を /usr/lpp/mmfs/5.0.5.0/installer/configuration/clusterdefinition.txt ファイルから削除します。
[node4] fqdn = B os = rhel7 arch = x86_64 ip_address = 192.168.6.37 is_admin_node = False is_object_store = False is_nfs = False is_smb = False is_hdfs = False is_protocol_node = False is_nsd_server = False access_ips = is_quorum_node = False is_manager_node = False is_gui_server = False is_ems_node = False is_callhome_node = False is_broker_node = False is_node_offline = False is_node_reachable = True is_node_excluded = False is_mestor_node = Falseバージョン 2.2.0 以降
ECS インスタンス B の残存構成情報を /usr/lpp/mmfs/5.1.2.0/ansible-toolkit/ansible/ibm-spectrum-scale-install-infra/vars/scale_clusterdefinition.json ファイルから削除します。
{ "fqdn": "iZuf6hn0blj1g377w4xxxxZ", "os": "rhel7", "arch": "x86_64", "ip_address": "172.19.0.100", "is_admin_node": false, "is_object_store": false, "is_nfs": false, "is_smb": false, "is_hdfs": false, "is_protocol_node": false, "is_nsd_server": false, "is_quorum_node": false, "is_manager_node": false, "is_gui_server": false, "is_ems_node": false, "is_callhome_node": false, "is_broker_node": false, "is_node_offline": false, "is_node_reachable": true, "is_node_excluded": false, "is_mestor_node": false, "scale_daemon_nodename": "iZuf6hn0blj1g377w4xxxxZ" }
CPFS ファイルシステムをマウントする際に [ FATAL ] No GPFS admin node specified. specify an admin node using 'spectrumscale node add <node name or IP> -a'. エラーが返された場合の対処法
CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これはコマンドを間違ったノードで実行したことを示します。
[ FATAL ] No GPFS admin node specified. specify an admin node using 'spectrumscale node add <node name or IP> -a'.CPFS コマンドを qr-001 ノードで実行したかどうかを確認してください。
[root@cpfs-08cd3xxx-000001-qr-001 ~]#CPFS ファイルシステムをマウントする際に「Failed to resolve domain: file-system-id.region.cpfs.aliyuncs.com」エラーが返された場合の対処法
原因
マウントコマンドの
file-system-id.region.cpfs.aliyuncs.comパラメーターが、エクスポートディレクトリのマウントアドレスに置き換えられていません。ソリューション
NAS コンソールにログインします。 対象の CPFS ファイルシステムの [操作] 列で、[管理] をクリックして [プロトコルサービス] ページに移動します。 [操作] 列で、[エクスポートディレクトリ] をクリックして [エクスポートディレクトリ] パネルを開き、マウントアドレスを取得します。 次に、マウントコマンドの
file-system-id.region.cpfs.aliyuncs.comパラメーターを、取得したマウントアドレスに置き換えます。 再度マウントコマンドを実行して、ファイルシステムをマウントします。
cpfs add コマンドを使用して CPFS ファイルシステムをマウントする際に YUM リポジトリのエラーが発生した場合の対処法
CPFS ファイルシステムをマウントする際に次のエラーが返された場合、これは CentOS 8 の YUM リポジトリ構成が無効になったことを示します。
Errors during downloading metadata for repository 'appstream':
Status code: 404 for http://mirrors.cloud.aliyuncs.com/centos/8/AppStream/x86_64/os/repodata/repomd.xml (IP: 100.100.XX.XX)
Error: Failed to download metadata for repo 'appstream': Cannot download repomd.xml: Cannot download repodata/repomd.xml: All mirrors were triedCentOS 8 は保守終了 (EOL) を迎え、Linux コミュニティはこのオペレーティングシステムバージョンをメンテナンスしなくなりました。YUM リポジトリを切り替えることを推奨します。
CPFS クライアントの起動に失敗した場合の対処法
現象:
管理ノード qr-001 で
mmgetstate -aを実行して ECS インスタンスのステータスを確認すると、インスタンスのステータスが down と表示されます。/usr/lpp/mmfs/bin/mmstartupコマンドを実行すると、次の情報が返されます。… mmfslinux.ko kernel extension does not exist. Use mmbuildgpl command to create the needed kernel extension for your kernel …
原因:
現在の ECS インスタンスのカーネルがアップグレードされています。
ソリューション:
/usr/lpp/mmfs/bin/mmbuildgplコマンドを実行して、カーネル拡張を再構築します。次の出力が返されます:
mmbuildgpl: Building GPL (5.1.X.X) module begins at Fri Dec 3 16:05:33 CST 2021. -------------------------------------------------------- Verifying Kernel Header... kernel version = 41800305 (418000305012001, 4.18.0-305.12.1.el8_4.x86_64, 4.18.0-305.12.1) module include dir = /lib/modules/4.18.0-305.12.1.el8_4.x86_64/build/include module build dir = /lib/modules/4.18.0-305.12.1.el8_4.x86_64/build kernel source dir = /usr/src/linux-4.18.0-305.12.1.el8_4.x86_64/include Found valid kernel header file under /usr/src/kernels/4.18.0-305.12.1.el8_4.x86_64/include Getting Kernel Cipher mode... Will use skcipher routines Verifying Compiler... make is present at /bin/make cpp is present at /bin/cpp gcc is present at /bin/gcc g++ is present at /bin/g++ ld is present at /bin/ld Verifying libelf devel package... Verifying elfutils-libelf-devel is installed ... Command: /bin/rpm -q elfutils-libelf-devel The required package elfutils-libelf-devel is installed Verifying Additional System Headers... Verifying kernel-headers is installed ... Command: /bin/rpm -q kernel-headers The required package kernel-headers is installed make World ... make InstallImages ... -------------------------------------------------------- mmbuildgpl: Building GPL module completed successfully at Fri Dec 3 16:05:54 CST 2021. --------------------------------------------------------/usr/lpp/mmfs/bin/mmstartupコマンドを実行して、ECS インスタンスを再起動します。/usr/lpp/mmfs/bin/mmmount allコマンドを実行して、ファイルシステムを再マウントします。
アンマウントされた ECS インスタンスの残存構成をクリーンアップする方法
まず、CPFS ファイルシステムが ECS インスタンスからアンマウントされていることを確認します。詳細については、「ファイルシステムのアンマウント」をご参照ください。次に、mmdelnode -N <id> --force コマンドを実行して、アンマウントされた ECS インスタンスの残存構成をクリーンアップします。以下に例を示します:
mmdelnode -N iZuf61mhwoc9flkufs0**** --force
Do you want to continue? (yes/no) yes
mmdelnode: [W] Could not cleanup the following unreached nodes:
iZuf61mhwoc9flkufs0****
mmdelnode: Command successfully completed
mmdelnode: Propagating the cluster configuration data to all affected nodes. This is an
asynchronous process.コマンド内の iZuf61mhwoc9flkufs0**** は、対象の ECS インスタンスの ID です。
スケールアウト操作を実行する際に「insufficient inventory」エラーが返された場合の対処法
CPFS ファイルシステムのスケールアウトは、CPFS ストレージノードの在庫とマウントポイント vSwitch の利用可能な IP 数に依存します。VPC コンソールに移動して、現在利用可能な IP の数を確認してください。CPFS ファイルシステムには最大 164 の利用可能な IP が必要です。vSwitch に十分な利用可能な IP があることを確認してください。
CPFS ファイルシステムがスケールアウトされた後、データは自動的にリバランスされますか?
CPFS ファイルシステムがスケールアウトされた後、デフォルトではデータリバランスは実行されません。既存のデータは元のストレージノードに残り、新しく追加されたストレージノードに自動的に移行されることはありません。
データリバランスはストレージノードのネットワークとディスク帯域幅を消費し、ファイルシステムのフロントエンド I/O パフォーマンスを低下させます。さらに、ファイルシステムに既存のデータが多いほど、データリバランスにかかる時間が長くなります。ほとんどのワークロードではスケールアウト後の自動データリバランスを必要としないことを考慮し、CPFS ファイルシステムはスケールアウト後に自動的にデータリバランスを実行しません。
CPFS は POSIX クライアントを使用してのみマウントおよびアクセスできますか?
CPFS は、CPFS-POSIX クライアントまたは CPFS-NFS クライアントのいずれかを使用してファイルシステムのマウントとアクセスをサポートします。CPFS は、CPFS-POSIX クライアントと CPFS-NFS クライアント間のクロスアクセスもサポートしています。たとえば、CPFS-POSIX クライアントで作成されたファイルとその変更は CPFS-NFS クライアントから見え、その逆も同様です。詳細については、「クライアントの説明」をご参照ください。