Elastic High Performance Computing E-HPC Product Introduction
1、Elastic High Performance Computing E-HPC 製品概要
1. E-HPC 製品設計の出発点
Elastic High Performance Computing E-HPC は、クラウド上で HPC 環境を迅速に構築し、クラウドサービスの利点を最大限に活用できるよう設計された製品です。
E-HPC の製品設計は、主に以下の 3 つの観点を考慮しています:
• HPC ユーザーの認識に基づくクラウドスーパーコンピューティング環境の構築:HPC ユーザーが考える HPC 環境とは、対応するソフトウェアがデプロイされた緊密結合されたクラスターであり、個別のサーバーやストレージネットワークではありません。
• HPC ユーザーの利用習慣に合わせたスーパーコンピューティングサービスの提供:HPC 利用には長期的に固定されたビジネスワークフローがあり、クラウドサービスは既存の利用プロセスに適合する必要があります。
• 新モデル/新体験を提供する複合サービス機能:クラウドサービスの特性を活かして、オフライン HPC では一般的でない、または存在しなかったモデルを提供し、クラウドスーパーコンピューティングの特徴を形成します。
2. HPC 製品ソリューションビュー
• クラスターリソースライフサイクル管理:クラスター作成、クラスター拡張とスケーリング、アプリケーション負荷に基づく自動スケーリング、クラスター管理と運用保守を含みます。
• クラスタージョブ管理とスケジューリング:スケジューラ管理と設定、ジョブスケジューリング、ジョブ負荷モニタリングとレポート、サードパーティスケジューラ統合、クラウド間ハイブリッドスケジューリングを含みます。
• ISV アプリケーションソフトウェアと運用環境管理:アプリケーションソフトウェアのデプロイ、クラスターアカウント管理、スタックを含みます。
• E-HPC パフォーマンスサービス:パフォーマンスデータのデータビジュアライゼーション、パフォーマンス分析と最適化、データキャッシングを含みます。
最後に、ビジネスポートは OpenAPI を通じて提供されます。ユーザーはクラウドデスクトップまたはローカルクライアントから E-HPC サービスを利用できます。
2、E-HPC 製品機能
E-HPC 製品は主に 4 つの主要機能を持っています:クラスター管理、自動スケーリング、ビジネスレポート、パフォーマンス分析です。
クラスター管理:クラウド上の IaaS リソースを HPC クラスターの方式で編成し利用できるよう支援します。以下を含みます:
• クラスターリソース管理。
• クラスターユーザー管理。
• クラスタージョブとスケジューラ管理。
• クラウド内外のリソースへのアクセス。
自動スケーリング:HPC ワークロードの実際の需要に応じてクラスターリソースを動的にスケーリングします。以下を含みます:
• 操作負荷の検出と統計。
• リソースのスケジューラへの登録/削除。
• 多次元スケーリング戦略。
ビジネスレポート:HPC クラスターディメンションのビジネスデータを監視し、時系列グラフと統計レポートを生成します。以下を含みます:
• HPC 操作のリアルタイムモニタリングと統計。
• HPC クラスターリソースのモニタリングと統計。
• ジョブ/リソース操作イベント通知とアラーム連携。
パフォーマンス分析:HPC ジョブに対するハードウェアレベル、プロセスレベル、関数レベルのパフォーマンス分析とパフォーマンスレポート。以下を含みます:
• HPC 操作のパフォーマンスモニタリング。
• HPC 操作のパフォーマンス分析。
1. E-HPC クラスター管理
E-HPC はクラスターリソースの作成、デプロイ、クラスターノード状態管理などのクラスター管理サービスを提供します。
図に示すように、左側は一般的なクラスター構成図で、グラフィックスノード、ヘッドノード、コンピュートノード、ファイルストレージを含みます。図の右側では、クラスターがクラウドにマッピングされています。Alibaba Cloud サービスコンポーネント(ECS インスタンス、GPU インスタンス、クラウドデスクトップ)を組み合わせて、E-HPC コンソールからクリック操作でクラスターを作成します。
E-HPC コントロールサービスは、リージョン内の 1 つ以上のクラスターを管理し、クラスター状態を監視し、レポート、アラーム、パフォーマンス分析などのビジネス機能を実装します。
2. E-HPC クラスターリソースの拡張と縮小
E-HPC クラスターリソースのスケーリングは、手動スケーリングと自動スケーリングの 2 種類に分けられます。
• 手動拡張:ユーザーが拡張に必要なリソースタイプと数量を直接指定します。E-HPC は対応するリソースの作成、関連ソフトウェアのデプロイ、スケジューラの対応キューへの追加、リソース状態を利用可能に設定することを担当します。縮小時は、スケジューラの対応する設定を完了し、関連するコンピュートノード情報をスケジューラからクリアします。
• 自動スケーリング:スケジューラと連携して実行されます。自動スケーリングのトリガーはユーザーの直接関与を必要としません。ユーザーは自動スケーリングポリシーを設定するだけで、E-HPC がスケジューラと連携してワークロードを感知し、設定されたポリシーに従ってスケーリングを実行します。
負荷感知:
• 並列リソース要件の感知:コア数、ノード数、メモリ、GPU など。
• 並列管理要件の感知:キュー、拡張対象の仮想ノード。
• しきい値制限:ユーザーリソース制限、クラスターリソース制限、キューリソース制限など。
• スケジューリング戦略:スケジューリング優先度、ジョブ間の依存関係制約など。
E-HPC は多様な拡張戦略を提供します。以下を含みます:
• インスタンスサイズ拡張の優先度。
• AZ 間/リージョン間。
• キュー拡張。
• バッチ拡張。
• 拡張待ち時間。
• インスタンス保持。
• 待ち時間/待ち戦略の自動回復。
• コスト最適化。
• インベントリ戦略。
• ……
3. E-HPC クラスターイベントモニタリングとビジネスレポート
E-HPC サービスは HPC スケジューラと密接に連携しているため、スケジューラレベルとジョブレベルの詳細なイベントからモニタリングデータとレポートデータを生成できます。これによりユーザーはビジネスステータスを分析し、ビジネスボトルネックを特定し、ビジネスプロセスを最適化できます。
イベントに基づくスケーリング水位超過アラームを実現:
4. E-HPC ハイブリッドクラスターソリューション(オフライン制御主体)
オフライン制御ベースのネットワーキング方式では、ヘッドノードがオフラインマシンルームに配置され、E-HPC はオフラインマシンルームのスケジューラと連携して、スケジューラ負荷に応じたクラウドリソースの拡張と縮小機能を実現します。
同様に、顧客は手動での拡張と縮小も選択できます。E-HPC はクラウド上のコンピュートノードを拡張し、顧客の必要に応じてラインスケーラを追加します。
A. 方式の特徴:
• 一貫した利用習慣:既存のローカル HPC クラスターを変更する必要がなく、ユーザーの利用習慣やスケジューラスクリプトも変更されません。
• ワンクリック作成:クラウド上でワンクリックで E-HPC クラスターを作成します。プロキシノードがクラウドリソースを代理管理し、クラウドの自動スケーリングとレポートサービスを統合します。
• 弾力的スケーリング:ビジネスピーク時にオンラインリソースを拡張し、従量課金で利用します。ビジネス低調時はオンラインリソースを自動リリースしてコストを削減します。
B. 適用シナリオ:
既存のオフラインマシンルームの HPC クラスターを引き続き利用し、ビジネスのピークとバレーに応じてクラウドリソースを柔軟に拡張・リリースすることで、迅速なリソース供給とコスト削減を実現します。
ハイブリッドクラウドクラスターの作成:https://help.aliyun.com/document_detail/84850.html
5. E-HPC ハイブリッドクラスターソリューション(クラウド制御主体)
クラウド管理・制御ベースのネットワーキング方式はサブパイプラインノードと呼ばれます。クラスターはクラウド HPC クラスターを基盤としており、ヘッドノードとログインノードはクラウド上に配置され、オフラインノードは補助および既存機器として利用されます。
A. 方式の特徴:
• クラウドでの運用保守:クラウド上の E-HPC 制御で、HPC スケジューラディメンションのリソース管理を行い、オフラインクラスターの運用保守コストを削減します。
• オフラインの管理:クラウド上でワンクリックで E-HPC クラスターを作成し、ローカルのオフラインコンピューティングリソースを管理して、既存のオフライン機器を有効活用します。
• 弾力的スケーリング:ビジネスピーク時にオンラインリソースを拡張し、従量課金で利用します。ビジネス低調時はオンラインリソースを自動リリースしてコストを削減します。
B. 適用シナリオ:
オフラインマシンルームの HPC クラスターリソースが老朽化しており、クラウドリソースを柔軟に活用しながら段階的にクラウドへ移行したい場合に適しています。同時に既存のオフラインコンピューティングリソースも管理し、効率的なコスト削減を実現します。
ハイブリッドクラウドマスターモードのベストプラクティス
6. E-HPC クラスタースケジューラ互換性ソリューション
E-HPC はプラットフォームの拡張コンポーネントとしてスケジューラプラグインを提供します。E-HPC の既存のスケジューラタイプやバージョンが現在のビジネス要件を満たさない場合、顧客はこのプラグインを使用してカスタマイズされたスケジューラを構築し、E-HPC プラットフォームに接続できます。
プラグインメカニズムによるサードパーティ/商用スケジューラの統合:
• E-HPC 制御はプラグインフレームワークインターフェイスを通じてクラスター管理を実行します。ジョブ管理、リソース管理、負荷モニタリング、容量拡張などを含みます。
• プラグインコードのカスタマイズでプラグインフレームワーク定義機能を実現し、スケジューラとの適応を完了します。
• E-HPC クラスター作成プロセスはカスタマイズされたプラグインのインストールとデプロイをサポートします
• 設定ファイルを通じたプラグインサポート機能の設定をサポートします
• E-HPC はプラグインテンプレートと PBS、LSF などのスケジューラプラグインサンプルを提供します。
1. E-HPC 製品設計の出発点
Elastic High Performance Computing E-HPC は、クラウド上で HPC 環境を迅速に構築し、クラウドサービスの利点を最大限に活用できるよう設計された製品です。
E-HPC の製品設計は、主に以下の 3 つの観点を考慮しています:
• HPC ユーザーの認識に基づくクラウドスーパーコンピューティング環境の構築:HPC ユーザーが考える HPC 環境とは、対応するソフトウェアがデプロイされた緊密結合されたクラスターであり、個別のサーバーやストレージネットワークではありません。
• HPC ユーザーの利用習慣に合わせたスーパーコンピューティングサービスの提供:HPC 利用には長期的に固定されたビジネスワークフローがあり、クラウドサービスは既存の利用プロセスに適合する必要があります。
• 新モデル/新体験を提供する複合サービス機能:クラウドサービスの特性を活かして、オフライン HPC では一般的でない、または存在しなかったモデルを提供し、クラウドスーパーコンピューティングの特徴を形成します。
2. HPC 製品ソリューションビュー
• クラスターリソースライフサイクル管理:クラスター作成、クラスター拡張とスケーリング、アプリケーション負荷に基づく自動スケーリング、クラスター管理と運用保守を含みます。
• クラスタージョブ管理とスケジューリング:スケジューラ管理と設定、ジョブスケジューリング、ジョブ負荷モニタリングとレポート、サードパーティスケジューラ統合、クラウド間ハイブリッドスケジューリングを含みます。
• ISV アプリケーションソフトウェアと運用環境管理:アプリケーションソフトウェアのデプロイ、クラスターアカウント管理、スタックを含みます。
• E-HPC パフォーマンスサービス:パフォーマンスデータのデータビジュアライゼーション、パフォーマンス分析と最適化、データキャッシングを含みます。
最後に、ビジネスポートは OpenAPI を通じて提供されます。ユーザーはクラウドデスクトップまたはローカルクライアントから E-HPC サービスを利用できます。
2、E-HPC 製品機能
E-HPC 製品は主に 4 つの主要機能を持っています:クラスター管理、自動スケーリング、ビジネスレポート、パフォーマンス分析です。
クラスター管理:クラウド上の IaaS リソースを HPC クラスターの方式で編成し利用できるよう支援します。以下を含みます:
• クラスターリソース管理。
• クラスターユーザー管理。
• クラスタージョブとスケジューラ管理。
• クラウド内外のリソースへのアクセス。
自動スケーリング:HPC ワークロードの実際の需要に応じてクラスターリソースを動的にスケーリングします。以下を含みます:
• 操作負荷の検出と統計。
• リソースのスケジューラへの登録/削除。
• 多次元スケーリング戦略。
ビジネスレポート:HPC クラスターディメンションのビジネスデータを監視し、時系列グラフと統計レポートを生成します。以下を含みます:
• HPC 操作のリアルタイムモニタリングと統計。
• HPC クラスターリソースのモニタリングと統計。
• ジョブ/リソース操作イベント通知とアラーム連携。
パフォーマンス分析:HPC ジョブに対するハードウェアレベル、プロセスレベル、関数レベルのパフォーマンス分析とパフォーマンスレポート。以下を含みます:
• HPC 操作のパフォーマンスモニタリング。
• HPC 操作のパフォーマンス分析。
1. E-HPC クラスター管理
E-HPC はクラスターリソースの作成、デプロイ、クラスターノード状態管理などのクラスター管理サービスを提供します。
図に示すように、左側は一般的なクラスター構成図で、グラフィックスノード、ヘッドノード、コンピュートノード、ファイルストレージを含みます。図の右側では、クラスターがクラウドにマッピングされています。Alibaba Cloud サービスコンポーネント(ECS インスタンス、GPU インスタンス、クラウドデスクトップ)を組み合わせて、E-HPC コンソールからクリック操作でクラスターを作成します。
E-HPC コントロールサービスは、リージョン内の 1 つ以上のクラスターを管理し、クラスター状態を監視し、レポート、アラーム、パフォーマンス分析などのビジネス機能を実装します。
2. E-HPC クラスターリソースの拡張と縮小
E-HPC クラスターリソースのスケーリングは、手動スケーリングと自動スケーリングの 2 種類に分けられます。
• 手動拡張:ユーザーが拡張に必要なリソースタイプと数量を直接指定します。E-HPC は対応するリソースの作成、関連ソフトウェアのデプロイ、スケジューラの対応キューへの追加、リソース状態を利用可能に設定することを担当します。縮小時は、スケジューラの対応する設定を完了し、関連するコンピュートノード情報をスケジューラからクリアします。
• 自動スケーリング:スケジューラと連携して実行されます。自動スケーリングのトリガーはユーザーの直接関与を必要としません。ユーザーは自動スケーリングポリシーを設定するだけで、E-HPC がスケジューラと連携してワークロードを感知し、設定されたポリシーに従ってスケーリングを実行します。
負荷感知:
• 並列リソース要件の感知:コア数、ノード数、メモリ、GPU など。
• 並列管理要件の感知:キュー、拡張対象の仮想ノード。
• しきい値制限:ユーザーリソース制限、クラスターリソース制限、キューリソース制限など。
• スケジューリング戦略:スケジューリング優先度、ジョブ間の依存関係制約など。
E-HPC は多様な拡張戦略を提供します。以下を含みます:
• インスタンスサイズ拡張の優先度。
• AZ 間/リージョン間。
• キュー拡張。
• バッチ拡張。
• 拡張待ち時間。
• インスタンス保持。
• 待ち時間/待ち戦略の自動回復。
• コスト最適化。
• インベントリ戦略。
• ……
3. E-HPC クラスターイベントモニタリングとビジネスレポート
E-HPC サービスは HPC スケジューラと密接に連携しているため、スケジューラレベルとジョブレベルの詳細なイベントからモニタリングデータとレポートデータを生成できます。これによりユーザーはビジネスステータスを分析し、ビジネスボトルネックを特定し、ビジネスプロセスを最適化できます。
イベントに基づくスケーリング水位超過アラームを実現:
4. E-HPC ハイブリッドクラスターソリューション(オフライン制御主体)
オフライン制御ベースのネットワーキング方式では、ヘッドノードがオフラインマシンルームに配置され、E-HPC はオフラインマシンルームのスケジューラと連携して、スケジューラ負荷に応じたクラウドリソースの拡張と縮小機能を実現します。
同様に、顧客は手動での拡張と縮小も選択できます。E-HPC はクラウド上のコンピュートノードを拡張し、顧客の必要に応じてラインスケーラを追加します。
A. 方式の特徴:
• 一貫した利用習慣:既存のローカル HPC クラスターを変更する必要がなく、ユーザーの利用習慣やスケジューラスクリプトも変更されません。
• ワンクリック作成:クラウド上でワンクリックで E-HPC クラスターを作成します。プロキシノードがクラウドリソースを代理管理し、クラウドの自動スケーリングとレポートサービスを統合します。
• 弾力的スケーリング:ビジネスピーク時にオンラインリソースを拡張し、従量課金で利用します。ビジネス低調時はオンラインリソースを自動リリースしてコストを削減します。
B. 適用シナリオ:
既存のオフラインマシンルームの HPC クラスターを引き続き利用し、ビジネスのピークとバレーに応じてクラウドリソースを柔軟に拡張・リリースすることで、迅速なリソース供給とコスト削減を実現します。
ハイブリッドクラウドクラスターの作成:https://help.aliyun.com/document_detail/84850.html
5. E-HPC ハイブリッドクラスターソリューション(クラウド制御主体)
クラウド管理・制御ベースのネットワーキング方式はサブパイプラインノードと呼ばれます。クラスターはクラウド HPC クラスターを基盤としており、ヘッドノードとログインノードはクラウド上に配置され、オフラインノードは補助および既存機器として利用されます。
A. 方式の特徴:
• クラウドでの運用保守:クラウド上の E-HPC 制御で、HPC スケジューラディメンションのリソース管理を行い、オフラインクラスターの運用保守コストを削減します。
• オフラインの管理:クラウド上でワンクリックで E-HPC クラスターを作成し、ローカルのオフラインコンピューティングリソースを管理して、既存のオフライン機器を有効活用します。
• 弾力的スケーリング:ビジネスピーク時にオンラインリソースを拡張し、従量課金で利用します。ビジネス低調時はオンラインリソースを自動リリースしてコストを削減します。
B. 適用シナリオ:
オフラインマシンルームの HPC クラスターリソースが老朽化しており、クラウドリソースを柔軟に活用しながら段階的にクラウドへ移行したい場合に適しています。同時に既存のオフラインコンピューティングリソースも管理し、効率的なコスト削減を実現します。
ハイブリッドクラウドマスターモードのベストプラクティス
6. E-HPC クラスタースケジューラ互換性ソリューション
E-HPC はプラットフォームの拡張コンポーネントとしてスケジューラプラグインを提供します。E-HPC の既存のスケジューラタイプやバージョンが現在のビジネス要件を満たさない場合、顧客はこのプラグインを使用してカスタマイズされたスケジューラを構築し、E-HPC プラットフォームに接続できます。
プラグインメカニズムによるサードパーティ/商用スケジューラの統合:
• E-HPC 制御はプラグインフレームワークインターフェイスを通じてクラスター管理を実行します。ジョブ管理、リソース管理、負荷モニタリング、容量拡張などを含みます。
• プラグインコードのカスタマイズでプラグインフレームワーク定義機能を実現し、スケジューラとの適応を完了します。
• E-HPC クラスター作成プロセスはカスタマイズされたプラグインのインストールとデプロイをサポートします
• 設定ファイルを通じたプラグインサポート機能の設定をサポートします
• E-HPC はプラグインテンプレートと PBS、LSF などのスケジューラプラグインサンプルを提供します。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
