概要
Alibaba Cloud Container GPU (cGPU) は、GPU のメモリとコンピューティング能力を分割し、複数の隔離されたコンテナとして透過的に管理します。Alibaba Cloud、Amazon Web Services (AWS)、Google Compute Engine (GCE)、またはデータセンターにデプロイされたコンテナクラスターで cGPU を有効化できます。また、AI 推論やトレーニングタスクの要件に基づいて、Alibaba Cloud Container Service for Kubernetes (ACK) で GPU 共有とスケジューリングのポリシーを柔軟にカスタマイズし、リソース使用率を最適化してコストを削減できます。
ソリューションハイライト
-
効率的な GPU メモリの隔離
Alibaba Cloud のホストカーネルによる仮想 GPU 隔離技術に基づき、GPU のメモリとコンピューティングリソースを分割して複数のコンテナとして管理することで、GPU 使用率を最大化し、メモリの競合を防止します。
-
柔軟な GPU リソースの共有とスケジューリング
さまざまなビジネスシナリオに応じたスケジューリング戦略で GPU のメモリとコンピューティングリソースを AI ジョブに割り当て、コンテナの高パフォーマンスを維持しながら GPU 使用率を最大化します。
-
カスタマイズ可能な GPU オートスケーリング
使用率やメモリ使用量などの主要な GPU メトリクスを設定し、GPU インスタンスのスケールアップ / スケールダウンを自動的にトリガーすることで、GPU リソースの可用性を向上させ、AI タスクの安定性を確保します。
-
リアルタイムの GPU 可視化モニタリング
Prometheus のクラスターおよびノードのダッシュボードから、メモリ割り当てや使用量、GPU 温度などの主要な GPU メトリクスをリアルタイムで可視化。GPU インスタンスの健全性を維持し、ソース分散を最適化します。
Alibaba Cloud cGPU で GPU 使用率を向上
個別相談を始める仕組み
お客様の課題
AI 推論ワークロードなど複数のタスクを 1 つの GPU で実行する場合、GPU は常に 1 つのタスクに占有され、メモリはフルに使用されているにもかかわらず、コンピューティングリソースの大部分はアイドル状態となり、GPU 使用率が低下します。
当社のソリューション
-
Alibaba Cloud cGPU を使用すると、1 つの GPU 上で複数の GPU コンテナを実行でき、アプリケーションは各コンテナ内で隔離されます。ホストカーネルが仮想 GPU をコンテナに提供し、メモリとコンピューティング能力を隔離します。各コンテナに割り当てられた GPU リソースは隔離され、操作の競合やセキュリティリスクを防止します。cGPU はオープンソースの Kubernetes および NVIDIA Docker と互換性があり、さまざまなタイプの Alibaba Cloud GPU コンピューティング型インスタンスや、Alibaba Cloud Container Service for Kubernetes (ACK) にデプロイして GPU 共有をサポートできます。
お客様の課題
現在市場に出回っている GPU 共有ソリューションは、アプリケーションの再コンパイルを必要とする API の変更に依存しているか、割り当て済みの GPU リソースを隔離できず、GPU エラーやアプリケーションのクラッシュを引き起こします。また、Kubernetes のデフォルトのスケジューリング機能では、AI ジョブを実行するノードを割り当てることができません。
当社のソリューション
-
ACK では、複数のコンテナで 1 つの GPU のリソースを共有できます。Application Real-Time Monitoring Service (ARMS) コンソールで GPU の使用状況をモニタリングし、コンテナワークロードの要件に基づいて各 Pod の GPU メモリを設定することで、リソース使用率を最大化し、コストを削減できます。さまざまなビジネスシナリオでの AI 推論やトレーニングタスクに対しては、AI ジョブのスケジューリングポリシーを適切に設定して、タスク効率と GPU 使用率を向上させることができます。たとえば、binpack スケジューリングポリシーを選択すると、リソースが不足するまで 1 つのノードにジョブを割り当てることで、サーバー間のデータ転送を回避し、リソースのフラグメンテーションを防止できます。また、gang スケジューリングポリシーを選択すると、ジョブのすべてのサブタスクが必要なリソースを取得できる場合にのみリソースを割り当てることで、リソースのデッドロックによるタスクの失敗やリソースの浪費を回避できます。
Application Real-Time Monitoring Service (ARMS)
包括的なモニタリング機能に基づき、リアルタイムレスポンスを備えたビジネスモニタリング機能を構築します。
詳細を見るセキュリティとコンプライアンス
-
CSA STAR -
ISO 27001 -
SOC2 Type II Report -
C5 -
MLPS 2.0 -
MTCS
Alibaba Cloud cGPU で GPU 使用率を向上
個別相談を始める関連リソース
ホワイトペーパー
AI アクセラレーションのホワイトペーパー
このホワイトペーパーは、AI インフラストラクチャ層の仕組みと、AI アクセラレーションのサポート方法を包括的に解説したガイドです。
ブログ
cGPU テクノロジーによる GPU 使用率の向上、AI 効率の強化、コスト削減
Alibaba Cloud は cGPU コンテナ共有テクノロジーを発表しました。ユーザーはコンテナを使用して、基盤の GPU リソースをきめ細かくスケジュールできます。
ブログ
Kubernetes における GPU 管理とデバイスプラグインの実装
この記事では、Kubernetes 向けの一般的な GPU プラグインと、Docker および Kubernetes で GPU を使用する方法を紹介します。
