cGPU で高い GPU 使用率を実現

GPU メモリとコンピューティング能力をコンテナとして管理・スケジューリングすることで、GPU 使用率を最大化し、コストを削減できます。

概要

Alibaba Cloud Container GPU (cGPU) は、GPU のメモリとコンピューティング能力を分割し、複数の隔離されたコンテナとして透過的に管理します。Alibaba Cloud、Amazon Web Services (AWS)、Google Compute Engine (GCE)、またはデータセンターにデプロイされたコンテナクラスターで cGPU を有効化できます。また、AI 推論やトレーニングタスクの要件に基づいて、Alibaba Cloud Container Service for Kubernetes (ACK) で GPU 共有とスケジューリングのポリシーを柔軟にカスタマイズし、リソース使用率を最適化してコストを削減できます。

ソリューションハイライト

  • 効率的な GPU メモリの隔離

    Alibaba Cloud のホストカーネルによる仮想 GPU 隔離技術に基づき、GPU のメモリとコンピューティングリソースを分割して複数のコンテナとして管理することで、GPU 使用率を最大化し、メモリの競合を防止します。

  • 柔軟な GPU リソースの共有とスケジューリング

    さまざまなビジネスシナリオに応じたスケジューリング戦略で GPU のメモリとコンピューティングリソースを AI ジョブに割り当て、コンテナの高パフォーマンスを維持しながら GPU 使用率を最大化します。

  • カスタマイズ可能な GPU オートスケーリング

    使用率やメモリ使用量などの主要な GPU メトリクスを設定し、GPU インスタンスのスケールアップ / スケールダウンを自動的にトリガーすることで、GPU リソースの可用性を向上させ、AI タスクの安定性を確保します。

  • リアルタイムの GPU 可視化モニタリング

    Prometheus のクラスターおよびノードのダッシュボードから、メモリ割り当てや使用量、GPU 温度などの主要な GPU メトリクスをリアルタイムで可視化。GPU インスタンスの健全性を維持し、ソース分散を最適化します。

Alibaba Cloud cGPU で GPU 使用率を向上

個別相談を始める

仕組み

お客様の課題

AI 推論ワークロードなど複数のタスクを 1 つの GPU で実行する場合、GPU は常に 1 つのタスクに占有され、メモリはフルに使用されているにもかかわらず、コンピューティングリソースの大部分はアイドル状態となり、GPU 使用率が低下します。

当社のソリューション

  • Alibaba Cloud cGPU を使用すると、1 つの GPU 上で複数の GPU コンテナを実行でき、アプリケーションは各コンテナ内で隔離されます。ホストカーネルが仮想 GPU をコンテナに提供し、メモリとコンピューティング能力を隔離します。各コンテナに割り当てられた GPU リソースは隔離され、操作の競合やセキュリティリスクを防止します。cGPU はオープンソースの Kubernetes および NVIDIA Docker と互換性があり、さまざまなタイプの Alibaba Cloud GPU コンピューティング型インスタンスや、Alibaba Cloud Container Service for Kubernetes (ACK) にデプロイして GPU 共有をサポートできます。

Elastic GPU Service (EGS)

GPU 技術に基づく強力な並列計算機能

詳細を見る

ECS 第 7 世代

TPM チップを完全搭載し、インスタンスのコンピューティング能力を最大 40% 向上させます。

詳細を見る

ECS Bare Metal Instance (EBM)

仮想サーバーの伸縮性と、物理サーバーの高性能かつ包括的な機能を兼ね備えています。

詳細を見る

お客様の課題

現在市場に出回っている GPU 共有ソリューションは、アプリケーションの再コンパイルを必要とする API の変更に依存しているか、割り当て済みの GPU リソースを隔離できず、GPU エラーやアプリケーションのクラッシュを引き起こします。また、Kubernetes のデフォルトのスケジューリング機能では、AI ジョブを実行するノードを割り当てることができません。

当社のソリューション

  • ACK では、複数のコンテナで 1 つの GPU のリソースを共有できます。Application Real-Time Monitoring Service (ARMS) コンソールで GPU の使用状況をモニタリングし、コンテナワークロードの要件に基づいて各 Pod の GPU メモリを設定することで、リソース使用率を最大化し、コストを削減できます。さまざまなビジネスシナリオでの AI 推論やトレーニングタスクに対しては、AI ジョブのスケジューリングポリシーを適切に設定して、タスク効率と GPU 使用率を向上させることができます。たとえば、binpack スケジューリングポリシーを選択すると、リソースが不足するまで 1 つのノードにジョブを割り当てることで、サーバー間のデータ転送を回避し、リソースのフラグメンテーションを防止できます。また、gang スケジューリングポリシーを選択すると、ジョブのすべてのサブタスクが必要なリソースを取得できる場合にのみリソースを割り当てることで、リソースのデッドロックによるタスクの失敗やリソースの浪費を回避できます。

Alibaba Cloud Container Service for Kubernetes (ACK)

クラウド上でコンテナ化アプリケーションを実行し、企業の高効率を実現します。

詳細を見る

Application Real-Time Monitoring Service (ARMS)

包括的なモニタリング機能に基づき、リアルタイムレスポンスを備えたビジネスモニタリング機能を構築します。

詳細を見る

セキュリティとコンプライアンス

世界中の主要な司法管轄区域において、安定的で信頼性が高く、安全かつコンプライアンスに準拠したクラウドコンピューティングインフラサービスを提供することをお約束します。
詳細を見る
  • CSA STAR
  • ISO 27001
  • SOC2 Type II Report
  • C5
  • MLPS 2.0
  • MTCS

Alibaba Cloud cGPU で GPU 使用率を向上

個別相談を始める

関連リソース

ホワイトペーパー

AI アクセラレーションのホワイトペーパー

このホワイトペーパーは、AI インフラストラクチャ層の仕組みと、AI アクセラレーションのサポート方法を包括的に解説したガイドです。

ブログ

cGPU テクノロジーによる GPU 使用率の向上、AI 効率の強化、コスト削減

Alibaba Cloud は cGPU コンテナ共有テクノロジーを発表しました。ユーザーはコンテナを使用して、基盤の GPU リソースをきめ細かくスケジュールできます。

ブログ

Kubernetes における GPU 管理とデバイスプラグインの実装

この記事では、Kubernetes 向けの一般的な GPU プラグインと、Docker および Kubernetes で GPU を使用する方法を紹介します。

Alibaba Cloud ソリューションで始める

Alibaba Cloud のパワーを学び、体験してください。

営業に連絡