すべてのプロダクト
Search
ドキュメントセンター

Server Load Balancer:AI サービスのフォールバック

最終更新日:Aug 12, 2026

ALB Extensible Edition では、転送ルールで 転送 アクションと複数レベルの フォールバック アクションを組み合わせることができます。プライマリターゲットが 4xx または 5xx レスポンスを返した場合、ALB はいずれかが成功するまで各フォールバックを順番に試行し、大規模言語モデル サービスの高可用性アーキテクチャを実現します。

ソリューションアーキテクチャ

高可用性を確保し、単一のモデルプロバイダーの障害によるダウンタイムを防ぐために、ALB Extensible Edition の転送ルールを設定できます。このルールは、リクエストを DeepSeek などのプライマリサービスにルーティングし、プライマリサービスが失敗した場合には、OpenAI および Model Studio (Bailian) を順番に試行するフォールバック アクションを備えています。リクエストがこのルールに一致すると、ALB はまずリクエストを DeepSeek に送信します。リクエストが失敗した場合 (4xx または 5xx エラー)、ALB は成功するレスポンスを受信するまで、リクエストを OpenAI、次に Model Studio (Bailian) へと自動的に転送します。また、フォールバック機能は、リクエストボディ 内のモデル名を、各ターゲットサービスで想定されているモデルに一致するように自動的に書き換えることもできます。

  • ALB Extensible Edition インスタンス:ロードバランシングとトラフィック転送を処理します。

  • AI サーバーグループ:バックエンドの大規模モデルサービスに接続します。この例では、DeepSeek、OpenAI、Model Studio (Bailian) の 3 つのサーバーグループを使用します。

  • HTTPS リスナー:クライアントリクエストを受信します。

  • 転送ルール:AI モデルの条件に基づいてリクエストを照合し、転送 および フォールバック アクションを設定します。

image

前提条件

  • ALB Extensible Edition のパブリックベータへのアクセス権が必要です。

  • 中国 (ウランチャブ) リージョンに Virtual Private Cloud (VPC) を作成済みであること。VPC には、アベイラビリティーゾーン A に 1 つ、アベイラビリティーゾーン B に 1 つの vSwitch が必要です。AI サーバーグループがパブリックな大規模モデル サービスを呼び出せるように、vSwitch にはパブリック向きのSNATを設定しておく必要があります。

  • Model Studio (Bailian) をアクティベートし、API キーを取得し、その API キーを Identity Management でアイデンティティ認証情報として追加済みであること。フォールバックを実証するため、DeepSeek および OpenAI サーバーグループが参照する、不正な API キー (例: fake-api-key) を含むアイデンティティ認証情報をさらに 2 つ作成済みであること。

  • カスタムドメインを登録済みであること。このガイドでは ALB インスタンスを中国 (ウランチャブ) リージョンにデプロイするため、ドメインには ICP 备案 が必要です。

  • カスタムドメインに一致するサーバー証明書を所有していること。Alibaba Cloud から証明書を購入していない場合は、Alibaba Cloud Certificate Service にアップロードする必要があります。

操作手順

1. ALB Extensible Edition インスタンスの作成

  1. ALB コンソールにログインし、中国 (ウランチャブ) リージョンを選択してから、ALB の作成 をクリックします。

  2. 購入ページで、次の設定を行い、今すぐ作成 をクリックします。

    • [リージョン]中国 (ウランチャブ) を選択します。

    • [インスタンスネットワークタイプ][インターネット] を選択します。

    • [VPC][アベイラビリティーゾーン]: ターゲット VPC を選択します。次に、[ウランチャブゾーン A][ウランチャブゾーン B] のチェックボックスをオンにし、それぞれに対応する vSwitch を選択して、[EIP の割り当て] を選択します。

    • [IPバージョン][IPv4] を選択します。

    • [エディション (インスタンス料金)][Extensible Edition] を選択します。

  3. 注文確認 ページで、インスタンスの設定詳細を確認し、今すぐ有効化 をクリックします。

2. AI サーバーグループの作成

DeepSeek、OpenAI、Model Studio (Bailian) 用に、AI サービスタイプのサーバーグループを 3 つ作成します。フォールバックを実証するため、DeepSeek と OpenAI のサーバーグループは、リクエストが失敗してフォールバックメカニズムがトリガーされるように、不正な API キーを含むアイデンティティ認証情報を参照します。

DeepSeek サーバーグループの作成

  1. サーバーグループ コンソールサーバーグループの作成 をクリックします。サーバーグループタイプAI サービス を選択し、名前として sgp-fake-deepseek を入力します。

  2. 作成 をクリックします。サーバーグループが作成されました ダイアログボックスで、バックエンドサーバーの追加 をクリックします。

  3. AI サービスの追加 ダイアログボックスで、次の設定を行い、OK をクリックします。

    • モデルプロバイダ[DeepSeek] を選択します。

    • エンドポイントモデルプロバイダ を選択すると自動的に入力されます。

    • 認証情報: 不正な API キーを含むアイデンティティ認証情報を選択します。

OpenAI サーバーグループの作成

  1. 上記の手順を繰り返し、sgp-fake-openai という名前の 2 つ目の AI サービス タイプのサーバーグループを作成します。

  2. バックエンドサーバーの追加 を行う際に、モデルプロバイダ[OpenAI] として選択し、認証情報 を不正な API キーを含むアイデンティティ認証情報に設定してから、OK をクリックします。

Model Studio (Bailian) サーバーグループの作成

  1. 上記の手順を繰り返し、sgp-bailian という名前の 3 つ目の AI サービス タイプのサーバーグループを作成します。

  2. バックエンドサーバーの追加 を行う際に、モデルプロバイダAlibaba Cloud Model Studio として選択し、認証情報 を有効な API キーを含むアイデンティティ認証情報に設定してから、OK をクリックします。

3. リスナーの作成

  1. ALB コンソールで、ターゲットインスタンスの ID をクリックして インスタンスの詳細 ページに移動します。リスナー タブで、リスナーの作成 をクリックします。

  2. リスナーの設定 ステップで、リスナープロトコルの選択[HTTPS] に、リスニングポート443 に設定します。次に、次へ をクリックします。

  3. SSL 証明書の設定 ステップで、カスタムドメインに一致するサーバー証明書を選択し、次へ をクリックします。

  4. サーバーグループの選択 ステップで、AI サービス タイプとサーバーグループ sgp-fake-deepseek を選択します。次に、次へ をクリックします。

    ここで選択したサーバーグループは、他のどの転送ルールにも一致しないリクエストを処理するリスナーのデフォルトルールに使用されます。これは、ニーズに応じて調整できます。
  5. 設定の確認 ステップで、設定を確認し、送信 をクリックします。

4. 転送ルールの設定

ALB は転送ルールを優先度の昇順で評価します。リクエストがルールに一致すると、ALB はそのルールのアクションを実行し、残りのルールはスキップします。

  1. インスタンス詳細ページの リスナー タブで、ターゲットリスナーの ID をクリックします。リスナーの詳細 ページで、転送ルール タブに切り替えます。

  2. 新しいルールの追加 をクリックし、次の設定を行ってから OK をクリックします。

    1. 転送条件AI モデル を選択し、モデル名deepseek-chat を入力します。

    2. 転送操作転送先 先としてサーバーグループ sgp-fake-deepseek を指定します。

    3. 操作の追加: サーバーグループ sgp-fake-openai への [フォールバック] を設定し、右側の モデル名gpt-3.5 を入力します。

    4. [フォールバック] セクションで、サーバグループの追加 をクリックします。サーバーグループ sgp-bailian を選択し、右側の モデル名qwen-turbo を入力します。

AI モデル 条件は、OpenAI 互換プロトコルを使用し、リクエストパスが /v1/completions/v1/chat/completions、または /v1/embeddings であるすべてのリクエストに一致します。モデル名 を指定した場合、リクエストボディの model フィールドも指定された名前と一致する必要があります。
フォールバックアクションにモデル名を設定すると、フォールバック時に ALB はリクエストボディの model フィールドを指定された名前に自動的に書き換えます。これにより、リクエストボディがターゲットサービスで想定されているモデルと一致することが保証されます。

5. DNS 名前解決の設定

クライアントがドメイン経由で ALB にアクセスできるように、カスタムドメインを ALB インスタンスの DNS 名にポイントする CNAME レコードを作成します。

このガイドでは、Alibaba Cloud DNS を例として使用します。ドメインが Alibaba Cloud に登録されていない場合は、まずドメインを Alibaba Cloud DNS コンソールに追加してください。

  1. ALB コンソールで、ターゲットインスタンスの ドメイン名 をコピーします。

  2. Alibaba Cloud DNS コンソールにログインします。ターゲットドメインの Actions 列で、解決設定 をクリックします。解決設定 ページで、Add Record をクリックします。

  3. 次の情報で CNAME レコードを追加し、OK をクリックします。

    • Record Type[CNAME] を選択します。

    • Hostnameai などのドメインプレフィックスを入力します。ルートドメインが example.com の場合、ALB にアクセスするための完全なドメインは ai.example.com になります。

    • Query SourceTTL: デフォルト設定のままにします。

    • Record Value: ALB インスタンスの DNS 名を入力します。

  4. Change Resource Record Confirmation ダイアログボックスで、DNS 情報を確認し、OK をクリックします。

6. テストと検証

  • curl コマンドを使用して、リクエストが正しい大規模モデルサービスにフォールバックすることを確認します。ai.example.com を設定したドメインに置き換えます。DNS レコードが伝播していることを確認してください。

  • クライアントリクエストは OpenAI 互換プロトコルを使用する必要があります。リクエストパスは /v1/completions/v1/chat/completions、または /v1/embeddings である必要があり、リクエストボディには model フィールドが含まれている必要があります。ALB はルーティングに model の値を使用します。

curl -v \
    -H "Content-Type: application/json" \
    -d '{
        "model": "deepseek-chat",
        "messages": [
            {
                "role": "user",
                "content": "Who are you"
            }
        ]
    }' \
    https://ai.example.com/v1/chat/completions

成功したリクエストは、次のレスポンスを返します。sgp-fake-deepseeksgp-fake-openai は不正な API キーを使用しているため、ALB は失敗のレスポンスを受け取り、順次フォールバックして、最終的にリクエストを sgp-bailian に転送します。レスポンスでは、modelqwen-turbo として表示され、content には Qwen からの自己紹介が含まれています。これにより、リクエストが Model Studio (Bailian) にフォールバックし、モデル名が qwen-turbo に書き換えられたことが確認できます。

{
    "choices": [
        {
            "message": {
                "role": "assistant",
                "content": "I am Qwen, a large language model from Alibaba's Tongyi Lab. I can answer questions, create text, use logical reasoning, and write code. How can I help you?"
            },
            "finish_reason": "stop",
            "index": 0
        }
    ],
    "object": "chat.completion",
    "model": "qwen-turbo"
}

詳細情報

課金

制限事項

  • フォールバックは、[サーバタイプ]、[IP タイプ]、[Function Compute タイプ]、[FQDN]、[AI サービス]のサーバーグループタイプでサポートされています。これらのサーバーグループタイプは、[転送先]およびフォールバックアクションの両方のターゲットとして使用できます。

  • [AI サービス]以外のサーバーグループへのフォールバックを設定する場合、そのサーバーグループが OpenAI プロトコル互換のモデルサービスを提供していることを確認してください。

  • デフォルトでは、1 つの転送ルールに対して最大 5 つのフォールバックサービスを設定できます。このクォータの引き上げを希望する場合は、チケットを起票してください。

  • フォールバックのトリガー条件 (HTTP 4xx または 5xx ステータスコード) は固定されており、カスタマイズできません。

ALB Extensible Edition のリージョン

エリア

リージョン

ゾーン

中国

中国 (ウランチャブ)

ゾーン A、ゾーン B、およびゾーン C

中国 (杭州)

ゾーン J およびゾーン K

中国 (北京)

ゾーン I、ゾーン K、およびゾーン L

中国 (上海)

ゾーン B およびゾーン F

中国 (香港)

ゾーン B、ゾーン C、およびゾーン D

アジアパシフィック

シンガポール

ゾーン A、ゾーン B、およびゾーン C

日本 (東京)

ゾーン B、ゾーン C、およびゾーン E

マレーシア (クアラルンプール)

ゾーン A、ゾーン B、およびゾーン C

ヨーロッパおよびアメリカ

ドイツ (フランクフルト)

ゾーン A およびゾーン B

米国 (シリコンバレー)

ゾーン A およびゾーン B

中東

UAE (ドバイ)

ゾーン A およびゾーン B

推奨事項

  • フォールバック順序の計画: ALB は設定された順序でフォールバックアクションを実行します。モデルの可用性、コスト、レスポンスのレイテンシーに基づいて、各フォールバックサービスの優先度を計画してください。

  • モデルの一貫性の確保: モデルプロバイダーによって、出力形式や機能は異なります。フォールバック中にビジネスロジックへの影響を最小限に抑えるために、各フォールバックサービスで同様の機能を持つモデルを選択してください。

よくある質問

フォールバックを設定しましたが、トリガーされません。なぜですか?

  • 転送ルールの条件がリクエストに一致し、そのルールが一致するすべてのルールの中で最も高い優先度を持っていることを確認してください。

  • 転送先 アクションのサーバーグループが 4xx または 5xx のステータスコードを返していることを確認してください。

フォールバック後にモデルがエラーを返します。なぜですか?

  • フォールバック先のサーバーグループの API キーが正しいか確認してください。

  • モデル名の書き換えを設定した場合は、書き換えられたモデル名がターゲットサービスでサポートされているモデルと一致することを確認してください。