AI Gateway は、プロトコル変換、セキュリティ、トラフィックガバナンス、オブザーバビリティの機能を提供する統合ゲートウェイとして、AI アプリケーションをモデルサービス、ツール、エージェントに接続します。
概要
大規模言語モデル (LLM) によって AI のユースケースが拡大するにつれて、アプリケーションアーキテクチャはマイクロサービスやクラウドネイティブから AI ネイティブへと進化しています。この変化により、統合、安定性、セキュリティ、コンプライアンス、管理における課題が生じます。
Cloud-native API Gateway は、AI アプリケーション、モデルサービス、ツール、エージェントを接続する中核ハブとして AI Gateway を提供します。AI ネイティブアプリケーション向けに、プロトコル変換、セキュリティ保護、トラフィックガバナンス、統合オブザーバビリティを提供します。
AI統合における課題
従来のアプリケーションとは異なり、AI アプリケーションはモデル中心です。推論、プロンプト、ツール呼び出し、メモリを活用してビジネス要件に対応します。
AI アプリケーションのトラフィックは、次の 3 つのカテゴリに分類されます。
-
モデルサービスへのアクセス:AI アプリケーションは推論と計画のためにモデルに依存します。このアクセスパスのセキュリティの確保と安定化は重要です。
-
外部ツールの呼び出し:ツールは AI アプリケーションと外部システムを橋渡しし、通常は Model Context Protocol (MCP) などのプロトコルを介して行われます。
-
外部からのアクセス:エンドユーザーまたは他の AI アプリケーションが、A2A などのプロトコルを介してサービスにアクセスします。
各シナリオには、それぞれ固有の課題があります。
モデルアクセスの課題
-
複数のモデル:プロバイダーによって API 仕様、認証、呼び出し方法が異なります。プロバイダー間で統合や並列呼び出しを行うための標準的な抽象化レイヤーは存在しません。
-
複数のモダリティ:マルチモーダルモデルには統一標準がありません。転送プロトコル (SSE、WebSocket、Web Real-Time Communication (WebRTC))、通信モード (同期または非同期)、リクエスト/レスポンス構造が異なるため、統合がより複雑になります。
-
複数のシナリオ:シナリオごとに必要なスロットリング、フォールトトレランス、サービス品質が異なります。たとえばリアルタイム音声認識は低 RT が求められる一方、長文理解は処理の安定性が求められます。
-
高いセキュリティ要件:外部モデルやオープンソースモデルの呼び出しには、データ漏洩のリスクがあります。機密データを送信する際は、プライバシー保護、監査証跡、アクセス制御に関するコンプライアンス要件を満たす必要があります。
-
高い安定性要件:モデルサービスはスロットリングの閾値が低く、従来の API と比べて RT や成功率が安定しにくい傾向があります。これらの変動は、上流の AI アプリケーションの継続性とユーザー体験に影響します。
ツールアクセスの課題
ツールアクセスでは、効率とセキュリティのバランスを取る必要があります。
利用可能なツールが増えると、LLM に大きなツールリストを送信するとトークン消費と推論コストが増加します。候補が多すぎると、モデルの選択精度も低下します。
ツールは中核となるビジネスロジックに紐付くことが多く、不適切な呼び出しはセキュリティリスクの対象領域を拡大します。悪意のある MCP ポイズニングなどの脅威に対処するには、堅牢なツールアクセスセキュリティが必要です。
エージェントアクセスの課題
開発者は、主に次の 3 つの方法で AI アプリケーションを構築します。
-
ハイコード開発:Spring AI Alibaba、ADK、LangChain などのフレームワークを使用します。柔軟性は最大ですが、より高度な技術スキルが必要です。
-
ローコード開発:Alibaba Cloud Model Studio などのプラットフォームを使用し、ドラッグアンドドロップのインターフェイスでフローをオーケストレーションします。迅速なプロトタイピングと反復に適しています。
-
ノーコード開発:JManus などのツールを使用し、プロンプト設定のみで AI アプリケーションを構築します。シンプルなシナリオに適しています。
AI アプリケーションを接続するための統一標準がないため、クラウドネイティブアーキテクチャのような集中型のガバナンスと制御を実現することが困難です。
AI アプリケーションの振る舞いは基盤となる LLM に依存するため、出力が不安定になる可能性があります。分離とフォールトトレランスがなければ、単一障害が依存する業務システム全体へ波及する可能性があります。
AI Gatewayによる各シナリオへの対応
AI Gateway は、AI アプリケーション、モデルサービス、ツール、エージェントを橋渡しします。次のシナリオは、各課題にどのように対応するかを示します。
モデルアクセス
ある企業は、Platform for AI (PAI) にファインチューニング済みモデルをデプロイし、フォールバックとして Model Studio を統合し、画像生成には Function Compute 上のオープンソースモデルを使用しています。AI Gateway は、API レイヤーでトラフィックガバナンスと認証を行う、統一されたモデルアクセスエントリポイントを提供します。
AI Gateway は次の課題に対応します。
-
複数のモデル:AI Gateway は、モデル名、リクエスト比率、またはヘッダーなどのリクエスト特性に基づいてリクエストをルーティングします。プロバイダー固有のプロトコルを OpenAI 互換インターフェイスに変換し、モデル間のシームレスな切り替えを可能にします。
-
複数のモダリティ:AI Gateway は、統一エンドポイントを通じて、HTTP および WebSocket 上のマルチモーダルモデル呼び出しをプロキシします。アプリケーションは、テキスト生成、画像生成、音声認識モデルを一貫した方法で呼び出せます。また、プラグインによりセキュリティと安定性を強化できます。
-
複数のシナリオ:シナリオ (テキスト生成、画像生成、音声認識) ごとに個別のモデル API を作成します。各呼び出し元に一意のコンシューマーIDを割り当てることで、コンシューマー単位のオブザーバビリティ、スロットリング、セキュリティ、課金が可能になります。
-
高いセキュリティ要件:AI Gateway は、ネットワーク、データ、コンテンツセキュリティにまたがる多層防御を提供します。
-
ネットワークセキュリティ:SSL 証明書、WAF、IP ブラックリスト/ホワイトリストを統合し、入口レイヤーで悪意のあるトラフィックを防御します。
-
データセキュリティ:コンシューマーを認証して API キーの直接露出を防ぎます。バックエンドのモデルサービスキーを管理し、ゲートウェイから機密データを分離できるよう、KMS でのキー保管をサポートします。
-
コンテンツセキュリティ:AI セキュリティガードレールを統合し、非準拠コンテンツやリスクのある入力をリアルタイムに遮断します。データマスキングプラグインは、リクエストを転送する前に機密情報を除去します。
-
-
高い安定性要件:AI Gateway は、オブザーバビリティと制御性により安定性を向上させます。
-
オブザーバビリティ:リクエストごとに、ソースプロバイダー、ターゲットモデル、コンシューマー、最初のバイトまでの時間、トークン数を記録します。スロットリング、遮断、フォールバックなどのイベントをマークします。組み込みダッシュボードでエンドツーエンドで可視化できます。
-
制御性:負荷分散、フォールバック、スロットリング、キャッシュを提供します。トークン上限や同時実行制御など、コンシューマー単位のガバナンスルールを設定できます。監視データを使用してポリシーを最適化し、リソースを動的に調整できます。
-
ツールアクセス
ある企業はツールアクセスにおけるセキュリティリスクに直面しており、統一的なガバナンスが必要です。アーキテクチャチームは標準プロトコルとして MCP を選択し、AI Gateway を使用して既存の HTTP API を自動的に MCP Servers に変換します。
AI Gateway は、ツール呼び出しの精度とセキュリティを確保します。
-
精度:
AI Gateway は既存の HTTP サービスに接続し、MCP サーバーをホストします。ツールの説明を動的に更新し、シナリオごとのツールリストを組み合わせた仮想 MCP サーバーを作成できます。プロバイダーとコンシューマーは、それぞれ独立して独自の MCP サーバーを定義できます。インテリジェントなツールルーティングにより、リクエスト内容に基づいて関連ツールをフィルタリングし、トークン消費を削減して選択精度を向上させます。
-
セキュリティ:AI Gateway は、ツールアクセスに対して多層のアクセス制御を提供します。MCP サーバーレベルの認証と、個々のツールに対するきめ細かな権限を提供します。アクセス権限は、呼び出し元IDとツールのリスクレベルに基づいて割り当てられます。
エージェントアクセス
AI アプリケーションが増えるにつれて、ある企業は集中管理のために AI Gateway の管理下に統合し、A2A プロトコルと Nacos AI Registry を使用してサービス登録とサービスディスカバリを行います。
AI Gateway は、安定性と柔軟性を備えた AI アプリケーション向けの統一プロキシを提供します。
-
安定性:AI Gateway は複数の Alibaba Cloud プラットフォームに接続します。Container Service for Kubernetes (ACK)、Function Compute、Serverless App Engine (SAE) に対応します。アクティブおよびパッシブのヘルスチェックにより異常ノードを分離し、カナリアリリースで変更リスクを低減し、多次元スロットリングで過負荷を防止します。
-
柔軟性:AI Gateway はサービスディスカバリを使用して、コンピューティングプラットフォーム間で AI アプリケーションを公開します。REST-to-A2A のプロトコル変換により、既存の HTTP アプリケーションを自動的にアップグレードします。Model Studio のローコードアプリケーションは、二次認証メカニズムにより統一プロキシアクセスを利用できます。
AI Gateway は Alibaba Cloud のオブザーバビリティシステムと統合します。アプリケーションレイヤーから MCP ツール、モデル呼び出しまでの呼び出しチェーン全体を対象としたエンドツーエンドのトレースと障害特定を、ワンクリックで有効化できます。
AI Gatewayの主な機能
モデル、MCPサーバー、エージェント向けの統一プロキシ
AI Gateway は、複数のサービスタイプに対して統一プロキシと管理を提供します。
-
AIサービス:Model Studio、OpenAI、Minimax、Anthropic、Amazon Bedrock、Azure、および自社構築モデル (Ollama、vLLM、SGLang) のモデルサービスをプロキシします。API キー設定と内部アドレス向けのカスタム DNS をサポートします。
-
エージェントサービス:Model Studio、Dify、およびカスタムエージェントワークロードを含むエージェントプラットフォームをサポートします。認証用の API キーとアプリ ID を設定します。
-
コンテナサービス:ACK または ACS クラスター上のサービスをサポートします。AI Gateway インスタンスごとに最大 3 つのコンテナクラスターをサポートします。
-
Nacosサービス:MSE Nacos レジストリに登録された、マイクロサービスと MCP Servers 両方のサービスインスタンスにアクセスします。
-
DNSサービス:DNS 解決を通じてバックエンドサービスにアクセスします。プライベートネットワークまたは内部ドメイン向けの専用DNSサーバーをサポートします。
-
固定アドレス:バックエンドサービスアドレスを固定の
IP:Portエントリとして設定します。 -
SAE:Alibaba Cloud SAE 上で実行されるサービスをサポートします。
-
Function Compute:Function Compute と直接統合し、HTTP トリガーをバイパスして呼び出し効率を向上させます。
-
Compute NestのMCPサービス:Compute Nest でホストされる MCP サーバーをサポートします。
AI Gateway は、サービスに対してアクティブおよびパッシブのヘルスチェックをサポートします。
-
アクティブヘルスチェック:ゲートウェイは、構成された検出ルールに基づいてサービスノードを定期的にプローブします。
-
パッシブヘルスチェック:ゲートウェイは、構成された検出ルールに基づき、実際のリクエストパフォーマンスからノードの健全性を評価します。
モデルとエージェント向けの負荷分散とカナリアリリース
モデル向けの負荷分散とカナリアリリース
モデル API は 3 つの負荷分散モードを提供します。
-
単一モデルサービス:単一の LLM サービスを指定します。モデル名のパススルー、またはモデル名の指定に対応します。モデル名を明示的に指定する場合、ユーザーリクエスト内のモデル名は無視されます。
-
複数モデルサービス (モデル名ベース):モデル名のマッチングルールとともに複数の LLM サービスを構成します。たとえば、deepseek-* のリクエストを DeepSeek サービスへ、qwen-* のリクエストを Model Studio へルーティングします。
-
複数モデルサービス (重みベース):モデルごとにリクエスト割り当ての重みを設定して複数の LLM サービスを構成します。新しいモデルのカナリアリリースに適しています。
モデル API は、ヘッダーなどのリクエスト特性に基づいてリクエストを異なるバックエンドへ転送するカスタムルートもサポートします。
エージェント向けのカナリアリリース
エージェント API も、ヘッダーなどのリクエスト特性に基づくカナリアリリースをサポートし、リクエストを異なるバックエンドへルーティングします。
コンシューマー単位の認証、オブザーバビリティ、スロットリング
AI Gateway は、コンシューマー単位の認証、監視、スロットリング、計測をサポートし、きめ細かな管理を可能にします。
コンシューマー認証
AI Gateway でコンシューマーを作成し、リクエスト認証情報を割り当てます。必要に応じて、モデル API、MCP サーバー、エージェント API の認証を有効にします。
AI Gateway は 3 つのコンシューマー認証方法 (API キー、JWT、HMAC) をサポートします。高いセキュリティ要件がある場合は、コンシューマー認証情報をKMSに保管します。
コンシューマー単位のオブザーバビリティと計測
AI Gateway は、コンシューマー単位の監視により、多次元のオブザーバビリティを提供します。主なメトリクスは次のとおりです。
-
QPS:1 秒あたりの AI リクエスト/レスポンス数。リクエスト QPS、ストリーミングレスポンス QPS、非ストリーミングレスポンス QPS に分類されます。
-
リクエスト成功率:1 秒、15 秒、1 分の粒度における成功率。
-
1秒あたりの消費トークン数:入力、出力、合計の 1 秒あたり消費トークン数。
-
平均RT:1 秒、15 秒、または 1 分の粒度における平均応答時間 (ms)。非ストリーミング RT、ストリーミング RT、最初のバイトまでの時間を含みます。
-
キャッシュヒット:期間ごとのキャッシュヒット数とミス数。
-
スロットリング統計:期間ごとのスロットリングされたリクエスト数と通常処理されたリクエスト数。
-
モデル別のトークン統計:指定期間におけるモデル別のトークン消費量。
-
コンシューマー別のトークン統計:指定期間におけるコンシューマー別のトークン消費量。
-
リスク統計:コンテンツセキュリティ検出で識別されたリスクリクエスト数。リスク種別とコンシューマー別に内訳を表示します。
これらのデータにより、コンシューマー単位の計測と課金が可能になります。たとえば、特定のコンシューマーが特定のモデルを呼び出して消費したトークン数を、指定期間で追跡できます。
コンシューマー単位のスロットリング
AI Gateway は、コンシューマー、モデル名、リクエストヘッダーに基づくスロットリングをサポートします。制限対象は、リクエスト、同時実行数、接続数、単位時間あたりのトークン数です。
AIセキュリティ保護
AI Gateway は機能を統合しています。モデル呼び出し中の機密語、コンプライアンス問題、プロンプトインジェクション、ブルートフォース攻撃を防ぐために、API ごとに有効化できます。
AI Gateway では、保護の各ディメンションに独立した遮断ポリシーを設定できます。
-
contentModeration:コンテンツコンプライアンス検出
-
promptAttack:プロンプト攻撃検出
-
sensitiveData:機密コンテンツ検出
-
maliciousFile:悪意のあるファイル検出
-
waterMark:デジタル透かし
-
customLabel:カスタムエージェントラベル
各ディメンションは、次の遮断ポリシーをサポートします。
-
High:すべてのリスクレベル (low、medium、high) を遮断します。
-
Medium:mediumおよびhighのリスクレベルを遮断します。
-
Low:highのリスクレベルのみを遮断します。
-
Monitor mode:記録のみ行い、遮断しません。
ホットスワップ対応のポリシーとプラグイン
AI Gateway は組み込みのポリシーとプラグインを提供するほか、特定のビジネス要件に対応するカスタムプラグインもサポートします。
モデル API には、ツール選択、セキュリティ保護、スロットリング、キャッシュ、Web検索の 5 つの主要な組み込みポリシーがあります。必要に応じて追加のポリシーとプラグインを有効化できます。
すべてのポリシーとプラグインはホットスワップに対応しており、サービスのトラフィックに影響を与えずにローリングアップデートできます。
次のステップ
AI Gateway のゲートウェイタイプと課金についてご確認ください。
AI Gateway の機能を体験するには、ゲートウェイインスタンスを作成してください。