すべてのプロダクト
Search
ドキュメントセンター

Intelligent Media Services:リアルタイム対話型 AI の概要

最終更新日:Aug 06, 2026

リアルタイム対話型 AI は、AI エージェントとユーザー間の効率的な音声およびビデオインタラクションを可能にします。

製品紹介

リアルタイム対話型 AI は、AI エージェントとユーザー間の音声およびビデオ通話アプリケーションの構築を支援します。ビジュアルインターフェイスを通じてカスタム AI エージェントを設定し、10 分以内にデプロイできます。AI エージェントは ApsaraVideo Real-time Communication (ARTC) ネットワーク経由でユーザーに接続し、オンラインカスタマーサービス、AI アシスタント、AI コンパニオン、マッチングアシスタント、バーチャル教師などのシナリオをサポートします。

機能

AI エージェントは、音声通話、ビデオ通話、チャットメッセージ、を通じてユーザーと対話します。ワークフローを設定することで、以下の機能が利用できます。

音声通話とビデオ通話

音声通話

AI アシスタントと音声で会話します。

555d2e763e3c49c23ac59cb7060d2a44

3D デジタルヒューマン通話

ビデオを通じてデジタルヒューマンと対話し、よりリアルな体験を実現します。

lQDPJwMuwU90JFXNC6zNBaCwNbn8uKeIjbgHiTmd5-WQAA_1440_2988

視覚理解通話

エージェントは音声とビデオ入力を組み合わせて、文脈に応じたフィードバックを提供します。

lQDPJwpRBT4ppFXNC6zNBaCwzODP1_m-L7MHiTmc7Nh_AA_1440_2988

ビデオ通話

デジタルヒューマンは視覚理解を利用して、ユーザーと双方向のビデオ通話を行います。image

詳細については、「音声通話とビデオ通話のクイックスタート」をご参照ください。

音声通話のワークフローには、3つのノードのみが必要です。

  1. STT (音声テキスト変換):音声およびビデオ入力を受信し、音声をテキストに変換します。

  2. LLM (大規模言語モデル):テキストを受信し、大規模モデルを呼び出して応答を生成します。

  3. TTS (音声合成):応答テキストを音声に変換し、RTC エンドポイントに出力します。

異なる通話タイプは、異なるワークフローに関連付けられています。音声通話から視覚理解通話などの別の通話タイプに切り替えるには、まず現在の通話を終了し、次にターゲットのワークフロータイプに関連付けられた AI エージェント ID を使用して新しい通話を開始します。API の使用方法については、「音声通話とビデオ通話のクイックスタート」をご参照ください。

チャットメッセージ

ダイアログボックスで AI エージェントと音声またはテキストでチャットします。

lQDPKHl9TD29I1XNC6zNBaCwklTx59f8apsHiTmbKaTPAA_1440_2988

image

詳細については、「チャットメッセージのクイックスタート」をご参照ください。

チャットメッセージのワークフローでは、以下の設定を使用します。

image

用語

SessionId

開発者が定義するチャットレコードの一意の識別子。例:

  • ユーザーの関連付け:sessionId を使用して、モバイルまたは PC 上で時間をまたいでセッションをリンクします。

  • セッションの分離:sessionId を使用して、同じユーザーからの複数のセッションを分離します。

チャットメッセージ

ユーザーは、チャットダイアログボックスで音声またはテキストで AI エージェントと対話し、質問をしたり情報を取得したりします。

音声通話

ユーザーは AI アシスタントと会話し、タイムリーな情報とサポートを得ることができます。

3D デジタルヒューマン通話

3D デジタルヒューマンは、音声対話、ボディランゲージ、表情を用いて仮想キャラクターを表現し、リアリズムとエンゲージメントを向上させます。

視覚理解通話

ライブカメラフィードと音声コマンドをマルチモーダルインタラクションを通じて融合し、音声のみまたはテキストのみのコミュニケーションを超えた、正確で直感的、かつパーソナライズされたフィードバックを提供します。

ビデオ通話

ビデオ通話は、デジタルヒューマン視覚理解を組み合わせたものです。両者が画面に表示され、デジタルヒューマンはユーザーのビデオフィードを理解し、応答します。

インタラクティブメッセージ

インタラクティブメッセージは、ユーザー間のコミュニケーションを改善し、ライブストリーミング中のエンゲージメントを高めます。

ApsaraVideo Real-time Communication (ARTC)

Alibaba Cloud ARTC は、WebRTC と 3,200 以上のグローバルノードを使用して、ユーザーと AI エージェント間の高可用性、高品質、超低レイテンシーの音声およびビデオ通話を提供します。詳細については、「ApsaraVideo Real-time Communication の概要」をご参照ください。

リアルタイムワークフロー

AI エージェントの中核部分であり、音声テキスト変換、大規模言語モデル、音声合成、Alibaba Cloud のベクトルデータベースなどの AI コンポーネントをドラッグアンドドロップして構築します。AI エージェントは、各ワークフローステップを順に実行します。

AI エージェント

事前構築済みまたはカスタム作成された、非常にリアルなクラウドベースのユーザーで、音声とビデオを通じてエンドユーザーと対話します。

利点

  • グローバルな高可用性と低レイテンシー:Alibaba Cloud のリアルタイム音声ビデオネットワークは、QoS 最適化を備えた 3,200 以上のグローバルノードにまたがり、世界中の AI エージェント通話のスムーズさを保証します。

  • 簡単な統合とデバッグ:音声テキスト変換、大規模言語モデル、音声合成、ベクトルデータベースなどの AI コンポーネントをワークフローに組み込むことで、迅速な立ち上げと簡単なデバッグが可能です。

  • 人間らしい動作:インテリジェントノイズ低減、割り込み検知、音声セグメンテーションにより、AI エージェントはより人間らしく振る舞います。

  • 簡単な統合:4 つの統合方法により、シナリオに最適なものを選択できます。

仕組み

image

  1. ユーザーは SDK を使用して、クラウドベースの AI エージェントとのリアルタイム音声ビデオ通話を開始します。

  2. AI エージェントはユーザーの音声およびビデオ入力を受信し、ワークフローを実行して応答を生成します。

  3. AI エージェントは応答ストリームを ARTC ネットワークにプッシュします。ユーザーはストリームをサブスクライブして再生し、会話を完了します。

AIAgentId は特定のワークフローに関連付けられています。進行中の通話中に AIAgentId を切り替えることはできません。また、UpdateAIAgentInstanceAIAgentId パラメーターの変更をサポートしていません。別の AI エージェントに切り替えるには、まず StopAIAgentInstance を呼び出して現在の通話を停止し、次に StartAIAgentInstance または GenerateAIAgentCall を呼び出してターゲットの AI エージェントを開始します。

機能

機能

説明

リアルタイムワークフロー

ビジュアルなドラッグアンドドロップインターフェイスを使用して AI エージェントのワークフローを構築します。

  • 音声テキスト変換:

    • 組み込みの Tongyi Qwen 機能。

  • 音声合成:

    • 組み込みの Tongyi Qwen 機能。

    • 標準プロトコルを使用して、カスタムの音声合成モジュールを接続します。

    • サードパーティのプラグインとして MiniMax の音声機能を統合します。

  • 大規模言語モデル (テキストからテキストへ):

    • 組み込みの Tongyi Qwen 機能。

    • Alibaba Cloud Model Studio のモデルハブまたはアプリケーションセンターから AI モデルを選択します。

    • OpenAI 標準を使用して、カスタムの大規模言語モデルを統合します。

  • デジタルヒューマン

    • サードパーティのプラグインとして Xiangxin のデジタルヒューマン機能を統合します。

  • ビデオフレーム抽出

  • マルチモーダル大規模言語モデル:

    • 組み込みの Tongyi Qwen 機能。

    • OpenAI 標準を使用して、カスタムのマルチモーダル大規模言語モデルを統合します。

カスタム AI エージェントの外観

画像をアップロードして、音声通話中の AI エージェントを表現します。

AI エージェントの感情認識

AI エージェントはユーザーの現在の感情を検出し、感情を考慮して応答します。

ウェルカムメッセージ

コンソールでウェルカムメッセージを設定します。会話が始まると AI エージェントがそれを話します。

プロアクティブなアナウンス

ビジネスサーバーは OpenAPI を使用して、AI エージェントからの音声ビデオ出力をトリガーします。

リアルタイムキャプション

エンドユーザーのインターフェイスに会話テキストをリアルタイムで表示します。

インテリジェントノイズ低減

AI エージェントは、ユーザー側からのバックグラウンドノイズをフィルタリングします。複数の人が同時に話す場合、最も大きな声を最初にキャプチャします。

インテリジェント割り込み検知

AI エージェントは、会話中にユーザーが割り込もうとしたことを検知します。

インテリジェントな文のセグメンテーション

AI エージェントは、長い文や複雑な文を自動的に分割して、読みやすさを向上させます。

文ごとの音声コールバック

コンソールで音声コールバックを設定して、リアルタイムの音声データを OSS に保存します。

トランシーバーモード

起動時または通話中にトランシーバーモードを有効にします。ボタンを押して AI エージェントと話します。

ASR ホットワード

ビジネス固有のホットワードを定義して、音声認識の精度を向上させます。

声紋ノイズ低減

グループ会話では、AI エージェントは主要な話者の声紋を識別して保持し、無関係なノイズを低減します。

ライブエージェントへの引き継ぎ

AI エージェントがリクエストを処理できない場合や、重要な決定が必要な場合に、会話をライブエージェントに引き継ぎます。

グレースフルシャットダウン

ビジネスサーバーが AI エージェントを停止させる際、現在の応答を終えてからシャットダウンすることで、突然の中断を避けることができます。

データアーカイブ

AI エージェントの会話をテキストに変換し、API を通じて取得します。音声ビデオ録画を OSS または ApsaraVideo VOD に保存します。

課金

リアルタイム対話型 AI は現在パブリックプレビュー中であり、この期間中は無料でご利用いただけます。

よくある質問

お問い合わせ

製品に関するご質問やサポートについては、DingTalk グループ番号 106730016696 を検索してグループにご参加ください。