全部產品
Search
文件中心

Alibaba Cloud Model Studio:Realtime API 概述

更新時間:Aug 26, 2026

Realtime API 提供多種傳輸協議,針對效能、延遲、弱網對抗、接入成本等不同需求進行最佳化,供開發人員靈活選擇。

Realtime API 支援 AOQ(AI over QUIC)WebRTCWebSocket 三種傳輸協議,開發人員可以根據業務情境靈活選擇。

維度

AOQ

WebRTC

WebSocket

適用情境

AI 多模態即時互動、弱網情境、混合資料轉送

瀏覽器端互動、傳統音視訊通話

服務端整合、快速原型驗證

瀏覽器安全色性

不支援

原生支援

原生支援

接入難度

中等

極低

弱網對抗

極致

良好

資料類型

音視頻 + 文本

音視頻 + 文本

文本/音頻/映像

建連速度

回聲消除/降噪

內建

內建

無,需用戶端自行處理

AI 情境適配

原生為 AI 多模態資料特徵深度定製

傳統設計,AI 情境需額外適配

基礎,適合純文字或低即時性情境

端側平台支援

Android / iOS / HarmonyOS

瀏覽器、移動端

全平台(任何支援 WebSocket 的環境)

開發人員可根據實際需求選擇協議方案:

  • AOQ 方案:適合對延遲、弱網對抗、多模態資料轉送有極致要求的 AI 即時互動情境,同時內建回聲消除和降噪能力,尤其是移動端原生應用。
  • WebRTC 方案:適合需要瀏覽器原生支援、已有 WebRTC 基礎設施的傳統音視訊通話情境,內建回聲消除和降噪能力。
  • WebSocket 方案:適合服務端整合、快速原型驗證、對接入門檻要求極低的情境。通過 DashScope SDK 可快速實現即時語音對話。

模型/應用支援力度

不同協議對模型和應用的支援情況如下:

模型/應用類型

模型

AOQ

WebRTC

WebSocket

即時全模態

qwen3.5-omni-plus-realtime

支援

支援

支援

qwen3.5-omni-flash-realtime

支援

支援

支援

即時語音翻譯

qwen3.5-livetranslate-flash-realtime

支援

支援

支援

即時語音辨識

Qwen-Audio-3.0-ASR-Flash-Streaming、Fun-ASR-Realtime系列模型

支援

不支援

支援

即時語音合成

CosyVoice系列模型

支援

不支援

支援

qwen-audio-3.0-tts-flash、qwen-audio-3.0-tts-plus

支援

不支援

支援

即時語音對話

qwen-audio-3.0-realtime-plus、qwen-audio-3.0-realtime-flash

支援

支援

支援

說明模型的名稱、上下文、價格、快照版本等資訊請參見阿里雲百鍊控制台;並發限流條件請參考限流

最佳實務