本文將為您介紹如何快速建立音視頻智能體。
服務開通
為了使用阿里雲AI即時互動服務,您需要滿足以下條件:
請先確保已開通 AI 即時互動功能。若尚未開通,請前往開通服務,已開通使用者可直接使用。
說明若出現“您當前購買數量超過還可購買的數量餘量,請重新選擇數量!”,表明服務已經開通。
第一步 建立音視頻工作流程
-
登入智能媒體服務控制台,單擊创建工作流模板。
-
按需選擇语音通话、数字人通话、视觉理解通话或视频通话,並配置工作流程節點。
STT 语音转文字
該節點負責將語音輸入轉換成可讀的文字格式,支援多語種識別。
模型版本包含以下選項:系統預置ASR(中英混合情境推薦,識別準確率更高)、Qwen3-ASR-Realtime、Fun-ASR-Realtime、NLS-ASR(延遲更低,追求超低延遲的情境時推薦)。靜默時間預設值為400 ms。
LLM 大语言模型
基於STT轉換得到的文字輸入,LLM可以使用大型預訓練語言模型來理解和產生自然語言文本。
在 LLM 大語言模型節點的基礎資訊中,還需配置系統人設(包括角色設定、任務目標、具備的能力及回複的要求與限制,最多 3072 字元)和對話記憶輪數(取值 0–30,增加輪數可保留更多對話上下文資訊,但可能導致大模型處理時間變長)。
目前AI即時互動支援您接入千問(系統預置)、阿里百鍊平台、阿里通義星塵以及自研接入(OpenAI規範)。
阿里百鍊平台
阿里雲的大模型服務平台阿里百鍊是一站式的大模型開發及應用構建平台。選擇對接阿里百鍊平台提供的語言模型和服務時,您可以選擇對接阿里百鍊模型中心或應用中心。
-
模型中心:進入阿里百鍊模型廣場選擇適合您的模型,複製模型Code擷取作為ModelId。
-
應用中心:需要先在阿里百鍊大模型服務平台建立智能體應用,完成後,擷取AppId。
-
進入百鍊API-KEY管理頁面,建立並複製API-Key。
阿里通義星塵
阿里通義星塵產品提供定製深度個人化智能體的能力,能夠快速創造一個擁有自己獨特的人設、風格的智能體,結合數字人語音即時互動能力,可以在指定的不同的情境中進行豐富的互動。
-
ModelId:目前阿里通義星塵有
xingchen-lite、xingchen-base、xingchen-plus、xingchen-plus-v2、xingchen-max五種模型供您選擇。 -
API-KEY:請前往星塵控制台建立API KEY並擷取。
自研接入(OpenAI規範)
AI即時互動也支援接入您自研的大模型,您可以按照OpenAI規範接入您的大模型。
OpenAI規範:如果您選擇按照OpenAI規範接入,您需要填入以下參數:
名稱
描述
樣本值
ModelId
OpenAI標準model欄位,表示模型名稱
abc
API-KEY
OpenAI標準api_key欄位,表示API鑒權資訊
AUJH-pfnTNMPBm6iWXcJAcWsrscb5KYaLitQhHBLKrI
目標模型HTTPS地址
OpenAI標準base_url欄位,表示目標服務要求地址
http://www.abc.com
更多自研LLM接入詳情,請參見LLM標準介面。
TTS 文字转语音
該節點負責將處理後的文本轉換回語音格式,以便使用者聽到系統的響應。
在 TTS 節點配置中,您還可以選擇版本(文字轉語音 2.0 或 文字轉語音 1.0(舊)),設定音色(如雲峰),調整音量(範圍 0~100),並通過試聽內容文字框輸入文字後單擊點擊試聽預覽語音效果。
-
您可以選擇適合您應用情境的文字轉語音模型,包括:系统预置模板、自研模板、三方插件。
-
系統預置模板:包含系统预置TTS、CosyVoice、Qwen3-TTS。
-
自研模板:您可以通過規範協議將您的自研大模型加入到工作流程當中。詳情請參見TTS標準介面。
-
三方外掛程式:當前僅支援選擇MiniMax语音模型,該目前有多個版本供您選擇,推薦您使用最新版本。具體詳情,請參見MiniMax語音模型。
-
-
在TTS節點,您也可以對LLM輸入的內容進行過濾。
在過濾設定下拉式功能表中,可選擇需要過濾的括弧類型,包括中文括弧()、英文括弧()、中文方括弧【】、英文方括弧[]和英文花括弧{}。
-
文本歸一化:將文本中的數字、符號等轉換為統一標準格式,提升合成語音的品質。如“120”轉換為“么二零”。
数字人
該節點負責產生與處理後的文本和音頻相對應的動作、表情和口型同步的數字人視頻流。
配置彈窗包含以下設定:節點名稱(自動產生);輸入類型為文字資料流和音頻流,輸出類型為視頻流。
當前支援在數字人節點中对接数字人插件、对接阿里灵境数字人:
视频抽帧
該節點負責從視頻中抽取單幀或多幀的圖片。
配置彈窗包含以下設定:節點名稱(自動產生),抽幀頻率(範圍1–30張/秒);輸入類型為視頻流,輸出類型為圖片(base64格式)。
VCR 视频内容理解
該節點負責識別視頻內容中,是否存在特定行為。
在 VCR 視頻內容理解節點 配置彈窗中,設定 節點名稱,並在 識別內容 地區勾選所需選項,包括 畫面是否固定、無效畫面識別、畫面人數、頭部運動識別、電子裝置識別、視線位移識別 和 自訂模型檢測識別。勾選 自訂模型檢測識別 後需填寫 檢測任務ID,不超過100字元,支援數字、大小寫字母、虛線和底線,且虛線和底線不能位於首尾。
MLLM多模态大模型
基於前置節點對資料的處理,MLLM可以對輸入的圖片與文字進行理解,產生自然語言文本。您也可以通過選擇不同類型的模型來控制模型的輸入。
節點配置面板中,模型類型可選多模態模型或文生文模型;系統人設用於設定角色設定、任務目標、具備的能力及回複的要求與限制等,最多支援 3072 字元;對話記憶輪數範圍為 1 到 30,增加記憶輪數可保留更多對話上下文資訊,但可能導致大模型處理時間變長。
目前AI即時互動支援您接入千問(系統預置)、阿里百鍊平台、阿里通義星塵以及自研大模型。
阿里百鍊平台 阿里雲的大模型服務平台阿里百鍊是一站式的大模型開發及應用構建平台。選擇對接阿里百鍊平台提供的語言模型和服務時,您可以選擇對接阿里百鍊模型中心或應用中心。
-
模型中心:進入阿里百鍊模型廣場選擇適合您的模型,複製模型Code擷取作為ModelId。
-
應用中心:需要先在阿里百鍊大模型服務平台建立智能體應用,完成後,擷取AppId。
-
進入百鍊API-KEY管理頁面,建立並複製API-Key。
通義星塵
通義星塵產品提供定製深度個人化智能體的能力,能夠快速創造一個擁有自己獨特的人設、風格的智能體,結合數字人語音即時互動能力,可以在指定的不同的情境中進行豐富的互動。
-
ModelId:目前通義星塵有
xingchen-lite、xingchen-base、xingchen-plus、xingchen-plus-v2、xingchen-max五種模型供您選擇。 -
API-KEY:請前往星塵控制台建立API KEY並擷取。
自研模型
AI即時互動也支援接入您自研的大模型,您可以按照OpenAI規範接入您的大模型。
OpenAI規範:如果您選擇按照OpenAI規範接入,您需要填入以下參數:
名稱
類型
必填
描述
樣本值
ModelId
String
是
OpenAI標準model欄位,表示模型名稱
abc
API-KEY
String
是
OpenAI標準api_key欄位,表示API鑒權資訊
AUJH-pfnTNMPBm6iWXcJAcWsrscb5KYaLitQhHBLKrI
目標模型HTTPS地址
String
是
OpenAI標準base_url欄位,表示目標服務要求地址
http://www.abc.com
單次調用圖片數上限
Integer
是
由於部分多模態大模型單次請求可接收圖片幀數量有上限,您可以設定此參數來適配不同的大模型。在請求您的MLLM服務時,會自動按照該值對視頻進行抽幀採樣。
15
更多自研接入,請參考MLLM標準介面。
-
-
單擊保存,完成音視頻工作流程建立。
第二步 建立音視頻智能體
-
登入智能媒體服務控制台,單擊创建智能体。
-
配置基礎資訊,綁定音視頻類型即時工作流程。
-
綁定具體的音視頻工作流程,AI智能體將遵循工作流程運行。
設定工作流程類型(可選語音通話、數字人通話、視覺理解通話、訊息對話或視訊通話),並在工作流程ID下拉框中選擇需要綁定的工作流程。
-
在配置智能體時,選擇當前帳號下已建立的即時音視頻ARTC應用,若登入帳號下還未建立即時音視頻ARTC應用,您也可以通過選擇系統自動建立。即時音視頻更多內容,請參見即時音視頻簡介。
說明AI即時互動依賴於ARTC應用,ARTC應用作為通訊橋樑,確保對話功能的正常運作。
-
當您綁定的工作流程類型為語音通話時,可以在進階功能配置中上傳自訂形象,以便在語音通話情境中展示該形象。
開啟自訂智能體形象開關後,在圖片來源中選擇指定圖片URI或上傳圖片,並填寫或上傳形象圖片。支援GIF、PNG、JPG格式,圖片大小不超過3 MB。
-
-
單擊提交,完成音視頻智能體建立。
第三步 體驗智能體
訊息對話智能體建立完成後,您可以通過掃描體驗二維碼來進行智能體的體驗。
-
在控制台產生Demo體驗二維碼。
在左側導覽列單擊智能體管理,找到目標智能體,在操作列單擊Demo體驗二維碼。在彈出的對話方塊中選擇到期時間(可選1小時、7小時、24小時、3天),然後單擊產生。
-
請使用DingTalk、微信或瀏覽器掃描二維碼,或將體驗地址複製到瀏覽器中,以體驗H5版本的Demo。
在Demo體驗二維碼彈窗中,左側為 APP 二維碼,右側為 H5 二維碼。彈窗下方還展示H5體驗地址、體驗Token及到期時間,每項均可單擊右側表徵圖複製。
整合音視頻智能體
您需要提前準備好以下參數,方便您進行整合。如何將音視頻智能體整合到您的專案中,請參見音視訊通話智能體整合。
-
Region ID:智能媒體服務控制台上工作流程、智能體所在地區。您可以在控制台頂部左上方的地區選取器中查看當前所選Region ID。
地區名稱
Region Id
華東1(杭州)
cn-hangzhou
華東2(上海)
cn-shanghai
華北2(北京)
cn-beijing
華南1(深圳)
cn-shenzhen
新加坡
ap-southeast-1
-
ARTC應用的AppId和AppKey。
在智能體管理頁面,單擊基本資料頁簽,在工作流程配置地區的即時音視頻RTC應用欄位中可查看對應的 RTC AppID。
在ApsaraVideo for Live控制台左側導覽列選擇直播+ > 即時音視頻 > 應用管理,單擊目標應用進入詳情頁,在基本資料地區查看並複製對應值。
-
AccessKey ID和AccessKey Secret:擷取詳情,請參見建立AccessKey。