阿里雲百鍊提供千問及第三方模型服務,覆蓋文本、映像、音頻、視頻等多種模態。
文本產生
映像與視頻
理解
分析圖片和視頻內容,返迴文本描述或結構化結果
產生
通過文本或圖片產生映像與視頻,支援編輯、參考與高解析度輸出
音頻與語音
語音合成
適用於有聲閱讀、語音播報、虛擬人等情境
語音辨識
專業 ASR 與大模型兩種方案,按精度與靈活性選擇
語音轉語音
端到端語音對話,無需分別調用 ASR 和 TTS
全模態
融合文本、映像、音頻、視頻等多種模態的理解與產生能力
向量與重排序
文本或圖文向量化,配合重排序提升檢索精度
查看所有模型
前往模型廣場查看所有千問、三方、領域及歷史版本模型。