全部產品
Search
文件中心

Alibaba Cloud Model Studio:Multimodal-Embedding API詳情

更新時間:Sep 09, 2026

多模態向量模型將文本、映像和視頻轉換為同一語義空間中的向量表示,支援跨模態檢索、內容分類和語義相似性計算。

核心能力

  • 跨模態檢索:以文搜圖、以圖搜視頻、以圖搜圖等跨模態語義搜尋。
  • 語義相似性計算:在統一向量空間中衡量不同模態內容之間的語義相似性。
  • 內容分類與聚類:基於語義向量進行智能分組、打標和群集。

關鍵特性 :所有模態(文本、圖片、視頻)的向量均位於同一語義空間,可通過餘弦相似性等方法直接進行跨模態匹配與比較。模型選型和使用方法詳見 文本與多模態向量化 。

重要此模型服務僅在“華北2(北京)”地區提供,調用時必須使用該地區的API Key。

向量類型說明

多模態向量模型支援兩種向量產生方式:

  • 多模態獨立向量:為 contents 中的每個輸入(文本、圖片、視頻、多圖)分別產生獨立向量。例如,輸入 1 段文本和 1 張圖片,返回 2 個獨立向量。適用於逐項對比不同內容的情境,如以圖搜圖、以文搜圖。

  • 多模態融合向量:將 contents 中的所有輸入融合為 1 個向量,實現跨模態綜合語義表徵。適用於需要整體理解多模態內容的情境,如將商品圖片和描述文本融合為統一表徵進行檢索。qwen3-vl-embedding 通過設定 enable_fusion=true 開啟融合模式。融合向量支援以下組合:

    • 文本 + 圖片融合
    • 文本 + 視頻融合
    • 多圖 + 文本融合(傳入多個 image 條目)
    • 圖片 + 視頻 + 文本混合融合

qwen2.5-vl-embedding 僅支援融合向量,不支援獨立向量。 tongyi-embedding-vision-plus 和 tongyi-embedding-vision-flash 僅支援獨立向量。

模型介紹、選型建議和使用方法,請參考文本與多模態向量化。

模型概覽

新加坡

模型名稱

向量維度

文本長度限制

圖片大小限制

視頻大小限制

單價(每百萬輸入Token)

免費額度(注)

tongyi-embedding-vision-plus

1152

1,024 Token

單張大小不超過3 MB。支援多圖,最多支援輸入8張

視頻檔案大小不超過 10 MB

圖片/視頻:$0.09

文本:$0.09

100萬Token

有效期間:自開通百鍊/模型發布/申請通過之日起90天(以較晚者為準)

tongyi-embedding-vision-flash

768

圖片/視頻:$0.03

文本:$0.09

北京

模型名稱

向量維度

文本長度限制

圖片大小限制

視頻大小限制

單價(每百萬輸入Token)

qwen3-vl-embedding

2560(預設), 2048, 1536, 1024, 768, 512, 256

32,000 Token

最多 1 張且單張大小不超過5 MB

視頻檔案大小不超過 50 MB

圖片/視頻:$0.258

文本:$0.1

multimodal-embedding-v1

1024

512 Token

最多 8 張且單張大小不超過3 MB

視頻檔案大小不超過 10 MB

免費試用

輸入格式與語種限制:

多模態融合向量模型
模型文本圖片視頻單次請求條數

qwen3-vl-embedding

支援中、英、日、韓、法、德等33種主流語言

所有支援語言

中文、日語、韓語、印尼語、越南語、泰語、英語、法語、德語、俄語、葡萄牙語、西班牙語、意大利語、瑞典語、丹麥語、捷克語、挪威語、荷蘭語、芬蘭語、土耳其語、波蘭語、斯瓦希裡語、羅馬尼亞語、塞爾維亞語、希臘語、哈薩克語、烏茲別克語、宿務語、阿拉伯語、烏爾都語、波斯語、印地語 / 天城語、希伯來語。

JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS, SGI(支援URL或Base64)

MP4, AVI, MOV(僅支援URL)

一次請求中傳入內容元素總數不超過 20;圖片數量不超過5;圖片、文本、視頻共用該上限。

多模態獨立向量模型
模型文本圖片視頻單次請求條數

tongyi-embedding-vision-plus

中/英文

JPG, PNG, BMP (支援URL或Base64)

MP4, MPEG, AVI, MOV, MPG, WEBM, FLV, MKV(僅支援URL)

暫無傳入內容元素數量限制,輸入內容總Token數不超過Token數量上限即可。

tongyi-embedding-vision-flash

multimodal-embedding-v1

一次請求中傳入內容元素總數不超過 20;圖片、視頻各最多 1 條,文本最多 20 條,共用總條數上限。

所有模型均支援 text、image、video 三種輸入類型及其組合。 tongyi-embedding-vision-plus 、 tongyi-embedding-vision-flash 額外支援 multi_images 多圖序列輸入。

模型能力對照

模型

預設維度

向量類型

支援的輸入

說明

qwen3-vl-embedding

2560

獨立 / 融合

text、image、video、多個 image 條目

通過 enable_fusion 參數開啟融合模式,可將多模態輸入融合為 1 個向量

tongyi-embedding-vision-plus

1152

僅獨立

text、image、video、multi_images

支援 multi_images 多圖序列(最多 8 張)

tongyi-embedding-vision-flash

768

multimodal-embedding-v1

1024

text、image、video

不支援 dimension 參數,固定 1024 維

前提條件

您需要已擷取與配置 API Key並配置API Key到環境變數。如果通過SDK調用,還需要安裝DashScope SDK。請將範例程式碼中的 DASHSCOPE_API_HOST 替換為擷取的 API Host。

HTTP調用

POST https://dashscope.aliyuncs.com/api/v1/services/embeddings/multimodal-embedding/multimodal-embedding

請求

多模態獨立向量

以下樣本使用 tongyi-embedding-vision-plus 模型產生獨立向量(每個輸入各自產生 1 個向量),也可替換為其他模型名稱。其中 multi_images 類型僅 tongyi-embedding-vision-plus 和 tongyi-embedding-vision-flash 支援。qwen3-vl-embedding 額外支援融合向量模式,通過設定 enable_fusion=true 開啟,詳見"多模態融合向量"標籤頁。

curl --silent --location --request POST 'https://dashscope.aliyuncs.com/api/v1/services/embeddings/multimodal-embedding/multimodal-embedding' \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json' \
    --data '{
        "model": "tongyi-embedding-vision-plus",
        "input": {
            "contents": [
                {"text": "多模態向量模型"},
                {"image": "https://img.alicdn.com/imgextra/i3/O1CN01rdstgY1uiZWt8gqSL_!!6000000006071-0-tps-1970-356.jpg"},
                {"video": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20250107/lbcemt/new+video.mp4"},
                {"multi_images": [
                    "https://img.alicdn.com/imgextra/i2/O1CN019eO00F1HDdlU4Syj5_!!6000000000724-2-tps-2476-1158.png",
                    "https://img.alicdn.com/imgextra/i2/O1CN01dSYhpw1nSoamp31CD_!!6000000005089-2-tps-1765-1639.png"
                    ]
                  }
            ]
        }
    }'

多模態融合向量

qwen3-vl-embedding支援融合向量產生,通過設定 enable_fusion=true 將所有輸入融合為 1 個向量。支援文本+圖片、文本+視頻、多圖+文本、圖片+視頻+文本等多種融合組合。以下樣本展示多圖+視頻+文本的混合融合。

curl --location 'https://dashscope.aliyuncs.com/api/v1/services/embeddings/multimodal-embedding/multimodal-embedding' \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json' \
    --data '{
        "model": "qwen3-vl-embedding",
        "input": {
            "contents": [
                {"text": "商品描述文本"},
                {"image": "https://dashscope.oss-cn-beijing.aliyuncs.com/images/256_1.png"},
                {"image": "https://img.alicdn.com/imgextra/i3/O1CN01rdstgY1uiZWt8gqSL_!!6000000006071-0-tps-1970-356.jpg"},
                {"video": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20250107/lbcemt/new+video.mp4"}
            ]
        },
        "parameters": {
            "enable_fusion": true
        }
    }'

要求標頭(Headers)

Content-Typestring(必選)

請求內容類型。此參數必須設定為application/json。

Authorizationstring(必選)

請求身份認證。介面使用阿里雲百鍊API Key進行身份認證。樣本值:Bearer sk-xxxx。

請求體(Request Body)

modelstring(必選)

模型名稱。設定為模型概覽中的模型名稱。

inputobject(必選)

輸入內容。

屬性

contentsarray(必選)

待處理的內容列表。每個元素是一個字典或者字串,用於指定內容的類型和值。格式為{"模態類型": "輸入字串或映像、視頻url"}。支援text, image, video和multi_images四種模態類型。

qwen3-vl-embedding 同時支援融合向量和獨立向量產生。在多模態獨立向量的基礎上增加 bool 類型欄位 enable_fusion,當 enable_fusion=true 時返回融合向量。qwen2.5-vl-embedding 僅支援融合向量,不支援獨立向量。

  • 文本:key為text。value為字串形式。也可不通過dict直接傳入字串。
  • 圖片:key為image。value可以是公開可訪問的URL,或Base64編碼的Data URI。Base64格式為 data:image/{format};base64,{data},其中 {format} 是圖片格式(如 jpeg, png),{data} 是Base64編碼字串。
  • 多圖片:僅tongyi-embedding-vision-plus、tongyi-embedding-vision-flash模型支援此類型。key為multi_images,value是多圖序列列表,每條為一個圖片,格式要求如上方所示。
  • 視頻:key為video,value必須是公開可訪問的URL。

parameters object (可選)

向量處理參數。HTTP調用需封裝在parameters對象中,SDK調用可直接使用以下參數。

屬性

output_type string (可選)

使用者指定輸出向量表示格式,目前僅支援dense。

dimension integer (可選)

用於使用者指定輸出向量維度。不同模型支援的值不同:

  • qwen3-vl-embedding 支援 2560、2048、1536、1024、768、512、256,預設值為 2560;
  • tongyi-embedding-vision-plus 不支援此參數,固定返回 1152 維向量。
  • tongyi-embedding-vision-flash 不支援此參數,固定返回 768 維向量。
  • multimodal-embedding-v1 不支援此參數,固定返回 1024 維向量。

fps float (可選)

控制視頻的幀數,比例越小,實際抽取的幀數越少,範圍為 [0,1]。預設值為1.0。

instruct string (可選)

添加自訂任務說明,可用於指導模型理解查詢意圖。建議使用英文撰寫,通常可帶來約 1%–5% 的效果提升。

enable_fusion bool (可選)

是否產生融合向量。僅 qwen3-vl-embedding 模型支援該參數。設定為 true 時,將 contents 中的所有多模態內容融合為 1 個向量;預設為 false,各模態獨立產生向量。融合向量支援文本+圖片、文本+視頻、多圖+文本(傳入多個 image 條目)、圖片+視頻+文本等組合,適用於需要綜合理解多模態內容的檢索情境。

響應

成功響應

{
    "output": {
        "embeddings": [
            {
                "index": 0,
                "embedding": [
                    -0.026611328125,
                    -0.016571044921875,
                    -0.02227783203125,
                    ...
                ],
                "type": "text"
            },
            {
                "index": 1,
                "embedding": [
                    0.051544189453125,
                    0.007717132568359375,
                    0.026611328125,
                    ...
                ],
                "type": "image"
            },
            {
                "index": 2,
                "embedding": [
                    -0.0217437744140625,
                    -0.016448974609375,
                    0.040679931640625,
                    ...
                ],
                "type": "video"
            }
        ]
    },
    "usage": {
        "input_tokens": 903,
        "input_tokens_details": {
            "image_tokens": 896,
            "text_tokens": 7
        },
        "output_tokens": 3,
        "total_tokens": 906
    },
    "request_id": "1fff9502-a6c5-9472-9ee1-73930fdd04c5"
}

說明不同模型返回的 usage 欄位存在差異,請參考以下說明:

  • tongyi-embedding-vision-* 系列模型:返回 input_tokens(含文本和圖片 Token 總和)、input_tokens_details(含 image_tokens 和 text_tokens)、output_tokens、total_tokens。以上響應樣本對應此類模型。
  • qwen3-vl-embedding:僅返回 input_tokens(僅含文本 Token,包括系統模板 Token)、image_tokens、total_tokens(= input_tokens + image_tokens)。不返回 input_tokens_details 和 output_tokens。樣本:
{
    "usage": {
        "input_tokens": 43,
        "image_tokens": 1247,
        "total_tokens": 1290
    }
}

說明

  • qwen2.5-vl-embedding:僅返回 input_tokens 和 image_tokens,不返回 total_tokens、input_tokens_details 和 output_tokens。
  • multimodal-embedding-v1:返回 input_tokens、image_tokens、image_count 和 duration,不返回 total_tokens、input_tokens_details 和 output_tokens。

異常響應

{
    "code":"InvalidApiKey",
    "message":"Invalid API-key provided.",
    "request_id":"fb53c4ec-1c12-4fc4-a580-cdb7c3261fc1"
}

本 API 常見的錯誤碼及排查方向如下。完整錯誤碼請參見通用錯誤碼。

錯誤碼

HTTP 狀態代碼

觸發條件

排查建議

InvalidApiKey

401

API Key 無效或已到期,返回 Invalid API-key provided.

確認 Authorization 要求標頭為 Bearer sk-xxx 格式,且使用的是當前帳號下有效 API Key。

BadRequest.EmptyModel

400

請求中缺少 model 欄位,返回 Required parameter model missing from request.

在請求體中補充 model 欄位,取值使用本文模型列表中的模型名稱。

InvalidParameter

400

model 取值不存在,返回 Model not exist.

核對 model 拼字,並確認該模型在當前地區的模型列表中已列出。

InvalidParameter

400

input.contents 缺失或為空白數組,返回 input can not be empty: input.contents 或 contents input can not be empty: input.contents

確認 input.contents 存在且為非空數組,數組中每個元素包含有效 text、image 或 video 鍵。

InvalidParameter

400

dimension 取值不在所選模型支援的向量維度範圍內。

按本文模型列表中該模型支援的向量維度取值;multimodal-embedding-v1 不支援 dimension 參數,固定為 1024 維。

InternalError.Algo

500

請求體結構不完整或 input.contents 元素格式異常,導致服務端處理失敗。

檢查請求體結構,確認 input 及 input.contents 欄位存在且元素格式符合本文請求參數說明;結構無誤仍持續報錯時,攜帶 request_id 聯絡支援人員。

outputobject

任務輸出資訊。

屬性

embeddingsarray

向量結果清單,每個對象對應輸入列表中的一個元素。

屬性

indexint

結果在輸入列表中的索引。

embeddingarray

產生的向量數組,維度取決於模型及 dimension 參數設定。

typestring

結果對應的輸入類型。text、image、video、multi_images 分別對應文本、圖片、視頻、多圖輸入。以下為特殊類型: fusion 為 qwen3-vl-embedding模型在融合向量模式下返回的類型;vl 為 qwen3-vl-embedding 模型在獨立向量模式下返回的類型。

request_idstring

請求唯一標識。可用於請求明細溯源和問題排查。

codestring

請求失敗的錯誤碼。請求成功時不會返回此參數,詳情請參見錯誤碼。

messagestring

請求失敗的詳細資料。請求成功時不會返回此參數,詳情請參見錯誤碼。

usageobject

輸出資訊統計。

屬性

input_tokensint

本次請求輸入內容的 Token 數目。對於 qwen3-vl-embedding 和 qwen2.5-vl-embedding 模型,該值僅包含文本 Token(含系統模板 Token),不包含圖片/視頻 Token;對於 tongyi-embedding-vision-* 系列模型,該值包含文本和圖片/視頻 Token 的總和。

input_tokens_detailsobject

輸入 Token 的詳細分類資訊。僅 tongyi-embedding-vision-* 系列模型返回此欄位,qwen3-vl-embedding、qwen2.5-vl-embedding 和 multimodal-embedding-v1 不返回此欄位。

屬性

image_tokensint

輸入內容中圖片或視頻等視覺部分消耗的 Token 數量,不包含文本(文本部分見 text_tokens)。圖片消耗的 Token 數量與輸入圖片的解析度有關,解析度越高消耗的 Token 越多;若輸入為視頻,系統會先對視頻抽幀,再基於抽幀結果計算 Token。

text_tokensint

輸入內容中文本部分消耗的 Token 數量(不包含圖片或視頻等視覺部分)。

output_tokensint

本次請求輸出的 Token 數目。僅 tongyi-embedding-vision-* 系列模型返回此欄位,其他模型不返回此欄位。

total_tokensint

輸入與輸出的 Token 總數。對於 qwen3-vl-embedding 模型,total_tokens = input_tokens + image_tokens。僅 qwen3-vl-embedding 和 tongyi-embedding-vision-* 系列模型返回此欄位,qwen2.5-vl-embedding 和 multimodal-embedding-v1 不返回此欄位。

image_tokensint

本次請求輸入的圖片或視頻等視覺部分消耗的 Token 數量(不包含文本)。圖片消耗的 Token 數量與輸入圖片的解析度有關;系統會對輸入視頻進行抽幀處理,幀數上限受系統配置控制,隨後基於處理結果計算 Token。僅 qwen3-vl-embedding、qwen2.5-vl-embedding 和 multimodal-embedding-v1 返回此欄位(作為頂層欄位),tongyi-embedding-vision-* 系列模型的圖片 Token 包含在 input_tokens_details.image_tokens 中。

image_countint

本次請求輸入的圖片數量。僅 multimodal-embedding-v1 返回此欄位。

durationint

本次請求輸入的視頻時間長度(秒)。僅 multimodal-embedding-v1 返回此欄位。

SDK使用

SDK 的 input 參數對應HTTP請求體中的 input.contents,兩者結構 不一致 。

程式碼範例

圖片向量化樣本

使用圖片URL

import dashscope
import json
from http import HTTPStatus
# 實際使用中請將url地址替換為您的圖片url地址
image = "https://dashscope.oss-cn-beijing.aliyuncs.com/images/256_1.png"
input = [{'image': image}]
# 調用模型介面
resp = dashscope.MultiModalEmbedding.call(
    model="tongyi-embedding-vision-plus",
    input=input
)

if resp.status_code == HTTPStatus.OK:
    result = {
        "status_code": resp.status_code,
        "request_id": getattr(resp, "request_id", ""),
        "code": getattr(resp, "code", ""),
        "message": getattr(resp, "message", ""),
        "output": resp.output,
        "usage": resp.usage
    }
    print(json.dumps(result, ensure_ascii=False, indent=4))

使用本地圖片

將本地圖片轉換為 Base64 格式後進行向量化:

import dashscope
import base64
import json
from http import HTTPStatus
# 讀取圖片並轉換為Base64,實際使用中請將xxx.png替換為您的圖片檔案名稱或路徑
image_path = "xxx.png"
with open(image_path, "rb") as image_file:
    # 讀取檔案並轉換為Base64
    base64_image = base64.b64encode(image_file.read()).decode('utf-8')
# 設定映像格式
image_format = "png"  # 根據實際情況修改,比如jpg、bmp 等
image_data = f"data:image/{image_format};base64,{base64_image}"
# 輸入資料
input = [{'image': image_data}]

# 調用模型介面
resp = dashscope.MultiModalEmbedding.call(
    model="tongyi-embedding-vision-plus",
    input=input
)
if resp.status_code == HTTPStatus.OK:
    result = {
        "status_code": resp.status_code,
        "request_id": getattr(resp, "request_id", ""),
        "code": getattr(resp, "code", ""),
        "message": getattr(resp, "message", ""),
        "output": resp.output,
        "usage": resp.usage
    }
    print(json.dumps(result, ensure_ascii=False, indent=4))

視頻向量化樣本

多模態向量化模型目前僅支援以URL形式輸入視頻檔案,暫不支援直接傳入本地視頻。

import dashscope
import json
from http import HTTPStatus
# 實際使用中請將url地址替換為您的視頻url地址
video = "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20250107/lbcemt/new+video.mp4"
input = [{'video': video}]
# 調用模型介面
resp = dashscope.MultiModalEmbedding.call(
    model="tongyi-embedding-vision-plus",
    input=input
)

if resp.status_code == HTTPStatus.OK:
    result = {
        "status_code": resp.status_code,
        "request_id": getattr(resp, "request_id", ""),
        "code": getattr(resp, "code", ""),
        "message": getattr(resp, "message", ""),
        "output": resp.output,
        "usage": resp.usage
    }
    print(json.dumps(result, ensure_ascii=False, indent=4))

文本向量化樣本

import dashscope
import json
from http import HTTPStatus

text = "通用多模態表徵模型樣本"
input = [{'text': text}]
# 調用模型介面
resp = dashscope.MultiModalEmbedding.call(
    model="tongyi-embedding-vision-plus",
    input=input
)

if resp.status_code == HTTPStatus.OK:
    result = {
        "status_code": resp.status_code,
        "request_id": getattr(resp, "request_id", ""),
        "code": getattr(resp, "code", ""),
        "message": getattr(resp, "message", ""),
        "output": resp.output,
        "usage": resp.usage
    }
    print(json.dumps(result, ensure_ascii=False, indent=4))

融合向量化樣本

import dashscope
import json
import os
from http import HTTPStatus

# 多模態融合向量:將文本、圖片、視頻融合成一個融合向量
# 適用於跨模態檢索、圖搜等情境
text = "這是一段測試文本,用於產生多模態融合向量"
image = "https://dashscope.oss-cn-beijing.aliyuncs.com/images/256_1.png"
video = "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20250107/lbcemt/new+video.mp4"

# 輸入包含文本、圖片、視頻,通過 enable_fusion 參數產生融合向量
input_data = [
    {"text": text},
    {"image": image},
    {"video": video}
]

# 使用 qwen3-vl-embedding 產生融合向量
resp = dashscope.MultiModalEmbedding.call(
    # 若沒有配置環境變數,請用百鍊API Key將下行替換為:api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen3-vl-embedding",
    input=input_data,
    enable_fusion=True,
    # 選擇性參數:指定向量維度(支援 2560、2048、1536、1024、768、512、256,預設 2560)
    # parameters={"dimension": 1024}
)

print(json.dumps(resp, ensure_ascii=False, indent=4))

多圖融合向量化樣本

使用 qwen3-vl-embedding 將多張圖片與文本融合為 1 個向量。傳入多個 image 條目即可實現多圖融合,適用於商品多角度圖片與描述文本的綜合語義檢索。

import dashscope
import json
import os
from http import HTTPStatus

# 多圖+文本融合向量:將多張商品圖片和描述文本融合為 1 個向量
# 適用於商品多角度圖片+描述文本的綜合語義檢索
text = "白色運動鞋,輕量透氣,適合跑步和日常穿著"
image1 = "https://dashscope.oss-cn-beijing.aliyuncs.com/images/256_1.png"
image2 = "https://img.alicdn.com/imgextra/i3/O1CN01rdstgY1uiZWt8gqSL_!!6000000006071-0-tps-1970-356.jpg"

# 傳入多個 image 條目實現多圖融合,enable_fusion=True 將所有輸入融合為 1 個向量
input_data = [
    {"text": text},
    {"image": image1},
    {"image": image2}
]

resp = dashscope.MultiModalEmbedding.call(
    # 若沒有配置環境變數,請用百鍊API Key將下行替換為:api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen3-vl-embedding",
    input=input_data,
    enable_fusion=True
)

print(json.dumps(resp, ensure_ascii=False, indent=4))

2026-03-06 快照版本樣本

以下樣本展示如何使用 tongyi-embedding-vision-plus-2026-03-06 模型,示範 res_level (多解析度)和 max_video_frames (視訊框架數)參數的使用。該模型基於 Qwen3 底座,支援 30+ 種語言,同時支援獨立向量和融合向量產生。

import dashscope
import json
import os
from http import HTTPStatus

# tongyi-embedding-vision-plus-2026-03-06 樣本
# 支援 res_level(多解析度)和 max_video_frames(視訊框架數)參數
image = "https://dashscope.oss-cn-beijing.aliyuncs.com/images/256_1.png"
video = "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20250107/lbcemt/new+video.mp4"
text = "這是1個視覺多模態表徵模型"

input_data = [
    {"text": text},
    {"image": image},
    {"video": video}
]

# 調用 2026-03-06 快照版本模型
resp = dashscope.MultiModalEmbedding.call(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="tongyi-embedding-vision-plus-2026-03-06",
    input=input_data,
    dimension=1152,      # 支援 1152/1024/512/256/128/64
    res_level=1,         # 解析度檔位:0/1/2/3,預設 1
    max_video_frames=64  # 視頻最大採樣幀數,預設 8,最大 64
)

if resp.status_code == HTTPStatus.OK:
    result = {
        "status_code": resp.status_code,
        "request_id": getattr(resp, "request_id", ""),
        "output": resp.output,
        "usage": resp.usage
    }
    print(json.dumps(result, ensure_ascii=False, indent=4))

2026-03-06 版本的融合向量用法:將 text、image、video 放在同一個 content 對象中,模型將所有輸入融合為 1 個向量(type 為 fused)。

import dashscope
import json
import os
from http import HTTPStatus

# 融合向量:將 text/image/video 放在同一個 content 對象中
# 模型會將所有輸入融合編碼為 1 個向量,type 為 "fused"
text = "白色運動鞋,輕量透氣,適合跑步和日常穿著"
image = "https://dashscope.oss-cn-beijing.aliyuncs.com/images/256_1.png"

# 同一對象中的多模態內容會被融合為 1 個向量
input_data = [
    {"text": text, "image": image}
]

resp = dashscope.MultiModalEmbedding.call(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="tongyi-embedding-vision-plus-2026-03-06",
    input=input_data,
    dimension=1152
)

if resp.status_code == HTTPStatus.OK:
    result = {
        "status_code": resp.status_code,
        "request_id": getattr(resp, "request_id", ""),
        "output": resp.output,
        "usage": resp.usage
    }
    print(json.dumps(result, ensure_ascii=False, indent=4))

輸出樣本

{
    "status_code": 200,
    "request_id": "40532987-ba72-42aa-a178-bb58b52fb7f3",
    "code": "",
    "message": "",
    "output": {
        "embeddings": [
            {
                "index": 0,
                "embedding": [
                    -0.009490966796875,
                    -0.024871826171875,
                    -0.031280517578125,
                    ...
                ],
                "type": "text"
            }
        ]
    },
    "usage": {
        "input_tokens": 10,
        "input_tokens_details": {
            "image_tokens": 0,
            "text_tokens": 10
        },
        "output_tokens": 1,
        "total_tokens": 11
    }
}

錯誤碼

如果模型調用失敗並返回報錯資訊,請參見錯誤碼進行解決。