Qwen2-VL に基づくマルチモーダル埋め込みサービスで、テキスト、画像、およびそれらを組み合わせた入力をセマンティックベクターに変換します。
|
モデル ID (service_id) |
ディメンション |
サービスの説明 |
QPS 上限 |
|
ops-m2-encoder |
768 ディメンション |
BM-6B でトレーニングされた、60 億の画像-テキストペア (中国語 30 億、英語 30 億) を持つバイリンガル (中国語-英語) のマルチモーダルサービスです。クロスモーダル検索 (Text-to-Image、Image-to-Text) と画像分類をサポートします。 説明
このモデルは、同一の入力オブジェクト内でテキストと画像の両方を受け付けません。 |
10 説明
より高い API の QPS 上限をリクエストするには、テクニカルサポートにチケットを送信してください。 |
|
ops-m2-encoder-large |
1024 ディメンション |
10 億のパラメーターを持つバイリンガル (中国語-英語) のマルチモーダルサービスです。マルチモーダルタスクにおいて、 説明
このモデルは、同一の入力オブジェクト内でテキストと画像の両方を受け付けません。 |
|
|
ops-gme-qwen2-vl-2b-instruct |
1536 ディメンション |
Qwen2-VL MLLM に基づくマルチモーダル埋め込みサービスです。テキスト、画像、および組み合わせたデータのシングルモーダルおよびマルチモーダル入力をサポートします。 |
|
|
ops-mm-embedding-v1-2b |
1536 ディメンション |
Alibaba Cloud AI 検索オープンプラットフォームチームによって開発されたマルチモーダル埋め込みモデルです。Qwen2-VL 2B Instruct でファインチューニングされており、テキスト、画像、ビデオ入力をサポートし、それらを統一されたセマンティックベクターにエンコーディングして、クロスモーダル検索および理解タスクに利用します。 |
|
|
ops-mm-embedding-v1-7b |
3584 ディメンション |
Alibaba Cloud AI 検索オープンプラットフォームチームによって開発されたマルチモーダル埋め込みモデルです。Qwen2-VL 7B Instruct でファインチューニングされており、テキスト、画像、ビデオ入力をサポートし、それらを統一されたセマンティックベクターにエンコーディングして、クロスモーダル検索および理解タスクに利用します。 |
|
|
ops-mm-embedding-face-001 |
512 ディメンション |
単一または複数の画像入力を高次元のセマンティックベクターにエンコーディングし、顔検索と比較を行うための顔検索モデルです。 |
前提条件
-
認証情報の取得
AI 検索オープンプラットフォームでは、認証に API キーが必要です。手順については、「API キーの取得」をご参照ください。
-
サービスエンドポイントの取得
サービスは、パブリックネットワークまたは VPC 経由で呼び出すことができます。詳細については、「サービスエンドポイントの取得」をご参照ください。
リクエスト
リクエストボディの制限
リクエストボディは 8 MB を超えることはできません。
リクエストメソッド
POST
URL
{host}/v3/openapi/workspaces/{workspace_name}/multi-modal-embedding/{service_id}
-
host:サービスエンドポイント。パブリックネットワークまたは VPC 経由でアクセスできます。「サービスエンドポイントの取得」をご参照ください。左側のナビゲーションウィンドウで、ご利用のワークスペース (例:default) を選択し、[API Keys] をクリックすると、パブリック API エンドポイントとプライベート API エンドポイントが表示されます。
-
workspace_name:ワークスペース名。例:default。 -
service_id:モデル ID。例:ops-m2-encoder。
リクエストパラメーター
ヘッダーパラメーター
API キー認証
|
パラメーター |
タイプ |
必須 |
説明 |
例 |
|
Content-Type |
String |
はい |
|
application/json |
|
Authorization |
String |
はい |
認証用の API キーです。 |
Bearer OS-d1**2a |
ボディパラメーター
|
パラメーター |
タイプ |
必須 |
説明 |
例 |
|
input |
List[ContentObject] |
はい |
埋め込みに変換するコンテンツ。リクエストごとに最大 32 オブジェクトまで指定できます。 |
|
ContentObject
|
パラメーター |
タイプ |
必須 |
説明 |
例 |
|
text |
String |
いいえ |
埋め込みに変換するテキスト。 |
|
|
image |
String |
いいえ |
埋め込みに変換する画像。URL または Base64 エンコードされた文字列として指定します。
|
または
|
レスポンスパラメーター
|
パラメーター |
タイプ |
説明 |
例 |
|
result.embeddings |
List |
埋め込みオブジェクトの配列。各オブジェクトは |
|
|
result.embeddings[].index |
Int |
対応する入力オブジェクトのインデックス。 |
0 |
|
result.embeddings[].embedding |
List[Double] |
結果として得られる埋め込みベクター。 |
[0.003143,0.009750,...,-0.017395] |
cURL リクエストの例
curl -X POST \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
"http://****-hangzhou.opensearch.aliyuncs.com/v3/openapi/workspaces/default/multi-modal-embedding/ops-m2-encoder" \
-d '{
"input":[
{
"image":"http://***/a.jpg"
}
]
}'
レスポンスの例
成功レスポンスの例
{
"request_id": "B4AB89C8-B135-****-A6F8-2BAB801A2CE4",
"latency": 38,
"usage": {
"image":1,
"token_count":28
},
"result": {
"embeddings": [
{
"index": 0,
"embedding": [
-0.033447265625,
0.10577392578125,
-0.0015211105346679688,
-0.044189453125,
...
0.004688262939453125,
-4.5239925384521484E-5
]
}
]
}
}
エラーレスポンスの例
エラーレスポンスには、原因を示す code と message が含まれます。
{
"request_id": "651B3087-8A07-****-B931-9C4E7B60F52D",
"latency": 0,
"code": "InvalidParameter",
"message": "JSON parse error: Cannot deserialize value of type `InputType` from String \"xxx\""
}
ステータスコード
すべてのステータスコードについては、「ステータスコード」をご参照ください。