すべてのプロダクト
Search
ドキュメントセンター

Vector Retrieval Service for Milvus:キーワード抽出

最終更新日:Sep 14, 2026

`AI_KEYWORDS` は Alibaba Cloud Milvus の AI 関数で、テキスト、イメージ、またはビデオから代表的なキーワードを抽出します。検索インデックス、記事のタグ付け、クロス言語のアセット取得に使用します。

コマンド構文

`AI_KEYWORDS` は 2 つの呼び出しモードをサポートしています:

  • REST API — エンドポイントを直接呼び出して、テキスト、イメージ、またはビデオからオンデマンドでキーワードを抽出します。

  • コレクション関数 — コレクションスキーマにキーワード抽出を埋め込み、データが挿入されるとキーワードが自動的に抽出されるようにします。

REST API

REST API

AI キーワードのエンドポイントに POST リクエストを送信します:

POST /v2/vectordb/ai/keywords
Content-Type: application/json

{
  "model_name": "<model_name>",
  "texts": ["<text_or_media_url>"],
  "params": {"max_keywords": 10, "target_language": "zh"}
}

コレクション関数 (Python SDK)

コレクション関数 (Python SDK)

スキーマ内でコレクション関数としてキーワード抽出を定義します。この関数は挿入時に自動的にトリガーされ、指定された出力フィールドに結果を書き込みます:

schema = MilvusClient.create_schema(auto_id=True, enable_dynamic_field=False)
schema.add_field("id", DataType.INT64, is_primary=True)
schema.add_field("content", DataType.VARCHAR, max_length=8192)
schema.add_field("keywords", DataType.JSON)
schema.add_field("dummy_vector", DataType.FLOAT_VECTOR, dim=2)
schema.add_function(
    Function(
        name="extract_keywords",
        function_type=texttransform_function_type(),
        input_field_names=["content"],
        output_field_names=["keywords"],
        params={
            "provider": "aliyun_milvus",
            "model_name": "<model_name>",
            "task": "ai_keywords",
            "max_keywords": "5",
            "target_language": "en",
            "temperature": "0",
        },
    )
)

パラメーター

パラメーター説明
model_name必須。モデル名。イメージまたはビデオの場合は、設定済みのマルチモーダルモデル (例:qwen3.7-plus) を使用します。
textsREST API の場合は必須。処理するテキストコンテンツ、またはイメージかビデオを指す URL。
max_keywordsオプション。抽出するキーワードの最大数。デフォルト:10。有効範囲:1~50。
target_languageオプション。出力キーワードの言語。デフォルトは入力言語です。サポートされている値:zh、en、es、fr、de、ja、ko、ru、ar、pt。
promptオプション。追加の抽出ルール。最大 5,000 文字。${...} テンプレート変数の補間はサポートされていません。
media_typeオプション。有効な値:image または video。
temperature/max_concurrency/timeout_secオプション。モデルの安定性、同時実行数、およびタイムアウトの設定。
provider/taskコレクション関数でのみ必須。それぞれ aliyun_milvus と ai_keywords に固定されます。

戻り値

各出力項目は、{"keywords":["keyword 1","keyword 2"]} というフォーマットの JSON 文字列です。`AI_KEYWORDS` がコレクション関数として使用される場合、スキーマはこの結果を自動的に解析し、JSON 出力フィールドに書き込みます。

例 1:技術記事にキーワードを自動でタグ付けする (テキスト)

ナレッジベースでは、フィルタリングと集約をサポートするために、記事のキーワードをインデックスフィールドに書き込む必要があります。

REST API

REST API

#!/usr/bin/env bash
set -euo pipefail

MILVUS_REST_BASE_URL="http://c-xxxx.milvus.aliyuncs.com:19530"
MILVUS_AUTH_TOKEN="<yourUsername>:<yourPassword>"

post_json() {
  local path="$1"
  local body="$2"
  curl -X POST \
    "$MILVUS_REST_BASE_URL$path" \
    -H "Authorization: Bearer $MILVUS_AUTH_TOKEN" \
    -H "Content-Type: application/json" \
    -d "$body"
}

BODY=$(cat <<JSON
{
  "model_name": "qwen3.7-max",
  "texts": ["Milvus is an open-source vector database for high-performance approximate nearest neighbor search in RAG, recommendation, and image search."],
  "params": {"max_keywords": 5, "target_language": "en", "temperature": 0}
}
JSON
)
RESPONSE_BODY="$(post_json "/v2/vectordb/ai/keywords" "$BODY")"
if command -v jq >/dev/null 2>&1; then
  echo "$RESPONSE_BODY" | jq .
  [ "$(echo "$RESPONSE_BODY" | jq -r '.code // -1')" = "0" ] || exit 1
else
  echo "$RESPONSE_BODY"
fi

Python (コレクション関数)

Python (コレクション関数)

次の例では、スキーマ作成、関数登録、データ挿入、および結果のクエリを処理する共有ユーティリティ関数 (texttransform_function_type および run_texttransform_example) を使用します。例 2 と例 3 では、これらの同じユーティリティを再利用します。

from __future__ import annotations

from typing import Any

from pymilvus import DataType, Function, FunctionType, MilvusClient

MILVUS_URI = "http://c-xxxx.milvus.aliyuncs.com:19530"
MILVUS_TOKEN = "<yourUsername>:<yourPassword>"

DUMMY_VECTOR_DIM = 2
TEXTTRANSFORM_FUNCTION_TYPE = 9

def texttransform_function_type() -> Any:
    for type_name in ("TEXTTRANSFORM", "TEXT_TRANSFORM", "TextTransform"):
        function_type = getattr(FunctionType, type_name, None)
        if function_type is not None:
            return function_type
    # Alibaba Cloud Milvus provides TEXTTRANSFORM as a managed extension (function type value 9);
    # some pymilvus versions do not have this enum member built in, while Function(...) validates through FunctionType(...).
    existing = getattr(FunctionType, "_value2member_map_", {}).get(TEXTTRANSFORM_FUNCTION_TYPE)
    if existing is not None:
        return existing
    extension = int.__new__(FunctionType, TEXTTRANSFORM_FUNCTION_TYPE)
    extension._name_ = "TEXTTRANSFORM"
    extension._value_ = TEXTTRANSFORM_FUNCTION_TYPE
    FunctionType._value2member_map_[TEXTTRANSFORM_FUNCTION_TYPE] = extension
    FunctionType._member_map_["TEXTTRANSFORM"] = extension
    return extension

def add_id(schema: Any) -> None:
    schema.add_field("id", DataType.INT64, is_primary=True)

def add_dummy_vector(schema: Any) -> None:
    schema.add_field("dummy_vector", DataType.FLOAT_VECTOR, dim=DUMMY_VECTOR_DIM)

def run_texttransform_example(*, client, collection_name, input_fields, output_field, function_name, function_params, rows) -> None:
    if client.has_collection(collection_name):
        client.drop_collection(collection_name)
    schema = MilvusClient.create_schema(auto_id=True, enable_dynamic_field=False)
    add_id(schema)
    for name, data_type, max_length in input_fields:
        field_params = {"max_length": max_length} if max_length is not None else {}
        schema.add_field(name, data_type, **field_params)
    output_name, output_data_type, output_max_length = output_field
    output_params = {"max_length": output_max_length} if output_max_length is not None else {}
    schema.add_field(output_name, output_data_type, **output_params)
    add_dummy_vector(schema)
    schema.add_function(
        Function(
            name=function_name,
            function_type=texttransform_function_type(),
            input_field_names=[name for name, _, _ in input_fields],
            output_field_names=[output_name],
            params=function_params,
        )
    )
    index_params = client.prepare_index_params()
    index_params.add_index(field_name="dummy_vector", index_type="AUTOINDEX", metric_type="COSINE")
    client.create_collection(collection_name=collection_name, schema=schema, index_params=index_params)
    client.insert(collection_name, rows)
    client.flush(collection_name)
    fields = [name for name, _, _ in input_fields] + [output_name]
    for row in client.query(collection_name, filter="", output_fields=fields, limit=len(rows)):
        print(row)

client = MilvusClient(uri=MILVUS_URI, token=MILVUS_TOKEN)

run_texttransform_example(
    client=client,
    collection_name="simple_ai_keywords_text",
    input_fields=[("content", DataType.VARCHAR, 8192)],
    output_field=("keywords", DataType.JSON, None),
    function_name="extract_keywords",
    function_params={"provider": "aliyun_milvus", "model_name": "qwen3.7-max", "task": "ai_keywords", "max_keywords": "5", "target_language": "en", "temperature": "0"},
    rows=[{"content": "Milvus is an open-source vector database for high-performance approximate nearest neighbor search in RAG, recommendation, and image search.", "dummy_vector": [0.1, 0.2]}],
)

期待される結果:keywords フィールドは {"keywords":["Milvus","vector database","approximate nearest neighbor search","RAG","open-source"]} を返します (target_language=en の場合の英語のキーワード)。

例 2:プロダクトイメージからキーワードを抽出する (イメージ)

メディアチームは、クロス言語のアセット検索をサポートするために、イメージから英語のキーワードを生成する必要があります。

REST API

REST API

#!/usr/bin/env bash
set -euo pipefail

MILVUS_REST_BASE_URL="http://c-xxxx.milvus.aliyuncs.com:19530"
MILVUS_AUTH_TOKEN="<yourUsername>:<yourPassword>"

post_json() {
  local path="$1"
  local body="$2"
  curl -X POST \
    "$MILVUS_REST_BASE_URL$path" \
    -H "Authorization: Bearer $MILVUS_AUTH_TOKEN" \
    -H "Content-Type: application/json" \
    -d "$body"
}

BODY=$(cat <<JSON
{"model_name":"qwen3.7-plus","texts":["https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260415/hynnff/wan-video-edit-clothes.webp"],"params":{"media_type":"image","max_keywords":5,"target_language":"en","temperature":0,"timeout_sec":120,"enable_thinking":false}}
JSON
)
RESPONSE_BODY="$(post_json "/v2/vectordb/ai/keywords" "$BODY")"
if command -v jq >/dev/null 2>&1; then
  echo "$RESPONSE_BODY" | jq .
  [ "$(echo "$RESPONSE_BODY" | jq -r '.code // -1')" = "0" ] || exit 1
else
  echo "$RESPONSE_BODY"
fi

Python (コレクション関数)

Python (コレクション関数)

この例では、例 1 で定義されたものと同じユーティリティ関数を使用します。以下には、固有の呼び出し部分のみを示します。

client = MilvusClient(uri=MILVUS_URI, token=MILVUS_TOKEN)

run_texttransform_example(
    client=client,
    collection_name="simple_ai_keywords_image",
    input_fields=[("image_url", DataType.VARCHAR, 4096)],
    output_field=("keywords", DataType.JSON, None),
    function_name="extract_image_keywords",
    function_params={"provider": "aliyun_milvus", "model_name": "qwen3.7-plus", "task": "ai_keywords", "media_type": "image", "max_keywords": "5", "target_language": "en", "temperature": "0"},
    rows=[{"image_url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/20260415/hynnff/wan-video-edit-clothes.webp", "dummy_vector": [0.1, 0.2]}],
)

期待される結果:keywords フィールドは、イメージから抽出された最大 5 つの英語のキーワードを {"keywords":[...]} のフォーマットで返します。

例 3:ビデオアセットからキーワードを抽出する (ビデオ)

ビデオライブラリでは、トピックやシーンによる取得を可能にするために、ビデオに自動でタグ付けする必要があります。

REST API

REST API

#!/usr/bin/env bash
set -euo pipefail

MILVUS_REST_BASE_URL="http://c-xxxx.milvus.aliyuncs.com:19530"
MILVUS_AUTH_TOKEN="<yourUsername>:<yourPassword>"

post_json() {
  local path="$1"
  local body="$2"
  curl -X POST \
    "$MILVUS_REST_BASE_URL$path" \
    -H "Authorization: Bearer $MILVUS_AUTH_TOKEN" \
    -H "Content-Type: application/json" \
    -d "$body"
}

BODY=$(cat <<JSON
{"model_name":"qwen3.7-plus","texts":["https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260409/dozxak/Wan_Video_Edit_33_1.mp4"],"params":{"media_type":"video","max_keywords":5,"target_language":"en","temperature":0}}
JSON
)
RESPONSE_BODY="$(post_json "/v2/vectordb/ai/keywords" "$BODY")"
if command -v jq >/dev/null 2>&1; then
  echo "$RESPONSE_BODY" | jq .
  [ "$(echo "$RESPONSE_BODY" | jq -r '.code // -1')" = "0" ] || exit 1
else
  echo "$RESPONSE_BODY"
fi

Python (コレクション関数)

Python (コレクション関数)

この例では、例 1 で定義されたものと同じユーティリティ関数を使用します。以下には、固有の呼び出し部分のみを示します。

client = MilvusClient(uri=MILVUS_URI, token=MILVUS_TOKEN)

run_texttransform_example(
    client=client,
    collection_name="simple_ai_keywords_video",
    input_fields=[("video_url", DataType.VARCHAR, 4096)],
    output_field=("keywords", DataType.JSON, None),
    function_name="extract_video_keywords",
    function_params={"provider": "aliyun_milvus", "model_name": "qwen3.7-plus", "task": "ai_keywords", "media_type": "video", "max_keywords": "5", "target_language": "en", "temperature": "0"},
    rows=[{"video_url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260409/dozxak/Wan_Video_Edit_33_1.mp4", "dummy_vector": [0.1, 0.2]}],
)

期待される結果:keywords フィールドは、ビデオのトピックに関連する最大 5 つの英語のキーワードを返します。これらのキーワードは、ビデオ取得用のフィールドに書き込むことができます。