Milvus の AI 関数は、モデルコールを Collection 関数および REST インターフェイスとしてラップすることで、データインジェスト、検索、またはビジネスワークフロー中に、個別のモデルコールパイプラインを維持することなく、テキスト、画像、動画、音声を処理できます。AI 関数は、埋め込み、再ランキング、コンテンツ理解と生成、メディア制作、バッチ処理、安全性検出など、一般的な AI シナリオをカバーしています。
適用シナリオ
マルチモーダル検索と検索拡張生成 (RAG) — テキスト、画像、動画の埋め込みを生成し、取得した候補を再ランキングします。
コンテンツ理解と処理 — タイトル、翻訳、要約、分類、感情分析結果、キーワード、エンティティ、構造化タグを生成します。
メディア制作 — カスタマーサービスの録音を文字起こししたり、商品画像を編集したり、動画生成タスクを作成してクエリを実行したりします。
バッチと安全性ガバナンス — 履歴アセットに対して非同期バッチ推論を開始し、モデルコールの入力または出力段階で安全性検出を有効にします。
アーキテクチャ
入力データとモデルサービスが Milvus AI 関数の機能レイヤーに入力されます。機能レイヤーは、関数の種類に応じて、埋め込み、構造化情報、生成テキスト、またはメディア URL を返します。検索、コンテンツ制作、ビジネスシステムでこれらを利用します。
サポート対象の AI 関数
次の表は、すべての AI 関数の一覧です。モデル列には、モデルタイプと代表的なモデルが記載されています。利用可能なモデルは、サーバー側のプロバイダー設定に依存します。
| AI 関数 | 説明 | 入力モダリティ | サポート対象のモデルタイプ / 代表的なモデル |
| AI_EMBEDDING | コンテンツを密なベクトルに変換し、セマンティック検索、検索拡張生成 (RAG)、クラスタリング、レコメンデーション、画像テキスト検索に利用します。 | テキスト、画像、動画 | テキスト埋め込み: text-embedding-v4; マルチモーダル埋め込み: qwen3-vl-embedding、tongyi-embedding-vision-plus。 |
| AI_EMBEDDING_CACHE | Redis の完全一致キャッシュからベクトルを再利用することで、繰り返し入力されるテキストの埋め込みレイテンシとモデル使用量を削減します。 | テキスト | テキスト埋め込み: text-embedding-v4、text-embedding-v3。 |
| AI_RERANK | 取得した候補のテキスト、画像、または動画に対してクエリをスコアリングし、再ランキングします。 | テキスト、画像、動画 | テキスト再ランキング: qwen3-rerank; マルチモーダル再ランキング: qwen3-vl-rerank。 |
| AI_TEXT_TRANSFORM | プロンプトに基づいて、タイトル、コピー、タグ、またはフィールド補完結果を 1 行ずつ生成します。 | テキスト | テキストモデル: qwen3.7-max、deepseek-v4-pro、deepseek-v4-flash。 |
| AI_TRANSLATE | テキストを指定されたターゲット言語に翻訳します。 | テキスト | テキストモデル: qwen3.7-max、deepseek-v4-pro、deepseek-v4-flash。 |
| AI_SIMILARITY | テキストペアのセマンティックな類似性を比較し、0 から 1 のスコアを返します。 | テキスト | テキストモデル: qwen3.7-max、deepseek-v4-pro、deepseek-v4-flash。 |
| AI_PII_MASK | テキスト内の個人に関する機密情報を識別してマスクします。 | テキスト | テキストモデル: qwen3.7-max、deepseek-v4-pro、glm-5.2。 |
| AI_SUMMARIZATION | テキスト、画像、または動画を簡潔に要約します。 | テキスト、画像、動画 | テキストモデル: qwen3.7-max; マルチモーダルモデル: qwen3.7-plus、qwen3.6-plus、kimi-k2.6。 |
| AI_EXTRACTION | 指定されたラベルに基づいてコンテンツから構造化フィールドを抽出し、JSON を返します。 | テキスト、画像、動画 | テキストモデル: qwen3.7-max; マルチモーダルモデル: qwen3.7-plus、qwen3.6-plus、kimi-k2.6。 |
| AI_ENTITY | 名前、組織、場所、時間、金額などの固有表現を抽出し、JSON を返します。 | テキスト、画像、動画 | テキストモデル: qwen3.7-max; マルチモーダルモデル: qwen3.7-plus、qwen3.6-plus、kimi-k2.6。 |
| AI_KEYWORD | コンテンツから代表的なキーワードを抽出し、JSON を返します。 | テキスト、画像、動画 | テキストモデル: qwen3.7-max; マルチモーダルモデル: qwen3.7-plus、qwen3.6-plus、kimi-k2.6。 |
| AI_CLASSIFICATION | 候補ラベルの中から、コンテンツに最も一致するカテゴリを選択します。 | テキスト、画像、動画 | テキストモデル: qwen3.7-max; マルチモーダルモデル: qwen3.7-plus、qwen3.6-plus、kimi-k2.6。 |
| AI_SENTIMENT | 候補の感情カテゴリの中から、コンテンツに最も一致するものを選択します。 | テキスト、画像、動画 | テキストモデル: qwen3.7-max; マルチモーダルモデル: qwen3.7-plus、qwen3.6-plus、kimi-k2.6。 |
| AI_MULTIMODAL_GENERATION | テキスト、画像、動画、または音声からテキスト結果を生成します。 | テキスト、画像、動画、音声 | マルチモーダルモデル: qwen3.7-plus、qwen3.6-plus、kimi-k2.6; 音声認識: qwen3-asr-flash。 |
| AI_TRANSCRIPTION | 音声 URL の音声を検索可能なテキストに文字起こしします。 | 音声 | 音声認識モデル: qwen3-asr-flash。 |
| AI_IMAGE_EDIT | 画像とプロンプトに基づいて、編集された画像の URL を生成します。 | テキスト、画像 | 画像生成モデル: wan2.7-image-pro、wan2.7-image。 |
| AI_VIDEO_EDIT | テキストから動画へ、画像から動画へ、または動画編集タスクを送信し、結果の動画 URL を非同期で取得します。 | テキスト、画像、動画 | 動画モデル: happyhorse-1.1-t2v、happyhorse-1.1-i2v、happyhorse-1.0-video-edit。 |
| AI_BATCH | チャット補完リクエストを JSONL 形式で非同期バッチタスクとして送信し、ステータスをポーリングして、出力ファイルまたはエラーファイルをダウンロードします。 | テキスト、画像、動画、音声 | テキストモデル: qwen3.7-max; Vision モデル: qwen3-vl-plus; オムニモーダルモデル: qwen3.5-omni-plus。 |
| AI_DATA_INSPECTION | モデルコールの入力段階、出力段階、またはその両方で安全でないコンテンツをチェックします。 | テキスト | 現在の TextTransform コールのテキストモデルを使用します (例: qwen3.7-max、deepseek-v4-pro)。 |
使用方法
Collection 関数 — Collection スキーマで関数を設定し、書き込み、検索、または検索の段階で自動的に実行します。
REST インターフェイス — ビジネスサービスからオンデマンドで関数を呼び出します。各関数ページには、cURL と Python の例が記載されています。
非同期タスク —
AI_BATCHとAI_VIDEO_EDITはタスク識別子を返します。タスクが終端状態に達するまでポーリングしてから、出力を読み取るか、結果をダウンロードします。
選択ガイド
検索 — まず
AI_EMBEDDINGを使用し、必要に応じてAI_RERANKを使用します。繰り返し入力されるテキストにはAI_EMBEDDING_CACHEを有効にします。
コンテンツ理解 — 目標に応じて、要約、抽出、エンティティ、キーワード、分類、感情分析、またはマルチモーダル生成の関数を選択します。
メディア生成 — 画像には
AI_IMAGE_EDITを、動画にはAI_VIDEO_EDITを使用します。大規模なオフライン処理にはAI_BATCHを使用します。
機密コンテンツの取り扱い — TextTransform リクエストまたは関数のパラメーターで
data_inspectionを有効にします。