全部产品
Search
文档中心

向量检索服务 Milvus 版:AI Function

更新时间:Aug 03, 2026

Milvus AI Function 将模型调用封装为 Collection Function 和 REST 接口,您可以在数据写入、检索或业务服务中处理文本、图片、视频和音频,而无需分别维护模型调用链路。覆盖向量化、重排序、内容理解与生成、媒体生成、批量任务和安全检测等常见 AI 场景。

应用场景

  • 多模态检索与 RAG:为文本、图片和视频生成向量,召回候选内容后再重排序。

  • 内容理解与加工:生成标题、翻译、摘要、分类、情感分析、关键词、实体和结构化标签。

  • 媒体生产:转写客服录音,编辑商品图片,或创建并查询视频生成任务。

  • 批量与安全治理:对历史素材发起异步批量推理,并在模型调用的输入或输出阶段启用安全检测。

架构

输入数据与模型服务共同进入 Milvus AI Function 能力层;能力层按函数类型返回向量、结构化信息、生成文本或媒体 URL,供搜索、内容生产和业务系统使用。

支持的 AI Function

下表列出当前文档目录中的全部函数。模型列列出模型类型及代表模型;实际可用模型以服务端 Provider 配置为准。

AI Function

描述

输入模态

支持的模型类型/代表模型

向量化

将内容转换为稠密向量,用于语义检索、RAG、聚类、推荐和图文检索。

文本、图片、视频

文本 Embedding:text-embedding-v4;多模态 Embedding:qwen3-vl-embeddingtongyi-embedding-vision-plus

向量化缓存

为重复文本复用 Redis 精确缓存中的向量,降低向量化延迟和模型用量。

文本

文本 Embedding:text-embedding-v4text-embedding-v3

重排序

为 Query 与已召回的候选文本、图片或视频打分并重排序。

文本、图片、视频

文本重排序:qwen3-rerank;多模态重排序:qwen3-vl-rerank

文本生成

根据 Prompt 按行生成标题、文案、标签或字段补全结果。

文本

文本模型:qwen3.7-maxdeepseek-v4-prodeepseek-v4-flash

翻译

将文本翻译为指定目标语言。

文本

文本模型:qwen3.7-maxdeepseek-v4-prodeepseek-v4-flash

相似度

比较成对文本的语义相似度,返回 0~1 分数。

文本

文本模型:qwen3.7-maxdeepseek-v4-prodeepseek-v4-flash

敏感信息脱敏

识别并掩码文本中的个人敏感信息。

文本

文本模型:qwen3.7-maxdeepseek-v4-proglm-5.2

摘要

将文本、图片或视频压缩为简洁摘要。

文本、图片、视频

文本模型:qwen3.7-max;多模态模型:qwen3.7-plusqwen3.6-pluskimi-k2.6

信息抽取

按给定标签从内容中抽取结构化字段并返回 JSON。

文本、图片、视频

文本模型:qwen3.7-max;多模态模型:qwen3.7-plusqwen3.6-pluskimi-k2.6

命名实体识别

抽取人名、组织、地点、时间、金额等命名实体并返回 JSON。

文本、图片、视频

文本模型:qwen3.7-max;多模态模型:qwen3.7-plusqwen3.6-pluskimi-k2.6

关键词提取

从内容中提取代表性关键词并返回 JSON。

文本、图片、视频

文本模型:qwen3.7-max;多模态模型:qwen3.7-plusqwen3.6-pluskimi-k2.6

分类

在候选标签中选择与内容最匹配的一类。

文本、图片、视频

文本模型:qwen3.7-max;多模态模型:qwen3.7-plusqwen3.6-pluskimi-k2.6

情感分析

从候选情感类别中选择最匹配的一类。

文本、图片、视频

文本模型:qwen3.7-max;多模态模型:qwen3.7-plusqwen3.6-pluskimi-k2.6

多模态生成

根据文本、图片、视频或音频生成文本结果。

文本、图片、视频、音频

多模态模型:qwen3.7-plusqwen3.6-pluskimi-k2.6;音频转写:qwen3-asr-flash

音频转写

将音频 URL 转写为可检索文本。

音频

语音识别模型:qwen3-asr-flash

图片编辑

根据图片和提示词生成编辑后的图片 URL。

文本、图片

图像生成模型:wan2.7-image-prowan2.7-image

视频生成与编辑

提交文生视频、图生视频或视频编辑任务,并异步获取结果视频 URL。

文本、图片、视频

视频模型:happyhorse-1.1-t2vhappyhorse-1.1-i2vhappyhorse-1.0-video-edit

批量推理

将 JSONL 中的 Chat Completions 请求提交为异步批量任务,轮询并下载输出或错误文件。

文本、图片、视频、音频

文本模型:qwen3.7-max;视觉模型:qwen3-vl-plus;全模态模型:qwen3.5-omni-plus

数据检测

在模型调用的输入、输出或两个阶段检查不安全内容。

文本

使用当前 TextTransform 调用的文本模型,例如 qwen3.7-maxdeepseek-v4-pro

使用方式

  • Collection Function:将函数配置到 Collection Schema,适合在写入、检索或搜索阶段自动执行。

  • REST 接口:适合由业务服务即时调用;每个函数页均提供 cURL 与 Python 示例。

  • 异步任务:AI_BATCHAI_VIDEO_EDIT 返回任务标识,必须查询至终态后读取输出或下载结果。

选择建议

  • 需要检索:先使用 AI_EMBEDDING,再按需要使用 AI_RERANK;重复文本可启用 AI_EMBEDDING_CACHE

  • 需要理解内容:按目标选择摘要、抽取、实体、关键词、分类、情感或多模态生成函数。

  • 需要生成媒体:图片使用 AI_IMAGE_EDIT,视频使用 AI_VIDEO_EDIT;大规模离线处理使用 AI_BATCH

  • 需要处理敏感内容:在 TextTransform 请求或 Function 参数中启用 data_inspection