Todos os produtos
Search
Central de documentação

Vector Retrieval Service for Milvus:Transcrição de áudio

Última atualização: Aug 19, 2026

A função AI_AUDIO_TRANSCRIBE converte áudio em texto. Utilize este recurso para indexar gravações de atendimento ao cliente, gerar atas de reunião, processar mensagens de voz e arquivar conteúdo de podcasts.

Importante

Antes de transcrever suas próprias gravações, confirme que você cumpriu as obrigações de notificação de gravação e obteve a autorização necessária. Recomendamos o uso de URLs de mídia de curta duração com privilégio mínimo, além de limitar o tempo de armazenamento tanto do áudio original quanto do texto transcrito, conforme sua política de retenção de dados de atendimento ao cliente.

Formato do comando

REST API

REST API

@id="c0004a7x2t"

{
  "model_name": "qwen3-asr-flash",
  "texts": ["<audio_url>"],
  "params": {
    "language": "zh",
    "enable_itn": true,
    "max_concurrency": 1
  }
}

@id="cmdpysecaud01"

@id="cmdpyhaud0001"

Python

Python

@id="cmdpycodaud01"

schema = MilvusClient.create_schema(auto_id=True, enable_dynamic_field=False)
schema.add_field("id", DataType.INT64, is_primary=True)
schema.add_field("audio_url", DataType.VARCHAR, max_length=4096)
schema.add_field("transcript", DataType.VARCHAR, max_length=4096)
schema.add_field("dummy_vector", DataType.FLOAT_VECTOR, dim=2)
schema.add_function(
    Function(
        name="transcribe_audio",
        function_type=texttransform_function_type(),
        input_field_names=["audio_url"],
        output_field_names=["transcript"],
        params={
            "provider": "aliyun_milvus",
            "model_name": "qwen3-asr-flash",
            "task": "ai_audio_transcribe",
            "language": "zh",
            "enable_itn": "true",
        },
    )
)

Parâmetros

@id="p0048a7x2t" Parâmetro

@id="p0050a7x2t" Descrição

@id="p0010a7x2t" model_name

@id="p0012a7x2t" Obrigatório. Utilize qwen3-asr-flash.

@id="p0015a7x2t" texts

@id="p0017a7x2t" Necessário para REST. Array de URLs de áudio. Não pode conter strings vazias. Os resultados seguem a ordem de entrada.

@id="p0020a7x2t" language

@id="p0022a7x2t" Opcional. Código do idioma de source, por exemplo zh, en.

@id="p0025a7x2t" enable_itn

@id="p0027a7x2t" Opcional. Booleano. Quando ativado, normaliza números falados e expressões similares para a forma escrita.

@id="p0030a7x2t" timeout_sec / max_concurrency

@id="p0032a7x2t" Opcional. Controlam, respectivamente, o tempo limite da chamada e a quantidade de processamentos simultâneos para múltiplos arquivos de áudio.

@id="p0035a7x2t" media_type

@id="p0037a7x2t" Pode ser omitido ou defina como audio. Outros valores causam erro.

@id="p0040a7x2t" Outros

@id="p0042a7x2t" prompt, temperature e outros parâmetros personalizados do modelo não são suportados. A acessibilidade da URL de áudio, bem como os formatos e durações aceitos, dependem das limitações do service de modelo.

Valores de retorno

data.output.outputs retorna o texto transcrito correspondente a cada entrada de áudio, respeitando a ordem. usage.audio_tokens indica o uso de tokens de áudio, enquanto usage.seconds mostra a duração do áudio processado.

{
  "code": 0,
  "data": {
    "output": {"outputs": ["<transcript>"]},
    "usage": {"audio_tokens": 256, "total_tokens": 256, "seconds": 45}
  }
}

Exemplo: Transcrever uma gravação de atendimento ao cliente

O exemplo a seguir converte uma mensagem de boas-vindas de hotline em texto para arquivamento de versões e revisão manual, permitindo verificar se horários de atendimento, avisos de gravação e demais conteúdos estão claramente expressos. Campos ausentes na transcrição devem ser marcados como "não confirmados", pois o modelo não consegue complementá-los.

O arquivo público padrão welcome.mp3 é uma mensagem de boas-vindas em chinês; portanto, o exemplo utiliza language=zh. Ao substituir AIFUNC_AUDIO_URL, atualize também AIFUNC_AUDIO_LANGUAGE para o idioma de source real. O exemplo com cURL requer jq.

REST API

REST API

@id="c0058a7x2t"

#!/usr/bin/env bash
set -euo pipefail

MILVUS_REST_BASE_URL="http://c-xxxx.milvus.aliyuncs.com:19530"
MILVUS_AUTH_TOKEN="<yourUsername>:<yourPassword>"

post_json() {
  local path="$1"
  local body="$2"
  curl -X POST \
    "$MILVUS_REST_BASE_URL$path" \
    -H "Authorization: Bearer $MILVUS_AUTH_TOKEN" \
    -H "Content-Type: application/json" \
    -d "$body"
}

MODEL_NAME="qwen3-asr-flash"
AUDIO_URL="${AIFUNC_AUDIO_URL:-https://dashscope.oss-cn-beijing.aliyuncs.com/audios/welcome.mp3}"

BODY=$(cat <<JSON
{
  "model_name": "$MODEL_NAME",
  "texts": ["$AUDIO_URL"],
  "params": {"language": "zh", "enable_itn": true, "max_concurrency": 1}
}
JSON
)

RESPONSE_BODY="$(post_json "/v2/vectordb/ai/audio_transcribe" "$BODY")"
if command -v jq >/dev/null 2>&1; then
  echo "$RESPONSE_BODY" | jq .
  [ "$(echo "$RESPONSE_BODY" | jq -r '.code // -1')" = "0" ] || exit 1
else
  echo "$RESPONSE_BODY"
fi

@id="pt0059a7x2t"

@id="h0060a7x2t"

Python

Python

@id="c0061a7x2t"

from __future__ import annotations

from typing import Any

from pymilvus import DataType, Function, FunctionType, MilvusClient

MILVUS_URI = "http://c-xxxx.milvus.aliyuncs.com:19530"
MILVUS_TOKEN = "<yourUsername>:<yourPassword>"

DUMMY_VECTOR_DIM = 2
TEXTTRANSFORM_FUNCTION_TYPE = 9

def texttransform_function_type() -> Any:
    for type_name in ("TEXTTRANSFORM", "TEXT_TRANSFORM", "TextTransform"):
        function_type = getattr(FunctionType, type_name, None)
        if function_type is not None:
            return function_type
    # Alibaba Cloud Milvus provides TEXTTRANSFORM as a hosted extension (function type value 9);
    # some pymilvus versions do not yet have this enum member built in, while Function(...) validates via FunctionType(...).
    existing = getattr(FunctionType, "_value2member_map_", {}).get(TEXTTRANSFORM_FUNCTION_TYPE)
    if existing is not None:
        return existing
    extension = int.__new__(FunctionType, TEXTTRANSFORM_FUNCTION_TYPE)
    extension._name_ = "TEXTTRANSFORM"
    extension._value_ = TEXTTRANSFORM_FUNCTION_TYPE
    FunctionType._value2member_map_[TEXTTRANSFORM_FUNCTION_TYPE] = extension
    FunctionType._member_map_["TEXTTRANSFORM"] = extension
    return extension

def add_id(schema: Any) -> None:
    schema.add_field("id", DataType.INT64, is_primary=True)

def add_dummy_vector(schema: Any) -> None:
    schema.add_field("dummy_vector", DataType.FLOAT_VECTOR, dim=DUMMY_VECTOR_DIM)

def run_texttransform_example(*, client, collection_name, input_fields, output_field, function_name, function_params, rows) -> None:
    if client.has_collection(collection_name):
        client.drop_collection(collection_name)
    schema = MilvusClient.create_schema(auto_id=True, enable_dynamic_field=False)
    add_id(schema)
    for name, data_type, max_length in input_fields:
        field_params = {"max_length": max_length} if max_length is not None else {}
        schema.add_field(name, data_type, **field_params)
    output_name, output_data_type, output_max_length = output_field
    output_params = {"max_length": output_max_length} if output_max_length is not None else {}
    schema.add_field(output_name, output_data_type, **output_params)
    add_dummy_vector(schema)
    schema.add_function(
        Function(
            name=function_name,
            function_type=texttransform_function_type(),
            input_field_names=[name for name, _, _ in input_fields],
            output_field_names=[output_name],
            params=function_params,
        )
    )
    index_params = client.prepare_index_params()
    index_params.add_index(field_name="dummy_vector", index_type="AUTOINDEX", metric_type="COSINE")
    client.create_collection(collection_name=collection_name, schema=schema, index_params=index_params)
    client.insert(collection_name, rows)
    client.flush(collection_name)
    fields = [name for name, _, _ in input_fields] + [output_name]
    for row in client.query(collection_name, filter="", output_fields=fields, limit=len(rows)):
        print(row)

MODEL_NAME = "qwen3-asr-flash"
client = MilvusClient(uri=MILVUS_URI, token=MILVUS_TOKEN)

run_texttransform_example(
    client=client,
    collection_name="simple_ai_audio_transcribe_schema",
    input_fields=[("audio_url", DataType.VARCHAR, 4096)],
    output_field=("transcript", DataType.VARCHAR, 4096),
    function_name="transcribe_audio",
    function_params={"provider": "aliyun_milvus", "model_name": MODEL_NAME, "task": "ai_audio_transcribe", "language": "zh", "enable_itn": "true"},
    rows=[{"audio_url": "https://dashscope.oss-cn-beijing.aliyuncs.com/audios/welcome.mp3", "dummy_vector": [0.1, 0.2]}],
)

Resultado esperado: data.output.outputs[0] contém uma transcrição não vazia da mensagem de boas-vindas, com no máximo 10.000 caracteres, que pode ser gravada no campo transcript do arquivo de versões da hotline (retorno de teste real, renderizado em inglês: Welcome to Alibaba Cloud.; a API retorna a transcrição no idioma de source do áudio).

{"code": 0, "data": {"output": {"outputs": ["Welcome to Alibaba Cloud."]}}}

No cenário Python, nomeie o campo de entrada como audio_url e o campo de saída como transcript. A Function executa a transcrição automaticamente durante a inserção.