Todos os produtos
Search
Central de documentação

Vector Retrieval Service for Milvus:Especificações de nós de computação e comparação de desempenho

Última atualização: Jun 29, 2026

Alibaba Cloud AISearch for Milvus (Milvus) oferece diferentes tipos de Compute Unit (CU) e quantidades flexíveis de nós de computação (Query Node). Use esta referência para selecionar o tipo de instância mais adequado ao seu cenário de negócios.

Tipos de CU

Os nós de computação do Milvus suportam os seguintes tipos de CU:

  • Otimizado para computação: Ideal para cargas de trabalho com alto QPS e baixa latência, como busca, sistemas de recomendação, IA generativa e chatbots.

  • Otimizado para armazenamento: Recomendado para grandes volumes de dados com requisitos moderados de desempenho de busca. Instâncias otimizadas para armazenamento oferecem quatro vezes a capacidade de armazenamento das instâncias otimizadas para computação e entregam excelente desempenho para a maioria dos cenários. São ideais para recuperação de dados não estruturados em larga escala, detecção de direitos autorais e preparação de dados de modelos.

    Importante

    Atualmente, as CUs otimizadas para armazenamento apresentam as seguintes limitações:

    • Somente scale-out e scale-in são suportados. Não há suporte para upgrades ou downgrades verticais. Confirme atentamente as especificações da CU antes da compra.

    • Recomenda-se apenas o índice DiskANN. Esse tipo de índice suporta somente dados vetoriais float. Para medir a distância entre vetores, há suporte apenas para distância euclidiana (L2), produto interno (IP) ou similaridade de cosseno (COSINE).

Comparação de capacidade de armazenamento

Tipo de CU

Tipo de índice

Especificações da CU

Referência de capacidade de dados vetoriais (baseada em dados vetoriais SIFT de 128 dimensões)

Referência de capacidade de dados vetoriais (baseada em dados vetoriais GIST de 960 dimensões)

Otimizado para computação

HNSW

M:30

efConstruction:360

4 vCPU 16 GiB (4 CUs)

16 milhões

3 milhões

8 vCPU 32 GiB (8 CUs)

32 milhões

6 milhões

16 vCPU 64 GiB (16 CUs)

64 milhões

12 milhões

32 vCPU 128 GiB (32 CUs)

128 milhões

24 milhões

Otimizado para armazenamento

DiskANN

8 vCPU 32 GiB (8 CUs)

120 milhões

23 milhões

16 vCPU 64 GiB (16 CUs)

240 milhões

46 milhões

32 vCPU 128 GiB (32 CUs)

480 milhões

92 milhões

Nota
  • Os dados da tabela baseiam-se em testes de desempenho e servem como referência para avaliação de capacidade.

  • O conjunto de dados de teste contém apenas chaves primárias e dados vetoriais, sem campos escalares. As chaves primárias são inteiros positivos autoincrementais iniciando em zero, convertidos para strings. Como os campos escalares são essenciais na maioria dos ambientes de produção e também consomem armazenamento, a contagem real de vetores armazenáveis será inferior aos valores apresentados na tabela.

Comparação de desempenho de recuperação

Tipo de CU

Especificações da CU

Tipo de índice

topk=50

topk=100

topk=250

topk=1000

QPS

RT_p99

QPS

RT_p99

QPS

RT_p99

QPS

RT_p99

Otimizado para computação

16 vCPU 64 GiB

(16 CUs)

HNSW

M:30 efConstruction:360

2000

< 10 ms

1200

< 10 ms

550

< 15 ms

150

< 30 ms

Otimizado para armazenamento

16 vCPU 64 GiB

(16 CUs)

DiskANN

700

< 15 ms

550

< 20 ms

200

< 30 ms

60

< 50 ms

Nota
  • Os dados baseiam-se em resultados de testes do conjunto de dados Cohere (10 milhões de vetores, 768 dimensões). O desempenho real varia conforme a distribuição de dados dos diferentes conjuntos.

  • A métrica RT_p99 é obtida mediante a execução sequencial de 1.000 consultas, considerando o tempo de resposta do percentil 99.

  • Os dados de teste contêm apenas chaves primárias e dados vetoriais, sem campos escalares. As chaves primárias são inteiros positivos autoincrementais iniciando em zero. Usa-se HNSW para instâncias otimizadas para computação e DiskANN para instâncias otimizadas para armazenamento.

  • O Milvus otimiza periodicamente os índices vetoriais em segundo plano. Esse processo geralmente é concluído em até 3 horas após a gravação dos dados, momento em que o sistema atinge o desempenho ideal.

Quantidade de nós de computação

É possível dimensionar a quantidade de nós de computação (Query Nodes) de 1 a 50. O QPS aumenta linearmente conforme o número de nós. Mais nós também melhoram a disponibilidade do serviço; portanto, para ambientes de produção que exigem alta disponibilidade, use pelo menos 2 nós.

Análise de cenários

Suponha que você esteja construindo um sistema de recuperação de imagens com 20 milhões de imagens. Cada imagem é representada por um vetor de 768 dimensões. Seu objetivo é processar 2.000 solicitações de busca por segundo e retornar os 100 principais resultados em até 10 milissegundos. Avalie suas opções da seguinte forma:

  1. Avaliação de latência: Escolha um tipo de CU com base nos seus requisitos de latência. Por exemplo, se for necessária uma latência inferior a 10 milissegundos, a CU otimizada para computação é o único tipo que atende a esse requisito.

  2. Consideração de capacidade: Calcule o número necessário de CUs com base no volume de dados e nas dimensões. Uma única CU otimizada para computação de 16 vCPU 64 GiB (16 CUs) comporta 12 milhões de vetores de 960 dimensões. Para acomodar 20 milhões de vetores de 768 dimensões, configure pelo menos duas dessas CUs, totalizando 32 CUs.

  3. Validação de throughput: Valide o throughput de cada nó para a configuração de top-k especificada. Por exemplo, com top-k definido como 100, um nó otimizado para computação fornece um QPS de 1.200. Para atingir um desempenho sustentado de 2.000 QPS, dobre o número de nós.

Com base nessa análise, escolha CUs otimizadas para computação e configure quatro nós, cada um com especificações de 16 vCPU 64 GiB (16 CUs).