O OSS Vectors é o recurso de armazenamento e recuperação de vetores do Alibaba Cloud Object Storage Service (OSS). Ele utiliza um tipo dedicado de bucket de vetores para armazenar, consultar e gerenciar dados vetoriais. Como solução econômica, escalável e fácil de usar, o OSS Vectors viabiliza o armazenamento e a consulta de vetores para aplicações de IA, como recuperação multimodal, bases de conhecimento, geração aumentada por recuperação (RAG) e agentes de IA. Grave dados vetoriais gerados por qualquer serviço de terceiros em um bucket de vetores. O OSS Vectors também oferece governança unificada tanto para dados brutos em grande escala quanto para dados vetoriais. Por exemplo, configure a mesma Bucket Policy para buckets padrão e de vetores ou exporte logs em formato unificado para auditoria.
Conceitos principais
Bucket de vetores: novo tipo de bucket que funciona como recurso de nuvem para gerenciar dados vetoriais em grande escala.
Índice de vetores: crie índices de vetores dentro de um bucket de vetores. Trata-se de uma tabela de índice para armazenar dados vetoriais. Crie vários índices de vetores em um único bucket para organizar os dados conforme diferentes necessidades de negócio. Ao iniciar uma consulta de recuperação, o sistema retorna resultados com base na similaridade dos dados vetoriais no índice especificado.
Dados vetoriais: arrays numéricos de alta dimensão gerados a partir de dados não estruturados (como imagens, vídeos e documentos) por meio de modelos de embedding vetorial. Esses arrays representam as características do conteúdo dos dados. A recuperação vetorial retorna resultados baseados na similaridade entre esses vetores. Utilize qualquer serviço de vetorização, como ECS, PAI ou Model Studio, para gerar vetores e gravá-los em um índice específico usando a API do OSS, SDKs ou a ferramenta ossutil. Durante a gravação, anexe metadados para filtragem escalar posterior.
Benefícios
Baixo custo: os dados vetoriais tornaram-se infraestrutura essencial para diversas aplicações de IA e crescem exponencialmente. O OSS Vectors possui modelo de faturamento simples e transparente, cobrando apenas dois itens: armazenamento de dados vetoriais e volume de dados verificados durante a recuperação. Isso reduz custos em mais de 90% em comparação aos métodos tradicionais.
Grande escala: projetado para armazenar e gerenciar volumes massivos de dados vetoriais, o OSS Vectors baseia-se em arquitetura serverless que lida automaticamente com o dimensionamento, eliminando a necessidade de planejamento de capacidade.
Facilidade de uso: oferece conjunto abrangente de APIs, SDKs e a ferramenta de linha de comando ossutil. Além disso, permite gerenciar dados vetoriais diretamente no console do OSS, realizando operações como recuperação, inserção e inserção em massa.
Gerenciamento unificado: gerencie buckets de vetores e buckets padrão (que armazenam dados brutos) de maneira consistente. Aplique a mesma Bucket Policy para controle de acesso ou configure um caminho comum de exportação de logs para auditoria, por exemplo.
Recuperação semântica: use a operação QueryVectors para consultar dados vetoriais em um índice e receber resultados ordenados por similaridade. O OSS Vectors também suporta filtragem baseada em metadados escalares. Anexe metadados ao gravar dados vetoriais em um bucket para permitir pós-filtragem. Ao criar um índice de vetores, defina também metadados não filtráveis; embora não sirvam para filtragem, eles retornam junto com os resultados da recuperação para fornecer informações descritivas sobre o vetor.
Casos de uso
Criação de aplicações RAG de baixo custo
Com a expansão dos serviços de IA, o crescimento exponencial de dados vetoriais aumenta a pressão sobre os custos de armazenamento e recuperação. Em cenários de recuperação multimodal, como bases de conhecimento, assistentes de IA e recuperação de imagens médicas, os usuários toleram cada vez mais latências de recuperação na faixa de dezenas a centenas de milissegundos. Nesses casos, utilizar o OSS Vectors como base de armazenamento para suas aplicações RAG atende aos requisitos de negócio com custo extremamente reduzido.
Desenvolvimento de agentes de IA com recuperação em camadas
Agentes de IA distintos possuem necessidades variadas de desempenho de recuperação. Centralize todos os seus dados vetoriais em um bucket de vetores de baixo custo. Para cenários de negócio que exigem alto desempenho e baixa latência, sincronize os dados quentes com outros produtos, como o Tablestore, para garantir recuperação de alta performance. Essa abordagem permite construir arquitetura de aplicação de agente de IA com recuperação em camadas.
Implementação de plataforma unificada de conteúdo de IA
Aplicações de IA geram grandes quantidades de conteúdo não estruturado (como conteúdo gerado por usuários, documentos internos e conteúdo gerado por IA) e seus vetores correspondentes, o que pode fragmentar os sistemas de armazenamento e recuperação. Ao armazenar dados brutos em buckets padrão do OSS e dados vetoriais em buckets de vetores, construa plataforma eficiente de gerenciamento de dados de IA para casos de uso como gestão de dados AIGC. Um único conjunto de APIs e SDKs permite gerenciar tanto arquivos brutos quanto índices de vetores, simplificando a criação de uma plataforma unificada de conteúdo de IA.
Recursos empresariais
Acesso por endpoint
O OSS Vectors fornece endpoints públicos e internos separados, isolados dos buckets padrão do OSS.
Endpoint público:
$bucketname-$uid.regionID.oss-vectors.aliyuncs.comEndpoint interno:
$bucketname-$uid.regionID-internal.oss-vectors.aliyuncs.com
Nota: use domínio de terceiro nível para todas as operações, exceto ListVectorBuckets .
Transferência segura
O HTTPS criptografa todos os dados em trânsito.
Controle de acesso
Bucket Policy: suporta políticas de autorização baseadas em recursos, permitindo controlar permissões no nível do bucket de vetores ou para um ou mais índices de vetores.
RAM Policy: oferece suporte a políticas de autorização RAM baseadas em identidade para controle granular de permissões sobre buckets de vetores, índices de vetores e operações de dados. Essas políticas também permitem autorização de acesso entre contas.
Logs
Exportação de logs de acesso: permite exportar logs de acesso para um bucket especificado em tempo real ou quase real.
Formato de log unificado: totalmente compatível com logs padrão do OSS, o formato inclui campo adicional
BucketARNpara identificar exclusivamente o recurso do bucket de vetores, facilitando a análise unificada de logs.
Cotas e limites
O OSS Vectors possui cotas e limites específicos. Ao projetar e implementar sua solução de armazenamento e recuperação vetorial, planeje a quantidade de buckets, a escala dos índices, a estrutura de metadados e a estratégia de chamadas de API com base nos limites abaixo. Para solicitar aumento de qualquer uma das cotas seguintes, entre em contato com o Suporte Técnico.
Uma única conta Alibaba Cloud pode criar no máximo 100 buckets de vetores por região.
Cada bucket de vetores comporta até 100 índices de vetores.
Um único índice de vetores armazena no máximo 2 bilhões de linhas de dados vetoriais.
Dimensões vetoriais: de 1 a 4.096.
Faixa TopK para solicitações de recuperação vetorial: de 1 a 500 por padrão.
Tamanho total de um único array vetorial: de 1 KB a 500 KB.
Tamanho máximo total de metadados (filtráveis e não filtráveis) por vetor: 200 KB.
Limite de tamanho para um único campo de metadados filtrável por vetor: 2 KB.
Quantidade máxima de campos de metadados (filtráveis e não filtráveis) por vetor: 100.
Metadados escalares aceitam quatro tipos de dados: String, Number, Boolean e List.
-
Ao utilizar metadados para filtrar vetores, observe as restrições abaixo:
O comprimento acumulado de metadados filtráveis em uma única instrução de filtro não pode exceder 20 KB.
A quantidade de itens de metadados filtráveis em uma única instrução de filtro limita-se a 1.024.
As condições de filtro suportam até 8 níveis de aninhamento.
-
Para filtragem escalar usando as operações QueryVectors ou ListVectors, há suporte aos seguintes operadores:
Igualdade: $eq, $ne
Intervalo: $gt, $gte, $lt, $lte
Inclusão: $in, $nin
Existência: $exists
Lógicos: $and, $or
A operação PutVectorIndex tem limite de 5 chamadas por segundo.
A operação PutVectors possui limite de QPS (Consultas Por Segundo) de 1.000. Uma única solicitação simultânea grava até 500 entradas por lote. O throughput total entre todas as solicitações simultâneas não ultrapassa 2.500 entradas por segundo. Por exemplo, se cada solicitação simultânea gravar 100 entradas em um lote, o QPS máximo de gravação suportado será 25 (2.500 / 100).
-
O limite de QPS para a operação QueryVectors é 100.
Nota: o QPS de recuperação depende de fatores como o número de vetores em um único índice, as dimensões vetoriais, o valor TopK e as condições de metadados escalares na consulta. Em configuração típica com 10 milhões de linhas de vetores de 1.024 dimensões e valor TopK de 100, o QPS de consulta geralmente atinge 100. Conforme o tamanho do índice ou o valor TopK aumentam, o QPS real de recuperação pode diminuir. O OSS Vectors não garante que o QPS chegará a 100. Realize testes com sua carga de trabalho para confirmar o desempenho real.
A operação ListVectorIndexes retorna no máximo 500 índices por página. Utilize paginação para obter o próximo lote de índices.
A concorrência máxima para a operação ListVectorIndexes é 16.
Faturamento
O OSS Vectors iniciou oficialmente o faturamento comercial em 10 de junho de 2026 (UTC+8). Acompanhe suas faturas. Para mais detalhes sobre o método de faturamento, consulte Itens de faturamento de vetores.