O PolarSearch é o mecanismo distribuído de busca e análise do PolarDB, desenvolvido com base no OpenSearch. Compatível com os ecossistemas Elasticsearch e OpenSearch, oferece busca full-text, busca vetorial e análise de dados multimodais com latência de milissegundos por meio de APIs e SDKs. Com o recurso integrado AutoETL, o PolarSearch agrega e sincroniza automaticamente os dados do PolarDB em tempo real, eliminando a necessidade de pipelines de dados manuais.
O PolarSearch permite executar:
Recuperação full-text | Recuperação vetorial |
Arquitetura técnica
O PolarSearch opera sobre o armazenamento distribuído compartilhado do PolarStore com uma arquitetura cloud-native que desacopla computação e armazenamento. Ele integra um mecanismo de busca proprietário e um framework de computação distribuída compatível com a DSL do Elasticsearch para armazenar, analisar e recuperar petabytes de dados multimodais em tempo real.
Benefícios
Maior eficiência: Elimina pipelines de sincronização de dados do MySQL ou para o mecanismo de busca. Reduz a latência de recuperação do
workloadde minutos para milissegundos e diminui o tempo de desenvolvimento em 50%.Otimização de custos: Substitui a arquitetura tradicional de "banco de dados + armazenamento de arquivos + mecanismo de computação" pelo armazenamento compartilhado distribuído multinível PFS, reduzindo o TCO em 40%.
Inovação nos negócios: Impulsiona infraestruturas de IA — recomendações inteligentes, bases de conhecimento RAG e bases de memória para agentes — mediante armazenamento, mineração e recuperação vetorial de dados não estruturados.
Casos de uso
Plataformas de e-commerce e SaaS
Busca fuzzy, correspondência semântica e recomendações personalizadas para títulos e páginas de produtos.
Análise de palavras-chave em tempo real e mineração de sentimentos em conteúdo gerado pelo usuário (UGC).
Bases de conhecimento RAG e gestão documental
Indexação e recuperação full-text em PDF, Word e outros formatos de documentos.
Armazenamento de características de imagens baseado em vetores para busca visual.
Memória de agentes e gestão de dados
Memória de curto prazo para contexto de conversas, estado de sessão e variáveis temporárias.
Memória de longo prazo para preferências de usuários, histórico de consultas e parâmetros de LLM.
Análise de logs e monitoramento de serviços
Recuperação em tempo real, agregação estatística e alertas de anomalias em petabytes de dados de log.
Análise de correlação e relatórios visuais em campos de log multidimensionais.
IoT e fluxos de dados em tempo real
Ingestão de alto throughput e recuperação rápida de dados de séries temporais de dispositivos IoT.
Agregação dinâmica e filtragem multicondicional de dados de sensores.
Recursos principais
Alta disponibilidade e escalabilidade
Balanceamento de carga automático e failover transparente em caso de falha de nó único, garantindo 99,99% de disponibilidade do serviço.
Dimensionamento online de armazenamento e computação para suportar centenas de milhões de registros.
Mecanismo de busca inteligente
O otimizador identifica consultas de índice full-text nos dados da tabela primária InnoDB e as direciona para os nós de busca.
Índices mistos combinam segmentação de texto, vetorização semântica e faixas numéricas para melhorar o desempenho das consultas em mais de 10 vezes.
Modelo de NLP para chinês integrado, com expansão de sinônimos, correção de pinyin e reconhecimento de intenção.
Diversos plugins de tokenização com suporte para upload e atualização de dicionários personalizados.
Fusão de dados multimodais
Armazenamento e recuperação unificados em índices diretos escalares, índices invertidos full-text e índices vetoriais.
Estende armazenamento, recuperação e análise de conteúdo para dados não estruturados, como imagens e documentos.
Recuperação e análise em tempo real
Os dados tornam-se pesquisáveis centenas de milissegundos após a gravação. O sistema suporta filtragem complexa, estatísticas de bucket e ordenação Top K.
Funções integradas para cálculos de janela deslizante em séries temporais e detecção de geofence.
Agregação automatizada de dados e sincronização em tempo real (AutoETL)
Agrega dados de uma ou múltiplas fontes PolarDB e os sincroniza com o PolarSearch em tempo real.
Consolida informações de origens únicas ou múltiplas do PolarDB e mantém a sincronização contínua com o PolarSearch.
Utiliza a Global Database Network (GDN) do PolarDB para ativar a sincronização de dados entre regiões para o PolarSearch.