PolarSearch est le moteur de recherche et d'analyse distribué de PolarDB, basé sur OpenSearch. Compatible avec les écosystèmes Elasticsearch et OpenSearch, il assure la recherche plein texte, la recherche vectorielle et l'analyse de données multimodales en quelques millisecondes via des API et des SDK. Grâce à la fonctionnalité intégrée AutoETL, PolarDB agrège et synchronise automatiquement les données vers PolarSearch en temps réel, sans pipeline de données manuel.
PolarSearch permet d'effectuer :
Récupération plein texte | Récupération vectorielle |
Architecture technique
PolarSearch s'exécute sur le stockage distribué partagé de PolarStore selon une architecture cloud native découplant le calcul et le stockage. Il intègre un moteur de recherche propriétaire ainsi qu'un framework de calcul distribué compatible avec le DSL d'Elasticsearch pour stocker, analyser et récupérer des pétaoctets de données multimodales en temps réel.
Avantages
Efficacité accrue : Supprime les pipelines de synchronisation des données entre MySQL ou et le moteur de recherche. La latence de récupération du
workloadpasse ainsi de plusieurs minutes à quelques millisecondes, tout en réduisant le temps de développement de 50 %.Optimisation des coûts : Remplace l'architecture traditionnelle « base de données + stockage de fichiers + moteur de calcul » par le stockage partagé distribué multiniveau PFS, ce qui diminue le TCO de 40 %.
Innovation métier : Soutient l'infrastructure IA (recommandations intelligentes, bases de connaissances RAG et mémoires d'agents) grâce au stockage, à l'exploration et à la récupération vectorielle de données non structurées.
Cas d'utilisation
Plateformes e-commerce et SaaS
Recherche floue, correspondance sémantique et recommandations personnalisées pour les titres et les pages produits.
Analyse de mots-clés en temps réel et exploration des sentiments dans les contenus générés par les utilisateurs (UGC).
Bases de connaissances RAG et gestion documentaire
Indexation et récupération plein texte sur divers formats de documents tels que PDF et Word.
Stockage vectoriel des caractéristiques d'images pour la recherche visuelle.
Mémoire d'agent et gestion des données
Mémoire à court terme pour le contexte de conversation, l'état de session et les variables temporaires.
Mémoire à long terme pour les préférences utilisateur, l'historique des requêtes et les paramètres LLM.
Analyse des journaux et supervision des services
Récupération en temps réel, agrégation statistique et alertes d'anomalies sur des pétaoctets de données de journal.
Analyses corrélées et rapports visuels portant sur des champs de journal multidimensionnels.
IoT et flux de données en temps réel
Ingestion à haut débit et récupération rapide des données chronologiques issues d'appareils IoT.
Agrégation dynamique et filtrage multi-critères des données de capteurs.
Fonctionnalités principales
Haute disponibilité et évolutivité
Équilibrage de charge automatique et basculement transparent lors de la défaillance d'un nœud unique, garantissant une disponibilité du service de 99,99 %.
Mise à l'échelle en ligne du stockage et du calcul pour gérer des centaines de millions d'enregistrements.
Moteur de recherche intelligent
L'optimiseur détecte les requêtes d'index plein texte sur les données de la table principale InnoDB et les route vers les nœuds de recherche.
Les index mixtes, combinant segmentation de texte, vectorisation sémantique et plages numériques, améliorent les performances des requêtes d'un facteur supérieur à 10.
Modèle NLP chinois intégré offrant l'expansion des synonymes, la correction pinyin et la reconnaissance d'intention.
Multiples plugins de tokenisation prenant en charge le téléchargement et la mise à jour de dictionnaires personnalisés.
Fusion de données multimodales
Stockage et récupération unifiés via des index forward scalaires, des index inversés plein texte et des index vectoriels.
Extension du stockage, de la récupération et de l'analyse de contenu aux données non structurées telles que les images et les documents.
Récupération et analyse en temps réel
Les données deviennent interrogeables quelques centaines de millisecondes après leur écriture. Le système prend en charge le filtrage complexe, les statistiques par bucket et le tri Top K.
Fonctions intégrées pour le calcul de fenêtres glissantes sur séries temporelles et la détection de géorepérage.
Agrégation automatisée des données et synchronisation en temps réel (AutoETL)
Consolide les données d'une ou plusieurs sources PolarDB pour une synchronisation temps réel vers PolarSearch.
Exploite le Global Database Network (GDN) de PolarDB afin d'activer la synchronisation interrégionale des données vers PolarSearch.