AnalyticDB for PostgreSQL propose le Retrieval-Augmented Generation (RAG) en tant que service géré. Il gère l'ingestion de documents, la création d'embeddings, la recherche hybride et le reclassement, vous permettant ainsi de développer des applications RAG sans gérer l'infrastructure sous-jacente.
En bref :
Ingérez des documents dans plus de 10 formats (PDF, DOCX, images avec OCR, etc.) avec découpage automatique et création d'embeddings.
Exécutez une recherche hybride (vecteurs denses, vecteurs clairsemés et recherche en texte intégral dans une seule requête) pour maximiser le rappel.
Reclassez les résultats à l'aide des modèles BAAI General Embedding (BGE) ou de grands modèles de langage (LLM) avant l'étape de génération.
Intégrez-vous à LlamaIndex et LangChain, ou appelez directement les API depuis Python, Java, Go, Node.js, PHP ou C#.
Stockez toutes les données documentaires dans votre propre instance AnalyticDB for PostgreSQL, avec chiffrement du disque, chiffrement SSL et isolation multi-locataire au niveau du namespace.
Fonctionnement du service
Le service RAG se compose de trois modules :
Traitement des données augmentées — Des extracteurs spécifiques au format analysent les documents et les divisent en fragments. Chaque fragment est converti en vecteurs (denses, clairsemés ou multimodaux) et stocké dans votre instance.
Recherche sémantique augmentée — Le système analyse sémantiquement les requêtes entrantes et les met en correspondance avec les fragments stockés à l'aide d'une recherche hybride, d'une récupération bidirectionnelle ou d'une requête de fusion, selon votre configuration.
Récupération augmentée — Le système note et reclasse les fragments récupérés à l'aide d'algorithmes de classement granulaires afin d'améliorer la pertinence et la diversité avant de les renvoyer à l'étape de génération.
Principaux avantages
Qualité de la génération augmentée — Le service RAG utilise des mécanismes de recherche en plus des technologies de génération par modèle de langage pour garantir un contenu généré plus précis et plus proche des données réelles, améliorant ainsi considérablement la qualité et la crédibilité des réponses.
Fusion de connaissances à grande échelle — Le service RAG accède et intègre diverses sources de données, telles que les bases de connaissances d'entreprise et les ressources du réseau public, afin de garantir que le contenu généré couvre un large éventail de connaissances et réponde aux besoins informationnels de différents scénarios.
API flexibles — Le service RAG fournit des API faciles à utiliser qui s'intègrent aux systèmes existants sans nécessiter la compréhension de technologies IA complexes, permettant ainsi des scénarios tels que les chatbots intelligents, la génération automatique de rapports et la création de contenu.
Optimisation et apprentissage continus — Le service RAG apprend continuellement à partir des dernières données et des retours clients, et ajuste automatiquement les politiques d'optimisation pour s'adapter aux exigences et environnements changeants, garantissant ainsi la qualité du service et l'expérience utilisateur à long terme.
Principales fonctionnalités
Compatibilité
Connectez-vous au service RAG en utilisant la méthode adaptée à votre pile technologique :
Accès direct à l'API — Lisez et écrivez des données vectorielles, téléchargez des documents pré-découpés ou téléchargez des documents bruts pour un traitement automatique.
Prise en charge des SDK — Python, Java, Go, Node.js, PHP et C#.
Prise en charge des frameworks RAG — LlamaIndex et LangChain.
Traitement des documents
Le service extrait le texte à l'aide d'extracteurs spécifiques au format, puis divise chaque document en fragments pour la création d'embeddings.
Formats d'entrée pris en charge :
| Format | Extracteur |
|---|---|
| PNG, JPG, JPEG, BMP | Reconnaissance optique de caractères (OCR) |
| PDF numérisé | OCR (les métadonnées image-avec-texte sont ajoutées automatiquement) |
| PDF (non numérisé) | Liaisons Python telles que PyMuPDF |
| HTML, MARKDOWN, JSON, CSV, DOCX, PPTX, TXT | Extracteur de texte |
Options de découpage :
Contrôlez la taille des fragments et le chevauchement à l'aide des paramètres
ChunkSizeetChunkOverlappour éviter les inefficacités d'embedding causées par des jetons trop volumineux.Spécifiez des séparateurs personnalisés pour diviser le texte aux limites logiques.
Embedding
Modèles d'embedding de texte : M3E, Text2Vec, Tongyi
Dimensions prises en charge : 512, 768, 1024, 1536
Modèles d'embedding d'images multimodales : CLIP, Tongyi
Dimensions prises en charge : 512, 640, 768, 1024, 1536
Recherche
Modes de recherche de base :
| Mode | Description |
|---|---|
| Recherche hybride | Recherche simultanée de vecteurs denses et de vecteurs clairsemés |
| Récupération bidirectionnelle | Exécution simultanée d'une recherche en texte intégral et d'une recherche vectorielle |
| Requête de fusion | Filtrage par conditions d'abord, puis exécution d'une recherche vectorielle |
Algorithmes de classement multi-voies :
| Algorithme | Méthode de classement |
|---|---|
| Fusion de rang réciproque (RRF) | Utilise les positions des résultats, pas les scores |
| Poids | Utilise les scores, pas les positions |
| En cascade | Utilise la recherche en texte intégral comme filtre, puis exécute une recherche vectorielle top-K |
Recherche augmentée :
Classement granulaire — Récupère plus de fragments que le top-K, puis les note et les reclasse à l'aide de modèles BGE ou de LLM.
Récupération par fenêtre — Renvoie plusieurs fragments avant et après chaque fragment correspondant pour préserver le contexte que le découpage peut avoir divisé aux frontières.
Sécurité
| Domaine | Détails |
|---|---|
| Confidentialité des données | Les données documentaires sont stockées dans votre instance AnalyticDB for PostgreSQL. Protégez-les avec le chiffrement du disque, le chiffrement SSL et les listes d'autorisation d'adresses IP. Détruisez ou désactivez l'accès aux données à tout moment. |
| Isolation multi-locataire | Utilisez des namespaces — similaires aux schémas de base de données — pour isoler les collections de documents au sein d'une seule instance à travers les limites organisationnelles. |
| Authentification | Authentification Resource Access Management (RAM) et authentification par nom d'utilisateur/mot de passe de l'instance. |
Cas d'utilisation
Service client intelligent — Générez des réponses professionnelles et personnalisées en ancrant les réponses dans votre base de connaissances d'entreprise.
Création de contenu — Produisez des articles, des résumés d'actualités et des descriptions de produits basés sur des thèmes ou des styles prédéfinis.
Gestion des connaissances — Organisez et résumez automatiquement les documents pour mettre en évidence des points de connaissance faciles à assimiler et accélérer le partage des connaissances au sein de l'équipe.
Éducation et formation — Générez du matériel pédagogique personnalisé — exercices, études de cas — adapté aux besoins des étudiants et au contenu du cours.
Recherche de brevets — Appliquez des optimiseurs de traitement de texte aux documents de brevet pour une recherche de similarité de brevets de haute qualité.