Todos os produtos
Search
Central de documentação

Data Transmission Service:What is AI data preparation

Última atualização: Jun 27, 2026

A criação de uma aplicação de geração aumentada por recuperação (RAG) exige a transferência de dados de bancos de dados source para vector stores. Esse pipeline geralmente envolve código personalizado de extração, armazenamento temporário de arquivos, lógica de fragmentação e chamadas de embedding. A preparação de dados para IA é um recurso do Data Transmission Service (DTS) que gerencia todo esse fluxo. Ele se conecta diretamente ao banco de dados source e entrega dados vetorizados a um banco de dados vetorial ou data lakehouse, sem necessidade de armazenamento intermediário ou exportações manuais.

Use a preparação de dados para IA para impulsionar bases de conhecimento corporativas, criação de conteúdo assistida por IA e sistemas inteligentes de atendimento ao cliente.

Informações gerais

Com o avanço da inteligência artificial, as aplicações de IA tornam-se cada vez mais diversificadas. No entanto, todas dependem dos dados fornecidos aos grandes modelos de linguagem (LLMs). A qualidade dessas informações — atualidade, precisão e relevância — afeta diretamente o desempenho do modelo. O recurso de preparação de dados para IA do DTS agiliza o carregamento de dados em uma base de conhecimento. Ele oferece ferramentas para extração, enriquecimento, segmentação e vetorização voltadas a cenários de IA. Assim, você extrai dados de diversos mecanismos de banco de dados com facilidade e concentra seus esforços no desenvolvimento das suas aplicações de IA.

Como funciona

A preparação de dados para IA executa um pipeline de ingestão em quatro etapas, do banco de dados source até o vector store de destino:

  1. Conexão: O DTS conecta-se diretamente ao banco de dados source e obtém dados completos e incrementais. Não é necessário exportar arquivos nem fazer uploads manuais.

  2. Análise: Os dados brutos, sejam documentos não estruturados ou tabelas relacionais estruturadas, são analisados e convertidos em um formato processável.

  3. Fragmentação: Cada documento é dividido em segmentos dimensionados para o modelo de embedding.

  4. Embedding: Cada fragmento é convertido em um vetor de embedding e gravado no banco de dados vetorial de destino.

À medida que os dados source mudam, o DTS mantém o destino sincronizado por meio de atualizações incrementais.

Casos de uso

  • Bases de conhecimento corporativas: Ingira e atualize continuamente documentos da empresa, wikis e registros estruturados para garantir que sua aplicação RAG sempre recupere informações atuais.

  • Criação de conteúdo assistida por IA: Alimente um índice de recuperação unificado com um corpus misto de documentos não estruturados e dados estruturados.

  • Atendimento inteligente ao cliente: Conecte a documentação de suporte e os registros de CRM diretamente a um pipeline RAG, sem precisar desenvolver código de ingestão personalizado.

Fluxos de dados suportados

Tarefas de preparação de dados

Source

Destino

MySQL

AnalyticDB for PostgreSQL

Base de conhecimento RAGFlow

Banco de dados vetorial Guia de configuração Tutoriais
AnalyticDB for PostgreSQL Criar e usar uma base de conhecimento DTS RAGFlow
Lindorm

Regiões suportadas

  • Data preparation tasks: Consulte Lista de regiões suportadas.

  • Bases de conhecimento RAGFlow: China (Hangzhou), China (Shanghai), China (Beijing), China (Shenzhen) e China (Hong Kong).

Limitações

Tarefas de preparação de dados

  • Não há suporte para tarefas entre regiões.

  • Crie os schemas de tabela necessários no banco de dados de destino antes de iniciar uma tarefa.

  • Não há suporte para sobrescrita de dados existentes no banco de dados de destino.

Bases de conhecimento RAGFlow

  • Somente o tipo de rede virtual private cloud (VPC) é suportado.

  • A VPC, o banco de dados vetorial e o OSS Bucket devem estar na mesma região.

Faturamento

Para obter detalhes sobre preços, consulte Métodos de faturamento da preparação de dados para IA.