A Geração Aumentada por Recuperação (RAG) conecta modelos de linguagem grandes (LLMs) a bases de conhecimento privadas, melhorando a precisão das respostas com dados específicos do domínio. Este guia orienta o desenvolvimento e a implantação de uma aplicação RAG no LangStudio.
Contexto
Os modelos RAG combinam recuperação de informações com IA generativa para fornecer respostas mais precisas e contextualmente relevantes. Em setores como finanças e saúde, onde informações corretas fundamentam decisões críticas, os modelos generativos tradicionais podem não ter o conhecimento específico necessário. O RAG preenche essa lacuna ao conectar os modelos a bases de conhecimento externas. Este tópico apresenta uma solução RAG para finanças e saúde desenvolvida no Platform for AI (PAI).
Pré-requisitos
-
O LangStudio oferece suporte aos bancos de dados vetoriais Faiss e Milvus. Para usar o Milvus, crie previamente uma instância desse banco .
NotaO Faiss é adequado para ambientes de teste e não exige configuração adicional de banco de dados. Para produção, use o Milvus, que suporta dados em maior escala.
-
Carregue o corpus da base de conhecimento RAG no OSS. Os seguintes exemplos de corpus estão disponíveis para os casos de uso de finanças e saúde:
Notícias Financeiras: Dados em formato PDF contendo reportagens de sites públicos de notícias.
Introduções a Doenças: Dados em formato CSV com informações sobre doenças extraídas da Wikipédia.
1. (Opcional) Implante modelos LLM e de embedding
Um fluxo de aplicação RAG requer um serviço de LLM e um serviço de modelo de embedding. Implante os serviços necessários pela Model Gallery conforme descrito abaixo ou pule esta etapa caso já possua serviços de modelo compatíveis com a API da OpenAI.
Acesse QuickStart > Model Gallery e implante modelos para os dois cenários a seguir. Para mais detalhes, consulte Implantação e treinamento de modelos.
Selecione um modelo de linguagem grande ajustado por instruções. Modelos base não seguem instruções do usuário de forma confiável.
No campo Scenario, selecione Large Language Models e implante o DeepSeek-R1-Distill-Qwen-7B.

No campo Scenario, selecione embedding e implante o bge-m3 general vector model.

2. Crie conexões
As conexões dos modelos LLM e de embedding nesta seção utilizam serviços EAS implantados via QuickStart > Model Gallery. Para outros tipos de conexão, consulte Configurar conexões.
2.1 Crie uma conexão de serviço LLM
No LangStudio, selecione um workspace, acesse a aba Configure Service Connection > Model Service e clique em New Connection para criar uma conexão genérica de serviço de modelo LLM.

Principais parâmetros:
|
Parâmetro |
Descrição |
|
Nome do modelo |
Se você implantou o modelo pela Model Gallery, encontre o nome na página de detalhes clicando no cartão do modelo na página da Model Gallery. Para mais detalhes, consulte Criar uma conexão - Model Service. |
|
Provedor de serviço |
|
2.2 Crie uma conexão de serviço de modelo de embedding
Crie uma conexão genérica de serviço de modelo de embedding seguindo o mesmo procedimento descrito na Etapa 2.1.

2.3 Crie uma conexão de banco de dados vetorial
Na aba Configure Service Connection > Database, clique em New Connection para estabelecer uma conexão com o banco de dados Milvus.

Principais parâmetros:
|
Parâmetro |
Descrição |
|
uri |
Endpoint da instância do Milvus no formato |
|
token |
Nome de usuário e senha da instância do Milvus: |
|
database |
Nome do banco de dados. Este tópico utiliza o banco padrão |
3. Crie um índice de base de conhecimento
Crie um índice de base de conhecimento. O LangStudio processa o corpus, divide-o em partes, vetoriza os dados e armazena os resultados no banco de dados vetorial. A tabela a seguir descreve os principais parâmetros. Para outras configurações, consulte Gerenciar bases de conhecimento.
|
Parâmetro |
Descrição |
|
Configurações básicas |
|
|
Caminho OSS da fonte de dados |
Defina este parâmetro com o caminho OSS do corpus da base de conhecimento RAG descrito nos Pré-requisitos. |
|
Caminho OSS de saída |
Especifique um caminho para armazenar resultados intermediários e metadados de índice gerados pelo processamento de documentos. Importante
Ao usar o Faiss como banco de dados vetorial, o fluxo da aplicação salva os arquivos de índice gerados no OSS. Por padrão, se você utilizar a função PAI padrão (a Instance RAM Role definida ao iniciar o runtime), o fluxo terá acesso ao bucket de armazenamento padrão do seu workspace. Portanto, recomendamos definir este parâmetro como um diretório no bucket OSS que contém o caminho de armazenamento padrão do workspace atual. Se utilizar uma função personalizada, conceda permissões de acesso ao OSS. Recomendamos a permissão AliyunOSSFullAccess. Para mais informações, consulte Gerenciar permissões para uma função RAM. |
|
Modelo de embedding e banco de dados |
|
|
Tipo de embedding |
Selecione General Embedding Model. |
|
Conexão de embedding |
Selecione a conexão de serviço de modelo de embedding criada na Etapa 2.2. |
|
Tipo de banco de dados vetorial |
Selecione Vector database Milvus. |
|
Conexão do banco de dados vetorial |
Selecione a conexão do banco de dados Milvus criada na Etapa 2.3. |
|
Nome da tabela |
Defina este parâmetro com o nome da Collection criada no banco de dados Milvus, conforme descrito nos Pré-requisitos. |
|
Configuração de vpc |
|
|
Configuração de vpc |
Selecione uma vpc igual à da instância do Milvus ou que possa se comunicar com ela. |
4. Crie e execute um fluxo de aplicação RAG
-
Acesse o LangStudio, selecione um workspace e, na aba Application Flow, clique em New Application Flow para criar um fluxo de aplicação RAG.

-
Inicie o runtime. No canto superior direito, clique em Create Runtime e configure os parâmetros. Observação: O runtime precisa estar em execução para processar nós Python ou acessar ferramentas adicionais.

Parâmetro principal:
VPC Configuration: Selecione a vpc usada para criar a instância do Milvus nos Pré-requisitos ou garanta que a vpc escolhida consiga se comunicar com a vpc da instância do Milvus.
-
Desenvolva o fluxo da aplicação.

Mantenha as configurações padrão dos demais nós ou ajuste-as conforme necessário. Configure os nós principais da seguinte forma:
-
Knowledge Retrieval: Recupera textos da base de conhecimento relevantes para a pergunta do usuário.
Knowledge base index name: Selecione o índice de base de conhecimento criado na Etapa 3.
Top K: Retorna os K melhores resultados correspondentes.
-
Nó LLM: Usa os documentos recuperados como contexto, envia-os ao modelo de linguagem grande junto com a pergunta do usuário e gera uma resposta.
Model configuration: Selecione a conexão criada na Etapa 2.1.
Chat history: Define se o histórico de conversas será ativado e usado como variáveis de entrada.
Para detalhes sobre cada componente, consulte a Biblioteca de Componentes Pré-construídos.
-
-
Depure ou execute o fluxo. No canto superior direito, clique em Run para executar o fluxo. Para informações sobre problemas comuns de execução, consulte as Perguntas frequentes.

-
Visualize os rastreamentos. Abaixo da resposta gerada, clique em View Traces para ver os detalhes do rastreamento ou a topologia.

5. Implante o fluxo da aplicação
Na página de desenvolvimento do fluxo da aplicação, clique em Deploy no canto superior direito para implantar o fluxo como um serviço EAS. Mantenha as demais configurações de implantação como padrão ou ajuste-as conforme necessário. Configure os seguintes parâmetros principais:
Resource deployment > Instances: Configure o número de instâncias de serviço. Esta implantação destina-se a testes; portanto, defina o número de instâncias como 1. Para produção, recomendamos o uso de múltiplas instâncias de serviço para mitigar o risco de ponto único de falha (SPOF).
VPC > vpc: Selecione a vpc onde a instância do Milvus está localizada ou garanta que a vpc escolhida possa se comunicar com a vpc da instância do Milvus.
Para mais detalhes sobre a implantação, consulte Implantar um fluxo de aplicação.
6. Chame o serviço
Após a implantação, você será redirecionado ao console do PAI-EAS. Na aba Debug, configure e envie uma requisição. A chave no corpo da requisição deve corresponder ao parâmetro "Dialogue input" no nó "Start" do fluxo da aplicação. Este guia utiliza o campo padrão question.

Para outros métodos de chamada do serviço, como o uso de uma API, consulte Chamar o serviço.