A Geração Aumentada por Recuperação (RAG) amplia as capacidades de um modelo de linguagem grande (LLM) para perguntas e respostas específicas de domínio. Ela recupera informações relevantes de uma base de conhecimento externa e as combina com a entrada do usuário. O PAI-EAS oferece uma solução de implantação baseada em cenários que permite criar um sistema de chat RAG com o LLM e o banco de dados vetorial de sua escolha.
Escopo
Este tópico se aplica ao PAI-RAG v0.4.x. Para versões anteriores, consulte PAI-RAG (v0.3.x).
Etapa 1: Implantar o service RAG
Faça logon no PAI console. Selecione uma região na parte superior da página. Em seguida, selecione o workspace desejado e clique em Elastic Algorithm Service (EAS).
Na aba Inference Service, clique em Deploy Service. Na seção Scenario-based Model Deployment, clique em RAG-based Smart Dialogue Deployment.
-
Na página RAG-based LLM Chatbot Deployment, configure os seguintes parâmetros principais:
-
Version: Selecione LLM Decoupled Deployment para implantar apenas o service RAG.
NotaA opção LLM Integrated Deployment implanta o service RAG e o LLM na mesma instância de service do EAS. Como os LLMs exigem recursos significativos, esse modo é recomendado apenas quando você usa modelos menores.
RAG Version:
pai-rag:0.4.3.-
Resource Information:
Resource Type: Selecione Public Resources.
Deployment: O próprio service RAG consome poucos recursos. Recomendamos selecionar uma especificação com pelo menos 8 vCPUs e 16 GB de memória, como
ecs.c7.2xlargeouecs.c7.4xlarge.
-
Configurações do banco de dados vetorial:
Vector Database Type: Selecione FAISS para criar um banco de dados vetorial local e começar rapidamente. Para ambientes de produção, recomendamos usar um banco de dados vetorial maduro. Para instruções de configuração, consulte Use an Alibaba Cloud vector database.
OSS Path: Selecione um diretório de armazenamento do OSS existente na região atual para armazenar os arquivos da base de conhecimento enviados. Se você não tiver um caminho de armazenamento disponível, consulte Quick start in the console para criar um.
VPC: Uma VPC é necessária para acessar o service de modelo do Alibaba Cloud Model Studio pela internet pública. Para isso, configure uma VPC, ative um gateway NAT público e configure uma entrada SNAT. Para mais informações, consulte Allow an EAS service to access the public internet.
-
Após configurar os parâmetros, clique em Deploy. A implantação do service geralmente leva cerca de 5 minutos. Quando o Service Status mudar para Running, a implantação foi bem-sucedida.
Etapa 2: Começar a usar perguntas e respostas com base de conhecimento
Na aba Inference Service, localize o service RAG implantado e acesse sua página de detalhes. Clique em Web applications no canto superior direito para abrir a interface web.

2.1 Configurar um LLM
No canto inferior esquerdo, clique em Settings > Model para abrir a página de configuração do modelo. Este exemplo mostra como configurar o modelo qwen3-8b do Alibaba Cloud Model Studio. Para mais informações sobre a configuração do modelo, consulte Configure models.
As chamadas aos modelos do Alibaba Cloud Model Studio são cobradas separadamente. Para mais informações, consulte Billing of Alibaba Cloud Model Studio.
Para chamar modelos do Alibaba Cloud Model Studio, você deve configure a VPC with public internet access para seu service RAG.
Model ID: Um identificador para selecionar um modelo durante um chat. Neste exemplo, insira Qwen3-8B_bailian.
-
Endpoint URL: O endereço do service de modelo. O endereço do service para o Alibaba Cloud Model Studio na região China (Beijing) é https://dashscope.aliyuncs.com/compatible-mode/v1.
ImportanteA URL deve terminar com
/v1ou/v2. Para um service EAS, anexe/v1à URL de invocação do service. API key: Para mais informações, consulte Obtain an API key.
Model Name: Insira qwen3-8b.

2.2 Adicionar uma base de conhecimento
Um modelo de embedding padrão já vem pré-configurado, permitindo que você crie imediatamente uma base de conhecimento e envie documentos.
-
Criar uma base de conhecimento. No painel de navegação à esquerda, clique em Knowledge Base. Na página Knowledge Base, clique em New Knowledge Base.
Por exemplo, para criar uma base de conhecimento sobre as especificações técnicas do iPhone 16, defina o nome da base de conhecimento como iPhone16 e mantenha as configurações padrão para os outros parâmetros.
Enviar um arquivo. Na aba File Management, clique em Upload File. Após o envio do arquivo, clique em Start Parsing. Arquivo de exemplo: iPhone 16 and iPhone 16 Plus - Technical Specifications - Apple (Chinese mainland).pdf.

Visualizar o arquivo da base de conhecimento. Após o envio bem-sucedido, clique no nome do arquivo para visualizar os fragmentos do documento.
-
Testar a recuperação. Mude para a aba Retrieval Test e insira uma consulta (por exemplo,
iPhone16) para testar a recuperação da base de conhecimento.
2.3 Perguntas e respostas com base de conhecimento
-
No painel de navegação à esquerda, clique em New Chat. Na parte superior da página de chat, selecione um modelo. Na parte inferior, clique em Knowledge Base, selecione a base de conhecimento a ser usada (por exemplo, iPhone16), clique em Activate e, em seguida, clique em Save.
NotaRecomendamos testar a configuração do modelo em um chat antes de ativar a base de conhecimento.

Insira sua pergunta na caixa de chat.

Etapa 3: Explorar modos avançados de perguntas e respostas
Perguntas e respostas multimodais (chat com imagem e texto)
As perguntas e respostas multimodais exigem que você configure variáveis de ambiente de armazenamento do OSS para guardar arquivos e imagens enviados, além de usar um modelo multimodal.
-
Configurar variáveis de ambiente de armazenamento do OSS para o service RAG. A implantação baseada em cenários não suporta diretamente a definição de variáveis de ambiente. Na página de implantação do service, clique em Convert to Custom Deployment no canto superior direito. Para um service existente, clique em Update para acessar a página de implantação. Na seção Environment Information, adicione as seguintes variáveis de ambiente:
FILE_STORE_TYPE: Defina como oss.
-
OSS_BUCKET: Insira o nome do seu bucket do OSS.
NotaQuando FILE_STORE_TYPE está definido como oss, um diretório chamado
pairag_knowledgebasesé criado automaticamente no OSS_BUCKET para armazenar arquivos da base de conhecimento e anexos de chat. Se FILE_STORE_TYPE não estiver definido, os arquivos serão armazenados no diretório OSS montado por padrão. OSS_ENDPOINT: O endpoint do OSS. Para mais informações, consulte OSS regions and endpoints. Um exemplo é
oss-cn-hangzhou.aliyuncs.com.OSS_ACCESS_KEY_ID e OSS_ACCESS_KEY_SECRET: Um par de AccessKey (ID e segredo) com a permissão AliyunOSSFullAccess.
Configurar um LLM multimodal (como a série Qwen-VL). O exemplo a seguir usa o qwen3-vl-plus. Ative a opção de modelo multimodal.

A figura a seguir mostra um exemplo de chat.

Perguntas e respostas agênticas (chamada de ferramenta MCP)
Este modo utiliza as capacidades de raciocínio e chamada de ferramentas do modelo (como busca e mapas) para responder a perguntas complexas.
Veja a seguir um exemplo de como usar este modo:
Configurar um modelo que suporte raciocínio. Na configuração do modelo, ative a opção Deep Thinking.

-
Configurar a busca.
-
Selecionar mecanismo de busca: Tavily Search.
Para buscas em chinês, você também pode configurar Alibaba Cloud General Search .
Tavily API Key: Visite o site oficial do Tavily para registrar uma conta e obter uma chave de API.

-
-
Configurar o MCP do Amap. No canto inferior esquerdo, clique em Settings > MCP e configure os seguintes parâmetros.
MCP Name: amaps
MCP Link: https://mcp-server-amap-jitptfyoyw.cn-hangzhou.fcapp.run/sse
MCP Type: SSE
-
Testar a conversa. No painel de navegação à esquerda, clique em New Chat. Na parte superior da página, selecione Qwen3-8B. Na parte inferior da página de chat, selecione Deep Thinking, Search e MCP (ative amaps).

Etapa 4: Avaliar o desempenho do RAG
O sistema RAG inclui um módulo de avaliação integrado para ajudar você a analisar quantitativamente o desempenho de perguntas e respostas em diferentes configurações. As etapas a seguir descrevem o processo de avaliação:
-
Criar um conjunto de dados. No painel de navegação à esquerda, clique em Evaluation. Na página Evaluation, clique em New Dataset.

-
Importar amostras. Clique no conjunto de dados criado para abrir a tarefa de avaliação. Na aba Samples, clique em Import Data.

-
Criar uma nova configuração de execução. Na aba Run Settings, clique em New Configuration e ajuste as definições conforme necessário.

-
Criar uma configuração de avaliação. Na aba Evaluator Settings, clique em New Configuration e selecione uma configuração e um tipo de avaliador conforme necessário.

-
Executar um experimento de avaliação. Na aba Samples, selecione as amostras a serem avaliadas, clique em Run Experiment, insira um nome para o experimento e selecione uma Run Configuration e Evaluation Configuration conforme necessário.

-
Visualizar os resultados da avaliação. Após a criação do experimento, você é redirecionado automaticamente para a página de detalhes do experimento. Você também pode acessar a aba Run History e selecionar o experimento alvo.

Configuração de produção
Usar um banco de dados vetorial da Alibaba Cloud
O PAI-RAG suporta a criação de uma biblioteca de recuperação vetorial usando Elasticsearch, Hologres, OpenSearch ou RDS for PostgreSQL.
Hologres, Elasticsearch e RDS for PostgreSQL suportam acesso via rede interna ou internet pública. Recomendamos usar a rede interna para acesso.
O OpenSearch suporta acesso apenas pela internet pública.
Elasticsearch
Preparar uma instância
Se você não tiver uma instância do Elasticsearch, faça logon no console do Alibaba Cloud Elasticsearch e crie uma com as seguintes configurações. Para mais informações, consulte Create an Alibaba Cloud Elasticsearch instance.
Region and Availability Zone: Selecione a mesma região do seu service EAS.
VPC: Selecione a mesma VPC do seu service EAS para permitir acesso via rede interna.
Instance Type: Selecione Standard.
Scenario Initialization Configuration: Selecione General-purpose.
Configurações do service
Você deve permitir que sua instância do Elasticsearch crie índices automaticamente. Na página da sua instância do Elasticsearch, clique em Modify Configurations e defina Auto Create Index como Allow Auto Create Index. Para mais informações, consulte Configure YML parameters.
Vector Database Type: Selecione Elasticsearch.
Private Endpoint and Port: Na página de detalhes da sua instância do Elasticsearch, encontre o endpoint privado e a porta na seção Basic Information. O formato é
http://<private_endpoint>:<private_port>.-
Index Name: O comportamento do sistema depende se você insere um nome de índice novo ou existente.
-
Inserir um novo nome: O EAS cria automaticamente um índice compatível com o PAI-RAG durante a implantação.
ImportantePor padrão, o Alibaba Cloud Elasticsearch não permite a criação automática de índices. Na página da sua instância do Elasticsearch, clique em Modify Configurations, atualize o arquivo YML e defina Auto Create Index como Allow Auto Create Index. Para mais informações, consulte Configure YML parameters.
Inserir um nome existente: O EAS usa o índice existente diretamente. Certifique-se de que o índice foi criado pelo service PAI-RAG para manter a compatibilidade estrutural.
-
Account e Password: Configure o nome de usuário e a senha definidos ao criar a instância do Elasticsearch. O nome de usuário padrão é elastic. Se você esqueceu a senha, pode reset the access password of an instance.
OSS Path: Selecione um diretório de armazenamento do OSS existente na região atual. Você pode gerenciar sua base de conhecimento montando um caminho do OSS.
Gerenciar índices com o Kibana
O Elasticsearch fornece recursos de gerenciamento de índices. Para mais informações, consulte Connect to an Elasticsearch cluster by using a Kibana client.
Hologres
Certifique-se de ter purchased a Hologres instance.
Vector Database Type: Selecione Hologres.
Invocation Information: As informações de host para a VPC especificada. Acesse a página de detalhes da instância no console do Hologres. Na seção Network Information, clique em Copy ao lado de Specified VPC para obter o endpoint. O host é a parte deste endpoint antes de
:80.Database Name: O nome do banco de dados da instância do Hologres. Se você não tiver um, consulte Create a database.
Account: Uma conta de usuário personalizada que você criou. Para mais informações, consulte Create a custom user. Para Select member role, selecione Instance Super Administrator (SuperUser).
Password: A senha da conta de usuário personalizada.
-
Table Name: O comportamento do sistema depende se você insere um nome de tabela novo ou existente.
Inserir um novo nome: O EAS cria automaticamente uma tabela compatível com o PAI-RAG durante a implantação.
Inserir um nome existente: O EAS usa a tabela existente diretamente. Certifique-se de que a tabela foi criada pelo service PAI-RAG para manter a compatibilidade estrutural.
OSS Path: Selecione um diretório de armazenamento do OSS existente na região atual. Você pode gerenciar sua base de conhecimento montando um caminho do OSS.
OpenSearch
Preparar uma instância
Se você não tiver uma instância do OpenSearch, faça logon no console do OpenSearch e crie uma com as seguintes configurações. Para mais informações, consulte Purchase an OpenSearch Vector Search Edition instance.
Product Version: Selecione Vector Search Edition.
Region and Availability Zone e VPC: O OpenSearch suporta acesso apenas pela internet pública, portanto, essas configurações não precisam ser consistentes com seu service EAS.
Configurações do service
Vector Database Type: Selecione OpenSearch.
-
Endpoint: O endpoint público da sua instância do OpenSearch Vector Search Edition.
NotaVocê deve ativar o acesso público para a instância do OpenSearch Vector Search Edition e adicionar o EAS public IP address à lista de permissões.
Instance ID: Obtenha o ID da instância na lista de instâncias do OpenSearch Vector Search Edition.
Username e Password: O nome de usuário e a senha definidos ao criar a instância do OpenSearch Vector Search Edition.
-
Table Name: Você deve primeiro criar uma tabela de índice que atenda aos requisitos. Para criar uma tabela, consulte Configure an instance e use os seguintes parâmetros principais:
-
Selecione o modelo de cenário de uso geral e importe o seguinte arquivo de configuração para a configuração de campos.
No Index Schema, certifique-se de que a dimensão do vetor corresponda à dimensão do modelo de embedding. Para Distance Type, recomendamos selecionar InnerProduct.
-
Gerenciar índices e dados
Faça logon no console do Alibaba Cloud OpenSearch Vector Search Edition e clique no ID da sua instância para acessar a página Instance Details.
Acesse a página de gerenciamento de tabelas para gerenciar a tabela de índice. Para mais informações, consulte Table management.

Acesse a página de gerenciamento de vetores para executar testes de consulta e gerenciar dados. Para mais informações, consulte Vector management.
RDS for PostgreSQL
Preparar uma instância
-
Se você não tiver uma instância do RDS for PostgreSQL, acesse a página de criação de instância RDS](https://rdsbuy.console.alibabacloud.com/newCreate/rds/PostgreSQL), configure os seguintes parâmetros principais e siga as instruções na tela para concluir o pagamento e a ativação. Para mais informações, consulte Create an ApsaraDB RDS for PostgreSQL instance.
Engine: Selecione PostgreSQL.
VPC: Selecione a mesma VPC do seu service EAS para permitir acesso via rede interna.
Privileged Account: Na seção More Configurations, configure uma conta privilegiada. Selecione Set Now e configure a conta e a senha do banco de dados.
-
Crie um banco de dados.
Clique no nome da instância. No painel de navegação à esquerda, clique em Database Management e, em seguida, clique em Create Database.
No painel Create Database, configure o Database (DB) Name. Para Authorized Account, selecione a conta privilegiada que você criou. Para informações sobre outros parâmetros, consulte Create a database and an account.
Após configurar os parâmetros, clique em Create.
Configurações do service
Certifique-se de ter created an RDS for PostgreSQL instance.
Vector Database Type: Selecione RDS for PostgreSQL.
Host address: O endpoint interno da sua instância do RDS for PostgreSQL. Você pode encontrá-lo na página Database Connection da instância no console do ApsaraDB RDS for PostgreSQL.
Port: O padrão é 5432. Insira a porta real se for diferente.
Database: A Authorized Account para o banco de dados deve ser uma privileged account. Para mais informações, consulte Create a database and an account. Você também deve instalar as extensões vector e jieba para o banco de dados.
Table Name: Um nome personalizado para a tabela do banco de dados.
Account e Password: O nome de usuário e a senha autorizados configurados ao criar o banco de dados. Para informações sobre como criar uma conta privilegiada, consulte Create a database and an account. Para Account Type, selecione Privileged Account.
OSS Path: Selecione um diretório de armazenamento do OSS existente na região atual. Você pode gerenciar sua base de conhecimento montando um caminho do OSS.
Gerenciamento de banco de dados
Acesse a lista de instâncias RDS, mude para a região onde sua instância está localizada e clique no nome da instância para acessar a página de detalhes da instância.
No painel de navegação à esquerda, selecione Database Management. Na coluna Actions do banco de dados alvo, clique em SQL Query.
Insira a Database Account e a Database Password, que são as credenciais da conta privilegiada definida ao criar a instância do RDS for PostgreSQL, e clique em Sign in.
Após fazer logon, você pode consultar a lista de bases de conhecimento importadas na instância do banco de dados.

FAQ
P: Como implantar um service de recuperação vetorial localmente no PAI
Solução
Implantação híbrida: embedding com GPU e banco de dados vetorial com CPU
Arquitetura: O EAS suporta uma implantação híbrida na qual o modelo de embedding é executado em uma instância acelerada por GPU e um banco de dados vetorial autogerenciado é executado em uma instância ECS baseada em CPU. Por exemplo, implante o modelo de embedding em ecs.gn6e-c12g1.12xlarge, que fornece quatro GPUs NVIDIA V100, e execute o Milvus ou Elasticsearch em um tipo de instância ECS otimizada para memória das séries r5 ou r6. Essa combinação separa os requisitos de computação para geração de embeddings dos requisitos de memória para armazenamento e recuperação de vetores.
Essa abordagem é adequada para ambientes de desenvolvimento e teste de pequena escala. Para um ambiente de produção, avalie estratégias de alta disponibilidade e backup de dados, ou use um dos services gerenciados de banco de dados vetorial da Alibaba Cloud descritos anteriormente neste tópico.
Configuração de rede:
Ao implantar o service de embedding no EAS, use o item de configuração VPC para selecionar a mesma VPC e zona da instância ECS que hospeda o banco de dados vetorial. Isso garante comunicação de baixa latência pela rede interna.
Para cenários entre regiões, use a Cloud Enterprise Network (CEN) ou uma conexão de peering de VPC para conectar as redes.
O shared gateway do EAS suporta invocação através de um endereço VPC, e o dedicated gateway suporta invocação entre regiões.
Considerações de desempenho:
Bancos de dados vetoriais são cargas de trabalho intensivas em memória e I/O. Para um banco de dados vetorial autogerenciado, escolha um tipo de instância ECS com grande capacidade de memória, como r5.4xlarge (16 vCPUs, 128 GiB). As famílias de instâncias r5, r6 e re4 otimizadas para memória fornecem de 16 GiB a 1920 GiB de memória, permitindo que você selecione um tipo de instância com base no tamanho da sua base de conhecimento.
Em um ambiente de produção, implemente sua própria solução de backup e alta disponibilidade para os dados vetoriais. O EAS não gerencia os dados vetoriais para você.
P: Um service de recuperação vetorial pode ser implantado no DSW?
O Data Science Workshop (DSW) é adequado para validação de Modelos de Linguagem Grandes (LLM) e depuração de código. Não o utilize para implantar um service de recuperação vetorial com múltiplos contêineres que inclua componentes Milvus, embedding e reranker. Para uma implantação de Geração Aumentada por Recuperação (RAG) de nível de produção, use o Elastic Algorithm Service (EAS).