A interface web do PAI-RAG permite configurar modelos, fragmentação da base de conhecimento, sandbox de código, serviços de busca e ferramentas MCP. Essas configurações permitem ajustar o comportamento de recuperação e resposta a perguntas do sistema RAG.
Configure modelos
Clique em Settings > Model no canto inferior esquerdo. Na aba LLM, adicione um modelo.
Implantações all-in-one geram automaticamente um registro de configuração de modelo. Adicione modelos de outras fontes, se necessário.
Model ID: Identifica uma configuração de modelo.
-
Endpoint URL: O endpoint de service do modelo.
NotaOs modelos do Alibaba Cloud Model Studio têm faturamento separado. Billing of Alibaba Cloud Model Studio.
-
Para serviços de modelo EAS, acesse a página de detalhes do serviço, clique em Basic Information e, em seguida, clique em View Endpoint Information. Adicione
/v1ao final da URL do endpoint.Endpoints de internet exigem que o service RAG tenha public network access configured in the VPC.
Endpoints vpc exigem que o service RAG e o service LLM estejam na mesma vpc.
API Key: Para o Alibaba Cloud Model Studio, obtain an API key. Para serviços EAS, insira o token obtido nas informações do endpoint.
Model Name: O valor depende da implantação. Se o service LLM estiver implantado no EAS com o mecanismo de inferência vLLM, insira o nome específico do modelo, obtido pela API
/v1/models. Para todos os outros modos de implantação, defina este campo comodefault.Multimodal model: Selecione esta opção se estiver usando um modelo multimodal. Esta opção vem desmarcada por padrão.
Thinking model: Para modelos que suportam os modos de raciocínio (thinking) e não raciocínio, use esta opção para ativar ou desativar o raciocínio. Esta opção vem desmarcada por padrão.
Após configurar o modelo, teste-o. Clique em New Chat no painel de navegação à esquerda, selecione o modelo na parte superior da página de chat e inicie uma conversa.
Configure MCP
Clique em Settings > MCP no canto inferior esquerdo para adicionar um MCP.
MCP Link: A URL do endpoint de service do MCP.
MCP Type: SSE, STDIO ou Streamable HTTP.
Bearer Token: (Opcional) Token de acesso para autenticação via Bearer token.
Insira o MCP Name (obrigatório, por exemplo, amaps), selecione Enable by Default conforme necessário e clique em Add.
Configure busca
Se a base de conhecimento não tiver informações para responder à pergunta do usuário, ou se a resposta exigir dados em tempo real, ative um service de busca (Tavily ).
Clique em Settings > Search no canto inferior esquerdo.
Busca Tavily
Registre-se no site oficial da Tavily e obtenha uma chave de API.
Selecione Tavily Search na lista suspensa Select Search Engine.
Insira a chave de API no campo Tavily API Key.
Use o controle deslizante para definir o Number of Search Results.
Clique em Save Search Configuration.
Configure a sandbox de código
A sandbox de código oferece um ambiente seguro para execução de código Python. Quando ativada, o assistente de IA usa automaticamente a sandbox de código para executar scripts.
Cenários
Análise de dados: Estatísticas, agregação e filtragem. Exemplo: "Analise os dados de vendas e calcule a média de vendas por região."
Visualização de dados: Geração de gráficos e plotagem de tendências. Exemplo: "Plote a tendência de vendas do último ano."
Operações matemáticas: Cálculos complexos e resolução de equações. Exemplo: "Calcule o desvio padrão desta sequência."
Processamento de arquivos: Análise de arquivos CSV, Excel e outros formatos para extrair e transformar dados.
Outras tarefas que exigem execução de código
Pré-requisitos
Antes de configurar a sandbox de código, conclua as etapas a seguir:
Ative o Function Compute: Acesse o console do Function Compute e siga as instruções para ativá-lo.
-
Crie um interpretador AgentRun: Acesse o console do AgentRun. Escolha Sandbox no painel de navegação à esquerda. Crie um modelo de sandbox com o tipo Code Interpreter.
NotaO Network Type padrão é Allow the default NIC to access the public network, o que exige que o service RAG tenha acesso à rede pública.
Alternativamente, selecione Allow access to vpc e configure a mesma vpc para o service RAG.
Obtenha o ID da conta Alibaba Cloud e o Sandbox ID. Se você configurou credenciais de acesso, obtenha também uma chave de API.
Configuração
Clique em Settings > Code Sandbox no canto inferior esquerdo e configure os seguintes parâmetros:
Enable Sandbox: Ativa ou desativa o recurso de sandbox.
Sandbox Type: Apenas sandboxes do Alibaba Cloud FC são suportadas.
Alibaba Cloud ID: O ID da sua conta Alibaba Cloud.
Interpreter ID: O ID da sandbox.
Interpreter Name: O nome do interpretador de código.
API Key: O par de AccessKey usado para verificação de identidade.
Default Timeout (s): Duração máxima da execução do código em segundos. Padrão: 50.
Após a configuração, faça upload de um arquivo (como titanic.csv) na interface de chat e faça uma pergunta. O assistente de IA invocará o interpretador de código para executar código Python para análise de dados e retornará os resultados. Por exemplo, ao perguntar "Qual é a proporção entre homens e mulheres?", o assistente de IA lerá os dados com pandas e retornará: 577 homens, 314 mulheres, proporção de aproximadamente 1,84:1.
Configure a política de fragmentação de arquivos
As configurações de fragmentação definem o método de fragmentação para documentos em uma base de conhecimento. Isso determina como os documentos são divididos em fragmentos para vetorização e recuperação. Configurações adequadas de fragmentação podem melhorar a taxa de recall e a qualidade das respostas.
A fragmentação pode ser configurada em dois níveis:
-
Configurações de fragmentação da base de conhecimento: Os arquivos enviados para a base de conhecimento são analisados usando suas configurações padrão.
Configurações de fragmentação no nível da base de conhecimento: Na área Chunking Settings da aba Knowledge Base Settings, configure os seguintes parâmetros:
Chunk Type: ex.: estruturado (structure)
Chunk Size: valor recomendado 1000
Chunk Overlap: valor recomendado 50
Image Understanding Model
Embedding Model: ex.: BAAI/bge-m3
-
Nível de arquivo:
-
Ao fazer upload de um arquivo, especifique seus parâmetros de fragmentação individualmente.
Na área Chunking Configuration da caixa de diálogo de upload de arquivo, defina os seguintes parâmetros:
Chunk Type: Selecione o método de fragmentação, ex.: structured (structure)
Chunk Size: Defina o tamanho de cada fragmento, ex.: 1000
Chunk Overlap: Defina a sobreposição entre fragmentos, ex.: 60
Image Understanding Model: Selecione se deseja usar um modelo de compreensão de imagem
Após a configuração, clique no botão Start Parsing para iniciar a análise.
-
Ao realizar uma operação de reanálise (reparse) em um arquivo existente, especifique novas configurações de fragmentação para acionar o reprocessamento.
Os parâmetros de fragmentação incluem:
Chunk Type: Selecione o método de fragmentação, ex.: estruturado (structure)
Chunk Size: valor recomendado 1000
Chunk Overlap: valor recomendado 50
Image Understanding Model: Usado para compreender o conteúdo da imagem; você pode optar por não usá-lo
-
Pré-requisitos
Antes de configurar as definições de fragmentação, certifique-se de atender aos seguintes pré-requisitos:
Uma base de conhecimento: Deve existir uma base de conhecimento ativa no sistema.
Uma configuração de embedding: Pelo menos um modelo de embedding deve estar configurado.
(Opcional) Um modelo multimodal: Necessário para compreensão de imagem. Configure um modelo de visão no sistema.
Descrição dos parâmetros
|
Parâmetro |
Descrição |
|
Chunk Type |
Selecione um tipo de fragmento com base nas características do documento:
|
|
Chunk Size |
Comprimento máximo de cada fragmento em caracteres ou tokens, dependendo do tipo de fragmento. Recomendado: 1000. |
|
Chunk Overlap | O comprimento da sobreposição entre fragmentos adjacentes. Isso preserva o contexto e evita quebras semânticas. Recomendado: 50. Importante
O tamanho do fragmento deve ser maior que a sobreposição do fragmento. |
|
Image Understanding Model |
|
|
Vector Model |
|
Sugestão de ajuste: Faça upload de alguns documentos com as configurações padrão primeiro. Analise o recall e a precisão no módulo de avaliação e, em seguida, ajuste os parâmetros com base nos resultados.
Sugestões de uso
RAG para documentos longos: Defina Chunk Type como Structured, Chunk Size como 1000 e Chunk Overlap como 50. Isso controla o comprimento do fragmento enquanto preserva o contexto.
Fragmentação estrita por separador: Use a fragmentação por Paragraph com um separador personalizado.
Dados tabulares: Selecione o tipo de fragmento Table (table) e configure as linhas de cabeçalho e o delimitador de linha. Se você não selecionar Merge rows, o sistema fragmentará os dados por linha. Se selecionar Merge rows, o sistema mesclará linhas em blocos com base no limite de tamanho do fragmento.
Documentos multimodais: Ative o Image Understanding Model para incluir conteúdo de imagens de PDFs e outros documentos na recuperação e geração de respostas.
Configure o FAQ do aplicativo
O recurso de FAQ mantém uma base de conhecimento de perguntas e respostas por aplicativo. Utilize-o para manuais de product, roteiros de atendimento ao cliente e perguntas frequentes.
Com o FAQ ativado e as entradas configuradas, as conversas seguem este fluxo:
O assistente de IA recupera a entrada de FAQ mais semelhante à pergunta do usuário.
Se uma correspondência atingir o limiar de similaridade, o sistema retorna a resposta do FAQ diretamente ou gera uma resposta com o modelo com base no resultado do FAQ, dependendo da configuração.
Se nenhuma correspondência for encontrada ou se a opção de retorno direto não estiver ativada, o sistema recorrerá a outros recursos, como base de conhecimento e busca.
Configuração:
Faça login no sistema e acesse a página de configuração do aplicativo desejado.
Ative FAQ: Na configuração do aplicativo, ative a chave Enable FAQ e salve suas alterações.
-
Abra a página de gerenciamento de FAQ para realizar as seguintes ações:
FAQ Reply Settings: Clique em Settings. Configure o score threshold de similaridade (recomendado entre 0,8 e 1,0), o modelo de embedding, se deve incluir perguntas ou respostas na recuperação e exibição, e se deve retornar resultados de ferramentas diretamente.
-
Gerencie FAQs:
-
Adicionar, editar ou excluir uma única entrada de FAQ.
Clique em + Add FAQ, insira a Question e a Answer na caixa de diálogo e clique em Create para adicionar a entrada.
Na lista de FAQ, clique no ícone de edição para modificar uma entrada ou no ícone de exclusão para removê-la.
-
Excluir entradas em lote.
Exclusão em lote: Selecione as caixas de seleção das entradas de FAQ desejadas e clique em Delete selected no canto superior direito para excluir todas as entradas selecionadas.
-
Importação em lote: Faça upload de um arquivo Excel, mapeie as colunas de perguntas e respostas e importe as entradas com um clique.
Na caixa de diálogo Upload File, selecione um arquivo xlsx ou xls e configure os seguintes parâmetros de análise:
Header Row Index: Especifique a posição da linha de cabeçalho. Deixe em branco para usar índices numéricos de coluna (0, 1, 2...)
Question Column: Especifique o índice da coluna para perguntas
Answer Column: Especifique o índice da coluna para respostas
Após a configuração, clique em Upload.
-
Após salvar, as conversas neste aplicativo priorizarão automaticamente a recuperação de FAQ.