Antes de iniciar uma sessão interativa no ChatBI, use um conjunto de dados para definir o escopo da análise. O conjunto de dados pode ser uma tabela de uma fonte de dados de destino ou um arquivo local.
Pré-requisito
Crie um grupo de recursos serverless na região onde você usa o ChatBI.
Observações de uso
Conjuntos de dados provenientes de fontes de dados aceitam apenas Hologres, MaxCompute, StarRocks e MySQL.
Conjuntos de dados baseados em arquivos locais aceitam apenas os formatos
xls,xlsxecsv. Você pode enviar no máximo 10 arquivos, cada um com até 1 GB.
Criar um conjunto de dados
-
Acesse a página do ChatBI.
Faça login no Alibaba Cloud e abra a página ChatBI Intelligent Data Insights. Selecione o ponto de acesso correspondente à região dos seus recursos do DataWorks, como o conjunto de dados e o grupo de recursos serverless.
No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados. Em seguida, clique em Create Dataset.
-
Na página Create Dataset, configure os seguintes parâmetros:
-
Se o tipo de conjunto de dados for Data Source:
Parâmetro
Descrição
Basic Information
Name
Insira um nome personalizado para o conjunto de dados.
Type
Tipo do conjunto de dados. Valores válidos:
-
Data Source
-
Local File
Selecione Data Source.
Data Source Type
Tipo da fonte de dados. Valores válidos:
-
Hologres
-
MaxCompute
-
StarRocks
-
MySQL
Informações da fonte de dados
Os parâmetros de configuração variam conforme o tipo de fonte de dados.
Por exemplo, para Hologres, configure Region, Hologres Instance e Database Name.
Resource Group
Selecione um grupo de recursos serverless do DataWorks para acessar a fonte de dados nas consultas durante as sessões subsequentes.
Test Network Connectivity
Teste a conectividade de rede entre o grupo de recursos serverless do DataWorks selecionado e a fonte de dados.
Select Destination Table
Selecionar tabelas de destino
Após concluir a configuração de Basic Information, clique em Next para avançar à etapa Select Destination Table.
Na lista To Be Selected, selecione as tabelas de destino e clique em
para adicioná-las à lista Selected. As tabelas selecionadas serão incluídas no conjunto de dados atual. -
-
Se o tipo de conjunto de dados for Local File:
Parâmetro
Descrição
Basic Information
Name
Insira um nome personalizado para o conjunto de dados.
Type
Tipo do conjunto de dados. Valores válidos:
-
Data Source
-
Local File
Selecione Local File.
Carregar arquivos locais
Somente os formatos
xls,xlsxecsvsão aceitos. Você pode enviar no máximo 10 arquivos, cada um com até 1 GB. -
-
Após concluir a configuração do conjunto de dados, clique em Next para prosseguir à etapa Data Insight. O sistema examina automaticamente o conjunto de dados para extrair características dos valores e aumentar a precisão das análises durante as sessões.
A geração de insights pode demorar. Se preferir, clique diretamente em Completed e visualize os resultados no conjunto de dados posteriormente.
Visualizar um conjunto de dados
No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados.
Localize o cartão do conjunto de dados desejado e clique nele para abrir a página de detalhes.
-
A página de detalhes do conjunto de dados exibe as informações básicas na parte superior (tipo, quantidade de tabelas/arquivos e criador). O lado esquerdo apresenta a lista de tabelas/arquivos, enquanto o lado direito mostra as informações básicas e uma prévia dos dados de cada tabela/arquivo (até 20 registros).

Editar um conjunto de dados
No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados.
-
Localize o cartão do conjunto de dados alvo. Use um dos métodos abaixo para acessar a página de edição.
Passe o mouse sobre o cartão do conjunto de dados desejado e, no canto superior direito, clique em .
Clique no cartão do conjunto de dados para abrir a página de detalhes e clique no botão Edit no canto superior direito.
-
Modifique a configuração do conjunto de dados. As descrições dos parâmetros são as mesmas apresentadas em Criar um conjunto de dados.
NotaAo editar uma configuração existente, não é possível alterar o tipo do conjunto de dados nem o tipo da fonte de dados.
Após concluir a edição, clique em Next para ir à etapa Data Insight. A geração de insights será executada novamente sobre os dados do conjunto.
Excluir um conjunto de dados
No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados.
Passe o mouse sobre o cartão do conjunto de dados desejado e, no canto superior direito, clique em . Após a exclusão, as sessões e gráficos associados deixarão de exibir os dados corretamente.
Próximos passos: Iniciar uma sessão baseada em um conjunto de dados
-
Use um dos métodos a seguir para iniciar uma sessão com base em um conjunto de dados específico.
No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados. Passe o mouse sobre o cartão do conjunto de dados desejado e, no canto superior direito, clique em
para iniciar a sessão.-
No painel de navegação à esquerda, clique em New Session para abrir a janela de sessão do ChatBI. Em seguida, clique em Select Dataset na janela da sessão.

Na página Chat, insira suas necessidades ou perguntas para começar a análise de dados. Para mais informações, consulte Sessões do ChatBI.
Dicas para fazer perguntas
A qualidade da análise do ChatBI depende diretamente da formulação das perguntas. Siga as dicas abaixo para obter resultados mais precisos e valiosos.
Defina um objetivo claro de análise
Uma boa pergunta de análise deve conter um sujeito bem definido, uma métrica e uma dimensão de análise.
|
Pergunta bem formulada (recomendado) |
Pergunta vaga (evitar) |
|
Tendência mensal de vendas na região Leste da China em 2025 |
Mostre a situação das vendas |
|
Novos usuários diários e taxa de crescimento ano a ano nos últimos 7 dias |
Como está o crescimento de usuários recentemente? |
|
Top 10 taxas de devolução por categoria de produto e distribuição dos motivos de devolução |
Há muitas devoluções? |
Use condições de tempo e filtros adequadamente
Especificar um intervalo de tempo e condições de filtro na pergunta ajuda o ChatBI a gerar SQL mais preciso e evita varreduras completas desnecessárias nas tabelas.
Especifique um intervalo de tempo: Por exemplo, "Margem bruta por linha de produtos no 4º trimestre de 2025" é mais preciso do que "Margem bruta por linha de produtos" e reduz o volume de dados consultados.
Defina dimensões de filtro: Por exemplo, "Distribuição do valor médio de pedidos para clientes VIP no Norte da China" é mais direcionado do que "Qual é o valor médio do pedido".
Utilize terminologia de negócios: Ao formular perguntas, use os valores reais dos campos nas tabelas de dados ou termos de negócios configurados na base de conhecimento. Por exemplo, prefira "status='Completed'" em vez de "pedidos concluídos". Isso facilita o mapeamento correto dos dados pelo ChatBI.
Divida requisitos complexos passo a passo
Para demandas de análise complexas, divida-as em várias perguntas simples e faça-as sequencialmente para uma análise progressiva.
Passo 1: Visão geral: Comece com uma pergunta abrangente para entender a tendência geral. Exemplo: "Tendência geral de vendas mensais em 2025".
Passo 2: Identificar anomalias: Após detectar uma anomalia, faça perguntas aprofundadas e direcionadas. Exemplo: "Motivos da queda nas vendas em março, detalhados por categoria de produto".
Passo 3: Análise de causa raiz: Investigue mais profundamente as principais descobertas. Exemplo: "Na categoria de eletrônicos em março, quais subcategorias tiveram as maiores quedas".
Dicas para conversas de múltiplas rodadas
O ChatBI suporta várias perguntas consecutivas na mesma sessão. As dicas abaixo ajudam a conduzir análises em múltiplas rodadas de maneira mais eficiente.
Aprofunde com perguntas de acompanhamento: Faça novas perguntas baseadas no resultado anterior. Por exemplo, primeiro pergunte "Ranking de vendas por região" e depois "Detalhes mensais de vendas da região melhor classificada".
Instruções de correção: Caso o resultado não atenda às expectativas, indique claramente o ajuste necessário na próxima interação. Exemplo: "Agrupe a análise acima por trimestre em vez de mês" ou "Exclua dados de teste e mostre apenas pedidos formais".
Alterne a visualização: Para o mesmo conjunto de dados, solicite diferentes formatos de exibição. Exemplo: "Exiba os dados acima como gráfico de pizza" ou "Ordene em ordem decrescente".
Lidando com resultados imprecisos
Quando os resultados da análise do ChatBI não forem suficientemente precisos, otimize-os considerando os aspectos abaixo.
Verifique a correspondência da tabela de destino: Na etapa "Identify destination table" do resultado da análise, confirme se o ChatBI selecionou a tabela correta. Se a tabela errada for escolhida, especifique explicitamente o nome da tabela na pergunta, por exemplo: "Analise vendas por categoria com base na tabela ods_order_detail".
Refine a formulação da pergunta: Reformule a questão usando terminologia de negócios mais precisa e definições claras de métricas. Por exemplo, altere "Quantos usuários ativos existem" para "Número de usuários distintos que fizeram login nos últimos 30 dias".
Melhore a base de conhecimento: Se um determinado tipo de pergunta apresentar imprecisões recorrentes, peça ao administrador para adicionar modelos de perguntas, termos ou lógica de negócios correspondentes na Base de conhecimento. Após a configuração, o ChatBI priorizará o conhecimento armazenado para compreender e processar tais perguntas.
Revise o SQL gerado: Expanda o código SQL na etapa "Generate execution plan" e verifique se a lógica da consulta está correta. Se houver problemas, copie o SQL, modifique-o manualmente e execute-o. Em seguida, adicione o SQL corrigido como modelo de pergunta na base de conhecimento.
Guia de configuração de fonte de dados
MySQL
Risco de varredura completa de tabela: O SQL gerado pelo ChatBI com base nas suas perguntas pode realizar varreduras completas. Se a tabela contiver um grande volume de dados (milhões de linhas), isso pode sobrecarregar o banco de dados. Recomendamos fortemente o uso de uma réplica ou instância secundária somente leitura como fonte de dados para evitar impactos no ambiente de produção.
Otimização de índices: Crie índices em colunas de filtro frequentemente consultadas (como colunas de tempo, status e categoria) para acelerar a execução do SQL gerado pelo ChatBI.
Nomenclatura de colunas: Utilize nomes de colunas em inglês com significado comercial claro (como
order_amountecustomer_name) e adicione comentários em chinês nas colunas. O ChatBI depende dos nomes e comentários para entender a estrutura da tabela. Uma boa nomenclatura melhora significativamente a precisão na identificação da tabela de destino e na geração de SQL.Cenários aplicáveis: Adequado para cenários de consulta em bancos de dados transacionais com volumes de dados na casa das dezenas de milhões de linhas, como análise de pedidos e gestão de clientes para dados de negócios online.
Hologres
Design de tabelas particionadas: Recomendamos o uso de tabelas particionadas por tempo (como data ou mês). Quando o SQL gerado pelo ChatBI consulta tabelas particionadas, ele realiza automaticamente a poda de partições, reduzindo drasticamente o volume de dados varridos e evitando tempos limite causados por intervalos de consulta excessivamente amplos.
Comentários em tabelas e colunas: O Hologres permite adicionar
COMMENTa tabelas e colunas. O ChatBI lê esses comentários para compreender a semântica dos dados. Adicione comentários em chinês a cada tabela e coluna chave para descrever seu significado comercial.Armazenamento híbrido linha-coluna: Para cenários de consulta do ChatBI focados em análise agregada, recomendamos o modo de armazenamento em colunas para obter melhor desempenho.
Cenários aplicáveis: Ideal para análises de dados em tempo real e quase em tempo real. Suporta consultas interativas em centenas de milhões de registros, sendo especialmente indicado para painéis em tempo real e análise de métricas instantâneas.
MaxCompute
Poda de partições: O MaxCompute é um motor de processamento de dados massivo, e uma única consulta pode varrer uma grande quantidade de informações. Recomendamos fortemente o uso de tabelas particionadas, garantindo que dimensões de filtro comuns (como data e região) sejam usadas como chaves de partição. Sempre que possível, o ChatBI utiliza condições de partição ao gerar SQL para reduzir varreduras completas desnecessárias.
Latência de consulta: Como motor de processamento em lote offline, os tempos de resposta do MaxCompute variam tipicamente de segundos a minutos, dependendo do volume de dados e da complexidade da consulta. Se for necessária resposta em nível de segundos, considere usar Hologres ou StarRocks.
Diferenças de dialeto SQL: O MaxCompute possui seu próprio dialeto SQL, com funções e sintaxe distintas do SQL padrão. O ChatBI é adaptado à sintaxe do MaxCompute e gera automaticamente SQL compatível com suas especificações. Caso o SQL gerado falhe na execução, adicione um modelo de pergunta na base de conhecimento para orientar a sintaxe correta.
Cenários aplicáveis: Projetado para análise offline de dados massivos na escala de TB a PB, como análise de tendências históricas e comportamento completo de usuários.
StarRocks
Recursos da arquitetura MPP: O StarRocks adota uma arquitetura de processamento massivamente paralelo (MPP), destacando-se em análises multidimensionais e consultas de agregação complexas. Perguntas de análise cruzada multidimensional feitas via ChatBI geralmente alcançam excelente desempenho no StarRocks.
Visões materializadas: Se certas consultas de agregação forem frequentes, crie visões materializadas no StarRocks para acelerar as consultas. O ChatBI utiliza automaticamente essas visões para melhorar o desempenho.
Modelagem de dados: O StarRocks suporta os modelos Duplicate Key, Aggregate Key, Unique Key e Primary Key. Para cenários de análise do ChatBI, o modelo Duplicate Key é adequado para análises multidimensionais flexíveis, enquanto o modelo Aggregate Key atende melhor a cenários de consulta de métricas fixas. Escolha o modelo apropriado conforme os requisitos reais de análise.
Cenários aplicáveis: Recomendado para análises multidimensionais em tempo real e consultas ad hoc. Oferece resposta em nível de segundos para centenas de milhões de registros, sendo ideal para análise de comportamento do usuário e relatórios em tempo real.