Todos os produtos
Search
Central de documentação

DataWorks:管理ChatBI数据集

Última atualização: Jun 27, 2026

Antes de iniciar uma sessão interativa no ChatBI, use um conjunto de dados para definir o escopo da análise. O conjunto de dados pode ser uma tabela de uma fonte de dados de destino ou um arquivo local.

Pré-requisito

Crie um grupo de recursos serverless na região onde você usa o ChatBI.

Observações de uso

  • Conjuntos de dados provenientes de fontes de dados aceitam apenas Hologres, MaxCompute, StarRocks e MySQL.

  • Conjuntos de dados baseados em arquivos locais aceitam apenas os formatos xls, xlsx e csv. Você pode enviar no máximo 10 arquivos, cada um com até 1 GB.

Criar um conjunto de dados

  1. Acesse a página do ChatBI.

    Faça login no Alibaba Cloud e abra a página ChatBI Intelligent Data Insights. Selecione o ponto de acesso correspondente à região dos seus recursos do DataWorks, como o conjunto de dados e o grupo de recursos serverless.

    Ponto de entrada do ChatBI na China (Hangzhou)

    Ponto de entrada do ChatBI na China (Xangai)

    Ponto de entrada do ChatBI na China (Shenzhen)

    Ponto de entrada do ChatBI na China (Hong Kong)

    Ponto de entrada do ChatBI na China (Chengdu)

    Ponto de entrada do ChatBI na China (Pequim)

    Ponto de entrada do ChatBI na China (Zhangjiakou)

    Ponto de entrada do ChatBI na Indonésia (Jacarta)

  2. No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados. Em seguida, clique em Create Dataset.

  3. Na página Create Dataset, configure os seguintes parâmetros:

    • Se o tipo de conjunto de dados for Data Source:

      Parâmetro

      Descrição

      Basic Information

      Name

      Insira um nome personalizado para o conjunto de dados.

      Type

      Tipo do conjunto de dados. Valores válidos:

      • Data Source

      • Local File

      Selecione Data Source.

      Data Source Type

      Tipo da fonte de dados. Valores válidos:

      • Hologres

      • MaxCompute

      • StarRocks

      • MySQL

      Informações da fonte de dados

      Os parâmetros de configuração variam conforme o tipo de fonte de dados.

      Por exemplo, para Hologres, configure Region, Hologres Instance e Database Name.

      Resource Group

      Selecione um grupo de recursos serverless do DataWorks para acessar a fonte de dados nas consultas durante as sessões subsequentes.

      Test Network Connectivity

      Teste a conectividade de rede entre o grupo de recursos serverless do DataWorks selecionado e a fonte de dados.

      Select Destination Table

      Selecionar tabelas de destino

      Após concluir a configuração de Basic Information, clique em Next para avançar à etapa Select Destination Table.

      Na lista To Be Selected, selecione as tabelas de destino e clique em image para adicioná-las à lista Selected. As tabelas selecionadas serão incluídas no conjunto de dados atual.

    • Se o tipo de conjunto de dados for Local File:

      Parâmetro

      Descrição

      Basic Information

      Name

      Insira um nome personalizado para o conjunto de dados.

      Type

      Tipo do conjunto de dados. Valores válidos:

      • Data Source

      • Local File

      Selecione Local File.

      Carregar arquivos locais

      Somente os formatos xls, xlsx e csv são aceitos. Você pode enviar no máximo 10 arquivos, cada um com até 1 GB.

  4. Após concluir a configuração do conjunto de dados, clique em Next para prosseguir à etapa Data Insight. O sistema examina automaticamente o conjunto de dados para extrair características dos valores e aumentar a precisão das análises durante as sessões.

  5. A geração de insights pode demorar. Se preferir, clique diretamente em Completed e visualize os resultados no conjunto de dados posteriormente.

Visualizar um conjunto de dados

  1. No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados.

  2. Localize o cartão do conjunto de dados desejado e clique nele para abrir a página de detalhes.

  3. A página de detalhes do conjunto de dados exibe as informações básicas na parte superior (tipo, quantidade de tabelas/arquivos e criador). O lado esquerdo apresenta a lista de tabelas/arquivos, enquanto o lado direito mostra as informações básicas e uma prévia dos dados de cada tabela/arquivo (até 20 registros).

    image

Editar um conjunto de dados

  1. No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados.

  2. Localize o cartão do conjunto de dados alvo. Use um dos métodos abaixo para acessar a página de edição.

    • Passe o mouse sobre o cartão do conjunto de dados desejado e, no canto superior direito, clique em image > Edit.

    • Clique no cartão do conjunto de dados para abrir a página de detalhes e clique no botão Edit no canto superior direito.

  3. Modifique a configuração do conjunto de dados. As descrições dos parâmetros são as mesmas apresentadas em Criar um conjunto de dados.

    Nota

    Ao editar uma configuração existente, não é possível alterar o tipo do conjunto de dados nem o tipo da fonte de dados.

  4. Após concluir a edição, clique em Next para ir à etapa Data Insight. A geração de insights será executada novamente sobre os dados do conjunto.

Excluir um conjunto de dados

  1. No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados.

  2. Passe o mouse sobre o cartão do conjunto de dados desejado e, no canto superior direito, clique em image > Delete. Após a exclusão, as sessões e gráficos associados deixarão de exibir os dados corretamente.

Próximos passos: Iniciar uma sessão baseada em um conjunto de dados

  1. Use um dos métodos a seguir para iniciar uma sessão com base em um conjunto de dados específico.

    • No painel de navegação à esquerda, clique em Dataset para acessar a página de conjuntos de dados. Passe o mouse sobre o cartão do conjunto de dados desejado e, no canto superior direito, clique em image para iniciar a sessão.

    • No painel de navegação à esquerda, clique em New Session para abrir a janela de sessão do ChatBI. Em seguida, clique em Select Dataset na janela da sessão.

      image

  2. Na página Chat, insira suas necessidades ou perguntas para começar a análise de dados. Para mais informações, consulte Sessões do ChatBI.

Dicas para fazer perguntas

A qualidade da análise do ChatBI depende diretamente da formulação das perguntas. Siga as dicas abaixo para obter resultados mais precisos e valiosos.

Defina um objetivo claro de análise

Uma boa pergunta de análise deve conter um sujeito bem definido, uma métrica e uma dimensão de análise.

Pergunta bem formulada (recomendado)

Pergunta vaga (evitar)

Tendência mensal de vendas na região Leste da China em 2025

Mostre a situação das vendas

Novos usuários diários e taxa de crescimento ano a ano nos últimos 7 dias

Como está o crescimento de usuários recentemente?

Top 10 taxas de devolução por categoria de produto e distribuição dos motivos de devolução

Há muitas devoluções?

Use condições de tempo e filtros adequadamente

Especificar um intervalo de tempo e condições de filtro na pergunta ajuda o ChatBI a gerar SQL mais preciso e evita varreduras completas desnecessárias nas tabelas.

  • Especifique um intervalo de tempo: Por exemplo, "Margem bruta por linha de produtos no 4º trimestre de 2025" é mais preciso do que "Margem bruta por linha de produtos" e reduz o volume de dados consultados.

  • Defina dimensões de filtro: Por exemplo, "Distribuição do valor médio de pedidos para clientes VIP no Norte da China" é mais direcionado do que "Qual é o valor médio do pedido".

  • Utilize terminologia de negócios: Ao formular perguntas, use os valores reais dos campos nas tabelas de dados ou termos de negócios configurados na base de conhecimento. Por exemplo, prefira "status='Completed'" em vez de "pedidos concluídos". Isso facilita o mapeamento correto dos dados pelo ChatBI.

Divida requisitos complexos passo a passo

Para demandas de análise complexas, divida-as em várias perguntas simples e faça-as sequencialmente para uma análise progressiva.

  • Passo 1: Visão geral: Comece com uma pergunta abrangente para entender a tendência geral. Exemplo: "Tendência geral de vendas mensais em 2025".

  • Passo 2: Identificar anomalias: Após detectar uma anomalia, faça perguntas aprofundadas e direcionadas. Exemplo: "Motivos da queda nas vendas em março, detalhados por categoria de produto".

  • Passo 3: Análise de causa raiz: Investigue mais profundamente as principais descobertas. Exemplo: "Na categoria de eletrônicos em março, quais subcategorias tiveram as maiores quedas".

Dicas para conversas de múltiplas rodadas

O ChatBI suporta várias perguntas consecutivas na mesma sessão. As dicas abaixo ajudam a conduzir análises em múltiplas rodadas de maneira mais eficiente.

  • Aprofunde com perguntas de acompanhamento: Faça novas perguntas baseadas no resultado anterior. Por exemplo, primeiro pergunte "Ranking de vendas por região" e depois "Detalhes mensais de vendas da região melhor classificada".

  • Instruções de correção: Caso o resultado não atenda às expectativas, indique claramente o ajuste necessário na próxima interação. Exemplo: "Agrupe a análise acima por trimestre em vez de mês" ou "Exclua dados de teste e mostre apenas pedidos formais".

  • Alterne a visualização: Para o mesmo conjunto de dados, solicite diferentes formatos de exibição. Exemplo: "Exiba os dados acima como gráfico de pizza" ou "Ordene em ordem decrescente".

Lidando com resultados imprecisos

Quando os resultados da análise do ChatBI não forem suficientemente precisos, otimize-os considerando os aspectos abaixo.

  • Verifique a correspondência da tabela de destino: Na etapa "Identify destination table" do resultado da análise, confirme se o ChatBI selecionou a tabela correta. Se a tabela errada for escolhida, especifique explicitamente o nome da tabela na pergunta, por exemplo: "Analise vendas por categoria com base na tabela ods_order_detail".

  • Refine a formulação da pergunta: Reformule a questão usando terminologia de negócios mais precisa e definições claras de métricas. Por exemplo, altere "Quantos usuários ativos existem" para "Número de usuários distintos que fizeram login nos últimos 30 dias".

  • Melhore a base de conhecimento: Se um determinado tipo de pergunta apresentar imprecisões recorrentes, peça ao administrador para adicionar modelos de perguntas, termos ou lógica de negócios correspondentes na Base de conhecimento. Após a configuração, o ChatBI priorizará o conhecimento armazenado para compreender e processar tais perguntas.

  • Revise o SQL gerado: Expanda o código SQL na etapa "Generate execution plan" e verifique se a lógica da consulta está correta. Se houver problemas, copie o SQL, modifique-o manualmente e execute-o. Em seguida, adicione o SQL corrigido como modelo de pergunta na base de conhecimento.

Guia de configuração de fonte de dados

MySQL

  • Risco de varredura completa de tabela: O SQL gerado pelo ChatBI com base nas suas perguntas pode realizar varreduras completas. Se a tabela contiver um grande volume de dados (milhões de linhas), isso pode sobrecarregar o banco de dados. Recomendamos fortemente o uso de uma réplica ou instância secundária somente leitura como fonte de dados para evitar impactos no ambiente de produção.

  • Otimização de índices: Crie índices em colunas de filtro frequentemente consultadas (como colunas de tempo, status e categoria) para acelerar a execução do SQL gerado pelo ChatBI.

  • Nomenclatura de colunas: Utilize nomes de colunas em inglês com significado comercial claro (como order_amount e customer_name) e adicione comentários em chinês nas colunas. O ChatBI depende dos nomes e comentários para entender a estrutura da tabela. Uma boa nomenclatura melhora significativamente a precisão na identificação da tabela de destino e na geração de SQL.

  • Cenários aplicáveis: Adequado para cenários de consulta em bancos de dados transacionais com volumes de dados na casa das dezenas de milhões de linhas, como análise de pedidos e gestão de clientes para dados de negócios online.

Hologres

  • Design de tabelas particionadas: Recomendamos o uso de tabelas particionadas por tempo (como data ou mês). Quando o SQL gerado pelo ChatBI consulta tabelas particionadas, ele realiza automaticamente a poda de partições, reduzindo drasticamente o volume de dados varridos e evitando tempos limite causados por intervalos de consulta excessivamente amplos.

  • Comentários em tabelas e colunas: O Hologres permite adicionar COMMENT a tabelas e colunas. O ChatBI lê esses comentários para compreender a semântica dos dados. Adicione comentários em chinês a cada tabela e coluna chave para descrever seu significado comercial.

  • Armazenamento híbrido linha-coluna: Para cenários de consulta do ChatBI focados em análise agregada, recomendamos o modo de armazenamento em colunas para obter melhor desempenho.

  • Cenários aplicáveis: Ideal para análises de dados em tempo real e quase em tempo real. Suporta consultas interativas em centenas de milhões de registros, sendo especialmente indicado para painéis em tempo real e análise de métricas instantâneas.

MaxCompute

  • Poda de partições: O MaxCompute é um motor de processamento de dados massivo, e uma única consulta pode varrer uma grande quantidade de informações. Recomendamos fortemente o uso de tabelas particionadas, garantindo que dimensões de filtro comuns (como data e região) sejam usadas como chaves de partição. Sempre que possível, o ChatBI utiliza condições de partição ao gerar SQL para reduzir varreduras completas desnecessárias.

  • Latência de consulta: Como motor de processamento em lote offline, os tempos de resposta do MaxCompute variam tipicamente de segundos a minutos, dependendo do volume de dados e da complexidade da consulta. Se for necessária resposta em nível de segundos, considere usar Hologres ou StarRocks.

  • Diferenças de dialeto SQL: O MaxCompute possui seu próprio dialeto SQL, com funções e sintaxe distintas do SQL padrão. O ChatBI é adaptado à sintaxe do MaxCompute e gera automaticamente SQL compatível com suas especificações. Caso o SQL gerado falhe na execução, adicione um modelo de pergunta na base de conhecimento para orientar a sintaxe correta.

  • Cenários aplicáveis: Projetado para análise offline de dados massivos na escala de TB a PB, como análise de tendências históricas e comportamento completo de usuários.

StarRocks

  • Recursos da arquitetura MPP: O StarRocks adota uma arquitetura de processamento massivamente paralelo (MPP), destacando-se em análises multidimensionais e consultas de agregação complexas. Perguntas de análise cruzada multidimensional feitas via ChatBI geralmente alcançam excelente desempenho no StarRocks.

  • Visões materializadas: Se certas consultas de agregação forem frequentes, crie visões materializadas no StarRocks para acelerar as consultas. O ChatBI utiliza automaticamente essas visões para melhorar o desempenho.

  • Modelagem de dados: O StarRocks suporta os modelos Duplicate Key, Aggregate Key, Unique Key e Primary Key. Para cenários de análise do ChatBI, o modelo Duplicate Key é adequado para análises multidimensionais flexíveis, enquanto o modelo Aggregate Key atende melhor a cenários de consulta de métricas fixas. Escolha o modelo apropriado conforme os requisitos reais de análise.

  • Cenários aplicáveis: Recomendado para análises multidimensionais em tempo real e consultas ad hoc. Oferece resposta em nível de segundos para centenas de milhões de registros, sendo ideal para análise de comportamento do usuário e relatórios em tempo real.