Este tópico mostra como usar um DMS Jupyter Notebook para consultar e analisar dados. O notebook é um documento interativo que integra código, texto e gráficos em uma única página, o que facilita o compartilhamento do trabalho com outros usuários.
Interface do notebook
A barra de ferramentas oferece as seguintes funções:
: Salva as edições no notebook.
: Insere uma célula acima da atual.
: Exclui a célula selecionada.
: Recorta a célula selecionada.
: Copia a célula selecionada.
: Cola o conteúdo copiado na célula selecionada.
: Execute a célula selecionada.
: Interrompe o kernel.
: Reinicia o kernel.
: Reinicia o kernel e reexecuta todo o notebook.
: Alterna o tipo de célula entre Code, SQL, Markdown e Raw.
: Abre a interface de chat do Copilot.
Recursos do DMS Jupyter Notebook
O DMS Jupyter Notebook é compatível com o Jupyter Notebook open source e oferece recursos aprimorados de consulta SQL e visualização.
Kernel IPython
O funcionamento é quase idêntico ao do Jupyter Notebook open source. Use pip para instale pacotes de extensão e acessar a internet.
-
Consulte dados de tabelas em um notebook usando a sintaxe Spark. Veja os exemplos de sintaxe a seguir:
-
Sintaxe 1:
df = spark.sql("select * from customer limit 10").show(); -
Sintaxe 2:
%%spark_sql select * from customer limit 10; -
Sintaxe 3:
Em uma célula, selecione e insira a instrução SQL.
CREATE TABLE IF NOT EXISTS 'default'.'select_2' AS SELECT 2;NotaPor padrão, uma célula Spark SQL exibe no máximo 3.000 linhas. Para alterar esse limite, modifique a variável de ambiente DMS_SPARK_SQL_DEFAULT_LIMIT inserindo o seguinte código em uma célula:
os.environ['DMS_SPARK_SQL_DEFAULT_LIMIT'] = '3000';
-
-
Na barra de ferramentas do notebook, alterne o tipo de célula de Code para SQL.
A sintaxe das células SQL é quase idêntica à do data warehouse lógico, com suporte a consultas entre bancos de dados e análise em tempo real. Os requisitos de permissão seguem as permissões refinadas do DMS.
-
Referencie variáveis em células SQL e Python (no formato
${variable_name}), personalize nomes de variáveis e visualize seus tipos. A seção a seguir descreve como defina, gerar saída e referenciar variáveis em um notebook.-
Definir e referenciar variáveis
Referencie uma variável do IPython em SQL usando ${var}, onde var é o nome da variável no IPython.
target_table = 'archieve_partitions' SELECT * FROM `datafactory`.`${target_table}`; -
Gerar saída de variáveis
Em uma célula IPython, use diretamente o nome da variável, exibido no canto inferior esquerdo do conjunto de resultados. O tipo da variável é pandas.core.frame.DataFrame. Para renomeá-la, clique em no nome da variável e insira um novo nome.
-
-
Visualize conjuntos de resultados SQL com um clique. Há suporte para visualização em tabela e em gráfico.
Na visualização de gráfico, o painel esquerdo corresponde às configurações. Defina o Chart type (como gráfico de linhas), os campos X-axis e Y-axis, grouping e condições de filter. A parte superior do painel disponibiliza os botões Try another e Baixe image.
Kernel PySpark
O AnalyticDB Spark tem suporte por padrão. O Spark open source também é compatível.
O Spark Magic fornece o comando mágico %%help para listar rapidamente os comandos suportados.
O Spark Magic é uma extensão do Jupyter Notebook.
AnalyticDB Spark
Após purchase an AnalyticDB cluster (Data Lakehouse Edition), enable and purchase a resource group e create a database account, use os seguintes comandos:
Comando | Descrição |
| Verifica ou soluciona problemas na configuração do AnalyticDB Spark. |
| Envia uma instrução SQL para o AnalyticDB Spark. |
Execute operações DDL usando a sintaxe de leitura e gravação no C-Store. Para mais informações, consulte Read from and write to internal tables. | |
| Envia código Python para o AnalyticDB Spark. |
Uma sessão do AnalyticDB Spark permanece ativa por 20 minutos. Após esse período, a sessão expira e é excluída. Reinicie o kernel para crie uma nova sessão.
Upload e baixe de arquivos
Use o ossutil para fazer upload e baixe dos conjuntos de dados necessários. Para obter informações sobre como configure o ossutil, consulte Configure ossutil.
Procedimento
-
Crie um notebook.
Na aba Files
, clique em
e selecione Notebook. No editor de células, escreva o conteúdo nos formatos SQL, Code, Markdown ou Raw.
-
Após verificar se o SQL gerado está correto, execute a instrução e visualize o conjunto de resultados.
-
Na área SQL gerada pelo Copilot, clique em Execute Query.
A instrução SQL é inserida automaticamente no documento à esquerda. O resultado da consulta também aparece abaixo da instrução SQL.
-
Exibição em tabela
A consulta retorna sete linhas da tabela ORDERS, incluindo
O_ORDERKEY(ID do pedido),O_CUSTKEY(ID do cliente) eO_ORDERSTATUS(status do pedido). O status do pedido em todos os registros éO. -
Exibição em gráfico
No painel de configuração de visualização de dados, defina o tipo de gráfico como line chart, selecione O_ORDERDATE para o campo X-axis e [Total] O_ORDERKEY para o campo Y-axis. Essa ação gera um gráfico de linhas de tendência de O_ORDERKEY agregado por data do pedido.
-
-
-
Após a execução bem-sucedida da instrução SQL, referencie o conjunto de resultados como uma variável em outras células SQL. Também é possível renomear a variável.
Por exemplo, o resultado da consulta SQL cria automaticamente uma variável chamada
SQL_949364. Em uma célula de código Python, executeSQL_RES=SQL_949364para atribuir o resultado a uma variável personalizada chamadaSQL_RES. O valor retornado é um DataFrame do pandas. -
Preveja tendências de dados.
-
Instale os pacotes de machine learning do Python executando o seguinte código em uma célula.
pip install pandas numpy matplotlib scikit-Learn Após a instalação dos pacotes, insira o código Python para prever dados e visualizar os resultados.
-
Próximas etapas
Perguntas frequentes
P: Quem pode visualize documentos de notebook?
R: Apenas membros do mesmo workspace e tenant podem visualizá-los. Se o usuário-alvo não estiver no tenant atual, adicione-o ao mesmo tenant do criador do workspace e, em seguida, adicione-o como membro do workspace.