Todos os produtos
Search
Central de documentação

AnalyticDB:Desenvolva jobs Spark com um Notebook

Última atualização: Jun 27, 2026

O recurso de Notebook AnalyticDB for MySQL é uma plataforma interativa para análise e desenvolvimento de dados que oferece funcionalidades como edição de jobs, análise de dados e visualização. Este tópico explica como usar o recurso Notebook no Data Management (DMS) para desenvolver jobs Spark SQL.

Pré-requisitos

Limitações

O recurso Notebook está disponível apenas nas seguintes regiões: .

Procedimento

  1. Crie um projeto e acesse o workspace.

    1. Acesse o DMS 5.0.

    2. Passe o ponteiro sobre o ícone 2023-01-28_15-57-17.png no canto superior esquerdo e escolha All Features > Data+AI > Notebook.

      Nota

      Se estiver usando o console do DMS no modo normal, escolha Data+AI > Notebook na barra de navegação superior.

    3. Clique em Create Workspace. Na caixa de diálogo exibida, insira um Workspace Name, selecione uma Region e clique em OK.

    4. Na coluna Actions do workspace desejado, clique em Go to Workspace.

  2. (Opcional) Adicione membros ao projeto. Se vários usuários trabalharem no workspace, esta etapa é obrigatória para atribuir diferentes funções a eles.

  3. Configure o espaço de armazenamento de código.

    1. Na aba Project Settings image, clique em Storage Management .

    2. Configure o caminho do OSS para Code Storage.

  4. Adicione um recurso.

    1. Na aba Project Settings image, clique em Resource Settings.

    2. Clique em Add Resource e configure os parâmetros do recurso.

      Parâmetro

      Obrigatório

      Descrição

      Resource Name

      Sim

      Nome do recurso. Especifique um nome personalizado.

      Resource Introduction

      Sim

      Descrição da finalidade do recurso. Valor personalizável.

      Image

      Sim

      Apenas a imagem Spark3.5+Python3.9 é compatível.

      AnalyticDB Instance

      Sim

      ID do cluster AnalyticDB for MySQL.

      Nota

      Se o cluster desejado não aparecer, verifique se ele foi adicionado ao DMS.

      AnalyticDB Resource Group

      Sim

      Selecione o grupo de recursos de job de destino.

      Executor Specifications

      Sim

      Especificação de recursos para executores Spark. Este exemplo usa o valor padrão medium.

      Para mais informações sobre as especificações correspondentes a diferentes modelos, consulte a coluna Model em Parâmetros de configuração de aplicativo Spark.

      Max Executors

      Min Executors

      Sim

      Quantidade de executores Spark.

      Ao selecionar a imagem Spark3.5+Python3.9, o sistema define Min Executors como 2 e Max Executors como 8 por padrão.

      Notebook Spec

      Sim

      Selecione uma especificação de Notebook. Este exemplo utiliza General_Tiny_v1 (1 núcleo e 4 GB de memória).

      VPC ID

      Sim

      Selecione a Virtual Private Cloud (VPC) onde reside o cluster AnalyticDB for MySQL para garantir a comunicação entre o Notebook e o cluster.

      Importante

      Se posteriormente você alterar o cluster AnalyticDB for MySQL para uma nova Virtual Private Cloud (VPC) e vSwitch, atualize o VPC ID e o vSwitch ID do recurso. Caso contrário, os envios de jobs falharão.

      Zone ID

      Sim

      Selecione a zona onde reside o cluster AnalyticDB for MySQL.

      vSwitch ID

      Sim

      Selecione o vSwitch ao qual pertence o cluster AnalyticDB for MySQL.

      Security group ID

      Sim

      Selecione um grupo de segurança disponível para garantir a comunicação entre o Notebook e o cluster AnalyticDB for MySQL.

      Release resource

      Sim

      Libera o recurso automaticamente após um período de inatividade especificado.

      Dependent Jars

      Não

      Caminho de armazenamento do pacote JAR no OSS. Necessário apenas para jobs Python que utilizam um pacote JAR.

      SparkConf

      Não

      Os itens de configuração são praticamente os mesmos do Spark open source. Os parâmetros seguem o formato key: value. Para mais detalhes sobre parâmetros diferentes do Spark open source e exclusivos do AnalyticDB for MySQL, consulte Parâmetros de configuração de aplicativo Spark.

    3. Clique em Save.

    4. Na coluna Actions do recurso, clique em Enable.

  5. Inicialize os dados.

    1. No canto superior esquerdo do console, clique em seu ícone 2023-01-28_15-57-17.png e escolha All features > Instance Management > Data Assets > Instance Management > Instance Management.

    2. Clique em +New. Na caixa de diálogo Add Instance, configure os seguintes parâmetros:

      Parâmetro

      Descrição

      Data Source

      Na aba Alibaba Cloud, selecione OSS.

      Basic Information

      Files and logs

      Selecione OSS.

      Instance Region

      Selecione a região onde reside o cluster AnalyticDB for MySQL.

      Import Method

      Selecione Connection String.

      Connection String

      Insira oss-cn-hangzhou.aliyuncs.com.

      Bucket

      Selecione o nome do bucket.

      Access Mode

      Modo de acesso. Este exemplo utiliza Security Hosting - Manual.

      AccessKey ID

      AccessKey ID da conta Alibaba Cloud ou de um usuário RAM com permissões para acessar o OSS.

      Para mais informações sobre como obter um AccessKey ID e um AccessKey Secret, consulte Contas e permissões.

      AccessKey Secret

      AccessKey Secret da conta Alibaba Cloud ou de um usuário RAM com permissões para acessar o OSS.

      Para mais informações sobre como obter um AccessKey ID e um AccessKey Secret, consulte Contas e permissões.

      Advanced Information

      Parâmetros opcionais. Para mais informações, consulte Advanced Information.

    3. Após configurar os parâmetros, clique em Test Connection no canto inferior esquerdo.

      Nota

      Se o teste de conectividade falhar, verifique as informações da instância inseridas com base na mensagem de erro.

    4. Quando a mensagem Successful connection aparecer, clique em Submit.

    5. Acesse o workspace e clique em sua aba image.

    6. Na aba Data Lake Data, clique em Add OSS e selecione o bucket adicionado na subetapa b.

  6. Crie um Notebook.

    Na aba Files image, clique em image e selecione Notebook.

  7. Desenvolva um job Spark SQL na página do Notebook.

    Nota

    Para mais informações sobre os botões da página do Notebook, consulte Interface do Notebook.

    1. Execute o seguinte comando para baixar as dependências Python:

      pip install delta
    2. Altere o tipo da célula para SQL e execute a seguinte instrução para criar um banco de dados.

      Nota

      O banco de dados db_delta criado nesta etapa e a tabela externa sample_data criada na próxima etapa serão exibidos automaticamente no AnalyticDB for MySQL. Em seguida, analise a tabela sample_data no console do AnalyticDB for MySQL.

      CREATE DATABASE db_delta 
      LOCATION 'oss://testBucketName/db_delta/';    -- Specify the storage path for data in the db_delta database.
    3. Mude o tipo da célula para Code, execute o código abaixo para criar a tabela externa sample_data e insira dados nela. Essa ação armazena os dados da tabela externa sample_data no caminho do OSS especificado na etapa anterior.

      # -*- coding: utf-8 -*-
      import pyspark
      from delta import *
      from pyspark.sql.types import *
      from pyspark.sql.functions import *
      print("Starting Delta table creation")
      data = [
          ("Robert", "Baratheon", "Baratheon", "Storms End", 48),
          ("Eddard", "Stark", "Stark", "Winterfell", 46),
          ("Jamie", "Lannister", "Lannister", "Casterly Rock", 29),
          ("Robert", "Baratheon", "Baratheon", "Storms End", 48),
          ("Eddard", "Stark", "Stark", "Winterfell", 46),
          ("Jamie", "Lannister", "Lannister", "Casterly Rock", 29),
          ("Robert", "Baratheon", "Baratheon", "Storms End", 48),
          ("Eddard", "Stark", "Stark", "Winterfell", 46),
          ("Jamie", "Lannister", "Lannister", "Casterly Rock", 29)
              ]
      schema = StructType([
          StructField("firstname", StringType(), True),
          StructField("lastname", StringType(), True),
          StructField("house", StringType(), True),
          StructField("location", StringType(), True),
          StructField("age", IntegerType(), True)
      ])
      sample_dataframe = spark.createDataFrame(data=data, schema=schema)
      sample_dataframe.write.format('delta').mode("overwrite").option('mergeSchema','true').saveAsTable("db_delta.sample_data")
    4. Altere o tipo da célula para SQL e execute a seguinte instrução para consultar os dados na tabela sample_data.

      SELECT * FROM db_delta.sample_data;
  8. Para analisar a tabela sample_data com Spark SQL no console do AnalyticDB for MySQL, siga estas etapas.

    1. Acesse o console do AnalyticDB for MySQL. No canto superior esquerdo do console, selecione uma região. No painel de navegação à esquerda, clique em Clusters. Localize o cluster desejado e clique em seu ID.

    2. No painel de navegação à esquerda, escolha Job Development > SQL Development > SQL Development. Selecione o mecanismo Spark e um grupo de recursos Interactive.

    3. Consulte a tabela sample_data.

      SELECT * FROM db_delta.sample_data LIMIT 1000;

Documentação relacionada

Notebook (legado): Saiba mais sobre o recurso Notebook.