O Machine Learning Designer usa pipelines para criar modelos. Crie um pipeline, organize componentes no canvas e defina a lógica de processamento. Este tutorial orienta a criação e a implantação de um modelo visual para previsão de doenças cardíacas, desde o preparo dos dados até a implantação.
Pré-requisitos
PAI ativado e workspace criado. Activate and create a default workspace.
Workspace associado a um recurso do MaxCompute. Quick Start - Prerequisites.
Etapa 1: Criar um pipeline
Abra o Machine Learning Designer, selecione um workspace e, no canto superior direito, clique em New Pipeline. Insira um nome para o pipeline e clique em OK.
|
Parâmetro |
Descrição |
|
Workflow name |
Nome personalizado do workflow. |
|
Workflow data storage |
Caminho do bucket do OSS para dados temporários e modelos. Caso não haja configuração, o sistema usa o armazenamento padrão do workspace. Em cada execução, o Designer cria automaticamente uma pasta temporária em |
|
Visibility |
|
Etapa 2: Preparar e pré-processar dados
Prepare e pré-processe os dados de treinamento antes de criar o modelo.
Preparar dados
Adicione componentes Source/Target para ler dados do MaxCompute, do OSS ou de outras fontes. Component Reference: Source/Target. Este exemplo usa Read Table para ler um conjunto de dados público de doenças cardíacas do PAI: Heart Disease Data Set.
-
Selecione um componente Source/Target para ler os dados.
Na lista de componentes à esquerda, clique em Source/Target e arraste Read Table para o canvas. O sistema cria o nó Read Table-1.
-
Configure a tabela de origem.
Selecione Read Table-1 no canvas. No painel de configuração à direita, insira o nome da tabela do MaxCompute em Table Name. Neste exemplo, insira
pai_online_project.heart_disease_prediction. Acesse a aba Fields para visualizar os detalhes dos campos.
Pré-processar dados
O componente de regressão logística binária exige entrada DOUBLE ou BIGINT. Pré-processe o conjunto de dados com conversão de tipo de dado para treinar o modelo.
-
Converta campos não numéricos em tipos numéricos.
Pesquise SQL script e arraste-o para o canvas. O sistema cria o nó SQL script-1.
Conecte Read Table-1 à porta de entrada t1 de SQL script-1.
-
Configure o nó.
Clique em SQL script-1. No painel de configuração, insira o SQL a seguir. A Input source na aba Parameters é t1.
select age, (case sex when 'male' then 1 else 0 end) as sex, (case cp when 'angina' then 0 when 'notang' then 1 else 2 end) as cp, trestbps, chol, (case fbs when 'true' then 1 else 0 end) as fbs, (case restecg when 'norm' then 0 when 'abn' then 1 else 2 end) as restecg, thalach, (case exang when 'true' then 1 else 0 end) as exang, oldpeak, (case slop when 'up' then 0 when 'flat' then 1 else 2 end) as slop, ca, (case thal when 'norm' then 0 when 'fix' then 1 else 2 end) as thal, (case status when 'sick' then 1 else 0 end) as ifHealth from ${t1}; Clique em Save no canto superior esquerdo do canvas.
-
Clique com o botão direito no componente SQL script-1 e selecione Run from Root Node To Here para depurar e executar o pipeline.
Os nós são executados sequencialmente. O ícone
aparece em cada nó após a execução bem-sucedida.NotaTambém é possível clicar em
(Run) no canto superior esquerdo do canvas para executar todo o pipeline. Em pipelines complexos, execute nós individuais para simplificar a depuração. Se a execução falhar, clique com o botão direito no nó com falha e selecione View Log para solucionar o problema. Após a execução, clique com o botão direito no nó de destino, como SQL script-1, e selecione para verificar a saída.
-
Converta todos os campos para o tipo de dado DOUBLE.
Arraste data type conversion para o canvas e conecte-o após SQL script-1. Na aba Set fields, clique em Select fields em Columns to convert to double e selecione todos os campos.
-
Normalize os recursos para o intervalo [0, 1].
Arraste normalization para o canvas e conecte-o após data type conversion-1. Selecione todos os campos na aba Set fields.
-
Divida os dados em conjuntos de treinamento e teste.
Arraste split para o canvas e conecte-o após normalization-1. Este componente gera duas tabelas de saída.
Por padrão, a divisão dos dados ocorre na proporção de 4:1. Ajuste a Splitting ratio na aba Parameters. Split.
Clique com o botão direito em data type conversion-1 e selecione Run from Here para executar os nós restantes.
Etapa 3: Treinar um modelo
A previsão de doenças cardíacas é um problema de classificação binária: cada amostra indica doença ou saúde. Use o componente de regressão logística binária para criar o modelo.
Arraste o componente Binary Logistic Regression para o canvas e conecte-o à porta Output Table 1 do nó split-1.
-
Configure o nó.
Clique em binary logistic regression-1. Na aba Set fields, defina Label column como ifhealth e Feature columns como todas as colunas restantes. Binary Logistic Regression.
NotaPara implantar o modelo na Step 6: Deploy the model (optional), selecione binary logistic regression e marque Generate PMML file na aba Set fields.
Execute o nó.
Etapa 4: Fazer previsões
Arraste prediction para o canvas. Conecte as entradas a binary logistic regression-1 e à porta Output Table 2 de split-1.
Clique em prediction-1. Na aba Set fields, defina Columns to be kept como ifhealth e Feature columns como todas as colunas, exceto ifhealth.
-
Execute o nó de previsão e visualize os resultados.
Clique com o botão direito no nó de previsão e escolha View Data > Output of Prediction Result.
A saída contém: ifhealth (rótulo real, 1,0 ou 0,0), prediction_result (resultado previsto), prediction_score (pontuação de confiança) e prediction_detail (probabilidades por classe em JSON).
Etapa 5: Avaliar o modelo
Arraste binary classification evaluation para o canvas e conecte-o após prediction-1.
Clique em binary classification evaluation-1. Na aba Set fields, defina Original label column como ifhealth.
-
Execute o nó de avaliação.
Clique com o botão direito em binary classification evaluation e selecione Visual Analysis para visualizar as métricas de avaliação.

Etapa 6: Implantar o modelo (opcional)
O Machine Learning Designer integra-se ao Elastic Algorithm Service (EAS). Após treinamento, previsão e avaliação, implante o modelo no EAS como um service online.
Após a execução do pipeline, clique em Model List, selecione um modelo e clique em Deploy to EAS.
-
Confirme a configuração. Deploy a model as an online service.
Model file e Processor type vêm pré-configurados. Ajuste outros parâmetros conforme necessário.
-
Clique em Deploy.
A implantação do service é concluída quando o Service status muda de Creating para Running.
ImportantePara evitar cobranças desnecessárias, clique em Stop em Actions quando o service não for mais necessário.
Documentos relacionados
O Designer fornece modelos de pipeline para criação de modelos. Template pipelines.
Agende pipelines offline com o DataWorks para atualizar modelos periodicamente. Use DataWorks to schedule Designer offline pipelines.
Configure variáveis globais para tornar os pipelines mais flexíveis e eficientes em services online e jobs agendados pelo DataWorks. Global variables.