O componente Box Plot no Machine Learning Designer visualiza a distribuição estatística de um conjunto de dados. Use-o para inspecionar a dispersão dos valores em um recurso contínuo e comparar distribuições entre grupos definidos por um recurso categórico.
Limitações
O relatório visual deste componente está disponível apenas no Machine Learning Studio.
Configure o componente
Método 1: Uso do console
Na página de configuração do pipeline no Machine Learning Designer, defina os seguintes parâmetros na guia Field Setting.
|
Parâmetro |
Descrição |
|
Continuous Features |
Coluna que contém o recurso contínuo a analisar. |
|
Enumeration Feature |
Coluna que contém o recurso categórico. Cada valor exclusivo nesta coluna gera um grupo separado de gráfico de caixa, o que permite comparar distribuições entre categorias. |
|
Stratified Samples |
Número de amostras estratificadas adotadas. |
Nota: No Machine Learning Studio, selecione apenas um campo para cada parâmetro. No Machine Learning Designer, é possível selecionar vários campos.
Método 2: Uso de comandos PAI
Execute o seguinte comando PAI com o componente SQL Script.
PAI -name box_plot -project algo_public
-DinputTable="boxplot"
-DcontinueCols="age"
-DcategoryCol="y"
-DoutputTable="pai_temp_6075_97181_1"
-DsampleSize="1000"
-Dlifecycle="7";
|
Parâmetro |
Obrigatório |
Descrição |
Padrão |
|
|
Sim |
Nome da tabela de entrada. |
N/A |
|
|
Não |
Partição a ler da tabela de entrada. Formatos suportados: |
N/A |
|
|
Sim |
Nome da tabela de saída que armazena o gráfico de caixa e as amostras. |
N/A |
|
|
Sim |
Coluna que contém o recurso contínuo. |
N/A |
|
|
Sim |
Coluna que contém o recurso categórico. Cada valor exclusivo produz um grupo separado de gráfico de caixa. |
N/A |
|
|
Não |
Número de pontos de dados amostrados por estrato para renderizar pontos de perturbação. |
1000 |
|
|
Não |
Ciclo de vida da tabela de saída. Unidade: dias. |
28 |
|
|
Não |
Número de núcleos alocados para computação. Deve ser um número inteiro positivo. |
Alocado automaticamente |
|
|
Não |
Tamanho de memória por núcleo. Valores válidos: 1–65536. Unidade: MB. |
Alocado automaticamente |
Exemplo
Dados de entrada
CREATE TABLE boxplot AS SELECT age, y FROM bank_data LIMIT 100;
A tabela de entrada tem duas colunas: age (recurso contínuo) e y (recurso categórico).
|
age |
y |
|
50 |
0 |
|
53 |
0 |
|
28 |
1 |
|
39 |
0 |
|
55 |
1 |
Configurações de parâmetros
Defina age como a coluna de recurso contínuo e y como a coluna de recurso categórico. Mantenha os valores padrão para todos os outros parâmetros.
Saída
Para visualizar a saída, clique em com o botão direito em Box Plot e escolha View Data > Output Port.
A tabela de saída contém as seguintes colunas:
|
Coluna |
Descrição |
|
|
Valores percentis calculados. |
|
|
Número de entradas de dados em cada intervalo, dividido por percentil. |
|
|
Amostras selecionadas de cada estrato. A taxa de amostragem segue a fórmula: taxa de amostragem = número de amostras estratificadas / número total de entradas de dados. Se a taxa for muito baixa e o produto do número de amostras em qualquer estrato pela taxa resultar em menos de 10, o sistema recalculará a taxa. |
O componente produz duas visualizações:

