Todos os produtos
Search
Central de documentação

Platform For AI:Gráfico de caixa

Última atualização: Jun 27, 2026

O componente Box Plot no Machine Learning Designer visualiza a distribuição estatística de um conjunto de dados. Use-o para inspecionar a dispersão dos valores em um recurso contínuo e comparar distribuições entre grupos definidos por um recurso categórico.

Limitações

O relatório visual deste componente está disponível apenas no Machine Learning Studio.

Configure o componente

Método 1: Uso do console

Na página de configuração do pipeline no Machine Learning Designer, defina os seguintes parâmetros na guia Field Setting.

Parâmetro

Descrição

Continuous Features

Coluna que contém o recurso contínuo a analisar.

Enumeration Feature

Coluna que contém o recurso categórico. Cada valor exclusivo nesta coluna gera um grupo separado de gráfico de caixa, o que permite comparar distribuições entre categorias.

Stratified Samples

Número de amostras estratificadas adotadas.

Nota: No Machine Learning Studio, selecione apenas um campo para cada parâmetro. No Machine Learning Designer, é possível selecionar vários campos.

Método 2: Uso de comandos PAI

Execute o seguinte comando PAI com o componente SQL Script.

PAI -name box_plot -project algo_public
    -DinputTable="boxplot"
    -DcontinueCols="age"
    -DcategoryCol="y"
    -DoutputTable="pai_temp_6075_97181_1"
    -DsampleSize="1000"
    -Dlifecycle="7";

Parâmetro

Obrigatório

Descrição

Padrão

inputTable

Sim

Nome da tabela de entrada.

N/A

inputTablePartitions

Não

Partição a ler da tabela de entrada. Formatos suportados: partition_name=value para partição única; name1=value1/name2=value2 para partições multinível. Para especificar várias partições, separe-as por vírgulas (,).

N/A

outputTable

Sim

Nome da tabela de saída que armazena o gráfico de caixa e as amostras.

N/A

continueCols

Sim

Coluna que contém o recurso contínuo.

N/A

categoryCol

Sim

Coluna que contém o recurso categórico. Cada valor exclusivo produz um grupo separado de gráfico de caixa.

N/A

sampleSize

Não

Número de pontos de dados amostrados por estrato para renderizar pontos de perturbação.

1000

lifecycle

Não

Ciclo de vida da tabela de saída. Unidade: dias.

28

coreNum

Não

Número de núcleos alocados para computação. Deve ser um número inteiro positivo.

Alocado automaticamente

memSizePerCore

Não

Tamanho de memória por núcleo. Valores válidos: 1–65536. Unidade: MB.

Alocado automaticamente

Exemplo

Dados de entrada

CREATE TABLE boxplot AS SELECT age, y FROM bank_data LIMIT 100;

A tabela de entrada tem duas colunas: age (recurso contínuo) e y (recurso categórico).

age

y

50

0

53

0

28

1

39

0

55

1

Configurações de parâmetros

Defina age como a coluna de recurso contínuo e y como a coluna de recurso categórico. Mantenha os valores padrão para todos os outros parâmetros.

Saída

Para visualizar a saída, clique em com o botão direito em Box Plot e escolha View Data > Output Port.

A tabela de saída contém as seguintes colunas:

Coluna

Descrição

percent_points

Valores percentis calculados.

percent_count

Número de entradas de dados em cada intervalo, dividido por percentil.

sample_list

Amostras selecionadas de cada estrato. A taxa de amostragem segue a fórmula: taxa de amostragem = número de amostras estratificadas / número total de entradas de dados. Se a taxa for muito baixa e o produto do número de amostras em qualquer estrato pela taxa resultar em menos de 10, o sistema recalculará a taxa.

O componente produz duas visualizações:

Box plot chart

Distribution of disturbance points