Todos os produtos
Search
Central de documentação

Platform For AI:Split

Última atualização: Jun 27, 2026

O componente Split no Machine Learning Designer do Platform for AI (PAI) divide um conjunto de dados em duas tabelas de saída. Use-o para criar conjuntos de treinamento e teste antes do treinamento do modelo.

Escolha o método de divisão com base nos seus dados:

Método

Quando usar

Divisão por proporção

Divisões aleatórias baseadas em proporção — adequado para a maioria dos conjuntos de dados

Divisão por limiar

Divisões ordenadas com base no valor de uma coluna numérica, como dados de séries temporais em que todas as linhas anteriores a uma data de corte devem ir para uma única tabela

Se os parâmetros de proporção e limiar estiverem configurados, o método baseado em limiar terá precedência.

Configure o componente

Método 1: Usar o PAI console

Na página de detalhes do pipeline, localize o componente Split na lista de componentes à esquerda, arraste-o para o canvas e conecte-o a um nó upstream. Clique em o componente para abrir seu painel de configuração.

Divisão por proporção

Configure os seguintes parâmetros na aba Parameters Setting:

Parâmetro

Descrição

Obrigatório

Splitting Method

Selecione Split by Ratio.

Sim

Splitting Fraction

Proporção de dados na Output Table 1 em relação ao conjunto de dados completo. Valores válidos: (0, 1). Por exemplo, defina 0.8 para colocar 80% das linhas na Output Table 1 e 20% na Output Table 2.

Sim

Random Seed

Fixa o estado do gerador aleatório para que a reexecução do pipeline com a mesma seed produza a mesma divisão. Se deixado em branco, o sistema gera uma seed automaticamente.

Não

ID Column (disponível em Advanced Options)

Mantém todas as linhas com o mesmo valor de ID na mesma tabela de saída. Use esta opção quando o conjunto de dados tiver várias linhas por entidade (por exemplo, múltiplas transações por cliente) para evitar que a mesma entidade apareça em ambas as tabelas (vazamento de dados). Apenas uma coluna pode ser selecionada.

Não

Divisão por limiar

Parâmetro

Descrição

Obrigatório

Splitting Method

Selecione Split by Threshold.

Sim

Threshold Column

Coluna numérica usada para a divisão. Colunas STRING não são suportadas.

Sim

Threshold

Linhas com valor da coluna menor que o limiar vão para a Output Table 1. Linhas com valor maior ou igual ao limiar vão para a Output Table 2. Por exemplo, com um limiar de 100: uma linha com valor 80 vai para a Output Table 1; uma linha com valor 100 ou 120 vai para a Output Table 2.

Sim

Parâmetros de ajuste

Parâmetro

Descrição

Cores

Número de núcleos para o trabalho. Alocado automaticamente com base no tamanho dos dados de entrada.

Memory size per core

Memória por núcleo em MB. Alocada automaticamente com base no tamanho dos dados de entrada.

Método 2: Execute comandos PAI

Na página de detalhes do pipeline, arraste o componente SQL Script para o canvas e clique em ele para abrir o painel de configuração. Em Parameters Setting, desmarque a opção Whether the system adds a create table statement, cole o seguinte comando no editor SQL Script e execute-o.

O exemplo abaixo divide a tabela wbpc por proporção, colocando 25% dos dados em wpbc_split1 e os 75% restantes em wpbc_split2:

PAI -name split -project algo_public
    -DinputTableName=wbpc
    -Doutput1TableName=wpbc_split1
    -Doutput2TableName=wpbc_split2
    -Dfraction=0.25;

Para mais informações sobre o componente SQL Script, consulte SQL Script.

Parâmetros de proporção ( fraction , randomSeed , idColName ) e parâmetros de limiar ( thresholdColName , threshold ) não podem ser usados no mesmo comando.

Parâmetros comuns

Parâmetro

Obrigatório

Descrição

Padrão

inputTableName

Sim

Nome da tabela de entrada.

inputTablePartitions

Não

Partições a serem lidas da tabela de entrada. Formatos: partition_name=value para partições de nível único; name1=value1/name2=value2 para partições de vários níveis. Separe múltiplas partições com vírgulas.

Todas as partições

output1TableName

Sim

Nome da Output Table 1.

output1TablePartition

Não

Nome da partição para a Output Table 1.

Não particionado

output2TableName

Sim

Nome da Output Table 2.

output2TablePartition

Não

Nome da partição para a Output Table 2.

Não particionado

lifecycle

Não

Ciclo de vida das tabelas de saída, em dias. Valores válidos: [1, 3650].

coreNum

Não

Número de núcleos. Parâmetro de ajuste; alocado automaticamente com base no tamanho dos dados de entrada.

Auto

memSizePerCore

Não

Memória por núcleo em MB. Parâmetro de ajuste; alocado automaticamente com base no tamanho dos dados de entrada. Valores válidos: (1, 65536).

Auto

Parâmetros de divisão por proporção

Parâmetro

Obrigatório

Descrição

Padrão

fraction

Sim

Proporção de dados na Output Table 1. Valores válidos: (0, 1).

randomSeed

Não

Seed aleatória; deve ser um número inteiro positivo.

Auto

idColName

Não

Nome da coluna de ID. Mantém todas as linhas com o mesmo ID na mesma tabela de saída, evitando vazamento de dados entre os conjuntos de treinamento e teste. Apenas uma coluna pode ser selecionada.

Parâmetros de divisão por limiar

Parâmetro

Obrigatório

Descrição

Padrão

thresholdColName

Sim

Nome da coluna de limiar. Colunas STRING não são suportadas.

threshold

Sim

Limiar de divisão. Linhas com valores menores que o limiar vão para a Output Table 1; linhas com valores maiores ou iguais ao limiar vão para a Output Table 2.