O componente Split no Machine Learning Designer do Platform for AI (PAI) divide um conjunto de dados em duas tabelas de saída. Use-o para criar conjuntos de treinamento e teste antes do treinamento do modelo.
Escolha o método de divisão com base nos seus dados:
|
Método |
Quando usar |
|
Divisão por proporção |
Divisões aleatórias baseadas em proporção — adequado para a maioria dos conjuntos de dados |
|
Divisão por limiar |
Divisões ordenadas com base no valor de uma coluna numérica, como dados de séries temporais em que todas as linhas anteriores a uma data de corte devem ir para uma única tabela |
Se os parâmetros de proporção e limiar estiverem configurados, o método baseado em limiar terá precedência.
Configure o componente
Método 1: Usar o PAI console
Na página de detalhes do pipeline, localize o componente Split na lista de componentes à esquerda, arraste-o para o canvas e conecte-o a um nó upstream. Clique em o componente para abrir seu painel de configuração.
Divisão por proporção
Configure os seguintes parâmetros na aba Parameters Setting:
|
Parâmetro |
Descrição |
Obrigatório |
|
Splitting Method |
Selecione Split by Ratio. |
Sim |
|
Splitting Fraction |
Proporção de dados na Output Table 1 em relação ao conjunto de dados completo. Valores válidos: (0, 1). Por exemplo, defina |
Sim |
|
Random Seed |
Fixa o estado do gerador aleatório para que a reexecução do pipeline com a mesma seed produza a mesma divisão. Se deixado em branco, o sistema gera uma seed automaticamente. |
Não |
|
ID Column (disponível em Advanced Options) |
Mantém todas as linhas com o mesmo valor de ID na mesma tabela de saída. Use esta opção quando o conjunto de dados tiver várias linhas por entidade (por exemplo, múltiplas transações por cliente) para evitar que a mesma entidade apareça em ambas as tabelas (vazamento de dados). Apenas uma coluna pode ser selecionada. |
Não |
Divisão por limiar
|
Parâmetro |
Descrição |
Obrigatório |
|
Splitting Method |
Selecione Split by Threshold. |
Sim |
|
Threshold Column |
Coluna numérica usada para a divisão. Colunas STRING não são suportadas. |
Sim |
|
Threshold |
Linhas com valor da coluna menor que o limiar vão para a Output Table 1. Linhas com valor maior ou igual ao limiar vão para a Output Table 2. Por exemplo, com um limiar de |
Sim |
Parâmetros de ajuste
|
Parâmetro |
Descrição |
|
Cores |
Número de núcleos para o trabalho. Alocado automaticamente com base no tamanho dos dados de entrada. |
|
Memory size per core |
Memória por núcleo em MB. Alocada automaticamente com base no tamanho dos dados de entrada. |
Método 2: Execute comandos PAI
Na página de detalhes do pipeline, arraste o componente SQL Script para o canvas e clique em ele para abrir o painel de configuração. Em Parameters Setting, desmarque a opção Whether the system adds a create table statement, cole o seguinte comando no editor SQL Script e execute-o.
O exemplo abaixo divide a tabela wbpc por proporção, colocando 25% dos dados em wpbc_split1 e os 75% restantes em wpbc_split2:
PAI -name split -project algo_public
-DinputTableName=wbpc
-Doutput1TableName=wpbc_split1
-Doutput2TableName=wpbc_split2
-Dfraction=0.25;
Para mais informações sobre o componente SQL Script, consulte SQL Script.
Parâmetros de proporção (fraction,randomSeed,idColName) e parâmetros de limiar (thresholdColName,threshold) não podem ser usados no mesmo comando.
Parâmetros comuns
|
Parâmetro |
Obrigatório |
Descrição |
Padrão |
|
|
Sim |
Nome da tabela de entrada. |
— |
|
|
Não |
Partições a serem lidas da tabela de entrada. Formatos: |
Todas as partições |
|
|
Sim |
Nome da Output Table 1. |
— |
|
|
Não |
Nome da partição para a Output Table 1. |
Não particionado |
|
|
Sim |
Nome da Output Table 2. |
— |
|
|
Não |
Nome da partição para a Output Table 2. |
Não particionado |
|
|
Não |
Ciclo de vida das tabelas de saída, em dias. Valores válidos: [1, 3650]. |
— |
|
|
Não |
Número de núcleos. Parâmetro de ajuste; alocado automaticamente com base no tamanho dos dados de entrada. |
Auto |
|
|
Não |
Memória por núcleo em MB. Parâmetro de ajuste; alocado automaticamente com base no tamanho dos dados de entrada. Valores válidos: (1, 65536). |
Auto |
Parâmetros de divisão por proporção
|
Parâmetro |
Obrigatório |
Descrição |
Padrão |
|
|
Sim |
Proporção de dados na Output Table 1. Valores válidos: (0, 1). |
— |
|
|
Não |
Seed aleatória; deve ser um número inteiro positivo. |
Auto |
|
|
Não |
Nome da coluna de ID. Mantém todas as linhas com o mesmo ID na mesma tabela de saída, evitando vazamento de dados entre os conjuntos de treinamento e teste. Apenas uma coluna pode ser selecionada. |
— |
Parâmetros de divisão por limiar
|
Parâmetro |
Obrigatório |
Descrição |
Padrão |
|
|
Sim |
Nome da coluna de limiar. Colunas STRING não são suportadas. |
— |
|
|
Sim |
Limiar de divisão. Linhas com valores menores que o limiar vão para a Output Table 1; linhas com valores maiores ou iguais ao limiar vão para a Output Table 2. |
— |