Executa inferência offline em modelos do componente XGBoost Train. Compatível com classificação e regressão usando entrada nos formatos Table ou LibSVM.
Limites
Mecanismos de computação compatíveis: MaxCompute, Flink e DLC.
Formatos de dados
Formatos compatíveis: Table e LibSVM.
-
Exemplo do formato Table:
f0
f1
label
0,1
1
0
0,9
2
1
-
Exemplo do formato LibSVM:
Sample data
2:1 9:1 10:1 20:1 29:1 33:1 35:1 39:1 40:1 52:1 57:1 64:1 68:1 76:1 85:1 87:1 91:1 94:1 101:1 104:1 116:1 123:1
0:1 9:1 18:1 20:1 23:1 33:1 35:1 38:1 41:1 52:1 55:1 64:1 68:1 76:1 85:1 87:1 91:1 94:1 101:1 105:1 115:1 121:1
2:1 8:1 18:1 20:1 29:1 33:1 35:1 39:1 41:1 52:1 57:1 64:1 68:1 76:1 85:1 87:1 91:1 94:1 101:1 104:1 116:1 123:1
2:1 9:1 13:1 21:1 28:1 33:1 36:1 38:1 40:1 53:1 57:1 64:1 68:1 76:1 85:1 87:1 91:1 94:1 97:1 105:1 113:1 119:1
0:1 9:1 18:1 20:1 22:1 33:1 35:1 38:1 44:1 52:1 55:1 64:1 68:1 76:1 85:1 87:1 91:1 94:1 101:1 104:1 115:1 121:1
0:1 8:1 18:1 20:1 23:1 33:1 35:1 38:1 41:1 52:1 55:1 64:1 68:1 76:1 85:1 87:1 91:1 94:1 101:1 105:1 116:1 121:1
Configuração pela GUI
Configure o componente XGBoost Predict na tela do Designer.
Parâmetro | Tipo | Descrição | |
Fields Setting | Reserved Column Name | String array | Colunas a preservar na saída. |
Feature Columns | String array | Colunas de recursos para dados no formato Table. Exclusivo com Vector Field (formato LibSVM). | |
Vector Field Name | String | Coluna com dados no formato LibSVM. Exclusivo com Feature Columns (formato Table). | |
Parameters Setting | Prediction Result Column | String | Nome da coluna de saída dos resultados da previsão. |
Execution Tuning | Number of Workers | Positive integer | Número de workers paralelos. Defina este valor junto com Memory per Worker. Valores válidos: [1, 9999]. |
Memory per Worker | Positive integer | Memória alocada por worker em MB. Valores válidos: [1024, 64 × 1024]. | |
Exemplo de uso
Este exemplo demonstra a classificação XGBoost em dados de eventos de bóson de Higgs com um modelo predefinido. Para criar esse pipeline a partir do modelo Use XGBoost algorithm to identify the Higgs boson, consulte Create a pipeline from a preset template.
Conversão do formato de saída para avaliação
O componente gera strings JSON serializadas da biblioteca open-source XGBoost. Converta essa saída para que os componentes de avaliação processem as previsões.
Adicione um componente SQL Script após o XGboost Predict. O SQL Script converte as previsões para o formato exigido pelo Binary classification Evaluation V2. Use o código a seguir:
set odps.sql.udf.getjsonobj.new=true;
select *, CONCAT("{\"0\":", 1.0-prob, ",\"1\":", prob, "}") as detail
FROM (
select *, cast(get_json_object(pred, '$[0]') as double) as prob FROM ${t1})
Referências
O XGBoost Predict requer um modelo treinado pelo componente XGBoost Train. Para detalhes de configuração, consulte XGBoost Train.
O Designer oferece componentes de algoritmo para tarefas de processamento de dados. Para obter a lista completa, consulte Overview of Designer components.