O componente Binary Classification Evaluation mede o desempenho de modelos de classificação binária. Ele calcula AUC (área sob a curva ROC), KS (Kolmogorov-Smirnov) e F1 score, além de gerar gráficos para análise visual. Use este componente após treinar um classificador binário no PAI Designer para avaliar a eficácia do modelo na separação entre classes positivas e negativas.
Saídas
Métricas
|
Métrica |
O que mede |
|
AUC (área sob a curva ROC) |
Separabilidade geral entre classes positivas e negativas em todos os limiares de decisão. Um valor maior indica que o modelo classifica amostras positivas acima das negativas com mais confiabilidade. Os valores variam de 0 a 1; 0,5 indica ausência de discriminação. |
|
KS (Kolmogorov-Smirnov) |
Separação máxima entre as distribuições acumuladas das amostras positivas e negativas. Valores mais altos indicam distinção mais forte entre as classes. Amplamente usado em scoring de crédito e modelagem de risco. |
|
F1 score |
Média harmônica entre precisão e recall. Recomendado para equilibrar falsos positivos e falsos negativos, especialmente em conjuntos de dados desbalanceados. |
Gráficos
|
Gráfico |
O que exibe |
|
Curva KS |
Diferença na distribuição acumulada entre amostras positivas e negativas em cada limiar de decisão. |
|
Curva Precisão-Recall (PR) |
Relação entre precisão e recall nos diferentes limiares. Útil quando as amostras positivas são raras. |
|
Curva ROC (Receiver Operating Characteristic) |
Taxa de verdadeiros positivos versus taxa de falsos positivos ao longo dos limiares. A área sob esta curva corresponde à métrica AUC. |
|
Gráfico de Lift |
Desempenho do modelo em comparação com uma seleção aleatória, considerando uma fração específica da população. Por exemplo, um lift de 3 nos primeiros 10% significa que o modelo encontra três vezes mais positivos nesse grupo do que uma amostragem aleatória. |
|
Gráfico de Ganho |
Percentual acumulado de amostras positivas capturadas conforme aumenta a fração da população-alvo. Útil para tarefas de seleção baseadas em ranking, como campanhas de marketing. |
Configure o componente
Método 1: Usar a GUI
Na página de workflow do Designer, adicione o componente Binary Classification Evaluation e configure seus parâmetros no painel direito.
|
Parâmetro |
Descrição |
|
Label column name |
Nome da coluna alvo. |
|
Score column name |
Coluna do score de previsão. Geralmente é a coluna |
|
Positive sample label value |
Valor do rótulo que identifica as amostras positivas. |
|
Number of bins for equal frequency binning |
Quantidade de intervalos para particionamento por frequência igual. |
|
Group column name |
Coluna de ID do grupo. As métricas de avaliação são calculadas separadamente para cada grupo. Use em cenários de avaliação por grupos. |
|
Advanced options |
Marque esta caixa de seleção para exibir os parâmetros Prediction detail column, Are prediction and evaluation targets consistent e Save performance metrics. |
|
Prediction detail column |
Nome da coluna que contém os detalhes da previsão. |
|
Are prediction and evaluation targets consistent |
Defina se o modelo prevê a mesma classe avaliada pela métrica. Consulte Consistência entre alvos de previsão e avaliação. |
|
Save performance metrics |
Defina se as métricas de desempenho devem ser salvas em uma tabela de saída. |
Consistência entre alvos de previsão e avaliação
Esta configuração controla o cálculo de métricas baseadas em ranking, como Lift, quando a classe prevista pelo modelo difere daquela avaliada pela métrica.
|
Cenário |
Previsão do modelo |
Avaliação da métrica |
Consistente? |
|
Finanças (scoring de risco) |
Probabilidade de o cliente ser "mau pagador" — score maior indica maior probabilidade de inadimplência |
Taxa de detecção de maus pagadores |
Sim |
|
Scoring de crédito |
Probabilidade de o cliente ser "bom pagador" — score maior indica maior probabilidade de adimplência |
Taxa de detecção de maus pagadores |
Não |
Método 2: Usar comandos PAI
Invoque o componente por meio do componente SQL Script usando a sintaxe de comando PAI abaixo. Para mais informações sobre como chamar comandos PAI, consulte SQL Script.
PAI -name=evaluate -project=algo_public
-DoutputMetricTableName=output_metric_table
-DoutputDetailTableName=output_detail_table
-DinputTableName=input_data_table
-DlabelColName=label
-DscoreColName=score
|
Parâmetro |
Obrigatório |
Padrão |
Descrição |
|
|
Sim |
— |
Nome da tabela de entrada. |
|
|
Não |
Tabela completa |
Partições da tabela de entrada. |
|
|
Sim |
— |
Nome da coluna alvo. |
|
|
Sim |
— |
Nome da coluna de score. |
|
|
Não |
— |
Nome da coluna de grupo. Use para cenários de avaliação por grupos. |
|
|
Não |
1000 |
Número de intervalos de frequência igual para calcular métricas como KS e PR. |
|
|
Sim |
— |
Tabela de saída para métricas, incluindo AUC, KS e F1 score. |
|
|
Não |
— |
Tabela de dados detalhados usada para gerar os gráficos. |
|
|
Não |
1 |
Valor do rótulo para amostras positivas. |
|
|
Não |
— |
Ciclo de vida da tabela de saída. |
|
|
Não |
Calculado automaticamente |
Número de núcleos. |
|
|
Não |
Calculado automaticamente |
Tamanho de memória por núcleo. |