このドキュメントでは、Designer のカイ二乗適合度検定コンポーネントについて説明します。このコンポーネントは、カテゴリ変数の観測度数が期待度数と一致するかどうかを検定します。帰無仮説は、観測度数と期待度数の間に有意差がないというものです。
コンポーネントの設定
コンポーネントは、次のいずれかの方法で設定できます。
方法 1:UI の使用
Designer のパイプラインページでコンポーネントのパラメーターを設定します。
|
パラメーター |
説明 |
|
入力列 |
検定対象の列。 |
|
クラス確率 |
クラス確率を指定します。フォーマットは |
方法 2:PAI コマンドの使用
PAI コマンドを使用してコンポーネントのパラメーターを設定します。PAI コマンドは、SQL スクリプトコンポーネントを使用して実行できます。詳細については、「SQL スクリプト」をご参照ください。
PAI -name chisq_test
-project algo_public
-DinputTableName=pai_chisq_test_input
-DcolName=f0
-DprobConfig=0:0.3,1:0.7
-DoutputTableName=pai_chisq_test_output0
-DoutputDetailTableName=pai_chisq_test_output0_detail
|
パラメーター |
必須 |
説明 |
デフォルト値 |
|
inputTableName |
はい |
入力テーブルの名前。 |
なし |
|
colName |
はい |
分析対象の列。 |
なし |
|
outputTableName |
はい |
出力テーブルの名前。 |
なし |
|
outputDetailTableName |
はい |
出力詳細テーブルの名前。 |
なし |
|
inputTablePartitions |
いいえ |
検定対象の入力テーブルパーティション。次のフォーマットがサポートされています:
説明
複数のパーティションはコンマ (,) で区切ります。 |
空 |
|
probConfig |
いいえ |
クラス確率を指定します。フォーマットは |
省略した場合、すべてのクラスが等しい確率を持つと見なされます。 |
例
-
テストデータ
create table pai_chisq_test_input as select * from ( select '1' as f0,'2' as f1 union all select '1' as f0,'3' as f1 union all select '1' as f0,'4' as f1 union all select '0' as f0,'3' as f1 union all select '0' as f0,'4' as f1 )tmp; -
PAI コマンド
PAI -name chisq_test -project algo_public -DinputTableName=pai_chisq_test_input -DcolName=f0 -DprobConfig=0:0.3,1:0.7 -DoutputTableName=pai_chisq_test_output0 -DoutputDetailTableName=pai_chisq_test_output0_detail -
出力
-
outputTableNameテーブルは、JSON フォーマットの単一行、単一列のテーブルです。{ "Chi-Square": { "comment": "ピアソンのカイ二乗検定", "df": 1, "p-value": 0.75, "value": 0.2380952380952381 } } -
outputDetailTableNameテーブルには、次のフィールドが含まれます。列名
説明
colNameで指定された列。クラス
observed
観測度数
expected
期待度数
residuals
標準化残差
(residuals = (observed - expected) / sqrt(expected)) -
出力例
f0 observed expected residuals 0 2.0 1.5 0.408248290463863 1 3.0 3.5 -0.267261241912424
-