データサイエンスパイロット アクションセット: 構文
自動機械学習パイプラインの探索、実行、順位付けなど、データサイエンスワークフローを自動化するアクションを提供します。
dsAutoMl アクション
自動機械学習パイプラインの探索、実行、順位付け。。
要約: 入力テーブルと出力テーブル
行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。
|
パラメーター |
サブパラメーター |
説明 |
|---|---|---|
|
required parametertable |
— |
テーブル名、caslib、他の共通パラメーターを指定します。 |
|
パラメーター |
サブパラメーター |
説明 |
|---|---|---|
|
required parameterfeatureOut |
— |
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。 |
|
required parameterpipelineOut |
— |
分析結果を格納する CAS テーブルを指定します。 |
|
— |
分析結果を格納する CAS テーブルを指定します。 | |
|
required parametertransformationOut |
— |
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。 |
パラメーターの説明
distinctCountLimit=integer
重複しない値のカウント制限を指定します。この制限を超えて misraGries パラメーターを True に設定すると、Misra-Gries frequency sketch アルゴリズムを使用して頻度分布が推定されます。それ以外の場合、重複しない値のカウント操作は中止されます。
| 別名 | maxNVals |
|---|---|
| デフォルト | 10000 |
| 最小値 | 256 |
ecdfTolerance=double
経験累積分布関数のトレランスを指定します。この値は Quantile sketch アルゴリズムによって使用されます。
| デフォルト | 0.001 |
|---|---|
| 範囲 | 1E-06–0.1 |
event="string"
モデル化したいターゲット変数の水準を指定します。複数水準の分類問題は、1対多の二項分類問題にキャストされます。event パラメーターの値はモデル化している水準を示します。
explorationPolicy={avaptPolicy}
自動変数分析とグループ化 (AVAPT) ポリシーを指定します。
| 別名 | avaptPolicy |
|---|
avaptPolicy の値は次のいずれかになります:
cardinality={cardinalityAvaptPolicy}
自動変数分析とグループ化 (AVAPT) カーディナリティポリシーを指定します。
cardinalityAvaptPolicy の値は次のいずれかになります:
lowMediumCutoff=double
低-中カットオフのカーディナリティのしきい値を指定します。
| デフォルト | 32 |
|---|---|
| 範囲 | 2–256 |
mediumHighCutoff=double
中-高カットオフのカーディナリティのしきい値を指定します。
| デフォルト | 64 |
|---|---|
| 範囲 | 2–1024 |
minNObsPerTargetLevel=double
各ターゲット水準の最小オブザベーション数を指定します。
| デフォルト | 10 |
|---|---|
| 範囲 | 5–100 |
cv={cvAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 変動係数ポリシーを指定します。
| 別名 | coefficientVariation |
|---|
cvAvaptPolicy の値は次のいずれかになります:
lowMoment=double
モーメント変動係数 (CV) の低-高割合しきい値の絶対値を指定します。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
lowRobust=double
ロバスト変動係数 (CV) の低-高割合しきい値の絶対値を指定します。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
dateTimeVariables={"variable-name-1" <, "variable-name-2", ...>}
日時変数を指定します。
| 別名 | dateTime |
|---|
dateVariables={"variable-name-1" <, "variable-name-2", ...>}
日付変数を指定します。
| 別名 | date |
|---|
entropy={entropyAvaptPolicy}
自動変数分析とグループ化 (AVAPT) エントロピーポリシーを指定します。
entropyAvaptPolicy の値は次のいずれかになります:
giniLowMediumCutoff=double
低-中カットオフの Gini エントロピーのしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | 0–1 |
giniMediumHighCutoff=double
中-高カットオフの Gini エントロピーのしきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–1 |
shannonLowMediumCutoff=double
低-中カットオフの Shannon エントロピーのしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | 0–1 |
shannonMediumHighCutoff=double
中-高カットオフの Shannon エントロピーのしきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–1 |
iqv={iqvAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 質的変動のインデックスポリシーを指定します。
| 別名 | qualitativeVariationIndex |
|---|
iqvAvaptPolicy の値は次のいずれかになります:
highTopBottom=double
名義変数の最も頻度の高い水準と最も頻度の低い水準の間の低-高カットオフ周波数比のしきい値を指定します。
| 別名 | highTop1Bottom1 |
|---|---|
| デフォルト | 100 |
| 最小値 | 1 |
highTopTwo=double
名義変数の最も頻度の高い水準と2番目に頻度の高い水準の間の低-高カットオフ周波数比のしきい値を指定します。
| 別名 | highTop1Top2 |
|---|---|
| デフォルト | 10 |
| 最小値 | 1 |
highVariationRatio=double
低-高カットオフの変動率のしきい値を指定します。
| 別名 | highModVr |
|---|---|
| デフォルト | 0.5 |
| 範囲 | (0–1] |
kurtosis={kurtosisAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 尖度ポリシーを指定します。
kurtosisAvaptPolicy の値は次のいずれかになります:
momentLowMediumCutoff=double
低-中カットオフのモーメント尖度しきい値の絶対値を指定します。
| デフォルト | 5 |
|---|---|
| 最小値 | 0 |
momentMediumHighCutoff=double
中-高カットオフのモーメント尖度しきい値の絶対値を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 0 |
robustLowMediumCutoff=double
低-中カットオフのロバスト尖度しきい値の絶対値を指定します。
| デフォルト | 2 |
|---|---|
| 最小値 | 0 |
robustMediumHighCutoff=double
中-高カットオフのロバスト尖度しきい値の絶対値を指定します。
| デフォルト | 3 |
|---|---|
| 最小値 | 0 |
missing={missingAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 欠損値グループ化ポリシーを指定します。
missingAvaptPolicy の値は次のいずれかになります:
lowMediumCutoff=double
低-中カットオフの欠損値割合のしきい値を指定します。
| デフォルト | 5 |
|---|---|
| 範囲 | 0–100 |
mediumHighCutoff=double
中-高カットオフの欠損値割合のしきい値を指定します。
| デフォルト | 25 |
|---|---|
| 範囲 | 0–100 |
nominal={nominalAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 名義ポリシーを指定します。
nominalAvaptPolicy の値は次のいずれかになります:
cardinalityRatio=double
AVAPT 名義ポリシーカーディナリティ比のしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | (0–1] |
cardinalityThreshold=double
AVAPT 名義ポリシーカーディナリティのしきい値を指定します。
| デフォルト | 1024 |
|---|---|
| 最小値 | 32 |
includeNegative=TRUE | FALSE
True に設定すると、名義分析で負の値を持つ数値変数が含まれます。
| デフォルト | FALSE |
|---|
includeNonIntegral=TRUE | FALSE
True に設定すると、名義分析で非整数値を持つ数値変数が含まれます。
| デフォルト | FALSE |
|---|
intervals={"variable-name-1" <, "variable-name-2", ...>}
間隔として考慮する変数を指定します。
nominals={"variable-name-1" <, "variable-name-2", ...>}
名義として考慮する変数を指定します。
outlier={outlierAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 外れ値ポリシーを指定します。
outlierAvaptPolicy の値は次のいずれかになります:
momentLowMediumCutoff=double
低-中カットオフの z スコア外れ値割合のしきい値を指定します。
| デフォルト | 1 |
|---|---|
| 範囲 | 0–100 |
momentMediumHighCutoff=double
中-高カットオフの z スコア外れ値割合のしきい値を指定します。
| デフォルト | 2.5 |
|---|---|
| 範囲 | 0–100 |
robustLowMediumCutoff=double
低-中カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。
| デフォルト | 1 |
|---|---|
| 範囲 | 0–100 |
robustMediumHighCutoff=double
中-高カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。
| デフォルト | 2.5 |
|---|---|
| 範囲 | 0–100 |
skewness={skewnessAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 歪度ポリシーを指定します。
skewnessAvaptPolicy の値は次のいずれかになります:
momentLowMediumCutoff=double
低-中カットオフのモーメント歪度のしきい値を指定します。
| デフォルト | 2 |
|---|---|
| 範囲 | 0–100 |
momentMediumHighCutoff=double
中-高カットオフのモーメント歪度のしきい値を指定します。
| デフォルト | 10 |
|---|---|
| 範囲 | 0–100 |
robustLowMediumCutoff=double
低-中カットオフのロバスト歪度しきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–3 |
robustMediumHighCutoff=double
中-高カットオフのロバスト歪度しきい値を指定します。
| デフォルト | 2 |
|---|---|
| 範囲 | 0–3 |
timeVariables={"variable-name-1" <, "variable-name-2", ...>}
時間変数を指定します。
| 別名 | time |
|---|
* featureOut={casouttable}
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。
| 別名 | featuresOut |
|---|
| 長い形式 | featureOut={name="table-name"} |
|---|---|
| 短い形式 | featureOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL"
ハイパーパラメーターの最適化に使用する方法を指定します。
| 別名 | hpOptimizer |
|---|---|
| デフォルト | TUNEALL |
inputs={{casinvardesc-1} <, {casinvardesc-2}, ...>}
分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。
inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。
| 別名 | vars |
|---|
kFolds=integer
交差検証の分割数を指定します。
| デフォルト | 5 |
|---|---|
| 範囲 | 2–10 |
logLevel=integer
ログ記録レベルを指定します。
| デフォルト | 0 |
|---|---|
| 範囲 | 0–3 |
misraGries=TRUE | FALSE
True に設定すると、重複しない値のカウント制限を超えた場合に、頻度分布の推定に Misra-Gries アルゴリズムが使用されます。
| デフォルト | TRUE |
|---|
modelTypes={"DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"}
objective="ASE" | "AUC" | "F1" | "MAE" | "MCE" | "MSLE" | "RASE" | "RMAE" | "RMSLE"
* pipelineOut={casouttable}
分析結果を格納する CAS テーブルを指定します。
| 別名 | pipelinesOut |
|---|
| 長い形式 | pipelineOut={name="table-name"} |
|---|---|
| 短い形式 | pipelineOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
sampleSize=integer
標本抽出するパイプラインの最大数を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 1 |
saveState={casouttable} | {savePipelinesOptions}
分析結果を格納する CAS テーブルを指定します。
| 別名 | saveModel |
|---|
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
compress=TRUE | FALSE
True に設定すると、テーブルにデータ圧縮が適用されます。
| デフォルト | FALSE |
|---|
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
label="string"
テーブルに関連付ける説明ラベルを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
maxMemSize=64-bit-integer
メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
|---|
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
replication=integer
フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"
threadBlockSize=64-bit-integer
出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。
| 別名 | blockSize |
|---|---|
| デフォルト | 1048576 |
| 最小値 | 0 |
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
timeStamp="string"
タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。
where={"string-1" <, "string-2", ...>}
出力データをサブセット化する 1 つ以上の式を指定します。複数の式が指定された場合、式は AND を使用して効果的に結合され、最終的な出力フィルタが形成されます。式に引用符で囲まれた値が含まれている場合は、ネストした引用符を使用します。
savePipelinesOptions の値は次のいずれかになります:
modelNamePrefix="string"
保存されたモデルの名前に使用する接頭辞を指定します。
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のモデルが上書きされます。
| デフォルト | TRUE |
|---|
topK=integer
保存する最適なモデルの数を指定します。
| デフォルト | 5 |
|---|---|
| 最小値 | 1 |
screenPolicy={sweeperPolicy}
変数の選別、変換、またはコピーを推奨するために使用する変数スクリーニングポリシーを指定します。
| 別名 | sweeperPolicy |
|---|
sweeperPolicy の値は次のいずれかになります:
constant=TRUE | FALSE
True に設定すると、定数値を持つ変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | unique |
|---|---|
| デフォルト | TRUE |
groupRareLevels=TRUE | FALSE
True に設定すると、まれな水準を持つ名義変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | groupRare |
|---|---|
| デフォルト | TRUE |
leakagePercentThreshold=double
ターゲットに関する非常に高い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。指定したしきい値よりも大きいターゲットエントロピー率の低下を持つ変数は、漏えい変数としてフラグが付けられます。
| 別名 | leakagePercentageThreshold |
|---|---|
| デフォルト | 90 |
| 範囲 | (0–100] |
lowCv=TRUE | FALSE
True に設定すると、低い変動係数 (CV) を持つ変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | lowCoefficientVariation |
|---|---|
| デフォルト | TRUE |
lowMutualInformation=double
ターゲットに関する低い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。
| 別名 | lowInformation |
|---|---|
| デフォルト | 0.05 |
| 最小値 | 0 |
missingIndicatorPercent=double
欠損値インジケーター変数を生成する変数スクリーニングポリシーを指定します。
| 別名 | missingIndicatorPercentage |
|---|---|
| デフォルト | 75 |
| 範囲 | [10–100) |
missingPercentThreshold=double
非常に高い欠損率を持つ変数を識別するための変数スクリーニングポリシーを指定します。
| 別名 | missingPercentageThreshold |
|---|---|
| デフォルト | 90 |
| 範囲 | [10–100) |
redundant=double
冗長な変数を識別するための対称不確実性 (SU) のしきい値を指定します。2 つの変数の SU がしきい値を超えた場合、ターゲットに関する情報が少ない変数には冗長としてフラグが付けられます。
| デフォルト | 1 |
|---|---|
| 範囲 | (0–1] |
seed=integer
乱数生成のシード値を指定します。いくつかのシナリオでは、この値は繰り返し可能な乱数生成に使用されます。
| デフォルト | 0 |
|---|
selectionPolicy={featureSelectOptions}
特徴量の選択ポリシーを指定します。
| 長い形式 | selectionPolicy={criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"} |
|---|---|
| 短い形式 | selectionPolicy="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU" |
featureSelectOptions の値は次のいずれかになります:
criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"
topK=integer
最も高いフィルター選択基準値を持つ特徴量の数が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。
| デフォルト | 50 |
|---|---|
| 最小値 | 1 |
topKPercent=double
最も高いフィルター選択基準値を持つ特徴量の割合が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。
| 別名 | topKPercentage |
|---|---|
| 範囲 | (0–100] |
* table={castable}
テーブル名、caslib、他の共通パラメーターを指定します。
| 長い形式 | table={name="table-name"} |
|---|---|
| 短い形式 | table="table-name" |
castable の値は次のいずれかになります:
caslib="string"
アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。
computedOnDemand=TRUE | FALSE
True に設定すると、アクションの開始時ではなくテーブルのロード時に計算変数が作成されます。
| 別名 | compOnDemand |
|---|---|
| デフォルト | FALSE |
computedVars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
作成する計算変数の名前を指定します。computedVarsProgram パラメーターの各変数の式を指定します。このパラメーターを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。
| 別名 | compVars |
|---|
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
computedVarsProgram="string"
computedVars パラメーターに含める各計算変数の式を指定します。
| 別名 | compPgm |
|---|
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。
* name="table-name"
入力テーブルの名前を指定します。
singlePass=TRUE | FALSE
True に設定すると、サーバー上に一時テーブルは作成されません。このパラメーターを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。
| デフォルト | FALSE |
|---|
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
アクションで使用する変数を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
入力データをサブセット化する式を指定します。
whereTable={groupbytable}
WHERE フィルターとして使用する行を含む入力テーブルを指定します。vars パラメーターが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメーターとこのパラメーターが指定されている場合、このフィルタリングテーブルが最初に適用されます。
groupbytable の値は次のいずれかになります:
casLib="string"
フィルターテーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
dataSourceOptions パラメーターの指定の詳細については、共通 dataSourceOptions パラメーターを参照してください。
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。
* name="table-name"
フィルターテーブルの名前を指定します。
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
フィルターテーブルから使用する変数名を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
フィルターテーブルからデータをサブセット化する式を指定します。
* target="variable-name"
ターゲット変数を指定します。
| 別名 | evalVar |
|---|
topKPipelines=integer
保存する最適なパイプラインの数を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 1 |
* transformationOut={casouttable}
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。
| 別名 | transformationsOut |
|---|
| 長い形式 | transformationOut={name="table-name"} |
|---|---|
| 短い形式 | transformationOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
transformationPolicy={transformationSpace}
特徴量マシンが動作する特徴量変換と生成空間を指定します。
| 別名 | transformationSpace |
|---|
transformationSpace の値は次のいずれかになります:
cardinality=TRUE | FALSE
True に設定すると、カーディナリティ低減変換が含まれます。
| デフォルト | TRUE |
|---|
entropy=TRUE | FALSE
True に設定すると、低エントロピーの処置のための変換が含まれます。
| デフォルト | FALSE |
|---|
interaction=TRUE | FALSE
True に設定すると、交互作用特徴量が検出され、生成されます。
| デフォルト | FALSE |
|---|
iqv=TRUE | FALSE
True に設定すると、低い質的変動の指数 (IQV) の処置のための変換が含まれます。
| デフォルト | FALSE |
|---|
kurtosis=TRUE | FALSE
True に設定すると、高い尖度の処置のための変換が含まれます。
| デフォルト | FALSE |
|---|
missing=TRUE | FALSE
True に設定すると、欠損値の処置のための変換が含まれます。
| デフォルト | TRUE |
|---|
outlier=TRUE | FALSE
True に設定すると、外れ値の処置のための変換が含まれます。
| デフォルト | FALSE |
|---|
skewness=TRUE | FALSE
True に設定すると、高い歪度の処置のための変換が含まれます。
| デフォルト | TRUE |
|---|
validationPartitionFraction=double
検証に使用する入力データの割合を指定します。
| デフォルト | 0.3 |
|---|---|
| 範囲 | 0.01–0.99 |
dsAutoMl アクション
自動機械学習パイプラインの探索、実行、順位付け。。
要約: 入力テーブルと出力テーブル
行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。
|
パラメーター |
サブパラメーター |
説明 |
|---|---|---|
|
required parametertable |
— |
テーブル名、caslib、他の共通パラメーターを指定します。 |
|
パラメーター |
サブパラメーター |
説明 |
|---|---|---|
|
required parameterfeatureOut |
— |
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。 |
|
required parameterpipelineOut |
— |
分析結果を格納する CAS テーブルを指定します。 |
|
— |
分析結果を格納する CAS テーブルを指定します。 | |
|
required parametertransformationOut |
— |
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。 |
パラメーターの説明
distinctCountLimit=integer
重複しない値のカウント制限を指定します。この制限を超えて misraGries パラメーターを True に設定すると、Misra-Gries frequency sketch アルゴリズムを使用して頻度分布が推定されます。それ以外の場合、重複しない値のカウント操作は中止されます。
| 別名 | maxNVals |
|---|---|
| デフォルト | 10000 |
| 最小値 | 256 |
ecdfTolerance=double
経験累積分布関数のトレランスを指定します。この値は Quantile sketch アルゴリズムによって使用されます。
| デフォルト | 0.001 |
|---|---|
| 範囲 | 1E-06–0.1 |
event="string"
モデル化したいターゲット変数の水準を指定します。複数水準の分類問題は、1対多の二項分類問題にキャストされます。event パラメーターの値はモデル化している水準を示します。
explorationPolicy={avaptPolicy}
自動変数分析とグループ化 (AVAPT) ポリシーを指定します。
| 別名 | avaptPolicy |
|---|
avaptPolicy の値は次のいずれかになります:
cardinality={cardinalityAvaptPolicy}
自動変数分析とグループ化 (AVAPT) カーディナリティポリシーを指定します。
cardinalityAvaptPolicy の値は次のいずれかになります:
lowMediumCutoff=double
低-中カットオフのカーディナリティのしきい値を指定します。
| デフォルト | 32 |
|---|---|
| 範囲 | 2–256 |
mediumHighCutoff=double
中-高カットオフのカーディナリティのしきい値を指定します。
| デフォルト | 64 |
|---|---|
| 範囲 | 2–1024 |
minNObsPerTargetLevel=double
各ターゲット水準の最小オブザベーション数を指定します。
| デフォルト | 10 |
|---|---|
| 範囲 | 5–100 |
cv={cvAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 変動係数ポリシーを指定します。
| 別名 | coefficientVariation |
|---|
cvAvaptPolicy の値は次のいずれかになります:
lowMoment=double
モーメント変動係数 (CV) の低-高割合しきい値の絶対値を指定します。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
lowRobust=double
ロバスト変動係数 (CV) の低-高割合しきい値の絶対値を指定します。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
dateTimeVariables={"variable-name-1" <, "variable-name-2", ...>}
日時変数を指定します。
| 別名 | dateTime |
|---|
dateVariables={"variable-name-1" <, "variable-name-2", ...>}
日付変数を指定します。
| 別名 | date |
|---|
entropy={entropyAvaptPolicy}
自動変数分析とグループ化 (AVAPT) エントロピーポリシーを指定します。
entropyAvaptPolicy の値は次のいずれかになります:
giniLowMediumCutoff=double
低-中カットオフの Gini エントロピーのしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | 0–1 |
giniMediumHighCutoff=double
中-高カットオフの Gini エントロピーのしきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–1 |
shannonLowMediumCutoff=double
低-中カットオフの Shannon エントロピーのしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | 0–1 |
shannonMediumHighCutoff=double
中-高カットオフの Shannon エントロピーのしきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–1 |
iqv={iqvAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 質的変動のインデックスポリシーを指定します。
| 別名 | qualitativeVariationIndex |
|---|
iqvAvaptPolicy の値は次のいずれかになります:
highTopBottom=double
名義変数の最も頻度の高い水準と最も頻度の低い水準の間の低-高カットオフ周波数比のしきい値を指定します。
| 別名 | highTop1Bottom1 |
|---|---|
| デフォルト | 100 |
| 最小値 | 1 |
highTopTwo=double
名義変数の最も頻度の高い水準と2番目に頻度の高い水準の間の低-高カットオフ周波数比のしきい値を指定します。
| 別名 | highTop1Top2 |
|---|---|
| デフォルト | 10 |
| 最小値 | 1 |
highVariationRatio=double
低-高カットオフの変動率のしきい値を指定します。
| 別名 | highModVr |
|---|---|
| デフォルト | 0.5 |
| 範囲 | (0–1] |
kurtosis={kurtosisAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 尖度ポリシーを指定します。
kurtosisAvaptPolicy の値は次のいずれかになります:
momentLowMediumCutoff=double
低-中カットオフのモーメント尖度しきい値の絶対値を指定します。
| デフォルト | 5 |
|---|---|
| 最小値 | 0 |
momentMediumHighCutoff=double
中-高カットオフのモーメント尖度しきい値の絶対値を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 0 |
robustLowMediumCutoff=double
低-中カットオフのロバスト尖度しきい値の絶対値を指定します。
| デフォルト | 2 |
|---|---|
| 最小値 | 0 |
robustMediumHighCutoff=double
中-高カットオフのロバスト尖度しきい値の絶対値を指定します。
| デフォルト | 3 |
|---|---|
| 最小値 | 0 |
missing={missingAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 欠損値グループ化ポリシーを指定します。
missingAvaptPolicy の値は次のいずれかになります:
lowMediumCutoff=double
低-中カットオフの欠損値割合のしきい値を指定します。
| デフォルト | 5 |
|---|---|
| 範囲 | 0–100 |
mediumHighCutoff=double
中-高カットオフの欠損値割合のしきい値を指定します。
| デフォルト | 25 |
|---|---|
| 範囲 | 0–100 |
nominal={nominalAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 名義ポリシーを指定します。
nominalAvaptPolicy の値は次のいずれかになります:
cardinalityRatio=double
AVAPT 名義ポリシーカーディナリティ比のしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | (0–1] |
cardinalityThreshold=double
AVAPT 名義ポリシーカーディナリティのしきい値を指定します。
| デフォルト | 1024 |
|---|---|
| 最小値 | 32 |
includeNegative=true | false
True に設定すると、名義分析で負の値を持つ数値変数が含まれます。
| デフォルト | false |
|---|
includeNonIntegral=true | false
True に設定すると、名義分析で非整数値を持つ数値変数が含まれます。
| デフォルト | false |
|---|
intervals={"variable-name-1" <, "variable-name-2", ...>}
間隔として考慮する変数を指定します。
nominals={"variable-name-1" <, "variable-name-2", ...>}
名義として考慮する変数を指定します。
outlier={outlierAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 外れ値ポリシーを指定します。
outlierAvaptPolicy の値は次のいずれかになります:
momentLowMediumCutoff=double
低-中カットオフの z スコア外れ値割合のしきい値を指定します。
| デフォルト | 1 |
|---|---|
| 範囲 | 0–100 |
momentMediumHighCutoff=double
中-高カットオフの z スコア外れ値割合のしきい値を指定します。
| デフォルト | 2.5 |
|---|---|
| 範囲 | 0–100 |
robustLowMediumCutoff=double
低-中カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。
| デフォルト | 1 |
|---|---|
| 範囲 | 0–100 |
robustMediumHighCutoff=double
中-高カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。
| デフォルト | 2.5 |
|---|---|
| 範囲 | 0–100 |
skewness={skewnessAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 歪度ポリシーを指定します。
skewnessAvaptPolicy の値は次のいずれかになります:
momentLowMediumCutoff=double
低-中カットオフのモーメント歪度のしきい値を指定します。
| デフォルト | 2 |
|---|---|
| 範囲 | 0–100 |
momentMediumHighCutoff=double
中-高カットオフのモーメント歪度のしきい値を指定します。
| デフォルト | 10 |
|---|---|
| 範囲 | 0–100 |
robustLowMediumCutoff=double
低-中カットオフのロバスト歪度しきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–3 |
robustMediumHighCutoff=double
中-高カットオフのロバスト歪度しきい値を指定します。
| デフォルト | 2 |
|---|---|
| 範囲 | 0–3 |
timeVariables={"variable-name-1" <, "variable-name-2", ...>}
時間変数を指定します。
| 別名 | time |
|---|
* featureOut={casouttable}
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。
| 別名 | featuresOut |
|---|
| 長い形式 | featureOut={name="table-name"} |
|---|---|
| 短い形式 | featureOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=true | false
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | false |
|---|
replace=true | false
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | false |
|---|
hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL"
ハイパーパラメーターの最適化に使用する方法を指定します。
| 別名 | hpOptimizer |
|---|---|
| デフォルト | TUNEALL |
inputs={{casinvardesc-1} <, {casinvardesc-2}, ...>}
分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。
inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。
| 別名 | vars |
|---|
kFolds=integer
交差検証の分割数を指定します。
| デフォルト | 5 |
|---|---|
| 範囲 | 2–10 |
logLevel=integer
ログ記録レベルを指定します。
| デフォルト | 0 |
|---|---|
| 範囲 | 0–3 |
misraGries=true | false
True に設定すると、重複しない値のカウント制限を超えた場合に、頻度分布の推定に Misra-Gries アルゴリズムが使用されます。
| デフォルト | true |
|---|
modelTypes={"DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"}
objective="ASE" | "AUC" | "F1" | "MAE" | "MCE" | "MSLE" | "RASE" | "RMAE" | "RMSLE"
* pipelineOut={casouttable}
分析結果を格納する CAS テーブルを指定します。
| 別名 | pipelinesOut |
|---|
| 長い形式 | pipelineOut={name="table-name"} |
|---|---|
| 短い形式 | pipelineOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=true | false
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | false |
|---|
replace=true | false
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | false |
|---|
sampleSize=integer
標本抽出するパイプラインの最大数を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 1 |
saveState={casouttable} | {savePipelinesOptions}
分析結果を格納する CAS テーブルを指定します。
| 別名 | saveModel |
|---|
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
compress=true | false
True に設定すると、テーブルにデータ圧縮が適用されます。
| デフォルト | false |
|---|
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
label="string"
テーブルに関連付ける説明ラベルを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
maxMemSize=64-bit-integer
メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
|---|
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=true | false
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | false |
|---|
replace=true | false
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | false |
|---|
replication=integer
フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"
threadBlockSize=64-bit-integer
出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。
| 別名 | blockSize |
|---|---|
| デフォルト | 1048576 |
| 最小値 | 0 |
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
timeStamp="string"
タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。
where={"string-1" <, "string-2", ...>}
出力データをサブセット化する 1 つ以上の式を指定します。複数の式が指定された場合、式は AND を使用して効果的に結合され、最終的な出力フィルタが形成されます。式に引用符で囲まれた値が含まれている場合は、ネストした引用符を使用します。
savePipelinesOptions の値は次のいずれかになります:
modelNamePrefix="string"
保存されたモデルの名前に使用する接頭辞を指定します。
replace=true | false
True に設定すると、同じ名前の既存のモデルが上書きされます。
| デフォルト | true |
|---|
topK=integer
保存する最適なモデルの数を指定します。
| デフォルト | 5 |
|---|---|
| 最小値 | 1 |
screenPolicy={sweeperPolicy}
変数の選別、変換、またはコピーを推奨するために使用する変数スクリーニングポリシーを指定します。
| 別名 | sweeperPolicy |
|---|
sweeperPolicy の値は次のいずれかになります:
constant=true | false
True に設定すると、定数値を持つ変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | unique |
|---|---|
| デフォルト | true |
groupRareLevels=true | false
True に設定すると、まれな水準を持つ名義変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | groupRare |
|---|---|
| デフォルト | true |
leakagePercentThreshold=double
ターゲットに関する非常に高い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。指定したしきい値よりも大きいターゲットエントロピー率の低下を持つ変数は、漏えい変数としてフラグが付けられます。
| 別名 | leakagePercentageThreshold |
|---|---|
| デフォルト | 90 |
| 範囲 | (0–100] |
lowCv=true | false
True に設定すると、低い変動係数 (CV) を持つ変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | lowCoefficientVariation |
|---|---|
| デフォルト | true |
lowMutualInformation=double
ターゲットに関する低い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。
| 別名 | lowInformation |
|---|---|
| デフォルト | 0.05 |
| 最小値 | 0 |
missingIndicatorPercent=double
欠損値インジケーター変数を生成する変数スクリーニングポリシーを指定します。
| 別名 | missingIndicatorPercentage |
|---|---|
| デフォルト | 75 |
| 範囲 | [10–100) |
missingPercentThreshold=double
非常に高い欠損率を持つ変数を識別するための変数スクリーニングポリシーを指定します。
| 別名 | missingPercentageThreshold |
|---|---|
| デフォルト | 90 |
| 範囲 | [10–100) |
redundant=double
冗長な変数を識別するための対称不確実性 (SU) のしきい値を指定します。2 つの変数の SU がしきい値を超えた場合、ターゲットに関する情報が少ない変数には冗長としてフラグが付けられます。
| デフォルト | 1 |
|---|---|
| 範囲 | (0–1] |
seed=integer
乱数生成のシード値を指定します。いくつかのシナリオでは、この値は繰り返し可能な乱数生成に使用されます。
| デフォルト | 0 |
|---|
selectionPolicy={featureSelectOptions}
特徴量の選択ポリシーを指定します。
| 長い形式 | selectionPolicy={criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"} |
|---|---|
| 短い形式 | selectionPolicy="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU" |
featureSelectOptions の値は次のいずれかになります:
criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"
topK=integer
最も高いフィルター選択基準値を持つ特徴量の数が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。
| デフォルト | 50 |
|---|---|
| 最小値 | 1 |
topKPercent=double
最も高いフィルター選択基準値を持つ特徴量の割合が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。
| 別名 | topKPercentage |
|---|---|
| 範囲 | (0–100] |
* table={castable}
テーブル名、caslib、他の共通パラメーターを指定します。
| 長い形式 | table={name="table-name"} |
|---|---|
| 短い形式 | table="table-name" |
castable の値は次のいずれかになります:
caslib="string"
アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。
computedOnDemand=true | false
True に設定すると、アクションの開始時ではなくテーブルのロード時に計算変数が作成されます。
| 別名 | compOnDemand |
|---|---|
| デフォルト | false |
computedVars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
作成する計算変数の名前を指定します。computedVarsProgram パラメーターの各変数の式を指定します。このパラメーターを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。
| 別名 | compVars |
|---|
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
computedVarsProgram="string"
computedVars パラメーターに含める各計算変数の式を指定します。
| 別名 | compPgm |
|---|
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。
* name="table-name"
入力テーブルの名前を指定します。
singlePass=true | false
True に設定すると、サーバー上に一時テーブルは作成されません。このパラメーターを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。
| デフォルト | false |
|---|
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
アクションで使用する変数を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
入力データをサブセット化する式を指定します。
whereTable={groupbytable}
WHERE フィルターとして使用する行を含む入力テーブルを指定します。vars パラメーターが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメーターとこのパラメーターが指定されている場合、このフィルタリングテーブルが最初に適用されます。
groupbytable の値は次のいずれかになります:
casLib="string"
フィルターテーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
dataSourceOptions パラメーターの指定の詳細については、共通 dataSourceOptions パラメーターを参照してください。
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。
* name="table-name"
フィルターテーブルの名前を指定します。
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
フィルターテーブルから使用する変数名を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
フィルターテーブルからデータをサブセット化する式を指定します。
* target="variable-name"
ターゲット変数を指定します。
| 別名 | evalVar |
|---|
topKPipelines=integer
保存する最適なパイプラインの数を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 1 |
* transformationOut={casouttable}
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。
| 別名 | transformationsOut |
|---|
| 長い形式 | transformationOut={name="table-name"} |
|---|---|
| 短い形式 | transformationOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=true | false
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | false |
|---|
replace=true | false
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | false |
|---|
transformationPolicy={transformationSpace}
特徴量マシンが動作する特徴量変換と生成空間を指定します。
| 別名 | transformationSpace |
|---|
transformationSpace の値は次のいずれかになります:
cardinality=true | false
True に設定すると、カーディナリティ低減変換が含まれます。
| デフォルト | true |
|---|
entropy=true | false
True に設定すると、低エントロピーの処置のための変換が含まれます。
| デフォルト | false |
|---|
interaction=true | false
True に設定すると、交互作用特徴量が検出され、生成されます。
| デフォルト | false |
|---|
iqv=true | false
True に設定すると、低い質的変動の指数 (IQV) の処置のための変換が含まれます。
| デフォルト | false |
|---|
kurtosis=true | false
True に設定すると、高い尖度の処置のための変換が含まれます。
| デフォルト | false |
|---|
missing=true | false
True に設定すると、欠損値の処置のための変換が含まれます。
| デフォルト | true |
|---|
outlier=true | false
True に設定すると、外れ値の処置のための変換が含まれます。
| デフォルト | false |
|---|
skewness=true | false
True に設定すると、高い歪度の処置のための変換が含まれます。
| デフォルト | true |
|---|
validationPartitionFraction=double
検証に使用する入力データの割合を指定します。
| デフォルト | 0.3 |
|---|---|
| 範囲 | 0.01–0.99 |
dsAutoMl アクション
自動機械学習パイプラインの探索、実行、順位付け。。
要約: 入力テーブルと出力テーブル
行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。
|
パラメーター |
サブパラメーター |
説明 |
|---|---|---|
|
required parametertable |
— |
テーブル名、caslib、他の共通パラメーターを指定します。 |
|
パラメーター |
サブパラメーター |
説明 |
|---|---|---|
|
required parameterfeatureOut |
— |
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。 |
|
required parameterpipelineOut |
— |
分析結果を格納する CAS テーブルを指定します。 |
|
— |
分析結果を格納する CAS テーブルを指定します。 | |
|
required parametertransformationOut |
— |
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。 |
パラメーターの説明
distinctCountLimit=integer
重複しない値のカウント制限を指定します。この制限を超えて misraGries パラメーターを True に設定すると、Misra-Gries frequency sketch アルゴリズムを使用して頻度分布が推定されます。それ以外の場合、重複しない値のカウント操作は中止されます。
| 別名 | maxNVals |
|---|---|
| デフォルト | 10000 |
| 最小値 | 256 |
ecdfTolerance=double
経験累積分布関数のトレランスを指定します。この値は Quantile sketch アルゴリズムによって使用されます。
| デフォルト | 0.001 |
|---|---|
| 範囲 | 1E-06–0.1 |
event="string"
モデル化したいターゲット変数の水準を指定します。複数水準の分類問題は、1対多の二項分類問題にキャストされます。event パラメーターの値はモデル化している水準を示します。
explorationPolicy={avaptPolicy}
自動変数分析とグループ化 (AVAPT) ポリシーを指定します。
| 別名 | avaptPolicy |
|---|
avaptPolicy の値は次のいずれかになります:
"cardinality":{cardinalityAvaptPolicy}
自動変数分析とグループ化 (AVAPT) カーディナリティポリシーを指定します。
cardinalityAvaptPolicy の値は次のいずれかになります:
"lowMediumCutoff":double
低-中カットオフのカーディナリティのしきい値を指定します。
| デフォルト | 32 |
|---|---|
| 範囲 | 2–256 |
"mediumHighCutoff":double
中-高カットオフのカーディナリティのしきい値を指定します。
| デフォルト | 64 |
|---|---|
| 範囲 | 2–1024 |
"minNObsPerTargetLevel":double
各ターゲット水準の最小オブザベーション数を指定します。
| デフォルト | 10 |
|---|---|
| 範囲 | 5–100 |
"cv":{cvAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 変動係数ポリシーを指定します。
| 別名 | coefficientVariation |
|---|
cvAvaptPolicy の値は次のいずれかになります:
"lowMoment":double
モーメント変動係数 (CV) の低-高割合しきい値の絶対値を指定します。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
"lowRobust":double
ロバスト変動係数 (CV) の低-高割合しきい値の絶対値を指定します。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
"dateTimeVariables":["variable-name-1" <, "variable-name-2", ...>]
日時変数を指定します。
| 別名 | dateTime |
|---|
"dateVariables":["variable-name-1" <, "variable-name-2", ...>]
日付変数を指定します。
| 別名 | date |
|---|
"entropy":{entropyAvaptPolicy}
自動変数分析とグループ化 (AVAPT) エントロピーポリシーを指定します。
entropyAvaptPolicy の値は次のいずれかになります:
"giniLowMediumCutoff":double
低-中カットオフの Gini エントロピーのしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | 0–1 |
"giniMediumHighCutoff":double
中-高カットオフの Gini エントロピーのしきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–1 |
"shannonLowMediumCutoff":double
低-中カットオフの Shannon エントロピーのしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | 0–1 |
"shannonMediumHighCutoff":double
中-高カットオフの Shannon エントロピーのしきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–1 |
"iqv":{iqvAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 質的変動のインデックスポリシーを指定します。
| 別名 | qualitativeVariationIndex |
|---|
iqvAvaptPolicy の値は次のいずれかになります:
"highTopBottom":double
名義変数の最も頻度の高い水準と最も頻度の低い水準の間の低-高カットオフ周波数比のしきい値を指定します。
| 別名 | highTop1Bottom1 |
|---|---|
| デフォルト | 100 |
| 最小値 | 1 |
"highTopTwo":double
名義変数の最も頻度の高い水準と2番目に頻度の高い水準の間の低-高カットオフ周波数比のしきい値を指定します。
| 別名 | highTop1Top2 |
|---|---|
| デフォルト | 10 |
| 最小値 | 1 |
"highVariationRatio":double
低-高カットオフの変動率のしきい値を指定します。
| 別名 | highModVr |
|---|---|
| デフォルト | 0.5 |
| 範囲 | (0–1] |
"kurtosis":{kurtosisAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 尖度ポリシーを指定します。
kurtosisAvaptPolicy の値は次のいずれかになります:
"momentLowMediumCutoff":double
低-中カットオフのモーメント尖度しきい値の絶対値を指定します。
| デフォルト | 5 |
|---|---|
| 最小値 | 0 |
"momentMediumHighCutoff":double
中-高カットオフのモーメント尖度しきい値の絶対値を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 0 |
"robustLowMediumCutoff":double
低-中カットオフのロバスト尖度しきい値の絶対値を指定します。
| デフォルト | 2 |
|---|---|
| 最小値 | 0 |
"robustMediumHighCutoff":double
中-高カットオフのロバスト尖度しきい値の絶対値を指定します。
| デフォルト | 3 |
|---|---|
| 最小値 | 0 |
"missing":{missingAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 欠損値グループ化ポリシーを指定します。
missingAvaptPolicy の値は次のいずれかになります:
"lowMediumCutoff":double
低-中カットオフの欠損値割合のしきい値を指定します。
| デフォルト | 5 |
|---|---|
| 範囲 | 0–100 |
"mediumHighCutoff":double
中-高カットオフの欠損値割合のしきい値を指定します。
| デフォルト | 25 |
|---|---|
| 範囲 | 0–100 |
"nominal":{nominalAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 名義ポリシーを指定します。
nominalAvaptPolicy の値は次のいずれかになります:
"cardinalityRatio":double
AVAPT 名義ポリシーカーディナリティ比のしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | (0–1] |
"cardinalityThreshold":double
AVAPT 名義ポリシーカーディナリティのしきい値を指定します。
| デフォルト | 1024 |
|---|---|
| 最小値 | 32 |
"includeNegative":True | False
True に設定すると、名義分析で負の値を持つ数値変数が含まれます。
| デフォルト | False |
|---|
"includeNonIntegral":True | False
True に設定すると、名義分析で非整数値を持つ数値変数が含まれます。
| デフォルト | False |
|---|
"intervals":["variable-name-1" <, "variable-name-2", ...>]
間隔として考慮する変数を指定します。
"nominals":["variable-name-1" <, "variable-name-2", ...>]
名義として考慮する変数を指定します。
"outlier":{outlierAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 外れ値ポリシーを指定します。
outlierAvaptPolicy の値は次のいずれかになります:
"momentLowMediumCutoff":double
低-中カットオフの z スコア外れ値割合のしきい値を指定します。
| デフォルト | 1 |
|---|---|
| 範囲 | 0–100 |
"momentMediumHighCutoff":double
中-高カットオフの z スコア外れ値割合のしきい値を指定します。
| デフォルト | 2.5 |
|---|---|
| 範囲 | 0–100 |
"robustLowMediumCutoff":double
低-中カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。
| デフォルト | 1 |
|---|---|
| 範囲 | 0–100 |
"robustMediumHighCutoff":double
中-高カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。
| デフォルト | 2.5 |
|---|---|
| 範囲 | 0–100 |
"skewness":{skewnessAvaptPolicy}
自動変数分析とグループ化 (AVAPT) 歪度ポリシーを指定します。
skewnessAvaptPolicy の値は次のいずれかになります:
"momentLowMediumCutoff":double
低-中カットオフのモーメント歪度のしきい値を指定します。
| デフォルト | 2 |
|---|---|
| 範囲 | 0–100 |
"momentMediumHighCutoff":double
中-高カットオフのモーメント歪度のしきい値を指定します。
| デフォルト | 10 |
|---|---|
| 範囲 | 0–100 |
"robustLowMediumCutoff":double
低-中カットオフのロバスト歪度しきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–3 |
"robustMediumHighCutoff":double
中-高カットオフのロバスト歪度しきい値を指定します。
| デフォルト | 2 |
|---|---|
| 範囲 | 0–3 |
"timeVariables":["variable-name-1" <, "variable-name-2", ...>]
時間変数を指定します。
| 別名 | time |
|---|
* featureOut={casouttable}
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。
| 別名 | featuresOut |
|---|
| 長い形式 | featureOut={"name":"table-name"} |
|---|---|
| 短い形式 | featureOut="table-name" |
casouttable の値は次のいずれかになります:
"caslib":"string"
出力テーブルの caslib の名前を指定します。
"indexVars":["variable-name-1" <, "variable-name-2", ...>]
出力データにインデックスを作成する変数のリストを指定します。
"lifetime":64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"
"name":"table-name"
出力テーブルの名前を指定します。
"promote":True | False
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | False |
|---|
"replace":True | False
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | False |
|---|
hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL"
ハイパーパラメーターの最適化に使用する方法を指定します。
| 別名 | hpOptimizer |
|---|---|
| デフォルト | TUNEALL |
inputs=[{casinvardesc-1} <, {casinvardesc-2}, ...>]
分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。
inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。
| 別名 | vars |
|---|
kFolds=integer
交差検証の分割数を指定します。
| デフォルト | 5 |
|---|---|
| 範囲 | 2–10 |
logLevel=integer
ログ記録レベルを指定します。
| デフォルト | 0 |
|---|---|
| 範囲 | 0–3 |
misraGries=True | False
True に設定すると、重複しない値のカウント制限を超えた場合に、頻度分布の推定に Misra-Gries アルゴリズムが使用されます。
| デフォルト | True |
|---|
modelTypes=["DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"]
objective="ASE" | "AUC" | "F1" | "MAE" | "MCE" | "MSLE" | "RASE" | "RMAE" | "RMSLE"
* pipelineOut={casouttable}
分析結果を格納する CAS テーブルを指定します。
| 別名 | pipelinesOut |
|---|
| 長い形式 | pipelineOut={"name":"table-name"} |
|---|---|
| 短い形式 | pipelineOut="table-name" |
casouttable の値は次のいずれかになります:
"caslib":"string"
出力テーブルの caslib の名前を指定します。
"indexVars":["variable-name-1" <, "variable-name-2", ...>]
出力データにインデックスを作成する変数のリストを指定します。
"lifetime":64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"
"name":"table-name"
出力テーブルの名前を指定します。
"promote":True | False
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | False |
|---|
"replace":True | False
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | False |
|---|
sampleSize=integer
標本抽出するパイプラインの最大数を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 1 |
saveState={casouttable} | {savePipelinesOptions}
分析結果を格納する CAS テーブルを指定します。
| 別名 | saveModel |
|---|
casouttable の値は次のいずれかになります:
"caslib":"string"
出力テーブルの caslib の名前を指定します。
"compress":True | False
True に設定すると、テーブルにデータ圧縮が適用されます。
| デフォルト | False |
|---|
"indexVars":["variable-name-1" <, "variable-name-2", ...>]
出力データにインデックスを作成する変数のリストを指定します。
"label":"string"
テーブルに関連付ける説明ラベルを指定します。
"lifetime":64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
"maxMemSize":64-bit-integer
メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
|---|
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"
"name":"table-name"
出力テーブルの名前を指定します。
"promote":True | False
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | False |
|---|
"replace":True | False
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | False |
|---|
"replication":integer
フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
"tableRedistUpPolicy":"DEFER" | "NOREDIST" | "REBALANCE"
"threadBlockSize":64-bit-integer
出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。
| 別名 | blockSize |
|---|---|
| デフォルト | 1048576 |
| 最小値 | 0 |
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
"timeStamp":"string"
タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。
"where":["string-1" <, "string-2", ...>]
出力データをサブセット化する 1 つ以上の式を指定します。複数の式が指定された場合、式は AND を使用して効果的に結合され、最終的な出力フィルタが形成されます。式に引用符で囲まれた値が含まれている場合は、ネストした引用符を使用します。
savePipelinesOptions の値は次のいずれかになります:
"modelNamePrefix":"string"
保存されたモデルの名前に使用する接頭辞を指定します。
"replace":True | False
True に設定すると、同じ名前の既存のモデルが上書きされます。
| デフォルト | True |
|---|
"topK":integer
保存する最適なモデルの数を指定します。
| デフォルト | 5 |
|---|---|
| 最小値 | 1 |
screenPolicy={sweeperPolicy}
変数の選別、変換、またはコピーを推奨するために使用する変数スクリーニングポリシーを指定します。
| 別名 | sweeperPolicy |
|---|
sweeperPolicy の値は次のいずれかになります:
"constant":True | False
True に設定すると、定数値を持つ変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | unique |
|---|---|
| デフォルト | True |
"groupRareLevels":True | False
True に設定すると、まれな水準を持つ名義変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | groupRare |
|---|---|
| デフォルト | True |
"leakagePercentThreshold":double
ターゲットに関する非常に高い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。指定したしきい値よりも大きいターゲットエントロピー率の低下を持つ変数は、漏えい変数としてフラグが付けられます。
| 別名 | leakagePercentageThreshold |
|---|---|
| デフォルト | 90 |
| 範囲 | (0–100] |
"lowCv":True | False
True に設定すると、低い変動係数 (CV) を持つ変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | lowCoefficientVariation |
|---|---|
| デフォルト | True |
"lowMutualInformation":double
ターゲットに関する低い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。
| 別名 | lowInformation |
|---|---|
| デフォルト | 0.05 |
| 最小値 | 0 |
"missingIndicatorPercent":double
欠損値インジケーター変数を生成する変数スクリーニングポリシーを指定します。
| 別名 | missingIndicatorPercentage |
|---|---|
| デフォルト | 75 |
| 範囲 | [10–100) |
"missingPercentThreshold":double
非常に高い欠損率を持つ変数を識別するための変数スクリーニングポリシーを指定します。
| 別名 | missingPercentageThreshold |
|---|---|
| デフォルト | 90 |
| 範囲 | [10–100) |
"redundant":double
冗長な変数を識別するための対称不確実性 (SU) のしきい値を指定します。2 つの変数の SU がしきい値を超えた場合、ターゲットに関する情報が少ない変数には冗長としてフラグが付けられます。
| デフォルト | 1 |
|---|---|
| 範囲 | (0–1] |
seed=integer
乱数生成のシード値を指定します。いくつかのシナリオでは、この値は繰り返し可能な乱数生成に使用されます。
| デフォルト | 0 |
|---|
selectionPolicy={featureSelectOptions}
特徴量の選択ポリシーを指定します。
| 長い形式 | selectionPolicy={"criterion":"CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"} |
|---|---|
| 短い形式 | selectionPolicy="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU" |
featureSelectOptions の値は次のいずれかになります:
"criterion":"CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"
"topK":integer
最も高いフィルター選択基準値を持つ特徴量の数が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。
| デフォルト | 50 |
|---|---|
| 最小値 | 1 |
"topKPercent":double
最も高いフィルター選択基準値を持つ特徴量の割合が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。
| 別名 | topKPercentage |
|---|---|
| 範囲 | (0–100] |
* table={castable}
テーブル名、caslib、他の共通パラメーターを指定します。
| 長い形式 | table={"name":"table-name"} |
|---|---|
| 短い形式 | table="table-name" |
castable の値は次のいずれかになります:
"caslib":"string"
アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。
"computedOnDemand":True | False
True に設定すると、アクションの開始時ではなくテーブルのロード時に計算変数が作成されます。
| 別名 | compOnDemand |
|---|---|
| デフォルト | False |
"computedVars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]
作成する計算変数の名前を指定します。computedVarsProgram パラメーターの各変数の式を指定します。このパラメーターを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。
| 別名 | compVars |
|---|
casinvardesc の値は次のいずれかになります:
"format":"string"
変数に適用するフォーマットを指定します。
"formattedLength":integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
"label":"string"
変数の説明ラベルを指定します。
* "name":"variable-name"
変数の名前を指定します。
"nfd":integer
フォーマット精度の長さを指定します。
"nfl":integer
フォーマットフィールドの長さを指定します。
"computedVarsProgram":"string"
computedVars パラメーターに含める各計算変数の式を指定します。
| 別名 | compPgm |
|---|
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import_ |
|---|
importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。
* "name":"table-name"
入力テーブルの名前を指定します。
"singlePass":True | False
True に設定すると、サーバー上に一時テーブルは作成されません。このパラメーターを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。
| デフォルト | False |
|---|
"vars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]
アクションで使用する変数を指定します。
casinvardesc の値は次のいずれかになります:
"format":"string"
変数に適用するフォーマットを指定します。
"formattedLength":integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
"label":"string"
変数の説明ラベルを指定します。
* "name":"variable-name"
変数の名前を指定します。
"nfd":integer
フォーマット精度の長さを指定します。
"nfl":integer
フォーマットフィールドの長さを指定します。
"where":"where-expression"
入力データをサブセット化する式を指定します。
"whereTable":{groupbytable}
WHERE フィルターとして使用する行を含む入力テーブルを指定します。vars パラメーターが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメーターとこのパラメーターが指定されている場合、このフィルタリングテーブルが最初に適用されます。
groupbytable の値は次のいずれかになります:
"casLib":"string"
フィルターテーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。
"dataSourceOptions":{adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
dataSourceOptions パラメーターの指定の詳細については、共通 dataSourceOptions パラメーターを参照してください。
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import_ |
|---|
importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。
* "name":"table-name"
フィルターテーブルの名前を指定します。
"vars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]
フィルターテーブルから使用する変数名を指定します。
casinvardesc の値は次のいずれかになります:
"format":"string"
変数に適用するフォーマットを指定します。
"formattedLength":integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
"label":"string"
変数の説明ラベルを指定します。
* "name":"variable-name"
変数の名前を指定します。
"nfd":integer
フォーマット精度の長さを指定します。
"nfl":integer
フォーマットフィールドの長さを指定します。
"where":"where-expression"
フィルターテーブルからデータをサブセット化する式を指定します。
* target="variable-name"
ターゲット変数を指定します。
| 別名 | evalVar |
|---|
topKPipelines=integer
保存する最適なパイプラインの数を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 1 |
* transformationOut={casouttable}
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。
| 別名 | transformationsOut |
|---|
| 長い形式 | transformationOut={"name":"table-name"} |
|---|---|
| 短い形式 | transformationOut="table-name" |
casouttable の値は次のいずれかになります:
"caslib":"string"
出力テーブルの caslib の名前を指定します。
"indexVars":["variable-name-1" <, "variable-name-2", ...>]
出力データにインデックスを作成する変数のリストを指定します。
"lifetime":64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"
"name":"table-name"
出力テーブルの名前を指定します。
"promote":True | False
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | False |
|---|
"replace":True | False
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | False |
|---|
transformationPolicy={transformationSpace}
特徴量マシンが動作する特徴量変換と生成空間を指定します。
| 別名 | transformationSpace |
|---|
transformationSpace の値は次のいずれかになります:
"cardinality":True | False
True に設定すると、カーディナリティ低減変換が含まれます。
| デフォルト | True |
|---|
"entropy":True | False
True に設定すると、低エントロピーの処置のための変換が含まれます。
| デフォルト | False |
|---|
"interaction":True | False
True に設定すると、交互作用特徴量が検出され、生成されます。
| デフォルト | False |
|---|
"iqv":True | False
True に設定すると、低い質的変動の指数 (IQV) の処置のための変換が含まれます。
| デフォルト | False |
|---|
"kurtosis":True | False
True に設定すると、高い尖度の処置のための変換が含まれます。
| デフォルト | False |
|---|
"missing":True | False
True に設定すると、欠損値の処置のための変換が含まれます。
| デフォルト | True |
|---|
"outlier":True | False
True に設定すると、外れ値の処置のための変換が含まれます。
| デフォルト | False |
|---|
"skewness":True | False
True に設定すると、高い歪度の処置のための変換が含まれます。
| デフォルト | True |
|---|
validationPartitionFraction=double
検証に使用する入力データの割合を指定します。
| デフォルト | 0.3 |
|---|---|
| 範囲 | 0.01–0.99 |
dsAutoMl アクション
自動機械学習パイプラインの探索、実行、順位付け。。
要約: 入力テーブルと出力テーブル
行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。
|
パラメーター |
サブパラメーター |
説明 |
|---|---|---|
|
required parametertable |
— |
テーブル名、caslib、他の共通パラメーターを指定します。 |
|
パラメーター |
サブパラメーター |
説明 |
|---|---|---|
|
required parameterfeatureOut |
— |
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。 |
|
required parameterpipelineOut |
— |
分析結果を格納する CAS テーブルを指定します。 |
|
— |
分析結果を格納する CAS テーブルを指定します。 | |
|
required parametertransformationOut |
— |
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。 |
パラメーターの説明
distinctCountLimit=integer
重複しない値のカウント制限を指定します。この制限を超えて misraGries パラメーターを True に設定すると、Misra-Gries frequency sketch アルゴリズムを使用して頻度分布が推定されます。それ以外の場合、重複しない値のカウント操作は中止されます。
| 別名 | maxNVals |
|---|---|
| デフォルト | 10000 |
| 最小値 | 256 |
ecdfTolerance=double
経験累積分布関数のトレランスを指定します。この値は Quantile sketch アルゴリズムによって使用されます。
| デフォルト | 0.001 |
|---|---|
| 範囲 | 1E-06–0.1 |
event="string"
モデル化したいターゲット変数の水準を指定します。複数水準の分類問題は、1対多の二項分類問題にキャストされます。event パラメーターの値はモデル化している水準を示します。
explorationPolicy=list(avaptPolicy)
自動変数分析とグループ化 (AVAPT) ポリシーを指定します。
| 別名 | avaptPolicy |
|---|
avaptPolicy の値は次のいずれかになります:
cardinality=list(cardinalityAvaptPolicy)
自動変数分析とグループ化 (AVAPT) カーディナリティポリシーを指定します。
cardinalityAvaptPolicy の値は次のいずれかになります:
lowMediumCutoff=double
低-中カットオフのカーディナリティのしきい値を指定します。
| デフォルト | 32 |
|---|---|
| 範囲 | 2–256 |
mediumHighCutoff=double
中-高カットオフのカーディナリティのしきい値を指定します。
| デフォルト | 64 |
|---|---|
| 範囲 | 2–1024 |
minNObsPerTargetLevel=double
各ターゲット水準の最小オブザベーション数を指定します。
| デフォルト | 10 |
|---|---|
| 範囲 | 5–100 |
cv=list(cvAvaptPolicy)
自動変数分析とグループ化 (AVAPT) 変動係数ポリシーを指定します。
| 別名 | coefficientVariation |
|---|
cvAvaptPolicy の値は次のいずれかになります:
lowMoment=double
モーメント変動係数 (CV) の低-高割合しきい値の絶対値を指定します。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
lowRobust=double
ロバスト変動係数 (CV) の低-高割合しきい値の絶対値を指定します。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
dateTimeVariables=list("variable-name-1" <, "variable-name-2", ...>)
日時変数を指定します。
| 別名 | dateTime |
|---|
dateVariables=list("variable-name-1" <, "variable-name-2", ...>)
日付変数を指定します。
| 別名 | date |
|---|
entropy=list(entropyAvaptPolicy)
自動変数分析とグループ化 (AVAPT) エントロピーポリシーを指定します。
entropyAvaptPolicy の値は次のいずれかになります:
giniLowMediumCutoff=double
低-中カットオフの Gini エントロピーのしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | 0–1 |
giniMediumHighCutoff=double
中-高カットオフの Gini エントロピーのしきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–1 |
shannonLowMediumCutoff=double
低-中カットオフの Shannon エントロピーのしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | 0–1 |
shannonMediumHighCutoff=double
中-高カットオフの Shannon エントロピーのしきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–1 |
iqv=list(iqvAvaptPolicy)
自動変数分析とグループ化 (AVAPT) 質的変動のインデックスポリシーを指定します。
| 別名 | qualitativeVariationIndex |
|---|
iqvAvaptPolicy の値は次のいずれかになります:
highTopBottom=double
名義変数の最も頻度の高い水準と最も頻度の低い水準の間の低-高カットオフ周波数比のしきい値を指定します。
| 別名 | highTop1Bottom1 |
|---|---|
| デフォルト | 100 |
| 最小値 | 1 |
highTopTwo=double
名義変数の最も頻度の高い水準と2番目に頻度の高い水準の間の低-高カットオフ周波数比のしきい値を指定します。
| 別名 | highTop1Top2 |
|---|---|
| デフォルト | 10 |
| 最小値 | 1 |
highVariationRatio=double
低-高カットオフの変動率のしきい値を指定します。
| 別名 | highModVr |
|---|---|
| デフォルト | 0.5 |
| 範囲 | (0–1] |
kurtosis=list(kurtosisAvaptPolicy)
自動変数分析とグループ化 (AVAPT) 尖度ポリシーを指定します。
kurtosisAvaptPolicy の値は次のいずれかになります:
momentLowMediumCutoff=double
低-中カットオフのモーメント尖度しきい値の絶対値を指定します。
| デフォルト | 5 |
|---|---|
| 最小値 | 0 |
momentMediumHighCutoff=double
中-高カットオフのモーメント尖度しきい値の絶対値を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 0 |
robustLowMediumCutoff=double
低-中カットオフのロバスト尖度しきい値の絶対値を指定します。
| デフォルト | 2 |
|---|---|
| 最小値 | 0 |
robustMediumHighCutoff=double
中-高カットオフのロバスト尖度しきい値の絶対値を指定します。
| デフォルト | 3 |
|---|---|
| 最小値 | 0 |
missing=list(missingAvaptPolicy)
自動変数分析とグループ化 (AVAPT) 欠損値グループ化ポリシーを指定します。
missingAvaptPolicy の値は次のいずれかになります:
lowMediumCutoff=double
低-中カットオフの欠損値割合のしきい値を指定します。
| デフォルト | 5 |
|---|---|
| 範囲 | 0–100 |
mediumHighCutoff=double
中-高カットオフの欠損値割合のしきい値を指定します。
| デフォルト | 25 |
|---|---|
| 範囲 | 0–100 |
nominal=list(nominalAvaptPolicy)
自動変数分析とグループ化 (AVAPT) 名義ポリシーを指定します。
nominalAvaptPolicy の値は次のいずれかになります:
cardinalityRatio=double
AVAPT 名義ポリシーカーディナリティ比のしきい値を指定します。
| デフォルト | 0.25 |
|---|---|
| 範囲 | (0–1] |
cardinalityThreshold=double
AVAPT 名義ポリシーカーディナリティのしきい値を指定します。
| デフォルト | 1024 |
|---|---|
| 最小値 | 32 |
includeNegative=TRUE | FALSE
True に設定すると、名義分析で負の値を持つ数値変数が含まれます。
| デフォルト | FALSE |
|---|
includeNonIntegral=TRUE | FALSE
True に設定すると、名義分析で非整数値を持つ数値変数が含まれます。
| デフォルト | FALSE |
|---|
intervals=list("variable-name-1" <, "variable-name-2", ...>)
間隔として考慮する変数を指定します。
nominals=list("variable-name-1" <, "variable-name-2", ...>)
名義として考慮する変数を指定します。
outlier=list(outlierAvaptPolicy)
自動変数分析とグループ化 (AVAPT) 外れ値ポリシーを指定します。
outlierAvaptPolicy の値は次のいずれかになります:
momentLowMediumCutoff=double
低-中カットオフの z スコア外れ値割合のしきい値を指定します。
| デフォルト | 1 |
|---|---|
| 範囲 | 0–100 |
momentMediumHighCutoff=double
中-高カットオフの z スコア外れ値割合のしきい値を指定します。
| デフォルト | 2.5 |
|---|---|
| 範囲 | 0–100 |
robustLowMediumCutoff=double
低-中カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。
| デフォルト | 1 |
|---|---|
| 範囲 | 0–100 |
robustMediumHighCutoff=double
中-高カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。
| デフォルト | 2.5 |
|---|---|
| 範囲 | 0–100 |
skewness=list(skewnessAvaptPolicy)
自動変数分析とグループ化 (AVAPT) 歪度ポリシーを指定します。
skewnessAvaptPolicy の値は次のいずれかになります:
momentLowMediumCutoff=double
低-中カットオフのモーメント歪度のしきい値を指定します。
| デフォルト | 2 |
|---|---|
| 範囲 | 0–100 |
momentMediumHighCutoff=double
中-高カットオフのモーメント歪度のしきい値を指定します。
| デフォルト | 10 |
|---|---|
| 範囲 | 0–100 |
robustLowMediumCutoff=double
低-中カットオフのロバスト歪度しきい値を指定します。
| デフォルト | 0.75 |
|---|---|
| 範囲 | 0–3 |
robustMediumHighCutoff=double
中-高カットオフのロバスト歪度しきい値を指定します。
| デフォルト | 2 |
|---|---|
| 範囲 | 0–3 |
timeVariables=list("variable-name-1" <, "variable-name-2", ...>)
時間変数を指定します。
| 別名 | time |
|---|
* featureOut=list(casouttable)
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。
| 別名 | featuresOut |
|---|
| 長い形式 | featureOut=list(name="table-name") |
|---|---|
| 短い形式 | featureOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
indexVars=list("variable-name-1" <, "variable-name-2", ...>)
出力データにインデックスを作成する変数のリストを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL"
ハイパーパラメーターの最適化に使用する方法を指定します。
| 別名 | hpOptimizer |
|---|---|
| デフォルト | TUNEALL |
inputs=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)
分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。
inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。
| 別名 | vars |
|---|
kFolds=integer
交差検証の分割数を指定します。
| デフォルト | 5 |
|---|---|
| 範囲 | 2–10 |
logLevel=integer
ログ記録レベルを指定します。
| デフォルト | 0 |
|---|---|
| 範囲 | 0–3 |
misraGries=TRUE | FALSE
True に設定すると、重複しない値のカウント制限を超えた場合に、頻度分布の推定に Misra-Gries アルゴリズムが使用されます。
| デフォルト | TRUE |
|---|
modelTypes=list("DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET")
objective="ASE" | "AUC" | "F1" | "MAE" | "MCE" | "MSLE" | "RASE" | "RMAE" | "RMSLE"
* pipelineOut=list(casouttable)
分析結果を格納する CAS テーブルを指定します。
| 別名 | pipelinesOut |
|---|
| 長い形式 | pipelineOut=list(name="table-name") |
|---|---|
| 短い形式 | pipelineOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
indexVars=list("variable-name-1" <, "variable-name-2", ...>)
出力データにインデックスを作成する変数のリストを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
sampleSize=integer
標本抽出するパイプラインの最大数を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 1 |
saveState={casouttable} | {savePipelinesOptions}
分析結果を格納する CAS テーブルを指定します。
| 別名 | saveModel |
|---|
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
compress=TRUE | FALSE
True に設定すると、テーブルにデータ圧縮が適用されます。
| デフォルト | FALSE |
|---|
indexVars=list("variable-name-1" <, "variable-name-2", ...>)
出力データにインデックスを作成する変数のリストを指定します。
label="string"
テーブルに関連付ける説明ラベルを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
maxMemSize=64-bit-integer
メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
|---|
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
replication=integer
フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"
threadBlockSize=64-bit-integer
出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。
| 別名 | blockSize |
|---|---|
| デフォルト | 1048576 |
| 最小値 | 0 |
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
timeStamp="string"
タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。
where=list("string-1" <, "string-2", ...>)
出力データをサブセット化する 1 つ以上の式を指定します。複数の式が指定された場合、式は AND を使用して効果的に結合され、最終的な出力フィルタが形成されます。式に引用符で囲まれた値が含まれている場合は、ネストした引用符を使用します。
savePipelinesOptions の値は次のいずれかになります:
modelNamePrefix="string"
保存されたモデルの名前に使用する接頭辞を指定します。
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のモデルが上書きされます。
| デフォルト | TRUE |
|---|
topK=integer
保存する最適なモデルの数を指定します。
| デフォルト | 5 |
|---|---|
| 最小値 | 1 |
screenPolicy=list(sweeperPolicy)
変数の選別、変換、またはコピーを推奨するために使用する変数スクリーニングポリシーを指定します。
| 別名 | sweeperPolicy |
|---|
sweeperPolicy の値は次のいずれかになります:
constant=TRUE | FALSE
True に設定すると、定数値を持つ変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | unique |
|---|---|
| デフォルト | TRUE |
groupRareLevels=TRUE | FALSE
True に設定すると、まれな水準を持つ名義変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | groupRare |
|---|---|
| デフォルト | TRUE |
leakagePercentThreshold=double
ターゲットに関する非常に高い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。指定したしきい値よりも大きいターゲットエントロピー率の低下を持つ変数は、漏えい変数としてフラグが付けられます。
| 別名 | leakagePercentageThreshold |
|---|---|
| デフォルト | 90 |
| 範囲 | (0–100] |
lowCv=TRUE | FALSE
True に設定すると、低い変動係数 (CV) を持つ変数を識別するための変数スクリーニングポリシーを使用します。
| 別名 | lowCoefficientVariation |
|---|---|
| デフォルト | TRUE |
lowMutualInformation=double
ターゲットに関する低い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。
| 別名 | lowInformation |
|---|---|
| デフォルト | 0.05 |
| 最小値 | 0 |
missingIndicatorPercent=double
欠損値インジケーター変数を生成する変数スクリーニングポリシーを指定します。
| 別名 | missingIndicatorPercentage |
|---|---|
| デフォルト | 75 |
| 範囲 | [10–100) |
missingPercentThreshold=double
非常に高い欠損率を持つ変数を識別するための変数スクリーニングポリシーを指定します。
| 別名 | missingPercentageThreshold |
|---|---|
| デフォルト | 90 |
| 範囲 | [10–100) |
redundant=double
冗長な変数を識別するための対称不確実性 (SU) のしきい値を指定します。2 つの変数の SU がしきい値を超えた場合、ターゲットに関する情報が少ない変数には冗長としてフラグが付けられます。
| デフォルト | 1 |
|---|---|
| 範囲 | (0–1] |
seed=integer
乱数生成のシード値を指定します。いくつかのシナリオでは、この値は繰り返し可能な乱数生成に使用されます。
| デフォルト | 0 |
|---|
selectionPolicy=list(featureSelectOptions)
特徴量の選択ポリシーを指定します。
| 長い形式 | selectionPolicy=list(criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU") |
|---|---|
| 短い形式 | selectionPolicy="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU" |
featureSelectOptions の値は次のいずれかになります:
criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"
topK=integer
最も高いフィルター選択基準値を持つ特徴量の数が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。
| デフォルト | 50 |
|---|---|
| 最小値 | 1 |
topKPercent=double
最も高いフィルター選択基準値を持つ特徴量の割合が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。
| 別名 | topKPercentage |
|---|---|
| 範囲 | (0–100] |
* table=list(castable)
テーブル名、caslib、他の共通パラメーターを指定します。
| 長い形式 | table=list(name="table-name") |
|---|---|
| 短い形式 | table="table-name" |
castable の値は次のいずれかになります:
caslib="string"
アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。
computedOnDemand=TRUE | FALSE
True に設定すると、アクションの開始時ではなくテーブルのロード時に計算変数が作成されます。
| 別名 | compOnDemand |
|---|---|
| デフォルト | FALSE |
computedVars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)
作成する計算変数の名前を指定します。computedVarsProgram パラメーターの各変数の式を指定します。このパラメーターを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。
| 別名 | compVars |
|---|
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
computedVarsProgram="string"
computedVars パラメーターに含める各計算変数の式を指定します。
| 別名 | compPgm |
|---|
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>)
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。
* name="table-name"
入力テーブルの名前を指定します。
singlePass=TRUE | FALSE
True に設定すると、サーバー上に一時テーブルは作成されません。このパラメーターを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。
| デフォルト | FALSE |
|---|
vars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)
アクションで使用する変数を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
入力データをサブセット化する式を指定します。
whereTable=list(groupbytable)
WHERE フィルターとして使用する行を含む入力テーブルを指定します。vars パラメーターが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメーターとこのパラメーターが指定されている場合、このフィルタリングテーブルが最初に適用されます。
groupbytable の値は次のいずれかになります:
casLib="string"
フィルターテーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。
dataSourceOptions=list(adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters)
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
dataSourceOptions パラメーターの指定の詳細については、共通 dataSourceOptions パラメーターを参照してください。
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。
* name="table-name"
フィルターテーブルの名前を指定します。
vars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)
フィルターテーブルから使用する変数名を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
フィルターテーブルからデータをサブセット化する式を指定します。
* target="variable-name"
ターゲット変数を指定します。
| 別名 | evalVar |
|---|
topKPipelines=integer
保存する最適なパイプラインの数を指定します。
| デフォルト | 10 |
|---|---|
| 最小値 | 1 |
* transformationOut=list(casouttable)
特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。
| 別名 | transformationsOut |
|---|
| 長い形式 | transformationOut=list(name="table-name") |
|---|---|
| 短い形式 | transformationOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
indexVars=list("variable-name-1" <, "variable-name-2", ...>)
出力データにインデックスを作成する変数のリストを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
transformationPolicy=list(transformationSpace)
特徴量マシンが動作する特徴量変換と生成空間を指定します。
| 別名 | transformationSpace |
|---|
transformationSpace の値は次のいずれかになります:
cardinality=TRUE | FALSE
True に設定すると、カーディナリティ低減変換が含まれます。
| デフォルト | TRUE |
|---|
entropy=TRUE | FALSE
True に設定すると、低エントロピーの処置のための変換が含まれます。
| デフォルト | FALSE |
|---|
interaction=TRUE | FALSE
True に設定すると、交互作用特徴量が検出され、生成されます。
| デフォルト | FALSE |
|---|
iqv=TRUE | FALSE
True に設定すると、低い質的変動の指数 (IQV) の処置のための変換が含まれます。
| デフォルト | FALSE |
|---|
kurtosis=TRUE | FALSE
True に設定すると、高い尖度の処置のための変換が含まれます。
| デフォルト | FALSE |
|---|
missing=TRUE | FALSE
True に設定すると、欠損値の処置のための変換が含まれます。
| デフォルト | TRUE |
|---|
outlier=TRUE | FALSE
True に設定すると、外れ値の処置のための変換が含まれます。
| デフォルト | FALSE |
|---|
skewness=TRUE | FALSE
True に設定すると、高い歪度の処置のための変換が含まれます。
| デフォルト | TRUE |
|---|
validationPartitionFraction=double
検証に使用する入力データの割合を指定します。
| デフォルト | 0.3 |
|---|---|
| 範囲 | 0.01–0.99 |