データサイエンスパイロット アクションセット: 構文

自動機械学習パイプラインの探索、実行、順位付けなど、データサイエンスワークフローを自動化するアクションを提供します。

dsAutoMl アクション

自動機械学習パイプラインの探索、実行、順位付け。。

dataSciencePilot.dsAutoMl <result=results> <status=rc> /
event="string",
explorationPolicy
={
cv
={
lowMoment=double
lowRobust=double
},
dateTimeVariables={"variable-name-1" <, "variable-name-2", ...>},
dateVariables={"variable-name-1" <, "variable-name-2", ...>},
nominal
={
includeNegative=TRUE | FALSE
includeNonIntegral=TRUE | FALSE
intervals={"variable-name-1" <, "variable-name-2", ...>}
nominals={"variable-name-1" <, "variable-name-2", ...>}
},
timeVariables={"variable-name-1" <, "variable-name-2", ...>}
},
required parameter featureOut
={
caslib="string",
indexVars={"variable-name-1" <, "variable-name-2", ...>},
lifetime=64-bit-integer,
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
},
hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL",
inputs
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
kFolds=integer,
logLevel=integer,
misraGries=TRUE | FALSE,
modelTypes={"DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"},
required parameter pipelineOut
={
caslib="string",
indexVars={"variable-name-1" <, "variable-name-2", ...>},
lifetime=64-bit-integer,
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
},
sampleSize=integer,
saveState={casouttable} | {savePipelinesOptions},
screenPolicy
={
constant=TRUE | FALSE,
groupRareLevels=TRUE | FALSE,
lowCv=TRUE | FALSE,
redundant=double
},
seed=integer,
required parameter table
={
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
singlePass=TRUE | FALSE,
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable
={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
required parameter target="variable-name",
topKPipelines=integer,
required parameter transformationOut
={
caslib="string",
indexVars={"variable-name-1" <, "variable-name-2", ...>},
lifetime=64-bit-integer,
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
},
transformationPolicy
={
cardinality=TRUE | FALSE,
entropy=TRUE | FALSE,
interaction=TRUE | FALSE,
iqv=TRUE | FALSE,
kurtosis=TRUE | FALSE,
missing=TRUE | FALSE,
outlier=TRUE | FALSE,
skewness=TRUE | FALSE
},
;
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

required parametertable

—

テーブル名、caslib、他の共通パラメーターを指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

required parameterfeatureOut

—

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

required parameterpipelineOut

—

分析結果を格納する CAS テーブルを指定します。

 saveState

—

分析結果を格納する CAS テーブルを指定します。

required parametertransformationOut

—

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

パラメーターの説明

distinctCountLimit=integer

重複しない値のカウント制限を指定します。この制限を超えて misraGries パラメーターを True に設定すると、Misra-Gries frequency sketch アルゴリズムを使用して頻度分布が推定されます。それ以外の場合、重複しない値のカウント操作は中止されます。

別名maxNVals
デフォルト10000
最小値256

ecdfTolerance=double

経験累積分布関数のトレランスを指定します。この値は Quantile sketch アルゴリズムによって使用されます。

デフォルト0.001
範囲1E-06–0.1

event="string"

モデル化したいターゲット変数の水準を指定します。複数水準の分類問題は、1対多の二項分類問題にキャストされます。event パラメーターの値はモデル化している水準を示します。

explorationPolicy={avaptPolicy}

自動変数分析とグループ化 (AVAPT) ポリシーを指定します。

別名avaptPolicy

avaptPolicy の値は次のいずれかになります:

cardinality={cardinalityAvaptPolicy}

自動変数分析とグループ化 (AVAPT) カーディナリティポリシーを指定します。

cardinalityAvaptPolicy の値は次のいずれかになります:

lowMediumCutoff=double

低-中カットオフのカーディナリティのしきい値を指定します。

デフォルト32
範囲2–256
mediumHighCutoff=double

中-高カットオフのカーディナリティのしきい値を指定します。

デフォルト64
範囲2–1024
minNObsPerTargetLevel=double

各ターゲット水準の最小オブザベーション数を指定します。

デフォルト10
範囲5–100
cv={cvAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 変動係数ポリシーを指定します。

別名coefficientVariation

cvAvaptPolicy の値は次のいずれかになります:

lowMoment=double

モーメント変動係数 (CV) の低-高割合しきい値の絶対値を指定します。

デフォルト1
最小値0
lowRobust=double

ロバスト変動係数 (CV) の低-高割合しきい値の絶対値を指定します。

デフォルト1
最小値0
dateTimeVariables={"variable-name-1" <, "variable-name-2", ...>}

日時変数を指定します。

別名dateTime
dateVariables={"variable-name-1" <, "variable-name-2", ...>}

日付変数を指定します。

別名date
entropy={entropyAvaptPolicy}

自動変数分析とグループ化 (AVAPT) エントロピーポリシーを指定します。

entropyAvaptPolicy の値は次のいずれかになります:

giniLowMediumCutoff=double

低-中カットオフの Gini エントロピーのしきい値を指定します。

デフォルト0.25
範囲0–1
giniMediumHighCutoff=double

中-高カットオフの Gini エントロピーのしきい値を指定します。

デフォルト0.75
範囲0–1
shannonLowMediumCutoff=double

低-中カットオフの Shannon エントロピーのしきい値を指定します。

デフォルト0.25
範囲0–1
shannonMediumHighCutoff=double

中-高カットオフの Shannon エントロピーのしきい値を指定します。

デフォルト0.75
範囲0–1
iqv={iqvAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 質的変動のインデックスポリシーを指定します。

別名qualitativeVariationIndex

iqvAvaptPolicy の値は次のいずれかになります:

highTopBottom=double

名義変数の最も頻度の高い水準と最も頻度の低い水準の間の低-高カットオフ周波数比のしきい値を指定します。

別名highTop1Bottom1
デフォルト100
最小値1
highTopTwo=double

名義変数の最も頻度の高い水準と2番目に頻度の高い水準の間の低-高カットオフ周波数比のしきい値を指定します。

別名highTop1Top2
デフォルト10
最小値1
highVariationRatio=double

低-高カットオフの変動率のしきい値を指定します。

別名highModVr
デフォルト0.5
範囲(0–1]
kurtosis={kurtosisAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 尖度ポリシーを指定します。

kurtosisAvaptPolicy の値は次のいずれかになります:

momentLowMediumCutoff=double

低-中カットオフのモーメント尖度しきい値の絶対値を指定します。

デフォルト5
最小値0
momentMediumHighCutoff=double

中-高カットオフのモーメント尖度しきい値の絶対値を指定します。

デフォルト10
最小値0
robustLowMediumCutoff=double

低-中カットオフのロバスト尖度しきい値の絶対値を指定します。

デフォルト2
最小値0
robustMediumHighCutoff=double

中-高カットオフのロバスト尖度しきい値の絶対値を指定します。

デフォルト3
最小値0
missing={missingAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 欠損値グループ化ポリシーを指定します。

missingAvaptPolicy の値は次のいずれかになります:

lowMediumCutoff=double

低-中カットオフの欠損値割合のしきい値を指定します。

デフォルト5
範囲0–100
mediumHighCutoff=double

中-高カットオフの欠損値割合のしきい値を指定します。

デフォルト25
範囲0–100
nominal={nominalAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 名義ポリシーを指定します。

nominalAvaptPolicy の値は次のいずれかになります:

cardinalityRatio=double

AVAPT 名義ポリシーカーディナリティ比のしきい値を指定します。

デフォルト0.25
範囲(0–1]
cardinalityThreshold=double

AVAPT 名義ポリシーカーディナリティのしきい値を指定します。

デフォルト1024
最小値32
includeNegative=TRUE | FALSE

True に設定すると、名義分析で負の値を持つ数値変数が含まれます。

デフォルトFALSE
includeNonIntegral=TRUE | FALSE

True に設定すると、名義分析で非整数値を持つ数値変数が含まれます。

デフォルトFALSE
intervals={"variable-name-1" <, "variable-name-2", ...>}

間隔として考慮する変数を指定します。

nominals={"variable-name-1" <, "variable-name-2", ...>}

名義として考慮する変数を指定します。

outlier={outlierAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 外れ値ポリシーを指定します。

outlierAvaptPolicy の値は次のいずれかになります:

momentLowMediumCutoff=double

低-中カットオフの z スコア外れ値割合のしきい値を指定します。

デフォルト1
範囲0–100
momentMediumHighCutoff=double

中-高カットオフの z スコア外れ値割合のしきい値を指定します。

デフォルト2.5
範囲0–100
robustLowMediumCutoff=double

低-中カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。

デフォルト1
範囲0–100
robustMediumHighCutoff=double

中-高カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。

デフォルト2.5
範囲0–100
skewness={skewnessAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 歪度ポリシーを指定します。

skewnessAvaptPolicy の値は次のいずれかになります:

momentLowMediumCutoff=double

低-中カットオフのモーメント歪度のしきい値を指定します。

デフォルト2
範囲0–100
momentMediumHighCutoff=double

中-高カットオフのモーメント歪度のしきい値を指定します。

デフォルト10
範囲0–100
robustLowMediumCutoff=double

低-中カットオフのロバスト歪度しきい値を指定します。

デフォルト0.75
範囲0–3
robustMediumHighCutoff=double

中-高カットオフのロバスト歪度しきい値を指定します。

デフォルト2
範囲0–3
timeVariables={"variable-name-1" <, "variable-name-2", ...>}

時間変数を指定します。

別名time

* featureOut={casouttable}

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

別名featuresOut
長い形式featureOut={name="table-name"}
短い形式featureOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL"

ハイパーパラメーターの最適化に使用する方法を指定します。

別名hpOptimizer
デフォルトTUNEALL

inputs={{casinvardesc-1} <, {casinvardesc-2}, ...>}

分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。

inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名vars

kFolds=integer

交差検証の分割数を指定します。

デフォルト5
範囲2–10

logLevel=integer

ログ記録レベルを指定します。

デフォルト0
範囲0–3

misraGries=TRUE | FALSE

True に設定すると、重複しない値のカウント制限を超えた場合に、頻度分布の推定に Misra-Gries アルゴリズムが使用されます。

デフォルトTRUE

modelTypes={"DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"}

パイプライン探索に含める機械学習アルゴリズムの種類とクラスを制御するための値を指定します。

DECISIONTREE

ディシジョンツリーモデルを指定します。

FOREST

ランダムフォレストモデルを指定します。

GLM

一般化線形モデルを指定します。

GRADBOOST

勾配ブースティングモデルを指定します。

LOGISTIC

ロジスティック回帰モデルを指定します。

NEURALNET

ニューラルネットワークモデルを指定します。

objective="ASE" | "AUC" | "F1" | "MAE" | "MCE" | "MSLE" | "RASE" | "RMAE" | "RMSLE"

使用するモデルパフォーマンスメトリックを使用します。

ASE

平均平方誤差(ASE)を使用します。

AUC

受信側操作の特性曲線を使用します。

F1

F1 係数を使用します。

MAE

平均絶対誤差を使用します。

MCE

誤分類誤差を使用します。

別名MCR
MSLE

平均平方対数誤差を使用します。

RASE

平均平方誤差(ASE)の平方根を使用します。

RMAE

平均絶対誤差の平方根を使用します。

RMSLE

平均平方対数誤差の平方根を使用します。

* pipelineOut={casouttable}

分析結果を格納する CAS テーブルを指定します。

別名pipelinesOut
長い形式pipelineOut={name="table-name"}
短い形式pipelineOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

sampleSize=integer

標本抽出するパイプラインの最大数を指定します。

デフォルト10
最小値1

saveState={casouttable} | {savePipelinesOptions}

分析結果を格納する CAS テーブルを指定します。

別名saveModel

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

compress=TRUE | FALSE

True に設定すると、テーブルにデータ圧縮が適用されます。

デフォルトFALSE
indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

label="string"

テーブルに関連付ける説明ラベルを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
maxMemSize=64-bit-integer

メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。

ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
replication=integer

フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。

デフォルト1
最小値0
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

threadBlockSize=64-bit-integer

出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。

別名blockSize
デフォルト1048576
最小値0
ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
timeStamp="string"

タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。

where={"string-1" <, "string-2", ...>}

出力データをサブセット化する 1 つ以上の式を指定します。複数の式が指定された場合、式は AND を使用して効果的に結合され、最終的な出力フィルタが形成されます。式に引用符で囲まれた値が含まれている場合は、ネストした引用符を使用します。

savePipelinesOptions の値は次のいずれかになります:

modelNamePrefix="string"

保存されたモデルの名前に使用する接頭辞を指定します。

replace=TRUE | FALSE

True に設定すると、同じ名前の既存のモデルが上書きされます。

デフォルトTRUE
topK=integer

保存する最適なモデルの数を指定します。

デフォルト5
最小値1

screenPolicy={sweeperPolicy}

変数の選別、変換、またはコピーを推奨するために使用する変数スクリーニングポリシーを指定します。

別名sweeperPolicy

sweeperPolicy の値は次のいずれかになります:

constant=TRUE | FALSE

True に設定すると、定数値を持つ変数を識別するための変数スクリーニングポリシーを使用します。

別名unique
デフォルトTRUE
groupRareLevels=TRUE | FALSE

True に設定すると、まれな水準を持つ名義変数を識別するための変数スクリーニングポリシーを使用します。

別名groupRare
デフォルトTRUE
leakagePercentThreshold=double

ターゲットに関する非常に高い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。指定したしきい値よりも大きいターゲットエントロピー率の低下を持つ変数は、漏えい変数としてフラグが付けられます。

別名leakagePercentageThreshold
デフォルト90
範囲(0–100]
lowCv=TRUE | FALSE

True に設定すると、低い変動係数 (CV) を持つ変数を識別するための変数スクリーニングポリシーを使用します。

別名lowCoefficientVariation
デフォルトTRUE
lowMutualInformation=double

ターゲットに関する低い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。

別名lowInformation
デフォルト0.05
最小値0
missingIndicatorPercent=double

欠損値インジケーター変数を生成する変数スクリーニングポリシーを指定します。

別名missingIndicatorPercentage
デフォルト75
範囲[10–100)
missingPercentThreshold=double

非常に高い欠損率を持つ変数を識別するための変数スクリーニングポリシーを指定します。

別名missingPercentageThreshold
デフォルト90
範囲[10–100)
redundant=double

冗長な変数を識別するための対称不確実性 (SU) のしきい値を指定します。2 つの変数の SU がしきい値を超えた場合、ターゲットに関する情報が少ない変数には冗長としてフラグが付けられます。

デフォルト1
範囲(0–1]

seed=integer

乱数生成のシード値を指定します。いくつかのシナリオでは、この値は繰り返し可能な乱数生成に使用されます。

デフォルト0

selectionPolicy={featureSelectOptions}

特徴量の選択ポリシーを指定します。

長い形式selectionPolicy={criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"}
短い形式selectionPolicy="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"

featureSelectOptions の値は次のいずれかになります:

criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"

使用するフィルター特徴量選択の基準を指定します。

別名stat
デフォルトMI
CHISQ

カイ 2 乗の統計量を使用します。

CRAMERSV

Cramer の V を使用します。

ENTROPY

エントロピー率の低下を使用します。

FTEST

F 検定を使用します。

G2

G2 の統計量を使用します。

IV

情報値の統計量を使用します。

MI

相互情報量の統計量を使用します。

NORMMI

正規化相互情報量の統計量を使用します。

PEARSON

Pearson の相関を使用します。

SU

対称不確実性の統計量を使用します。

topK=integer

最も高いフィルター選択基準値を持つ特徴量の数が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。

デフォルト50
最小値1
topKPercent=double

最も高いフィルター選択基準値を持つ特徴量の割合が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。

別名topKPercentage
範囲(0–100]

* table={castable}

テーブル名、caslib、他の共通パラメーターを指定します。

長い形式table={name="table-name"}
短い形式table="table-name"

castable の値は次のいずれかになります:

caslib="string"

アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。

computedOnDemand=TRUE | FALSE

True に設定すると、アクションの開始時ではなくテーブルのロード時に計算変数が作成されます。

別名compOnDemand
デフォルトFALSE
computedVars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

作成する計算変数の名前を指定します。computedVarsProgram パラメーターの各変数の式を指定します。このパラメーターを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。

別名compVars

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

computedVarsProgram="string"

computedVars パラメーターに含める各計算変数の式を指定します。

別名compPgm
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>}

データソースオプションを指定します。

別名options
dataSource
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。

* name="table-name"

入力テーブルの名前を指定します。

singlePass=TRUE | FALSE

True に設定すると、サーバー上に一時テーブルは作成されません。このパラメーターを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。

デフォルトFALSE
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

アクションで使用する変数を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

入力データをサブセット化する式を指定します。

whereTable={groupbytable}

WHERE フィルターとして使用する行を含む入力テーブルを指定します。vars パラメーターが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメーターとこのパラメーターが指定されている場合、このフィルタリングテーブルが最初に適用されます。

groupbytable の値は次のいずれかになります:

casLib="string"

フィルターテーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。

dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}

データソースオプションを指定します。

別名options
dataSource

dataSourceOptions パラメーターの指定の詳細については、共通 dataSourceOptions パラメーターを参照してください。

importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。

* name="table-name"

フィルターテーブルの名前を指定します。

vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

フィルターテーブルから使用する変数名を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

フィルターテーブルからデータをサブセット化する式を指定します。

* target="variable-name"

ターゲット変数を指定します。

別名evalVar

topKPipelines=integer

保存する最適なパイプラインの数を指定します。

デフォルト10
最小値1

* transformationOut={casouttable}

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

別名transformationsOut
長い形式transformationOut={name="table-name"}
短い形式transformationOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

transformationPolicy={transformationSpace}

特徴量マシンが動作する特徴量変換と生成空間を指定します。

別名transformationSpace

transformationSpace の値は次のいずれかになります:

cardinality=TRUE | FALSE

True に設定すると、カーディナリティ低減変換が含まれます。

デフォルトTRUE
entropy=TRUE | FALSE

True に設定すると、低エントロピーの処置のための変換が含まれます。

デフォルトFALSE
interaction=TRUE | FALSE

True に設定すると、交互作用特徴量が検出され、生成されます。

デフォルトFALSE
iqv=TRUE | FALSE

True に設定すると、低い質的変動の指数 (IQV) の処置のための変換が含まれます。

デフォルトFALSE
kurtosis=TRUE | FALSE

True に設定すると、高い尖度の処置のための変換が含まれます。

デフォルトFALSE
missing=TRUE | FALSE

True に設定すると、欠損値の処置のための変換が含まれます。

デフォルトTRUE
outlier=TRUE | FALSE

True に設定すると、外れ値の処置のための変換が含まれます。

デフォルトFALSE
skewness=TRUE | FALSE

True に設定すると、高い歪度の処置のための変換が含まれます。

デフォルトTRUE

validationPartitionFraction=double

検証に使用する入力データの割合を指定します。

デフォルト0.3
範囲0.01–0.99

dsAutoMl アクション

自動機械学習パイプラインの探索、実行、順位付け。。

results, info = s:dataSciencePilot_dsAutoMl{
event="string",
explorationPolicy
={
cv
={
lowMoment=double
lowRobust=double
},
dateTimeVariables={"variable-name-1" <, "variable-name-2", ...>},
dateVariables={"variable-name-1" <, "variable-name-2", ...>},
nominal
={
includeNegative=true | false
includeNonIntegral=true | false
intervals={"variable-name-1" <, "variable-name-2", ...>}
nominals={"variable-name-1" <, "variable-name-2", ...>}
},
timeVariables={"variable-name-1" <, "variable-name-2", ...>}
},
required parameter featureOut
={
caslib="string",
indexVars={"variable-name-1" <, "variable-name-2", ...>},
lifetime=64-bit-integer,
name="table-name",
promote=true | false,
replace=true | false,
},
hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL",
inputs
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
kFolds=integer,
logLevel=integer,
misraGries=true | false,
modelTypes={"DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"},
required parameter pipelineOut
={
caslib="string",
indexVars={"variable-name-1" <, "variable-name-2", ...>},
lifetime=64-bit-integer,
name="table-name",
promote=true | false,
replace=true | false,
},
sampleSize=integer,
saveState={casouttable} | {savePipelinesOptions},
screenPolicy
={
constant=true | false,
groupRareLevels=true | false,
lowCv=true | false,
redundant=double
},
seed=integer,
required parameter table
={
caslib="string",
computedOnDemand=true | false,
computedVars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
singlePass=true | false,
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable
={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
required parameter target="variable-name",
topKPipelines=integer,
required parameter transformationOut
={
caslib="string",
indexVars={"variable-name-1" <, "variable-name-2", ...>},
lifetime=64-bit-integer,
name="table-name",
promote=true | false,
replace=true | false,
},
transformationPolicy
={
cardinality=true | false,
entropy=true | false,
interaction=true | false,
iqv=true | false,
kurtosis=true | false,
missing=true | false,
outlier=true | false,
skewness=true | false
},
}
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

required parametertable

—

テーブル名、caslib、他の共通パラメーターを指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

required parameterfeatureOut

—

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

required parameterpipelineOut

—

分析結果を格納する CAS テーブルを指定します。

 saveState

—

分析結果を格納する CAS テーブルを指定します。

required parametertransformationOut

—

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

パラメーターの説明

distinctCountLimit=integer

重複しない値のカウント制限を指定します。この制限を超えて misraGries パラメーターを True に設定すると、Misra-Gries frequency sketch アルゴリズムを使用して頻度分布が推定されます。それ以外の場合、重複しない値のカウント操作は中止されます。

別名maxNVals
デフォルト10000
最小値256

ecdfTolerance=double

経験累積分布関数のトレランスを指定します。この値は Quantile sketch アルゴリズムによって使用されます。

デフォルト0.001
範囲1E-06–0.1

event="string"

モデル化したいターゲット変数の水準を指定します。複数水準の分類問題は、1対多の二項分類問題にキャストされます。event パラメーターの値はモデル化している水準を示します。

explorationPolicy={avaptPolicy}

自動変数分析とグループ化 (AVAPT) ポリシーを指定します。

別名avaptPolicy

avaptPolicy の値は次のいずれかになります:

cardinality={cardinalityAvaptPolicy}

自動変数分析とグループ化 (AVAPT) カーディナリティポリシーを指定します。

cardinalityAvaptPolicy の値は次のいずれかになります:

lowMediumCutoff=double

低-中カットオフのカーディナリティのしきい値を指定します。

デフォルト32
範囲2–256
mediumHighCutoff=double

中-高カットオフのカーディナリティのしきい値を指定します。

デフォルト64
範囲2–1024
minNObsPerTargetLevel=double

各ターゲット水準の最小オブザベーション数を指定します。

デフォルト10
範囲5–100
cv={cvAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 変動係数ポリシーを指定します。

別名coefficientVariation

cvAvaptPolicy の値は次のいずれかになります:

lowMoment=double

モーメント変動係数 (CV) の低-高割合しきい値の絶対値を指定します。

デフォルト1
最小値0
lowRobust=double

ロバスト変動係数 (CV) の低-高割合しきい値の絶対値を指定します。

デフォルト1
最小値0
dateTimeVariables={"variable-name-1" <, "variable-name-2", ...>}

日時変数を指定します。

別名dateTime
dateVariables={"variable-name-1" <, "variable-name-2", ...>}

日付変数を指定します。

別名date
entropy={entropyAvaptPolicy}

自動変数分析とグループ化 (AVAPT) エントロピーポリシーを指定します。

entropyAvaptPolicy の値は次のいずれかになります:

giniLowMediumCutoff=double

低-中カットオフの Gini エントロピーのしきい値を指定します。

デフォルト0.25
範囲0–1
giniMediumHighCutoff=double

中-高カットオフの Gini エントロピーのしきい値を指定します。

デフォルト0.75
範囲0–1
shannonLowMediumCutoff=double

低-中カットオフの Shannon エントロピーのしきい値を指定します。

デフォルト0.25
範囲0–1
shannonMediumHighCutoff=double

中-高カットオフの Shannon エントロピーのしきい値を指定します。

デフォルト0.75
範囲0–1
iqv={iqvAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 質的変動のインデックスポリシーを指定します。

別名qualitativeVariationIndex

iqvAvaptPolicy の値は次のいずれかになります:

highTopBottom=double

名義変数の最も頻度の高い水準と最も頻度の低い水準の間の低-高カットオフ周波数比のしきい値を指定します。

別名highTop1Bottom1
デフォルト100
最小値1
highTopTwo=double

名義変数の最も頻度の高い水準と2番目に頻度の高い水準の間の低-高カットオフ周波数比のしきい値を指定します。

別名highTop1Top2
デフォルト10
最小値1
highVariationRatio=double

低-高カットオフの変動率のしきい値を指定します。

別名highModVr
デフォルト0.5
範囲(0–1]
kurtosis={kurtosisAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 尖度ポリシーを指定します。

kurtosisAvaptPolicy の値は次のいずれかになります:

momentLowMediumCutoff=double

低-中カットオフのモーメント尖度しきい値の絶対値を指定します。

デフォルト5
最小値0
momentMediumHighCutoff=double

中-高カットオフのモーメント尖度しきい値の絶対値を指定します。

デフォルト10
最小値0
robustLowMediumCutoff=double

低-中カットオフのロバスト尖度しきい値の絶対値を指定します。

デフォルト2
最小値0
robustMediumHighCutoff=double

中-高カットオフのロバスト尖度しきい値の絶対値を指定します。

デフォルト3
最小値0
missing={missingAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 欠損値グループ化ポリシーを指定します。

missingAvaptPolicy の値は次のいずれかになります:

lowMediumCutoff=double

低-中カットオフの欠損値割合のしきい値を指定します。

デフォルト5
範囲0–100
mediumHighCutoff=double

中-高カットオフの欠損値割合のしきい値を指定します。

デフォルト25
範囲0–100
nominal={nominalAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 名義ポリシーを指定します。

nominalAvaptPolicy の値は次のいずれかになります:

cardinalityRatio=double

AVAPT 名義ポリシーカーディナリティ比のしきい値を指定します。

デフォルト0.25
範囲(0–1]
cardinalityThreshold=double

AVAPT 名義ポリシーカーディナリティのしきい値を指定します。

デフォルト1024
最小値32
includeNegative=true | false

True に設定すると、名義分析で負の値を持つ数値変数が含まれます。

デフォルトfalse
includeNonIntegral=true | false

True に設定すると、名義分析で非整数値を持つ数値変数が含まれます。

デフォルトfalse
intervals={"variable-name-1" <, "variable-name-2", ...>}

間隔として考慮する変数を指定します。

nominals={"variable-name-1" <, "variable-name-2", ...>}

名義として考慮する変数を指定します。

outlier={outlierAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 外れ値ポリシーを指定します。

outlierAvaptPolicy の値は次のいずれかになります:

momentLowMediumCutoff=double

低-中カットオフの z スコア外れ値割合のしきい値を指定します。

デフォルト1
範囲0–100
momentMediumHighCutoff=double

中-高カットオフの z スコア外れ値割合のしきい値を指定します。

デフォルト2.5
範囲0–100
robustLowMediumCutoff=double

低-中カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。

デフォルト1
範囲0–100
robustMediumHighCutoff=double

中-高カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。

デフォルト2.5
範囲0–100
skewness={skewnessAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 歪度ポリシーを指定します。

skewnessAvaptPolicy の値は次のいずれかになります:

momentLowMediumCutoff=double

低-中カットオフのモーメント歪度のしきい値を指定します。

デフォルト2
範囲0–100
momentMediumHighCutoff=double

中-高カットオフのモーメント歪度のしきい値を指定します。

デフォルト10
範囲0–100
robustLowMediumCutoff=double

低-中カットオフのロバスト歪度しきい値を指定します。

デフォルト0.75
範囲0–3
robustMediumHighCutoff=double

中-高カットオフのロバスト歪度しきい値を指定します。

デフォルト2
範囲0–3
timeVariables={"variable-name-1" <, "variable-name-2", ...>}

時間変数を指定します。

別名time

* featureOut={casouttable}

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

別名featuresOut
長い形式featureOut={name="table-name"}
短い形式featureOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=true | false

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトfalse
replace=true | false

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトfalse
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL"

ハイパーパラメーターの最適化に使用する方法を指定します。

別名hpOptimizer
デフォルトTUNEALL

inputs={{casinvardesc-1} <, {casinvardesc-2}, ...>}

分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。

inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名vars

kFolds=integer

交差検証の分割数を指定します。

デフォルト5
範囲2–10

logLevel=integer

ログ記録レベルを指定します。

デフォルト0
範囲0–3

misraGries=true | false

True に設定すると、重複しない値のカウント制限を超えた場合に、頻度分布の推定に Misra-Gries アルゴリズムが使用されます。

デフォルトtrue

modelTypes={"DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"}

パイプライン探索に含める機械学習アルゴリズムの種類とクラスを制御するための値を指定します。

DECISIONTREE

ディシジョンツリーモデルを指定します。

FOREST

ランダムフォレストモデルを指定します。

GLM

一般化線形モデルを指定します。

GRADBOOST

勾配ブースティングモデルを指定します。

LOGISTIC

ロジスティック回帰モデルを指定します。

NEURALNET

ニューラルネットワークモデルを指定します。

objective="ASE" | "AUC" | "F1" | "MAE" | "MCE" | "MSLE" | "RASE" | "RMAE" | "RMSLE"

使用するモデルパフォーマンスメトリックを使用します。

ASE

平均平方誤差(ASE)を使用します。

AUC

受信側操作の特性曲線を使用します。

F1

F1 係数を使用します。

MAE

平均絶対誤差を使用します。

MCE

誤分類誤差を使用します。

別名MCR
MSLE

平均平方対数誤差を使用します。

RASE

平均平方誤差(ASE)の平方根を使用します。

RMAE

平均絶対誤差の平方根を使用します。

RMSLE

平均平方対数誤差の平方根を使用します。

* pipelineOut={casouttable}

分析結果を格納する CAS テーブルを指定します。

別名pipelinesOut
長い形式pipelineOut={name="table-name"}
短い形式pipelineOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=true | false

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトfalse
replace=true | false

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトfalse
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

sampleSize=integer

標本抽出するパイプラインの最大数を指定します。

デフォルト10
最小値1

saveState={casouttable} | {savePipelinesOptions}

分析結果を格納する CAS テーブルを指定します。

別名saveModel

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

compress=true | false

True に設定すると、テーブルにデータ圧縮が適用されます。

デフォルトfalse
indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

label="string"

テーブルに関連付ける説明ラベルを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
maxMemSize=64-bit-integer

メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。

ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=true | false

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトfalse
replace=true | false

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトfalse
replication=integer

フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。

デフォルト1
最小値0
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

threadBlockSize=64-bit-integer

出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。

別名blockSize
デフォルト1048576
最小値0
ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
timeStamp="string"

タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。

where={"string-1" <, "string-2", ...>}

出力データをサブセット化する 1 つ以上の式を指定します。複数の式が指定された場合、式は AND を使用して効果的に結合され、最終的な出力フィルタが形成されます。式に引用符で囲まれた値が含まれている場合は、ネストした引用符を使用します。

savePipelinesOptions の値は次のいずれかになります:

modelNamePrefix="string"

保存されたモデルの名前に使用する接頭辞を指定します。

replace=true | false

True に設定すると、同じ名前の既存のモデルが上書きされます。

デフォルトtrue
topK=integer

保存する最適なモデルの数を指定します。

デフォルト5
最小値1

screenPolicy={sweeperPolicy}

変数の選別、変換、またはコピーを推奨するために使用する変数スクリーニングポリシーを指定します。

別名sweeperPolicy

sweeperPolicy の値は次のいずれかになります:

constant=true | false

True に設定すると、定数値を持つ変数を識別するための変数スクリーニングポリシーを使用します。

別名unique
デフォルトtrue
groupRareLevels=true | false

True に設定すると、まれな水準を持つ名義変数を識別するための変数スクリーニングポリシーを使用します。

別名groupRare
デフォルトtrue
leakagePercentThreshold=double

ターゲットに関する非常に高い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。指定したしきい値よりも大きいターゲットエントロピー率の低下を持つ変数は、漏えい変数としてフラグが付けられます。

別名leakagePercentageThreshold
デフォルト90
範囲(0–100]
lowCv=true | false

True に設定すると、低い変動係数 (CV) を持つ変数を識別するための変数スクリーニングポリシーを使用します。

別名lowCoefficientVariation
デフォルトtrue
lowMutualInformation=double

ターゲットに関する低い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。

別名lowInformation
デフォルト0.05
最小値0
missingIndicatorPercent=double

欠損値インジケーター変数を生成する変数スクリーニングポリシーを指定します。

別名missingIndicatorPercentage
デフォルト75
範囲[10–100)
missingPercentThreshold=double

非常に高い欠損率を持つ変数を識別するための変数スクリーニングポリシーを指定します。

別名missingPercentageThreshold
デフォルト90
範囲[10–100)
redundant=double

冗長な変数を識別するための対称不確実性 (SU) のしきい値を指定します。2 つの変数の SU がしきい値を超えた場合、ターゲットに関する情報が少ない変数には冗長としてフラグが付けられます。

デフォルト1
範囲(0–1]

seed=integer

乱数生成のシード値を指定します。いくつかのシナリオでは、この値は繰り返し可能な乱数生成に使用されます。

デフォルト0

selectionPolicy={featureSelectOptions}

特徴量の選択ポリシーを指定します。

長い形式selectionPolicy={criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"}
短い形式selectionPolicy="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"

featureSelectOptions の値は次のいずれかになります:

criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"

使用するフィルター特徴量選択の基準を指定します。

別名stat
デフォルトMI
CHISQ

カイ 2 乗の統計量を使用します。

CRAMERSV

Cramer の V を使用します。

ENTROPY

エントロピー率の低下を使用します。

FTEST

F 検定を使用します。

G2

G2 の統計量を使用します。

IV

情報値の統計量を使用します。

MI

相互情報量の統計量を使用します。

NORMMI

正規化相互情報量の統計量を使用します。

PEARSON

Pearson の相関を使用します。

SU

対称不確実性の統計量を使用します。

topK=integer

最も高いフィルター選択基準値を持つ特徴量の数が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。

デフォルト50
最小値1
topKPercent=double

最も高いフィルター選択基準値を持つ特徴量の割合が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。

別名topKPercentage
範囲(0–100]

* table={castable}

テーブル名、caslib、他の共通パラメーターを指定します。

長い形式table={name="table-name"}
短い形式table="table-name"

castable の値は次のいずれかになります:

caslib="string"

アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。

computedOnDemand=true | false

True に設定すると、アクションの開始時ではなくテーブルのロード時に計算変数が作成されます。

別名compOnDemand
デフォルトfalse
computedVars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

作成する計算変数の名前を指定します。computedVarsProgram パラメーターの各変数の式を指定します。このパラメーターを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。

別名compVars

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

computedVarsProgram="string"

computedVars パラメーターに含める各計算変数の式を指定します。

別名compPgm
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>}

データソースオプションを指定します。

別名options
dataSource
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。

* name="table-name"

入力テーブルの名前を指定します。

singlePass=true | false

True に設定すると、サーバー上に一時テーブルは作成されません。このパラメーターを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。

デフォルトfalse
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

アクションで使用する変数を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

入力データをサブセット化する式を指定します。

whereTable={groupbytable}

WHERE フィルターとして使用する行を含む入力テーブルを指定します。vars パラメーターが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメーターとこのパラメーターが指定されている場合、このフィルタリングテーブルが最初に適用されます。

groupbytable の値は次のいずれかになります:

casLib="string"

フィルターテーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。

dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}

データソースオプションを指定します。

別名options
dataSource

dataSourceOptions パラメーターの指定の詳細については、共通 dataSourceOptions パラメーターを参照してください。

importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。

* name="table-name"

フィルターテーブルの名前を指定します。

vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

フィルターテーブルから使用する変数名を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

フィルターテーブルからデータをサブセット化する式を指定します。

* target="variable-name"

ターゲット変数を指定します。

別名evalVar

topKPipelines=integer

保存する最適なパイプラインの数を指定します。

デフォルト10
最小値1

* transformationOut={casouttable}

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

別名transformationsOut
長い形式transformationOut={name="table-name"}
短い形式transformationOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=true | false

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトfalse
replace=true | false

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトfalse
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

transformationPolicy={transformationSpace}

特徴量マシンが動作する特徴量変換と生成空間を指定します。

別名transformationSpace

transformationSpace の値は次のいずれかになります:

cardinality=true | false

True に設定すると、カーディナリティ低減変換が含まれます。

デフォルトtrue
entropy=true | false

True に設定すると、低エントロピーの処置のための変換が含まれます。

デフォルトfalse
interaction=true | false

True に設定すると、交互作用特徴量が検出され、生成されます。

デフォルトfalse
iqv=true | false

True に設定すると、低い質的変動の指数 (IQV) の処置のための変換が含まれます。

デフォルトfalse
kurtosis=true | false

True に設定すると、高い尖度の処置のための変換が含まれます。

デフォルトfalse
missing=true | false

True に設定すると、欠損値の処置のための変換が含まれます。

デフォルトtrue
outlier=true | false

True に設定すると、外れ値の処置のための変換が含まれます。

デフォルトfalse
skewness=true | false

True に設定すると、高い歪度の処置のための変換が含まれます。

デフォルトtrue

validationPartitionFraction=double

検証に使用する入力データの割合を指定します。

デフォルト0.3
範囲0.01–0.99

dsAutoMl アクション

自動機械学習パイプラインの探索、実行、順位付け。。

results=s.dataSciencePilot.dsAutoMl(
event="string",
explorationPolicy
={
"cv"
:{
"lowMoment":double
"lowRobust":double
},
"dateTimeVariables":["variable-name-1" <, "variable-name-2", ...>],
"dateVariables":["variable-name-1" <, "variable-name-2", ...>],
"iqv"
:{
"highTopBottom":double
"highTopTwo":double
},
"missing"
:{
},
"nominal"
:{
"includeNegative":True | False
"includeNonIntegral":True | False
"intervals":["variable-name-1" <, "variable-name-2", ...>]
"nominals":["variable-name-1" <, "variable-name-2", ...>]
},
"timeVariables":["variable-name-1" <, "variable-name-2", ...>]
},
required parameter featureOut
={
"caslib":"string",
"indexVars":["variable-name-1" <, "variable-name-2", ...>],
"lifetime":64-bit-integer,
"name":"table-name",
"promote":True | False,
"replace":True | False,
},
hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL",
inputs
=[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
kFolds=integer,
logLevel=integer,
misraGries=True | False,
modelTypes=["DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"],
required parameter pipelineOut
={
"caslib":"string",
"indexVars":["variable-name-1" <, "variable-name-2", ...>],
"lifetime":64-bit-integer,
"name":"table-name",
"promote":True | False,
"replace":True | False,
},
sampleSize=integer,
saveState={casouttable} | {savePipelinesOptions},
screenPolicy
={
"constant":True | False,
"groupRareLevels":True | False,
"lowCv":True | False,
"redundant":double
},
seed=integer,
required parameter table
={
"caslib":"string",
"computedOnDemand":True | False,
"computedVars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>},
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter "name":"table-name",
"singlePass":True | False,
"vars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"where":"where-expression",
"whereTable"
:{
"casLib":"string"
"dataSourceOptions":{adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter "name":"table-name"
"vars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>]
"where":"where-expression"
}
},
required parameter target="variable-name",
topKPipelines=integer,
required parameter transformationOut
={
"caslib":"string",
"indexVars":["variable-name-1" <, "variable-name-2", ...>],
"lifetime":64-bit-integer,
"name":"table-name",
"promote":True | False,
"replace":True | False,
},
transformationPolicy
={
"cardinality":True | False,
"entropy":True | False,
"interaction":True | False,
"iqv":True | False,
"kurtosis":True | False,
"missing":True | False,
"outlier":True | False,
"skewness":True | False
},
)
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

required parametertable

—

テーブル名、caslib、他の共通パラメーターを指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

required parameterfeatureOut

—

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

required parameterpipelineOut

—

分析結果を格納する CAS テーブルを指定します。

 saveState

—

分析結果を格納する CAS テーブルを指定します。

required parametertransformationOut

—

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

パラメーターの説明

distinctCountLimit=integer

重複しない値のカウント制限を指定します。この制限を超えて misraGries パラメーターを True に設定すると、Misra-Gries frequency sketch アルゴリズムを使用して頻度分布が推定されます。それ以外の場合、重複しない値のカウント操作は中止されます。

別名maxNVals
デフォルト10000
最小値256

ecdfTolerance=double

経験累積分布関数のトレランスを指定します。この値は Quantile sketch アルゴリズムによって使用されます。

デフォルト0.001
範囲1E-06–0.1

event="string"

モデル化したいターゲット変数の水準を指定します。複数水準の分類問題は、1対多の二項分類問題にキャストされます。event パラメーターの値はモデル化している水準を示します。

explorationPolicy={avaptPolicy}

自動変数分析とグループ化 (AVAPT) ポリシーを指定します。

別名avaptPolicy

avaptPolicy の値は次のいずれかになります:

"cardinality":{cardinalityAvaptPolicy}

自動変数分析とグループ化 (AVAPT) カーディナリティポリシーを指定します。

cardinalityAvaptPolicy の値は次のいずれかになります:

"lowMediumCutoff":double

低-中カットオフのカーディナリティのしきい値を指定します。

デフォルト32
範囲2–256
"mediumHighCutoff":double

中-高カットオフのカーディナリティのしきい値を指定します。

デフォルト64
範囲2–1024
"minNObsPerTargetLevel":double

各ターゲット水準の最小オブザベーション数を指定します。

デフォルト10
範囲5–100
"cv":{cvAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 変動係数ポリシーを指定します。

別名coefficientVariation

cvAvaptPolicy の値は次のいずれかになります:

"lowMoment":double

モーメント変動係数 (CV) の低-高割合しきい値の絶対値を指定します。

デフォルト1
最小値0
"lowRobust":double

ロバスト変動係数 (CV) の低-高割合しきい値の絶対値を指定します。

デフォルト1
最小値0
"dateTimeVariables":["variable-name-1" <, "variable-name-2", ...>]

日時変数を指定します。

別名dateTime
"dateVariables":["variable-name-1" <, "variable-name-2", ...>]

日付変数を指定します。

別名date
"entropy":{entropyAvaptPolicy}

自動変数分析とグループ化 (AVAPT) エントロピーポリシーを指定します。

entropyAvaptPolicy の値は次のいずれかになります:

"giniLowMediumCutoff":double

低-中カットオフの Gini エントロピーのしきい値を指定します。

デフォルト0.25
範囲0–1
"giniMediumHighCutoff":double

中-高カットオフの Gini エントロピーのしきい値を指定します。

デフォルト0.75
範囲0–1
"shannonLowMediumCutoff":double

低-中カットオフの Shannon エントロピーのしきい値を指定します。

デフォルト0.25
範囲0–1
"shannonMediumHighCutoff":double

中-高カットオフの Shannon エントロピーのしきい値を指定します。

デフォルト0.75
範囲0–1
"iqv":{iqvAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 質的変動のインデックスポリシーを指定します。

別名qualitativeVariationIndex

iqvAvaptPolicy の値は次のいずれかになります:

"highTopBottom":double

名義変数の最も頻度の高い水準と最も頻度の低い水準の間の低-高カットオフ周波数比のしきい値を指定します。

別名highTop1Bottom1
デフォルト100
最小値1
"highTopTwo":double

名義変数の最も頻度の高い水準と2番目に頻度の高い水準の間の低-高カットオフ周波数比のしきい値を指定します。

別名highTop1Top2
デフォルト10
最小値1
"highVariationRatio":double

低-高カットオフの変動率のしきい値を指定します。

別名highModVr
デフォルト0.5
範囲(0–1]
"kurtosis":{kurtosisAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 尖度ポリシーを指定します。

kurtosisAvaptPolicy の値は次のいずれかになります:

"momentLowMediumCutoff":double

低-中カットオフのモーメント尖度しきい値の絶対値を指定します。

デフォルト5
最小値0
"momentMediumHighCutoff":double

中-高カットオフのモーメント尖度しきい値の絶対値を指定します。

デフォルト10
最小値0
"robustLowMediumCutoff":double

低-中カットオフのロバスト尖度しきい値の絶対値を指定します。

デフォルト2
最小値0
"robustMediumHighCutoff":double

中-高カットオフのロバスト尖度しきい値の絶対値を指定します。

デフォルト3
最小値0
"missing":{missingAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 欠損値グループ化ポリシーを指定します。

missingAvaptPolicy の値は次のいずれかになります:

"lowMediumCutoff":double

低-中カットオフの欠損値割合のしきい値を指定します。

デフォルト5
範囲0–100
"mediumHighCutoff":double

中-高カットオフの欠損値割合のしきい値を指定します。

デフォルト25
範囲0–100
"nominal":{nominalAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 名義ポリシーを指定します。

nominalAvaptPolicy の値は次のいずれかになります:

"cardinalityRatio":double

AVAPT 名義ポリシーカーディナリティ比のしきい値を指定します。

デフォルト0.25
範囲(0–1]
"cardinalityThreshold":double

AVAPT 名義ポリシーカーディナリティのしきい値を指定します。

デフォルト1024
最小値32
"includeNegative":True | False

True に設定すると、名義分析で負の値を持つ数値変数が含まれます。

デフォルトFalse
"includeNonIntegral":True | False

True に設定すると、名義分析で非整数値を持つ数値変数が含まれます。

デフォルトFalse
"intervals":["variable-name-1" <, "variable-name-2", ...>]

間隔として考慮する変数を指定します。

"nominals":["variable-name-1" <, "variable-name-2", ...>]

名義として考慮する変数を指定します。

"outlier":{outlierAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 外れ値ポリシーを指定します。

outlierAvaptPolicy の値は次のいずれかになります:

"momentLowMediumCutoff":double

低-中カットオフの z スコア外れ値割合のしきい値を指定します。

デフォルト1
範囲0–100
"momentMediumHighCutoff":double

中-高カットオフの z スコア外れ値割合のしきい値を指定します。

デフォルト2.5
範囲0–100
"robustLowMediumCutoff":double

低-中カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。

デフォルト1
範囲0–100
"robustMediumHighCutoff":double

中-高カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。

デフォルト2.5
範囲0–100
"skewness":{skewnessAvaptPolicy}

自動変数分析とグループ化 (AVAPT) 歪度ポリシーを指定します。

skewnessAvaptPolicy の値は次のいずれかになります:

"momentLowMediumCutoff":double

低-中カットオフのモーメント歪度のしきい値を指定します。

デフォルト2
範囲0–100
"momentMediumHighCutoff":double

中-高カットオフのモーメント歪度のしきい値を指定します。

デフォルト10
範囲0–100
"robustLowMediumCutoff":double

低-中カットオフのロバスト歪度しきい値を指定します。

デフォルト0.75
範囲0–3
"robustMediumHighCutoff":double

中-高カットオフのロバスト歪度しきい値を指定します。

デフォルト2
範囲0–3
"timeVariables":["variable-name-1" <, "variable-name-2", ...>]

時間変数を指定します。

別名time

* featureOut={casouttable}

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

別名featuresOut
長い形式featureOut={"name":"table-name"}
短い形式featureOut="table-name"

casouttable の値は次のいずれかになります:

"caslib":"string"

出力テーブルの caslib の名前を指定します。

"indexVars":["variable-name-1" <, "variable-name-2", ...>]

出力データにインデックスを作成する変数のリストを指定します。

"lifetime":64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

"name":"table-name"

出力テーブルの名前を指定します。

"promote":True | False

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFalse
"replace":True | False

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFalse
"tableRedistUpPolicy":"DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL"

ハイパーパラメーターの最適化に使用する方法を指定します。

別名hpOptimizer
デフォルトTUNEALL

inputs=[{casinvardesc-1} <, {casinvardesc-2}, ...>]

分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。

inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名vars

kFolds=integer

交差検証の分割数を指定します。

デフォルト5
範囲2–10

logLevel=integer

ログ記録レベルを指定します。

デフォルト0
範囲0–3

misraGries=True | False

True に設定すると、重複しない値のカウント制限を超えた場合に、頻度分布の推定に Misra-Gries アルゴリズムが使用されます。

デフォルトTrue

modelTypes=["DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"]

パイプライン探索に含める機械学習アルゴリズムの種類とクラスを制御するための値を指定します。

DECISIONTREE

ディシジョンツリーモデルを指定します。

FOREST

ランダムフォレストモデルを指定します。

GLM

一般化線形モデルを指定します。

GRADBOOST

勾配ブースティングモデルを指定します。

LOGISTIC

ロジスティック回帰モデルを指定します。

NEURALNET

ニューラルネットワークモデルを指定します。

objective="ASE" | "AUC" | "F1" | "MAE" | "MCE" | "MSLE" | "RASE" | "RMAE" | "RMSLE"

使用するモデルパフォーマンスメトリックを使用します。

ASE

平均平方誤差(ASE)を使用します。

AUC

受信側操作の特性曲線を使用します。

F1

F1 係数を使用します。

MAE

平均絶対誤差を使用します。

MCE

誤分類誤差を使用します。

別名MCR
MSLE

平均平方対数誤差を使用します。

RASE

平均平方誤差(ASE)の平方根を使用します。

RMAE

平均絶対誤差の平方根を使用します。

RMSLE

平均平方対数誤差の平方根を使用します。

* pipelineOut={casouttable}

分析結果を格納する CAS テーブルを指定します。

別名pipelinesOut
長い形式pipelineOut={"name":"table-name"}
短い形式pipelineOut="table-name"

casouttable の値は次のいずれかになります:

"caslib":"string"

出力テーブルの caslib の名前を指定します。

"indexVars":["variable-name-1" <, "variable-name-2", ...>]

出力データにインデックスを作成する変数のリストを指定します。

"lifetime":64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

"name":"table-name"

出力テーブルの名前を指定します。

"promote":True | False

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFalse
"replace":True | False

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFalse
"tableRedistUpPolicy":"DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

sampleSize=integer

標本抽出するパイプラインの最大数を指定します。

デフォルト10
最小値1

saveState={casouttable} | {savePipelinesOptions}

分析結果を格納する CAS テーブルを指定します。

別名saveModel

casouttable の値は次のいずれかになります:

"caslib":"string"

出力テーブルの caslib の名前を指定します。

"compress":True | False

True に設定すると、テーブルにデータ圧縮が適用されます。

デフォルトFalse
"indexVars":["variable-name-1" <, "variable-name-2", ...>]

出力データにインデックスを作成する変数のリストを指定します。

"label":"string"

テーブルに関連付ける説明ラベルを指定します。

"lifetime":64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
"maxMemSize":64-bit-integer

メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。

ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

"name":"table-name"

出力テーブルの名前を指定します。

"promote":True | False

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFalse
"replace":True | False

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFalse
"replication":integer

フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。

デフォルト1
最小値0
"tableRedistUpPolicy":"DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

"threadBlockSize":64-bit-integer

出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。

別名blockSize
デフォルト1048576
最小値0
ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
"timeStamp":"string"

タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。

"where":["string-1" <, "string-2", ...>]

出力データをサブセット化する 1 つ以上の式を指定します。複数の式が指定された場合、式は AND を使用して効果的に結合され、最終的な出力フィルタが形成されます。式に引用符で囲まれた値が含まれている場合は、ネストした引用符を使用します。

savePipelinesOptions の値は次のいずれかになります:

"modelNamePrefix":"string"

保存されたモデルの名前に使用する接頭辞を指定します。

"replace":True | False

True に設定すると、同じ名前の既存のモデルが上書きされます。

デフォルトTrue
"topK":integer

保存する最適なモデルの数を指定します。

デフォルト5
最小値1

screenPolicy={sweeperPolicy}

変数の選別、変換、またはコピーを推奨するために使用する変数スクリーニングポリシーを指定します。

別名sweeperPolicy

sweeperPolicy の値は次のいずれかになります:

"constant":True | False

True に設定すると、定数値を持つ変数を識別するための変数スクリーニングポリシーを使用します。

別名unique
デフォルトTrue
"groupRareLevels":True | False

True に設定すると、まれな水準を持つ名義変数を識別するための変数スクリーニングポリシーを使用します。

別名groupRare
デフォルトTrue
"leakagePercentThreshold":double

ターゲットに関する非常に高い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。指定したしきい値よりも大きいターゲットエントロピー率の低下を持つ変数は、漏えい変数としてフラグが付けられます。

別名leakagePercentageThreshold
デフォルト90
範囲(0–100]
"lowCv":True | False

True に設定すると、低い変動係数 (CV) を持つ変数を識別するための変数スクリーニングポリシーを使用します。

別名lowCoefficientVariation
デフォルトTrue
"lowMutualInformation":double

ターゲットに関する低い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。

別名lowInformation
デフォルト0.05
最小値0
"missingIndicatorPercent":double

欠損値インジケーター変数を生成する変数スクリーニングポリシーを指定します。

別名missingIndicatorPercentage
デフォルト75
範囲[10–100)
"missingPercentThreshold":double

非常に高い欠損率を持つ変数を識別するための変数スクリーニングポリシーを指定します。

別名missingPercentageThreshold
デフォルト90
範囲[10–100)
"redundant":double

冗長な変数を識別するための対称不確実性 (SU) のしきい値を指定します。2 つの変数の SU がしきい値を超えた場合、ターゲットに関する情報が少ない変数には冗長としてフラグが付けられます。

デフォルト1
範囲(0–1]

seed=integer

乱数生成のシード値を指定します。いくつかのシナリオでは、この値は繰り返し可能な乱数生成に使用されます。

デフォルト0

selectionPolicy={featureSelectOptions}

特徴量の選択ポリシーを指定します。

長い形式selectionPolicy={"criterion":"CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"}
短い形式selectionPolicy="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"

featureSelectOptions の値は次のいずれかになります:

"criterion":"CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"

使用するフィルター特徴量選択の基準を指定します。

別名stat
デフォルトMI
CHISQ

カイ 2 乗の統計量を使用します。

CRAMERSV

Cramer の V を使用します。

ENTROPY

エントロピー率の低下を使用します。

FTEST

F 検定を使用します。

G2

G2 の統計量を使用します。

IV

情報値の統計量を使用します。

MI

相互情報量の統計量を使用します。

NORMMI

正規化相互情報量の統計量を使用します。

PEARSON

Pearson の相関を使用します。

SU

対称不確実性の統計量を使用します。

"topK":integer

最も高いフィルター選択基準値を持つ特徴量の数が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。

デフォルト50
最小値1
"topKPercent":double

最も高いフィルター選択基準値を持つ特徴量の割合が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。

別名topKPercentage
範囲(0–100]

* table={castable}

テーブル名、caslib、他の共通パラメーターを指定します。

長い形式table={"name":"table-name"}
短い形式table="table-name"

castable の値は次のいずれかになります:

"caslib":"string"

アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。

"computedOnDemand":True | False

True に設定すると、アクションの開始時ではなくテーブルのロード時に計算変数が作成されます。

別名compOnDemand
デフォルトFalse
"computedVars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]

作成する計算変数の名前を指定します。computedVarsProgram パラメーターの各変数の式を指定します。このパラメーターを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。

別名compVars

casinvardesc の値は次のいずれかになります:

"format":"string"

変数に適用するフォーマットを指定します。

"formattedLength":integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

"label":"string"

変数の説明ラベルを指定します。

* "name":"variable-name"

変数の名前を指定します。

"nfd":integer

フォーマット精度の長さを指定します。

"nfl":integer

フォーマットフィールドの長さを指定します。

"computedVarsProgram":"string"

computedVars パラメーターに含める各計算変数の式を指定します。

別名compPgm
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>}

データソースオプションを指定します。

別名options
dataSource
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import_

importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。

* "name":"table-name"

入力テーブルの名前を指定します。

"singlePass":True | False

True に設定すると、サーバー上に一時テーブルは作成されません。このパラメーターを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。

デフォルトFalse
"vars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]

アクションで使用する変数を指定します。

casinvardesc の値は次のいずれかになります:

"format":"string"

変数に適用するフォーマットを指定します。

"formattedLength":integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

"label":"string"

変数の説明ラベルを指定します。

* "name":"variable-name"

変数の名前を指定します。

"nfd":integer

フォーマット精度の長さを指定します。

"nfl":integer

フォーマットフィールドの長さを指定します。

"where":"where-expression"

入力データをサブセット化する式を指定します。

"whereTable":{groupbytable}

WHERE フィルターとして使用する行を含む入力テーブルを指定します。vars パラメーターが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメーターとこのパラメーターが指定されている場合、このフィルタリングテーブルが最初に適用されます。

groupbytable の値は次のいずれかになります:

"casLib":"string"

フィルターテーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。

"dataSourceOptions":{adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}

データソースオプションを指定します。

別名options
dataSource

dataSourceOptions パラメーターの指定の詳細については、共通 dataSourceOptions パラメーターを参照してください。

"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import_

importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。

* "name":"table-name"

フィルターテーブルの名前を指定します。

"vars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]

フィルターテーブルから使用する変数名を指定します。

casinvardesc の値は次のいずれかになります:

"format":"string"

変数に適用するフォーマットを指定します。

"formattedLength":integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

"label":"string"

変数の説明ラベルを指定します。

* "name":"variable-name"

変数の名前を指定します。

"nfd":integer

フォーマット精度の長さを指定します。

"nfl":integer

フォーマットフィールドの長さを指定します。

"where":"where-expression"

フィルターテーブルからデータをサブセット化する式を指定します。

* target="variable-name"

ターゲット変数を指定します。

別名evalVar

topKPipelines=integer

保存する最適なパイプラインの数を指定します。

デフォルト10
最小値1

* transformationOut={casouttable}

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

別名transformationsOut
長い形式transformationOut={"name":"table-name"}
短い形式transformationOut="table-name"

casouttable の値は次のいずれかになります:

"caslib":"string"

出力テーブルの caslib の名前を指定します。

"indexVars":["variable-name-1" <, "variable-name-2", ...>]

出力データにインデックスを作成する変数のリストを指定します。

"lifetime":64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

"name":"table-name"

出力テーブルの名前を指定します。

"promote":True | False

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFalse
"replace":True | False

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFalse
"tableRedistUpPolicy":"DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

transformationPolicy={transformationSpace}

特徴量マシンが動作する特徴量変換と生成空間を指定します。

別名transformationSpace

transformationSpace の値は次のいずれかになります:

"cardinality":True | False

True に設定すると、カーディナリティ低減変換が含まれます。

デフォルトTrue
"entropy":True | False

True に設定すると、低エントロピーの処置のための変換が含まれます。

デフォルトFalse
"interaction":True | False

True に設定すると、交互作用特徴量が検出され、生成されます。

デフォルトFalse
"iqv":True | False

True に設定すると、低い質的変動の指数 (IQV) の処置のための変換が含まれます。

デフォルトFalse
"kurtosis":True | False

True に設定すると、高い尖度の処置のための変換が含まれます。

デフォルトFalse
"missing":True | False

True に設定すると、欠損値の処置のための変換が含まれます。

デフォルトTrue
"outlier":True | False

True に設定すると、外れ値の処置のための変換が含まれます。

デフォルトFalse
"skewness":True | False

True に設定すると、高い歪度の処置のための変換が含まれます。

デフォルトTrue

validationPartitionFraction=double

検証に使用する入力データの割合を指定します。

デフォルト0.3
範囲0.01–0.99

dsAutoMl アクション

自動機械学習パイプラインの探索、実行、順位付け。。

results <– cas.dataSciencePilot.dsAutoMl(s,
event="string",
explorationPolicy
=list(
cv
=list(
lowMoment=double
lowRobust=double
),
dateTimeVariables=list("variable-name-1" <, "variable-name-2", ...>),
dateVariables=list("variable-name-1" <, "variable-name-2", ...>),
iqv
=list(),
nominal
=list(
includeNegative=TRUE | FALSE
includeNonIntegral=TRUE | FALSE
intervals=list("variable-name-1" <, "variable-name-2", ...>)
nominals=list("variable-name-1" <, "variable-name-2", ...>)
),
timeVariables=list("variable-name-1" <, "variable-name-2", ...>)
),
required parameter featureOut
=list(
caslib="string",
indexVars=list("variable-name-1" <, "variable-name-2", ...>),
lifetime=64-bit-integer,
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
),
hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL",
inputs
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
kFolds=integer,
logLevel=integer,
misraGries=TRUE | FALSE,
modelTypes=list("DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET"),
required parameter pipelineOut
=list(
caslib="string",
indexVars=list("variable-name-1" <, "variable-name-2", ...>),
lifetime=64-bit-integer,
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
),
sampleSize=integer,
saveState=list(casouttable) | list(savePipelinesOptions),
screenPolicy
=list(
constant=TRUE | FALSE,
groupRareLevels=TRUE | FALSE,
lowCv=TRUE | FALSE,
redundant=double
),
seed=integer,
required parameter table
=list(
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>),
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters),
required parameter name="table-name",
singlePass=TRUE | FALSE,
vars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
where="where-expression",
whereTable
=list(
casLib="string"
dataSourceOptions=list(adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters)
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
required parameter name="table-name"
vars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>)
where="where-expression"
)
),
required parameter target="variable-name",
topKPipelines=integer,
required parameter transformationOut
=list(
caslib="string",
indexVars=list("variable-name-1" <, "variable-name-2", ...>),
lifetime=64-bit-integer,
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
),
transformationPolicy
=list(
cardinality=TRUE | FALSE,
entropy=TRUE | FALSE,
interaction=TRUE | FALSE,
iqv=TRUE | FALSE,
kurtosis=TRUE | FALSE,
missing=TRUE | FALSE,
outlier=TRUE | FALSE,
skewness=TRUE | FALSE
),
)
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

required parametertable

—

テーブル名、caslib、他の共通パラメーターを指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

required parameterfeatureOut

—

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

required parameterpipelineOut

—

分析結果を格納する CAS テーブルを指定します。

 saveState

—

分析結果を格納する CAS テーブルを指定します。

required parametertransformationOut

—

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

パラメーターの説明

distinctCountLimit=integer

重複しない値のカウント制限を指定します。この制限を超えて misraGries パラメーターを True に設定すると、Misra-Gries frequency sketch アルゴリズムを使用して頻度分布が推定されます。それ以外の場合、重複しない値のカウント操作は中止されます。

別名maxNVals
デフォルト10000
最小値256

ecdfTolerance=double

経験累積分布関数のトレランスを指定します。この値は Quantile sketch アルゴリズムによって使用されます。

デフォルト0.001
範囲1E-06–0.1

event="string"

モデル化したいターゲット変数の水準を指定します。複数水準の分類問題は、1対多の二項分類問題にキャストされます。event パラメーターの値はモデル化している水準を示します。

explorationPolicy=list(avaptPolicy)

自動変数分析とグループ化 (AVAPT) ポリシーを指定します。

別名avaptPolicy

avaptPolicy の値は次のいずれかになります:

cardinality=list(cardinalityAvaptPolicy)

自動変数分析とグループ化 (AVAPT) カーディナリティポリシーを指定します。

cardinalityAvaptPolicy の値は次のいずれかになります:

lowMediumCutoff=double

低-中カットオフのカーディナリティのしきい値を指定します。

デフォルト32
範囲2–256
mediumHighCutoff=double

中-高カットオフのカーディナリティのしきい値を指定します。

デフォルト64
範囲2–1024
minNObsPerTargetLevel=double

各ターゲット水準の最小オブザベーション数を指定します。

デフォルト10
範囲5–100
cv=list(cvAvaptPolicy)

自動変数分析とグループ化 (AVAPT) 変動係数ポリシーを指定します。

別名coefficientVariation

cvAvaptPolicy の値は次のいずれかになります:

lowMoment=double

モーメント変動係数 (CV) の低-高割合しきい値の絶対値を指定します。

デフォルト1
最小値0
lowRobust=double

ロバスト変動係数 (CV) の低-高割合しきい値の絶対値を指定します。

デフォルト1
最小値0
dateTimeVariables=list("variable-name-1" <, "variable-name-2", ...>)

日時変数を指定します。

別名dateTime
dateVariables=list("variable-name-1" <, "variable-name-2", ...>)

日付変数を指定します。

別名date
entropy=list(entropyAvaptPolicy)

自動変数分析とグループ化 (AVAPT) エントロピーポリシーを指定します。

entropyAvaptPolicy の値は次のいずれかになります:

giniLowMediumCutoff=double

低-中カットオフの Gini エントロピーのしきい値を指定します。

デフォルト0.25
範囲0–1
giniMediumHighCutoff=double

中-高カットオフの Gini エントロピーのしきい値を指定します。

デフォルト0.75
範囲0–1
shannonLowMediumCutoff=double

低-中カットオフの Shannon エントロピーのしきい値を指定します。

デフォルト0.25
範囲0–1
shannonMediumHighCutoff=double

中-高カットオフの Shannon エントロピーのしきい値を指定します。

デフォルト0.75
範囲0–1
iqv=list(iqvAvaptPolicy)

自動変数分析とグループ化 (AVAPT) 質的変動のインデックスポリシーを指定します。

別名qualitativeVariationIndex

iqvAvaptPolicy の値は次のいずれかになります:

highTopBottom=double

名義変数の最も頻度の高い水準と最も頻度の低い水準の間の低-高カットオフ周波数比のしきい値を指定します。

別名highTop1Bottom1
デフォルト100
最小値1
highTopTwo=double

名義変数の最も頻度の高い水準と2番目に頻度の高い水準の間の低-高カットオフ周波数比のしきい値を指定します。

別名highTop1Top2
デフォルト10
最小値1
highVariationRatio=double

低-高カットオフの変動率のしきい値を指定します。

別名highModVr
デフォルト0.5
範囲(0–1]
kurtosis=list(kurtosisAvaptPolicy)

自動変数分析とグループ化 (AVAPT) 尖度ポリシーを指定します。

kurtosisAvaptPolicy の値は次のいずれかになります:

momentLowMediumCutoff=double

低-中カットオフのモーメント尖度しきい値の絶対値を指定します。

デフォルト5
最小値0
momentMediumHighCutoff=double

中-高カットオフのモーメント尖度しきい値の絶対値を指定します。

デフォルト10
最小値0
robustLowMediumCutoff=double

低-中カットオフのロバスト尖度しきい値の絶対値を指定します。

デフォルト2
最小値0
robustMediumHighCutoff=double

中-高カットオフのロバスト尖度しきい値の絶対値を指定します。

デフォルト3
最小値0
missing=list(missingAvaptPolicy)

自動変数分析とグループ化 (AVAPT) 欠損値グループ化ポリシーを指定します。

missingAvaptPolicy の値は次のいずれかになります:

lowMediumCutoff=double

低-中カットオフの欠損値割合のしきい値を指定します。

デフォルト5
範囲0–100
mediumHighCutoff=double

中-高カットオフの欠損値割合のしきい値を指定します。

デフォルト25
範囲0–100
nominal=list(nominalAvaptPolicy)

自動変数分析とグループ化 (AVAPT) 名義ポリシーを指定します。

nominalAvaptPolicy の値は次のいずれかになります:

cardinalityRatio=double

AVAPT 名義ポリシーカーディナリティ比のしきい値を指定します。

デフォルト0.25
範囲(0–1]
cardinalityThreshold=double

AVAPT 名義ポリシーカーディナリティのしきい値を指定します。

デフォルト1024
最小値32
includeNegative=TRUE | FALSE

True に設定すると、名義分析で負の値を持つ数値変数が含まれます。

デフォルトFALSE
includeNonIntegral=TRUE | FALSE

True に設定すると、名義分析で非整数値を持つ数値変数が含まれます。

デフォルトFALSE
intervals=list("variable-name-1" <, "variable-name-2", ...>)

間隔として考慮する変数を指定します。

nominals=list("variable-name-1" <, "variable-name-2", ...>)

名義として考慮する変数を指定します。

outlier=list(outlierAvaptPolicy)

自動変数分析とグループ化 (AVAPT) 外れ値ポリシーを指定します。

outlierAvaptPolicy の値は次のいずれかになります:

momentLowMediumCutoff=double

低-中カットオフの z スコア外れ値割合のしきい値を指定します。

デフォルト1
範囲0–100
momentMediumHighCutoff=double

中-高カットオフの z スコア外れ値割合のしきい値を指定します。

デフォルト2.5
範囲0–100
robustLowMediumCutoff=double

低-中カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。

デフォルト1
範囲0–100
robustMediumHighCutoff=double

中-高カットオフの修正済四分位範囲外れ値割合のしきい値を指定します。

デフォルト2.5
範囲0–100
skewness=list(skewnessAvaptPolicy)

自動変数分析とグループ化 (AVAPT) 歪度ポリシーを指定します。

skewnessAvaptPolicy の値は次のいずれかになります:

momentLowMediumCutoff=double

低-中カットオフのモーメント歪度のしきい値を指定します。

デフォルト2
範囲0–100
momentMediumHighCutoff=double

中-高カットオフのモーメント歪度のしきい値を指定します。

デフォルト10
範囲0–100
robustLowMediumCutoff=double

低-中カットオフのロバスト歪度しきい値を指定します。

デフォルト0.75
範囲0–3
robustMediumHighCutoff=double

中-高カットオフのロバスト歪度しきい値を指定します。

デフォルト2
範囲0–3
timeVariables=list("variable-name-1" <, "variable-name-2", ...>)

時間変数を指定します。

別名time

* featureOut=list(casouttable)

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

別名featuresOut
長い形式featureOut=list(name="table-name")
短い形式featureOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

indexVars=list("variable-name-1" <, "variable-name-2", ...>)

出力データにインデックスを作成する変数のリストを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

hyperParameterOptimizer="MODELCOMPOSER" | "TUNEALL"

ハイパーパラメーターの最適化に使用する方法を指定します。

別名hpOptimizer
デフォルトTUNEALL

inputs=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。

inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名vars

kFolds=integer

交差検証の分割数を指定します。

デフォルト5
範囲2–10

logLevel=integer

ログ記録レベルを指定します。

デフォルト0
範囲0–3

misraGries=TRUE | FALSE

True に設定すると、重複しない値のカウント制限を超えた場合に、頻度分布の推定に Misra-Gries アルゴリズムが使用されます。

デフォルトTRUE

modelTypes=list("DECISIONTREE", "FOREST", "GLM", "GRADBOOST", "LOGISTIC", "NEURALNET")

パイプライン探索に含める機械学習アルゴリズムの種類とクラスを制御するための値を指定します。

DECISIONTREE

ディシジョンツリーモデルを指定します。

FOREST

ランダムフォレストモデルを指定します。

GLM

一般化線形モデルを指定します。

GRADBOOST

勾配ブースティングモデルを指定します。

LOGISTIC

ロジスティック回帰モデルを指定します。

NEURALNET

ニューラルネットワークモデルを指定します。

objective="ASE" | "AUC" | "F1" | "MAE" | "MCE" | "MSLE" | "RASE" | "RMAE" | "RMSLE"

使用するモデルパフォーマンスメトリックを使用します。

ASE

平均平方誤差(ASE)を使用します。

AUC

受信側操作の特性曲線を使用します。

F1

F1 係数を使用します。

MAE

平均絶対誤差を使用します。

MCE

誤分類誤差を使用します。

別名MCR
MSLE

平均平方対数誤差を使用します。

RASE

平均平方誤差(ASE)の平方根を使用します。

RMAE

平均絶対誤差の平方根を使用します。

RMSLE

平均平方対数誤差の平方根を使用します。

* pipelineOut=list(casouttable)

分析結果を格納する CAS テーブルを指定します。

別名pipelinesOut
長い形式pipelineOut=list(name="table-name")
短い形式pipelineOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

indexVars=list("variable-name-1" <, "variable-name-2", ...>)

出力データにインデックスを作成する変数のリストを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

sampleSize=integer

標本抽出するパイプラインの最大数を指定します。

デフォルト10
最小値1

saveState={casouttable} | {savePipelinesOptions}

分析結果を格納する CAS テーブルを指定します。

別名saveModel

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

compress=TRUE | FALSE

True に設定すると、テーブルにデータ圧縮が適用されます。

デフォルトFALSE
indexVars=list("variable-name-1" <, "variable-name-2", ...>)

出力データにインデックスを作成する変数のリストを指定します。

label="string"

テーブルに関連付ける説明ラベルを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
maxMemSize=64-bit-integer

メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。

ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
replication=integer

フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。

デフォルト1
最小値0
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

threadBlockSize=64-bit-integer

出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。

別名blockSize
デフォルト1048576
最小値0
ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
timeStamp="string"

タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。

where=list("string-1" <, "string-2", ...>)

出力データをサブセット化する 1 つ以上の式を指定します。複数の式が指定された場合、式は AND を使用して効果的に結合され、最終的な出力フィルタが形成されます。式に引用符で囲まれた値が含まれている場合は、ネストした引用符を使用します。

savePipelinesOptions の値は次のいずれかになります:

modelNamePrefix="string"

保存されたモデルの名前に使用する接頭辞を指定します。

replace=TRUE | FALSE

True に設定すると、同じ名前の既存のモデルが上書きされます。

デフォルトTRUE
topK=integer

保存する最適なモデルの数を指定します。

デフォルト5
最小値1

screenPolicy=list(sweeperPolicy)

変数の選別、変換、またはコピーを推奨するために使用する変数スクリーニングポリシーを指定します。

別名sweeperPolicy

sweeperPolicy の値は次のいずれかになります:

constant=TRUE | FALSE

True に設定すると、定数値を持つ変数を識別するための変数スクリーニングポリシーを使用します。

別名unique
デフォルトTRUE
groupRareLevels=TRUE | FALSE

True に設定すると、まれな水準を持つ名義変数を識別するための変数スクリーニングポリシーを使用します。

別名groupRare
デフォルトTRUE
leakagePercentThreshold=double

ターゲットに関する非常に高い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。指定したしきい値よりも大きいターゲットエントロピー率の低下を持つ変数は、漏えい変数としてフラグが付けられます。

別名leakagePercentageThreshold
デフォルト90
範囲(0–100]
lowCv=TRUE | FALSE

True に設定すると、低い変動係数 (CV) を持つ変数を識別するための変数スクリーニングポリシーを使用します。

別名lowCoefficientVariation
デフォルトTRUE
lowMutualInformation=double

ターゲットに関する低い水準情報を持つ変数に対する変数スクリーニングポリシーを指定します。

別名lowInformation
デフォルト0.05
最小値0
missingIndicatorPercent=double

欠損値インジケーター変数を生成する変数スクリーニングポリシーを指定します。

別名missingIndicatorPercentage
デフォルト75
範囲[10–100)
missingPercentThreshold=double

非常に高い欠損率を持つ変数を識別するための変数スクリーニングポリシーを指定します。

別名missingPercentageThreshold
デフォルト90
範囲[10–100)
redundant=double

冗長な変数を識別するための対称不確実性 (SU) のしきい値を指定します。2 つの変数の SU がしきい値を超えた場合、ターゲットに関する情報が少ない変数には冗長としてフラグが付けられます。

デフォルト1
範囲(0–1]

seed=integer

乱数生成のシード値を指定します。いくつかのシナリオでは、この値は繰り返し可能な乱数生成に使用されます。

デフォルト0

selectionPolicy=list(featureSelectOptions)

特徴量の選択ポリシーを指定します。

長い形式selectionPolicy=list(criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU")
短い形式selectionPolicy="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"

featureSelectOptions の値は次のいずれかになります:

criterion="CHISQ" | "CRAMERSV" | "ENTROPY" | "FTEST" | "G2" | "IV" | "MI" | "NORMMI" | "PEARSON" | "SU"

使用するフィルター特徴量選択の基準を指定します。

別名stat
デフォルトMI
CHISQ

カイ 2 乗の統計量を使用します。

CRAMERSV

Cramer の V を使用します。

ENTROPY

エントロピー率の低下を使用します。

FTEST

F 検定を使用します。

G2

G2 の統計量を使用します。

IV

情報値の統計量を使用します。

MI

相互情報量の統計量を使用します。

NORMMI

正規化相互情報量の統計量を使用します。

PEARSON

Pearson の相関を使用します。

SU

対称不確実性の統計量を使用します。

topK=integer

最も高いフィルター選択基準値を持つ特徴量の数が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。

デフォルト50
最小値1
topKPercent=double

最も高いフィルター選択基準値を持つ特徴量の割合が選択されることを指定します。topK と topKPercent の両方が指定されている場合は、topKPercent が使用されます。

別名topKPercentage
範囲(0–100]

* table=list(castable)

テーブル名、caslib、他の共通パラメーターを指定します。

長い形式table=list(name="table-name")
短い形式table="table-name"

castable の値は次のいずれかになります:

caslib="string"

アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。

computedOnDemand=TRUE | FALSE

True に設定すると、アクションの開始時ではなくテーブルのロード時に計算変数が作成されます。

別名compOnDemand
デフォルトFALSE
computedVars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

作成する計算変数の名前を指定します。computedVarsProgram パラメーターの各変数の式を指定します。このパラメーターを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。

別名compVars

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

computedVarsProgram="string"

computedVars パラメーターに含める各計算変数の式を指定します。

別名compPgm
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>)

データソースオプションを指定します。

別名options
dataSource
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。

* name="table-name"

入力テーブルの名前を指定します。

singlePass=TRUE | FALSE

True に設定すると、サーバー上に一時テーブルは作成されません。このパラメーターを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。

デフォルトFALSE
vars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

アクションで使用する変数を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

入力データをサブセット化する式を指定します。

whereTable=list(groupbytable)

WHERE フィルターとして使用する行を含む入力テーブルを指定します。vars パラメーターが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメーターとこのパラメーターが指定されている場合、このフィルタリングテーブルが最初に適用されます。

groupbytable の値は次のいずれかになります:

casLib="string"

フィルターテーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。

dataSourceOptions=list(adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters)

データソースオプションを指定します。

別名options
dataSource

dataSourceOptions パラメーターの指定の詳細については、共通 dataSourceOptions パラメーターを参照してください。

importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメーターの指定の詳細については、共通 importOptions パラメーターを参照してください。

* name="table-name"

フィルターテーブルの名前を指定します。

vars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

フィルターテーブルから使用する変数名を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

フィルターテーブルからデータをサブセット化する式を指定します。

* target="variable-name"

ターゲット変数を指定します。

別名evalVar

topKPipelines=integer

保存する最適なパイプラインの数を指定します。

デフォルト10
最小値1

* transformationOut=list(casouttable)

特徴量変換と生成パイプラインを格納する CAS テーブルを指定します。

別名transformationsOut
長い形式transformationOut=list(name="table-name")
短い形式transformationOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

indexVars=list("variable-name-1" <, "variable-name-2", ...>)

出力データにインデックスを作成する変数のリストを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE"

実行中の CAS サーバー上でワーカーポッドの数が増加した場合のテーブル再配布ポリシーを指定します。

DEFER

再配布ポリシーの選択を上位レベルのエンティティに延期します。

NOREDIST

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータを再配布しません。

REBALANCE

実行中の CAS サーバー上でワーカーポッドの数が変更された場合に、テーブルデータをリバランスします。

transformationPolicy=list(transformationSpace)

特徴量マシンが動作する特徴量変換と生成空間を指定します。

別名transformationSpace

transformationSpace の値は次のいずれかになります:

cardinality=TRUE | FALSE

True に設定すると、カーディナリティ低減変換が含まれます。

デフォルトTRUE
entropy=TRUE | FALSE

True に設定すると、低エントロピーの処置のための変換が含まれます。

デフォルトFALSE
interaction=TRUE | FALSE

True に設定すると、交互作用特徴量が検出され、生成されます。

デフォルトFALSE
iqv=TRUE | FALSE

True に設定すると、低い質的変動の指数 (IQV) の処置のための変換が含まれます。

デフォルトFALSE
kurtosis=TRUE | FALSE

True に設定すると、高い尖度の処置のための変換が含まれます。

デフォルトFALSE
missing=TRUE | FALSE

True に設定すると、欠損値の処置のための変換が含まれます。

デフォルトTRUE
outlier=TRUE | FALSE

True に設定すると、外れ値の処置のための変換が含まれます。

デフォルトFALSE
skewness=TRUE | FALSE

True に設定すると、高い歪度の処置のための変換が含まれます。

デフォルトTRUE

validationPartitionFraction=double

検証に使用する入力データの割合を指定します。

デフォルト0.3
範囲0.01–0.99
最終更新: 2026年3月26日