データの前処理 アクションセット: 構文

データの前処理と変換のアクションを提供します

rustats アクション

ロバストな単変量統計量、中心化モーメント、分位点、度数分布統計量を計算します。

CASL 構文

dataPreprocess.rustats <result=results> <status=rc> /
casOutStats={
caslib="string",
compress=TRUE | FALSE,
indexVars={"variable-name-1" <, "variable-name-2", ...>},
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
memoryFormat="DVR" | "INHERIT" | "STANDARD",
name="table-name",
onDemand=TRUE | FALSE,
promote=TRUE | FALSE,
replace=TRUE | FALSE,
replication=integer,
threadBlockSize=64-bit-integer,
timeStamp="string",
where={"string-1" <, "string-2", ...>}
},
complementaryStats=TRUE | FALSE,
confidenceInterval=TRUE | FALSE,
excessKurtosis=TRUE | FALSE,
freq="variable-name",
includeMissingGroup=TRUE | FALSE,
inputs={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
maxIterations=integer,
nArgumentsForEachVar={integer-1 <, integer-2, ...>},
nNominalVars=integer,
nominalStats={
bottomK=integer,
fuzzyCompare=double,
iqv=TRUE | FALSE,
topK=integer
},
nominalVarsIndices={integer-1 <, integer-2, ...>},
outputTableOptions={
forceTableReturn=TRUE | FALSE,
tableNames={"string-1" <, "string-2", ...>}
},
requestPackages={{
aadLocationUseMean=TRUE | FALSE,
allCentralizedMoments=TRUE | FALSE,
allKurtoses=TRUE | FALSE,
allLocations=TRUE | FALSE,
allNominalStats=TRUE | FALSE,
allScales=TRUE | FALSE,
allSkewnesses=TRUE | FALSE,
alpha=double,
kurtoses={"AVGQUANTILE", "CLASSICAL", "MOORS", "QUANTILE"} | {"string-1" <, "string-2", ...>},
locations={"BIWEIGHT", "GEOMETRICMEAN", "HARMONICMEAN", "MEAN", "MEDIAN", "TRIMMEDMEAN", "WINSORIZEDMEAN"} | {"string-1" <, "string-2", ...>},
maxOrder=integer,
nPercentiles=integer,
percentiles={double-1 <, double-2, ...>},
scales={"AAD", "BIWEIGHT", "GINI", "IQR", "MAD", "STD"} | {"string-1" <, "string-2", ...>},
skewnesses={"AVGQUANTILE", "CLASSICAL", "PEARMED", "QUANTILE"} | {"string-1" <, "string-2", ...>},
standardizeMoments=TRUE | FALSE
}, {...}},
seed=integer,
standardError=TRUE | FALSE,
required parameter table={
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
computedVarsProgram="string",
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
onDemand=TRUE | FALSE,
orderBy={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=TRUE | FALSE,
vars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
tolerance=double,
unbiased=TRUE | FALSE,
varsToArgumentsMap={integer-1 <, integer-2, ...>},
weight="variable-name"
;
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

required parametertable

—

テーブル名、caslib、他の共通パラメータを指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

 casOutStats

—

出力テーブルの設定を指定します。

パラメーターの説明

casOutStats={casouttable}

出力テーブルの設定を指定します。

casOutStats パラメーターの指定の詳細については、共通 casouttable パラメーターを参照してください。

別名casOut

complementaryStats=TRUE | FALSE

True に設定すると、無修正平方和、修正済平方和、変動係数などの相補的な単変量統計が計算されます。

デフォルトFALSE

confidenceInterval=TRUE | FALSE

True に設定すると、信頼区間が結果に含まれます。このパラメータは、stdErr パラメータを有効にします。

デフォルトFALSE

excessKurtosis=TRUE | FALSE

True に設定すると、尖度の代わりに過剰尖度が計算されます。過剰尖度は、正規分布に関して定義されます。

デフォルトTRUE

freq="variable-name"

頻度変数を指定します。

別名frequency

includeMissingGroup=TRUE | FALSE

True に設定すると、欠損値は group-by キーとして許可されます。

デフォルトFALSE

inputs={{casinvardesc-1} <, {casinvardesc-2}, ...>}

分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。

inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名vars

maxIterations=integer

MAD 尺度、GINI 尺度、Medcouple 歪度推定量などの反復ロバストな単変量統計量の最大反復回数を指定します。このパラメータは、ZSCORE 外れ値定義が使用されている場合に使用できます。

別名maxIters
rustatsMaxNiters

nArgumentsForEachVar={integer-1 <, integer-2, ...>}

各変数の引数 (要求パッケージ) の数を指定します。設定されていない場合、すべての要求パッケージがすべての変数に含まれます。

別名nArgsForEachVar

nNominalVars=integer

nomVarsIndices パラメータに値を指定しない場合、最後の nNomVars 変数を名義として扱うように指定します。

最小値 (含まない)0

nominalStats={nominalStatistics}

名義統計量を計算します。これらには、質的変動のインデックスと、最も頻繁な値と最も頻度の低い値が含まれます。

nominalStatistics の値は次のいずれかになります:

bottomK=integer

計算する最小頻度のアイテムの数を指定します。

デフォルト5
distinctCountLimit=integer

重複しない値のカウント制限を指定します。

fuzzyCompare=double

数値の区別を決定するために使用されるファジー比較のしきい値を指定します。

別名precision
範囲0–1E-05
iqv=TRUE | FALSE

True に設定すると、質的変動のインデックスを計算します。これらには、Shannon エントロピー、Gini 指数と他のいくつかの度数分布の散布度測定値が含まれます。

デフォルトTRUE
topK=integer

計算する最も頻繁なアイテムの数を指定します。

デフォルト5

nominalVarsIndices={integer-1 <, integer-2, ...>}

名義変数として扱う変数のインデックスを指定します。

outputTableOptions={outputTableOptions}

結果テーブルのオプションを指定します。サーバーが返す結果テーブルと、グループごとの結果の処理方法を指定できます。

別名outputTableOpts

outputTableOptions の値は次のいずれかになります:

forceTableReturn=TRUE | FALSE

True に設定すると、出力が出力テーブルとして保存されていても、結果テーブルはクライアントに返されます。

デフォルトFALSE
tableNames={"string-1" <, "string-2", ...>}

生成する結果テーブルの名前を指定します。デフォルトは、すべての結果テーブルが返されます。

別名outputTables

percentileDefinition=integer

使用するパーセント点の定義を指定します。定義には 1 から 6 の番号が付けられます。デフォルト値は 6 です。

別名pctlDef
デフォルト6
範囲1–6

percentileMaxIterations=integer

パーセント点計算の最大反復回数を指定します。

別名pctlMaxIters

percentileTolerance=double

パーセント点計算のトレランスを指定します。

別名pctlEpsilon
デフォルト1E-05

quantileSketch={quantileSketchOptions}

分位点スケッチのオプションを指定します。

別名quantileSketchOptions

quantileSketchOptions の値は次のいずれかになります:

compressionFactor=double

分位点スケッチに使用する圧縮因子を指定します。

デフォルト10
最小値1
epsilon=double

分位点スケッチに使用するトレランスを指定します。

デフォルト0.001
範囲1E-06–0.1

requestPackages={{rustatsRequestPackage-1} <, {rustatsRequestPackage-2}, ...>}

アクションによって処理されるロバストな単変量統計量要求パッケージの配列を指定します。

別名reqPacks

rustatsRequestPackage の値は次のいずれかになります:

aadLocationUseMean=TRUE | FALSE

True に設定すると、中央値の代わりに、平均が絶対平均偏差 (AAD) 尺度推定量の中心として使用されます。

別名aadLocUseMean
デフォルトTRUE
allCentralizedMoments=TRUE | FALSE

True に設定すると、すべての中心化モーメント (6次まで) が計算されます。

デフォルトFALSE
allKurtoses=TRUE | FALSE

True に設定すると、すべての尖度の推定値が計算されます。

デフォルトFALSE
allLocations=TRUE | FALSE

True に設定すると、すべての位置の推定値が計算されます。

デフォルトFALSE
allNominalStats=TRUE | FALSE

すべての名義統計量を計算します。これらには、質的変動のインデックスと、最も頻繁な値と最も頻度の低い値が含まれます。

デフォルトFALSE
allScales=TRUE | FALSE

True に設定すると、すべての尺度の推定値が計算されます。

デフォルトFALSE
allSkewnesses=TRUE | FALSE

True に設定すると、すべての歪度の推定値が計算されます。

デフォルトFALSE
alpha=double

位置推定値の信頼区間の有意水準を指定します。

デフォルト0.05
kurtoses={"AVGQUANTILE", "CLASSICAL", "MOORS", "QUANTILE"} | {"string-1" <, "string-2", ...>}

計算する尖度推定値タイプのリストを指定します。

AVGQUANTILE平均分位点ベースの歪度推定値を使用します。
CLASSICAL古典的尖度推定値を使用します。
MOORSMoor 尖度推定値を使用します。
QUANTILE尖度推定値を使用します。
kurtosisAlphaQuantile=double

分位点または平均分位点の尖度推定量の下限(アルファ)分位点を指定します。

別名kurtAlphaQuantile
デフォルト2.5
範囲(0–50]
kurtosisBetaQuantile=double

分位点または平均分位点の尖度推定量の上限(ベータ)分位点を指定します。

別名kurtBetaQuantile
デフォルト25
範囲(0–50]
locationBiweightTuning=double

Tukey 双加重位置推定量の調整係数 を指定します。

別名locBiweightTuning
デフォルト6
最小値 (含まない)0
locationLowerPercentile=double

パーセント点を必要とする位置推定値の下限パーセント点を指定します。

別名locLowerPerc
デフォルト5
範囲(0, 50)
locations={"BIWEIGHT", "GEOMETRICMEAN", "HARMONICMEAN", "MEAN", "MEDIAN", "TRIMMEDMEAN", "WINSORIZEDMEAN"} | {"string-1" <, "string-2", ...>}

計算する位置推定値タイプのリストを指定します。

BIWEIGHT位置の Tukey biweight ベースの推定値を使用します。
GEOMETRICMEAN位置の幾何平均を使用します。
HARMONICMEAN位置の調和平均を使用します。
MEAN位置の算術平均を使用します。
MEDIAN位置の中央値を使用します。
TRIMMEDMEAN位置のトリム平均を使用します。lowerPerc、upperPerc、symPerc の各パラメータで境界を指定できます。
WINSORIZEDMEAN位置のウィンザー化平均を使用します。lowerPerc、upperPerc、symPerc の各パラメータで境界を指定できます。
locationSymmetricPercentile=double

パーセント点を必要とする位置推定値の対称パーセント点を指定します。例えば、値が 20 の場合は、下限パーセント点を 10 に、上限パーセント点を 90 に設定することを示します。

別名locSymPerc
デフォルト10
範囲(0, 100)
locationUpperPercentile=double

パーセント点を必要とする位置推定値の上限パーセント点を指定します。

別名locUpperPerc
デフォルト95
範囲(50, 100)
maxOrder=integer

計算する中心化モーメントの最大次数を指定します。

別名nMoments
デフォルト4
最大値6
nPercentiles=integer

均等な頻度パーセント点を計算します。例えば、値を 3 に設定すると、25、50、75 のパーセント点の計算が求められます。

デフォルト0
最小値0
percentiles={double-1 <, double-2, ...>}

計算する分位点またはパーセント点のリストを指定します。

scaleBiweightTuning=double

Tukey 双加重尺度推定量の調整係数を指定します。

別名sclBiweightTuning
デフォルト9
最小値 (含まない)0
scales={"AAD", "BIWEIGHT", "GINI", "IQR", "MAD", "STD"} | {"string-1" <, "string-2", ...>}

計算する尺度推定値の種類のリストを指定します。

AAD平均または中央値に関する絶対偏差を尺度として使用します。
BIWEIGHT尺度に Tukey biweight ベースの推定値を使用します。
GINI尺度に Gini スケールを使用します。
IQR尺度に四分位範囲を使用します。
MAD尺度に中央値に関する絶対偏差の中央値を使用します。
STD尺度に標準偏差を使用します。
skewnesses={"AVGQUANTILE", "CLASSICAL", "PEARMED", "QUANTILE"} | {"string-1" <, "string-2", ...>}

歪度推定値の種類のリストを指定します。

AVGQUANTILE平均分位点に基づく歪度の推定値を使用します。
CLASSICAL歪度に古典的歪度係数を使用します。
PEARMED歪度にピアソン中央値歪度係数を使用します。
QUANTILE分位点ベースの歪度推定値を使用します。
skewnessQuantile=double

分位点歪度推定量の分位点を指定します。

別名skewQuantile
デフォルト25
範囲(0, 50)
standardizeMoments=TRUE | FALSE

中心化モーメントの代わりに、標準化モーメントが生成されることを指定します。

別名stdMoments
デフォルトFALSE

seed=integer

シード値を指定します。シードは、ランダムな値を生成するために使用されます。

デフォルト0

standardError=TRUE | FALSE

True に設定すると、位置の標準誤差が結果に含まれます。

別名stdErr
デフォルトFALSE

* table={castable}

テーブル名、caslib、他の共通パラメータを指定します。

table パラメーターの指定の詳細については、共通 castable パラメーターを参照してください。

tolerance=double

反復するロバストな単変量統計量のトレランスを指定します。

デフォルト1E-05

unbiased=TRUE | FALSE

True に設定すると、標準偏差、分散、古典的歪度、古典的尖度がバイアスに対して補正されます。

デフォルトTRUE

varsToArgumentsMap={integer-1 <, integer-2, ...>}

各変数に対して計算する要求パッケージを指定します。nArgsForEachVar パラメータに値が指定されている場合は、これを設定する必要があります。それ以外の場合は、両方のパラメータが無視され、すべての要求パッケージがすべての変数に対して計算されます。

weight="variable-name"

重み変数を指定します。

rustats アクション

ロバストな単変量統計量、中心化モーメント、分位点、度数分布統計量を計算します。

Lua 構文

results, info = s:dataPreprocess_rustats{
casOutStats={
caslib="string",
compress=true | false,
indexVars={"variable-name-1" <, "variable-name-2", ...>},
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
memoryFormat="DVR" | "INHERIT" | "STANDARD",
name="table-name",
onDemand=true | false,
promote=true | false,
replace=true | false,
replication=integer,
threadBlockSize=64-bit-integer,
timeStamp="string",
where={"string-1" <, "string-2", ...>}
},
complementaryStats=true | false,
confidenceInterval=true | false,
excessKurtosis=true | false,
freq="variable-name",
includeMissingGroup=true | false,
inputs={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
maxIterations=integer,
nArgumentsForEachVar={integer-1 <, integer-2, ...>},
nNominalVars=integer,
nominalStats={
bottomK=integer,
fuzzyCompare=double,
iqv=true | false,
topK=integer
},
nominalVarsIndices={integer-1 <, integer-2, ...>},
outputTableOptions={
forceTableReturn=true | false,
tableNames={"string-1" <, "string-2", ...>}
},
requestPackages={{
aadLocationUseMean=true | false,
allCentralizedMoments=true | false,
allKurtoses=true | false,
allLocations=true | false,
allNominalStats=true | false,
allScales=true | false,
allSkewnesses=true | false,
alpha=double,
kurtoses={"AVGQUANTILE", "CLASSICAL", "MOORS", "QUANTILE"} | {"string-1" <, "string-2", ...>},
locations={"BIWEIGHT", "GEOMETRICMEAN", "HARMONICMEAN", "MEAN", "MEDIAN", "TRIMMEDMEAN", "WINSORIZEDMEAN"} | {"string-1" <, "string-2", ...>},
maxOrder=integer,
nPercentiles=integer,
percentiles={double-1 <, double-2, ...>},
scales={"AAD", "BIWEIGHT", "GINI", "IQR", "MAD", "STD"} | {"string-1" <, "string-2", ...>},
skewnesses={"AVGQUANTILE", "CLASSICAL", "PEARMED", "QUANTILE"} | {"string-1" <, "string-2", ...>},
standardizeMoments=true | false
}, {...}},
seed=integer,
standardError=true | false,
required parameter table={
caslib="string",
computedOnDemand=true | false,
computedVars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
computedVarsProgram="string",
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
onDemand=true | false,
orderBy={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=true | false,
vars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
tolerance=double,
unbiased=true | false,
varsToArgumentsMap={integer-1 <, integer-2, ...>},
weight="variable-name"
}
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

required parametertable

—

テーブル名、caslib、他の共通パラメータを指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

 casOutStats

—

出力テーブルの設定を指定します。

パラメーターの説明

casOutStats={casouttable}

出力テーブルの設定を指定します。

casOutStats パラメーターの指定の詳細については、共通 casouttable パラメーターを参照してください。

別名casOut

complementaryStats=true | false

True に設定すると、無修正平方和、修正済平方和、変動係数などの相補的な単変量統計が計算されます。

デフォルトfalse

confidenceInterval=true | false

True に設定すると、信頼区間が結果に含まれます。このパラメータは、stdErr パラメータを有効にします。

デフォルトfalse

excessKurtosis=true | false

True に設定すると、尖度の代わりに過剰尖度が計算されます。過剰尖度は、正規分布に関して定義されます。

デフォルトtrue

freq="variable-name"

頻度変数を指定します。

別名frequency

includeMissingGroup=true | false

True に設定すると、欠損値は group-by キーとして許可されます。

デフォルトfalse

inputs={{casinvardesc-1} <, {casinvardesc-2}, ...>}

分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。

inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名vars

maxIterations=integer

MAD 尺度、GINI 尺度、Medcouple 歪度推定量などの反復ロバストな単変量統計量の最大反復回数を指定します。このパラメータは、ZSCORE 外れ値定義が使用されている場合に使用できます。

別名maxIters
rustatsMaxNiters

nArgumentsForEachVar={integer-1 <, integer-2, ...>}

各変数の引数 (要求パッケージ) の数を指定します。設定されていない場合、すべての要求パッケージがすべての変数に含まれます。

別名nArgsForEachVar

nNominalVars=integer

nomVarsIndices パラメータに値を指定しない場合、最後の nNomVars 変数を名義として扱うように指定します。

最小値 (含まない)0

nominalStats={nominalStatistics}

名義統計量を計算します。これらには、質的変動のインデックスと、最も頻繁な値と最も頻度の低い値が含まれます。

nominalStatistics の値は次のいずれかになります:

bottomK=integer

計算する最小頻度のアイテムの数を指定します。

デフォルト5
distinctCountLimit=integer

重複しない値のカウント制限を指定します。

fuzzyCompare=double

数値の区別を決定するために使用されるファジー比較のしきい値を指定します。

別名precision
範囲0–1E-05
iqv=true | false

True に設定すると、質的変動のインデックスを計算します。これらには、Shannon エントロピー、Gini 指数と他のいくつかの度数分布の散布度測定値が含まれます。

デフォルトtrue
topK=integer

計算する最も頻繁なアイテムの数を指定します。

デフォルト5

nominalVarsIndices={integer-1 <, integer-2, ...>}

名義変数として扱う変数のインデックスを指定します。

outputTableOptions={outputTableOptions}

結果テーブルのオプションを指定します。サーバーが返す結果テーブルと、グループごとの結果の処理方法を指定できます。

別名outputTableOpts

outputTableOptions の値は次のいずれかになります:

forceTableReturn=true | false

True に設定すると、出力が出力テーブルとして保存されていても、結果テーブルはクライアントに返されます。

デフォルトfalse
tableNames={"string-1" <, "string-2", ...>}

生成する結果テーブルの名前を指定します。デフォルトは、すべての結果テーブルが返されます。

別名outputTables

percentileDefinition=integer

使用するパーセント点の定義を指定します。定義には 1 から 6 の番号が付けられます。デフォルト値は 6 です。

別名pctlDef
デフォルト6
範囲1–6

percentileMaxIterations=integer

パーセント点計算の最大反復回数を指定します。

別名pctlMaxIters

percentileTolerance=double

パーセント点計算のトレランスを指定します。

別名pctlEpsilon
デフォルト1E-05

quantileSketch={quantileSketchOptions}

分位点スケッチのオプションを指定します。

別名quantileSketchOptions

quantileSketchOptions の値は次のいずれかになります:

compressionFactor=double

分位点スケッチに使用する圧縮因子を指定します。

デフォルト10
最小値1
epsilon=double

分位点スケッチに使用するトレランスを指定します。

デフォルト0.001
範囲1E-06–0.1

requestPackages={{rustatsRequestPackage-1} <, {rustatsRequestPackage-2}, ...>}

アクションによって処理されるロバストな単変量統計量要求パッケージの配列を指定します。

別名reqPacks

rustatsRequestPackage の値は次のいずれかになります:

aadLocationUseMean=true | false

True に設定すると、中央値の代わりに、平均が絶対平均偏差 (AAD) 尺度推定量の中心として使用されます。

別名aadLocUseMean
デフォルトtrue
allCentralizedMoments=true | false

True に設定すると、すべての中心化モーメント (6次まで) が計算されます。

デフォルトfalse
allKurtoses=true | false

True に設定すると、すべての尖度の推定値が計算されます。

デフォルトfalse
allLocations=true | false

True に設定すると、すべての位置の推定値が計算されます。

デフォルトfalse
allNominalStats=true | false

すべての名義統計量を計算します。これらには、質的変動のインデックスと、最も頻繁な値と最も頻度の低い値が含まれます。

デフォルトfalse
allScales=true | false

True に設定すると、すべての尺度の推定値が計算されます。

デフォルトfalse
allSkewnesses=true | false

True に設定すると、すべての歪度の推定値が計算されます。

デフォルトfalse
alpha=double

位置推定値の信頼区間の有意水準を指定します。

デフォルト0.05
kurtoses={"AVGQUANTILE", "CLASSICAL", "MOORS", "QUANTILE"} | {"string-1" <, "string-2", ...>}

計算する尖度推定値タイプのリストを指定します。

AVGQUANTILE平均分位点ベースの歪度推定値を使用します。
CLASSICAL古典的尖度推定値を使用します。
MOORSMoor 尖度推定値を使用します。
QUANTILE尖度推定値を使用します。
kurtosisAlphaQuantile=double

分位点または平均分位点の尖度推定量の下限(アルファ)分位点を指定します。

別名kurtAlphaQuantile
デフォルト2.5
範囲(0–50]
kurtosisBetaQuantile=double

分位点または平均分位点の尖度推定量の上限(ベータ)分位点を指定します。

別名kurtBetaQuantile
デフォルト25
範囲(0–50]
locationBiweightTuning=double

Tukey 双加重位置推定量の調整係数 を指定します。

別名locBiweightTuning
デフォルト6
最小値 (含まない)0
locationLowerPercentile=double

パーセント点を必要とする位置推定値の下限パーセント点を指定します。

別名locLowerPerc
デフォルト5
範囲(0, 50)
locations={"BIWEIGHT", "GEOMETRICMEAN", "HARMONICMEAN", "MEAN", "MEDIAN", "TRIMMEDMEAN", "WINSORIZEDMEAN"} | {"string-1" <, "string-2", ...>}

計算する位置推定値タイプのリストを指定します。

BIWEIGHT位置の Tukey biweight ベースの推定値を使用します。
GEOMETRICMEAN位置の幾何平均を使用します。
HARMONICMEAN位置の調和平均を使用します。
MEAN位置の算術平均を使用します。
MEDIAN位置の中央値を使用します。
TRIMMEDMEAN位置のトリム平均を使用します。lowerPerc、upperPerc、symPerc の各パラメータで境界を指定できます。
WINSORIZEDMEAN位置のウィンザー化平均を使用します。lowerPerc、upperPerc、symPerc の各パラメータで境界を指定できます。
locationSymmetricPercentile=double

パーセント点を必要とする位置推定値の対称パーセント点を指定します。例えば、値が 20 の場合は、下限パーセント点を 10 に、上限パーセント点を 90 に設定することを示します。

別名locSymPerc
デフォルト10
範囲(0, 100)
locationUpperPercentile=double

パーセント点を必要とする位置推定値の上限パーセント点を指定します。

別名locUpperPerc
デフォルト95
範囲(50, 100)
maxOrder=integer

計算する中心化モーメントの最大次数を指定します。

別名nMoments
デフォルト4
最大値6
nPercentiles=integer

均等な頻度パーセント点を計算します。例えば、値を 3 に設定すると、25、50、75 のパーセント点の計算が求められます。

デフォルト0
最小値0
percentiles={double-1 <, double-2, ...>}

計算する分位点またはパーセント点のリストを指定します。

scaleBiweightTuning=double

Tukey 双加重尺度推定量の調整係数を指定します。

別名sclBiweightTuning
デフォルト9
最小値 (含まない)0
scales={"AAD", "BIWEIGHT", "GINI", "IQR", "MAD", "STD"} | {"string-1" <, "string-2", ...>}

計算する尺度推定値の種類のリストを指定します。

AAD平均または中央値に関する絶対偏差を尺度として使用します。
BIWEIGHT尺度に Tukey biweight ベースの推定値を使用します。
GINI尺度に Gini スケールを使用します。
IQR尺度に四分位範囲を使用します。
MAD尺度に中央値に関する絶対偏差の中央値を使用します。
STD尺度に標準偏差を使用します。
skewnesses={"AVGQUANTILE", "CLASSICAL", "PEARMED", "QUANTILE"} | {"string-1" <, "string-2", ...>}

歪度推定値の種類のリストを指定します。

AVGQUANTILE平均分位点に基づく歪度の推定値を使用します。
CLASSICAL歪度に古典的歪度係数を使用します。
PEARMED歪度にピアソン中央値歪度係数を使用します。
QUANTILE分位点ベースの歪度推定値を使用します。
skewnessQuantile=double

分位点歪度推定量の分位点を指定します。

別名skewQuantile
デフォルト25
範囲(0, 50)
standardizeMoments=true | false

中心化モーメントの代わりに、標準化モーメントが生成されることを指定します。

別名stdMoments
デフォルトfalse

seed=integer

シード値を指定します。シードは、ランダムな値を生成するために使用されます。

デフォルト0

standardError=true | false

True に設定すると、位置の標準誤差が結果に含まれます。

別名stdErr
デフォルトfalse

* table={castable}

テーブル名、caslib、他の共通パラメータを指定します。

table パラメーターの指定の詳細については、共通 castable パラメーターを参照してください。

tolerance=double

反復するロバストな単変量統計量のトレランスを指定します。

デフォルト1E-05

unbiased=true | false

True に設定すると、標準偏差、分散、古典的歪度、古典的尖度がバイアスに対して補正されます。

デフォルトtrue

varsToArgumentsMap={integer-1 <, integer-2, ...>}

各変数に対して計算する要求パッケージを指定します。nArgsForEachVar パラメータに値が指定されている場合は、これを設定する必要があります。それ以外の場合は、両方のパラメータが無視され、すべての要求パッケージがすべての変数に対して計算されます。

weight="variable-name"

重み変数を指定します。

rustats アクション

ロバストな単変量統計量、中心化モーメント、分位点、度数分布統計量を計算します。

Python 構文

results= s.dataPreprocess.rustats(
casOutStats={
"caslib":"string",
"compress":True | False,
"indexVars":["variable-name-1" <, "variable-name-2", ...>],
"label":"string",
"lifetime":64-bit-integer,
"maxMemSize":64-bit-integer,
"memoryFormat":"DVR" | "INHERIT" | "STANDARD",
"name":"table-name",
"onDemand":True | False,
"promote":True | False,
"replace":True | False,
"replication":integer,
"threadBlockSize":64-bit-integer,
"timeStamp":"string",
"where":["string-1" <, "string-2", ...>]
},
complementaryStats=True | False,
confidenceInterval=True | False,
excessKurtosis=True | False,
freq="variable-name",
includeMissingGroup=True | False,
inputs=[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
maxIterations=integer,
nArgumentsForEachVar=[integer-1 <, integer-2, ...>],
nNominalVars=integer,
nominalStats={
"bottomK":integer,
"fuzzyCompare":double,
"iqv":True | False,
"topK":integer
},
nominalVarsIndices=[integer-1 <, integer-2, ...>],
outputTableOptions={
"forceTableReturn":True | False,
"tableNames":["string-1" <, "string-2", ...>]
},
requestPackages=[{
"aadLocationUseMean":True | False,
"allCentralizedMoments":True | False,
"allKurtoses":True | False,
"allLocations":True | False,
"allNominalStats":True | False,
"allScales":True | False,
"allSkewnesses":True | False,
"alpha":double,
"kurtoses":["AVGQUANTILE", "CLASSICAL", "MOORS", "QUANTILE"] | ["string-1" <, "string-2", ...>],
"locations":["BIWEIGHT", "GEOMETRICMEAN", "HARMONICMEAN", "MEAN", "MEDIAN", "TRIMMEDMEAN", "WINSORIZEDMEAN"] | ["string-1" <, "string-2", ...>],
"maxOrder":integer,
"nPercentiles":integer,
"percentiles":[double-1 <, double-2, ...>],
"scales":["AAD", "BIWEIGHT", "GINI", "IQR", "MAD", "STD"] | ["string-1" <, "string-2", ...>],
"skewnesses":["AVGQUANTILE", "CLASSICAL", "PEARMED", "QUANTILE"] | ["string-1" <, "string-2", ...>],
"standardizeMoments":True | False
}<, {...}>],
seed=integer,
standardError=True | False,
required parameter table={
"caslib":"string",
"computedOnDemand":True | False,
"computedVars":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"computedVarsProgram":"string",
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>},
"groupBy":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"groupByMode":"NOSORT" | "REDISTRIBUTE",
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter "name":"table-name",
"onDemand":True | False,
"orderBy":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"singlePass":True | False,
"vars":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"where":"where-expression",
"whereTable":{
"casLib":"string"
"dataSourceOptions":{adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter "name":"table-name"
"vars":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>]
"where":"where-expression"
}
},
tolerance=double,
unbiased=True | False,
varsToArgumentsMap=[integer-1 <, integer-2, ...>],
weight="variable-name"
)
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

required parametertable

—

テーブル名、caslib、他の共通パラメータを指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

 casOutStats

—

出力テーブルの設定を指定します。

パラメーターの説明

casOutStats={casouttable}

出力テーブルの設定を指定します。

casOutStats パラメーターの指定の詳細については、共通 casouttable パラメーターを参照してください。

別名casOut

complementaryStats=True | False

True に設定すると、無修正平方和、修正済平方和、変動係数などの相補的な単変量統計が計算されます。

デフォルトFalse

confidenceInterval=True | False

True に設定すると、信頼区間が結果に含まれます。このパラメータは、stdErr パラメータを有効にします。

デフォルトFalse

excessKurtosis=True | False

True に設定すると、尖度の代わりに過剰尖度が計算されます。過剰尖度は、正規分布に関して定義されます。

デフォルトTrue

freq="variable-name"

頻度変数を指定します。

別名frequency

includeMissingGroup=True | False

True に設定すると、欠損値は group-by キーとして許可されます。

デフォルトFalse

inputs=[{casinvardesc-1} <, {casinvardesc-2}, ...>]

分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。

inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名vars

maxIterations=integer

MAD 尺度、GINI 尺度、Medcouple 歪度推定量などの反復ロバストな単変量統計量の最大反復回数を指定します。このパラメータは、ZSCORE 外れ値定義が使用されている場合に使用できます。

別名maxIters
rustatsMaxNiters

nArgumentsForEachVar=[integer-1 <, integer-2, ...>]

各変数の引数 (要求パッケージ) の数を指定します。設定されていない場合、すべての要求パッケージがすべての変数に含まれます。

別名nArgsForEachVar

nNominalVars=integer

nomVarsIndices パラメータに値を指定しない場合、最後の nNomVars 変数を名義として扱うように指定します。

最小値 (含まない)0

nominalStats={nominalStatistics}

名義統計量を計算します。これらには、質的変動のインデックスと、最も頻繁な値と最も頻度の低い値が含まれます。

nominalStatistics の値は次のいずれかになります:

"bottomK":integer

計算する最小頻度のアイテムの数を指定します。

デフォルト5
"distinctCountLimit":integer

重複しない値のカウント制限を指定します。

"fuzzyCompare":double

数値の区別を決定するために使用されるファジー比較のしきい値を指定します。

別名precision
範囲0–1E-05
"iqv":True | False

True に設定すると、質的変動のインデックスを計算します。これらには、Shannon エントロピー、Gini 指数と他のいくつかの度数分布の散布度測定値が含まれます。

デフォルトTrue
"topK":integer

計算する最も頻繁なアイテムの数を指定します。

デフォルト5

nominalVarsIndices=[integer-1 <, integer-2, ...>]

名義変数として扱う変数のインデックスを指定します。

outputTableOptions={outputTableOptions}

結果テーブルのオプションを指定します。サーバーが返す結果テーブルと、グループごとの結果の処理方法を指定できます。

別名outputTableOpts

outputTableOptions の値は次のいずれかになります:

"forceTableReturn":True | False

True に設定すると、出力が出力テーブルとして保存されていても、結果テーブルはクライアントに返されます。

デフォルトFalse
"tableNames":["string-1" <, "string-2", ...>]

生成する結果テーブルの名前を指定します。デフォルトは、すべての結果テーブルが返されます。

別名outputTables

percentileDefinition=integer

使用するパーセント点の定義を指定します。定義には 1 から 6 の番号が付けられます。デフォルト値は 6 です。

別名pctlDef
デフォルト6
範囲1–6

percentileMaxIterations=integer

パーセント点計算の最大反復回数を指定します。

別名pctlMaxIters

percentileTolerance=double

パーセント点計算のトレランスを指定します。

別名pctlEpsilon
デフォルト1E-05

quantileSketch={quantileSketchOptions}

分位点スケッチのオプションを指定します。

別名quantileSketchOptions

quantileSketchOptions の値は次のいずれかになります:

"compressionFactor":double

分位点スケッチに使用する圧縮因子を指定します。

デフォルト10
最小値1
"epsilon":double

分位点スケッチに使用するトレランスを指定します。

デフォルト0.001
範囲1E-06–0.1

requestPackages=[{rustatsRequestPackage-1} <, {rustatsRequestPackage-2}, ...>]

アクションによって処理されるロバストな単変量統計量要求パッケージの配列を指定します。

別名reqPacks

rustatsRequestPackage の値は次のいずれかになります:

"aadLocationUseMean":True | False

True に設定すると、中央値の代わりに、平均が絶対平均偏差 (AAD) 尺度推定量の中心として使用されます。

別名aadLocUseMean
デフォルトTrue
"allCentralizedMoments":True | False

True に設定すると、すべての中心化モーメント (6次まで) が計算されます。

デフォルトFalse
"allKurtoses":True | False

True に設定すると、すべての尖度の推定値が計算されます。

デフォルトFalse
"allLocations":True | False

True に設定すると、すべての位置の推定値が計算されます。

デフォルトFalse
"allNominalStats":True | False

すべての名義統計量を計算します。これらには、質的変動のインデックスと、最も頻繁な値と最も頻度の低い値が含まれます。

デフォルトFalse
"allScales":True | False

True に設定すると、すべての尺度の推定値が計算されます。

デフォルトFalse
"allSkewnesses":True | False

True に設定すると、すべての歪度の推定値が計算されます。

デフォルトFalse
"alpha":double

位置推定値の信頼区間の有意水準を指定します。

デフォルト0.05
"kurtoses":["AVGQUANTILE", "CLASSICAL", "MOORS", "QUANTILE"] | ["string-1" <, "string-2", ...>]

計算する尖度推定値タイプのリストを指定します。

AVGQUANTILE平均分位点ベースの歪度推定値を使用します。
CLASSICAL古典的尖度推定値を使用します。
MOORSMoor 尖度推定値を使用します。
QUANTILE尖度推定値を使用します。
"kurtosisAlphaQuantile":double

分位点または平均分位点の尖度推定量の下限(アルファ)分位点を指定します。

別名kurtAlphaQuantile
デフォルト2.5
範囲(0–50]
"kurtosisBetaQuantile":double

分位点または平均分位点の尖度推定量の上限(ベータ)分位点を指定します。

別名kurtBetaQuantile
デフォルト25
範囲(0–50]
"locationBiweightTuning":double

Tukey 双加重位置推定量の調整係数 を指定します。

別名locBiweightTuning
デフォルト6
最小値 (含まない)0
"locationLowerPercentile":double

パーセント点を必要とする位置推定値の下限パーセント点を指定します。

別名locLowerPerc
デフォルト5
範囲(0, 50)
"locations":["BIWEIGHT", "GEOMETRICMEAN", "HARMONICMEAN", "MEAN", "MEDIAN", "TRIMMEDMEAN", "WINSORIZEDMEAN"] | ["string-1" <, "string-2", ...>]

計算する位置推定値タイプのリストを指定します。

BIWEIGHT位置の Tukey biweight ベースの推定値を使用します。
GEOMETRICMEAN位置の幾何平均を使用します。
HARMONICMEAN位置の調和平均を使用します。
MEAN位置の算術平均を使用します。
MEDIAN位置の中央値を使用します。
TRIMMEDMEAN位置のトリム平均を使用します。lowerPerc、upperPerc、symPerc の各パラメータで境界を指定できます。
WINSORIZEDMEAN位置のウィンザー化平均を使用します。lowerPerc、upperPerc、symPerc の各パラメータで境界を指定できます。
"locationSymmetricPercentile":double

パーセント点を必要とする位置推定値の対称パーセント点を指定します。例えば、値が 20 の場合は、下限パーセント点を 10 に、上限パーセント点を 90 に設定することを示します。

別名locSymPerc
デフォルト10
範囲(0, 100)
"locationUpperPercentile":double

パーセント点を必要とする位置推定値の上限パーセント点を指定します。

別名locUpperPerc
デフォルト95
範囲(50, 100)
"maxOrder":integer

計算する中心化モーメントの最大次数を指定します。

別名nMoments
デフォルト4
最大値6
"nPercentiles":integer

均等な頻度パーセント点を計算します。例えば、値を 3 に設定すると、25、50、75 のパーセント点の計算が求められます。

デフォルト0
最小値0
"percentiles":[double-1 <, double-2, ...>]

計算する分位点またはパーセント点のリストを指定します。

"scaleBiweightTuning":double

Tukey 双加重尺度推定量の調整係数を指定します。

別名sclBiweightTuning
デフォルト9
最小値 (含まない)0
"scales":["AAD", "BIWEIGHT", "GINI", "IQR", "MAD", "STD"] | ["string-1" <, "string-2", ...>]

計算する尺度推定値の種類のリストを指定します。

AAD平均または中央値に関する絶対偏差を尺度として使用します。
BIWEIGHT尺度に Tukey biweight ベースの推定値を使用します。
GINI尺度に Gini スケールを使用します。
IQR尺度に四分位範囲を使用します。
MAD尺度に中央値に関する絶対偏差の中央値を使用します。
STD尺度に標準偏差を使用します。
"skewnesses":["AVGQUANTILE", "CLASSICAL", "PEARMED", "QUANTILE"] | ["string-1" <, "string-2", ...>]

歪度推定値の種類のリストを指定します。

AVGQUANTILE平均分位点に基づく歪度の推定値を使用します。
CLASSICAL歪度に古典的歪度係数を使用します。
PEARMED歪度にピアソン中央値歪度係数を使用します。
QUANTILE分位点ベースの歪度推定値を使用します。
"skewnessQuantile":double

分位点歪度推定量の分位点を指定します。

別名skewQuantile
デフォルト25
範囲(0, 50)
"standardizeMoments":True | False

中心化モーメントの代わりに、標準化モーメントが生成されることを指定します。

別名stdMoments
デフォルトFalse

seed=integer

シード値を指定します。シードは、ランダムな値を生成するために使用されます。

デフォルト0

standardError=True | False

True に設定すると、位置の標準誤差が結果に含まれます。

別名stdErr
デフォルトFalse

* table={castable}

テーブル名、caslib、他の共通パラメータを指定します。

table パラメーターの指定の詳細については、共通 castable パラメーターを参照してください。

tolerance=double

反復するロバストな単変量統計量のトレランスを指定します。

デフォルト1E-05

unbiased=True | False

True に設定すると、標準偏差、分散、古典的歪度、古典的尖度がバイアスに対して補正されます。

デフォルトTrue

varsToArgumentsMap=[integer-1 <, integer-2, ...>]

各変数に対して計算する要求パッケージを指定します。nArgsForEachVar パラメータに値が指定されている場合は、これを設定する必要があります。それ以外の場合は、両方のパラメータが無視され、すべての要求パッケージがすべての変数に対して計算されます。

weight="variable-name"

重み変数を指定します。

rustats アクション

ロバストな単変量統計量、中心化モーメント、分位点、度数分布統計量を計算します。

R 構文

results <– cas.dataPreprocess.rustats(s,
casOutStats=list(
caslib="string",
compress=TRUE | FALSE,
indexVars=list("variable-name-1" <, "variable-name-2", ...>),
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
memoryFormat="DVR" | "INHERIT" | "STANDARD",
name="table-name",
onDemand=TRUE | FALSE,
promote=TRUE | FALSE,
replace=TRUE | FALSE,
replication=integer,
threadBlockSize=64-bit-integer,
timeStamp="string",
where=list("string-1" <, "string-2", ...>)
),
complementaryStats=TRUE | FALSE,
confidenceInterval=TRUE | FALSE,
excessKurtosis=TRUE | FALSE,
freq="variable-name",
includeMissingGroup=TRUE | FALSE,
inputs=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
maxIterations=integer,
nArgumentsForEachVar=list(integer-1 <, integer-2, ...>),
nNominalVars=integer,
nominalStats=list(
bottomK=integer,
fuzzyCompare=double,
iqv=TRUE | FALSE,
topK=integer
),
nominalVarsIndices=list(integer-1 <, integer-2, ...>),
outputTableOptions=list(
forceTableReturn=TRUE | FALSE,
tableNames=list("string-1" <, "string-2", ...>)
),
requestPackages=list( list(
aadLocationUseMean=TRUE | FALSE,
allCentralizedMoments=TRUE | FALSE,
allKurtoses=TRUE | FALSE,
allLocations=TRUE | FALSE,
allNominalStats=TRUE | FALSE,
allScales=TRUE | FALSE,
allSkewnesses=TRUE | FALSE,
alpha=double,
kurtoses=list("AVGQUANTILE", "CLASSICAL", "MOORS", "QUANTILE") | list("string-1" <, "string-2", ...>),
locations=list("BIWEIGHT", "GEOMETRICMEAN", "HARMONICMEAN", "MEAN", "MEDIAN", "TRIMMEDMEAN", "WINSORIZEDMEAN") | list("string-1" <, "string-2", ...>),
maxOrder=integer,
nPercentiles=integer,
percentiles=list(double-1 <, double-2, ...>),
scales=list("AAD", "BIWEIGHT", "GINI", "IQR", "MAD", "STD") | list("string-1" <, "string-2", ...>),
skewnesses=list("AVGQUANTILE", "CLASSICAL", "PEARMED", "QUANTILE") | list("string-1" <, "string-2", ...>),
standardizeMoments=TRUE | FALSE
) <, list(...)>),
seed=integer,
standardError=TRUE | FALSE,
required parameter table=list(
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
computedVarsProgram="string",
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>),
groupBy=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters),
required parameter name="table-name",
onDemand=TRUE | FALSE,
orderBy=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
singlePass=TRUE | FALSE,
vars=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
where="where-expression",
whereTable=list(
casLib="string"
dataSourceOptions=list(adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameterslist)
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
required parameter name="table-name"
vars=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>)
where="where-expression"
)
),
tolerance=double,
unbiased=TRUE | FALSE,
varsToArgumentsMap=list(integer-1 <, integer-2, ...>),
weight="variable-name"
)
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

required parametertable

—

テーブル名、caslib、他の共通パラメータを指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

 casOutStats

—

出力テーブルの設定を指定します。

パラメーターの説明

casOutStats=list(casouttable)

出力テーブルの設定を指定します。

casOutStats パラメーターの指定の詳細については、共通 casouttable パラメーターを参照してください。

別名casOut

complementaryStats=TRUE | FALSE

True に設定すると、無修正平方和、修正済平方和、変動係数などの相補的な単変量統計が計算されます。

デフォルトFALSE

confidenceInterval=TRUE | FALSE

True に設定すると、信頼区間が結果に含まれます。このパラメータは、stdErr パラメータを有効にします。

デフォルトFALSE

excessKurtosis=TRUE | FALSE

True に設定すると、尖度の代わりに過剰尖度が計算されます。過剰尖度は、正規分布に関して定義されます。

デフォルトTRUE

freq="variable-name"

頻度変数を指定します。

別名frequency

includeMissingGroup=TRUE | FALSE

True に設定すると、欠損値は group-by キーとして許可されます。

デフォルトFALSE

inputs=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

分析に使用する変数を指定します。入力テーブルから変数のサブセットを指定することができます。

inputs パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名vars

maxIterations=integer

MAD 尺度、GINI 尺度、Medcouple 歪度推定量などの反復ロバストな単変量統計量の最大反復回数を指定します。このパラメータは、ZSCORE 外れ値定義が使用されている場合に使用できます。

別名maxIters
rustatsMaxNiters

nArgumentsForEachVar=list(integer-1 <, integer-2, ...>)

各変数の引数 (要求パッケージ) の数を指定します。設定されていない場合、すべての要求パッケージがすべての変数に含まれます。

別名nArgsForEachVar

nNominalVars=integer

nomVarsIndices パラメータに値を指定しない場合、最後の nNomVars 変数を名義として扱うように指定します。

最小値 (含まない)0

nominalStats=list(nominalStatistics)

名義統計量を計算します。これらには、質的変動のインデックスと、最も頻繁な値と最も頻度の低い値が含まれます。

nominalStatistics の値は次のいずれかになります:

bottomK=integer

計算する最小頻度のアイテムの数を指定します。

デフォルト5
distinctCountLimit=integer

重複しない値のカウント制限を指定します。

fuzzyCompare=double

数値の区別を決定するために使用されるファジー比較のしきい値を指定します。

別名precision
範囲0–1E-05
iqv=TRUE | FALSE

True に設定すると、質的変動のインデックスを計算します。これらには、Shannon エントロピー、Gini 指数と他のいくつかの度数分布の散布度測定値が含まれます。

デフォルトTRUE
topK=integer

計算する最も頻繁なアイテムの数を指定します。

デフォルト5

nominalVarsIndices=list(integer-1 <, integer-2, ...>)

名義変数として扱う変数のインデックスを指定します。

outputTableOptions=list(outputTableOptions)

結果テーブルのオプションを指定します。サーバーが返す結果テーブルと、グループごとの結果の処理方法を指定できます。

別名outputTableOpts

outputTableOptions の値は次のいずれかになります:

forceTableReturn=TRUE | FALSE

True に設定すると、出力が出力テーブルとして保存されていても、結果テーブルはクライアントに返されます。

デフォルトFALSE
tableNames=list("string-1" <, "string-2", ...>)

生成する結果テーブルの名前を指定します。デフォルトは、すべての結果テーブルが返されます。

別名outputTables

percentileDefinition=integer

使用するパーセント点の定義を指定します。定義には 1 から 6 の番号が付けられます。デフォルト値は 6 です。

別名pctlDef
デフォルト6
範囲1–6

percentileMaxIterations=integer

パーセント点計算の最大反復回数を指定します。

別名pctlMaxIters

percentileTolerance=double

パーセント点計算のトレランスを指定します。

別名pctlEpsilon
デフォルト1E-05

quantileSketch=list(quantileSketchOptions)

分位点スケッチのオプションを指定します。

別名quantileSketchOptions

quantileSketchOptions の値は次のいずれかになります:

compressionFactor=double

分位点スケッチに使用する圧縮因子を指定します。

デフォルト10
最小値1
epsilon=double

分位点スケッチに使用するトレランスを指定します。

デフォルト0.001
範囲1E-06–0.1

requestPackages=list( list(rustatsRequestPackage-1) <, list(rustatsRequestPackage-2), ...>)

アクションによって処理されるロバストな単変量統計量要求パッケージの配列を指定します。

別名reqPacks

rustatsRequestPackage の値は次のいずれかになります:

aadLocationUseMean=TRUE | FALSE

True に設定すると、中央値の代わりに、平均が絶対平均偏差 (AAD) 尺度推定量の中心として使用されます。

別名aadLocUseMean
デフォルトTRUE
allCentralizedMoments=TRUE | FALSE

True に設定すると、すべての中心化モーメント (6次まで) が計算されます。

デフォルトFALSE
allKurtoses=TRUE | FALSE

True に設定すると、すべての尖度の推定値が計算されます。

デフォルトFALSE
allLocations=TRUE | FALSE

True に設定すると、すべての位置の推定値が計算されます。

デフォルトFALSE
allNominalStats=TRUE | FALSE

すべての名義統計量を計算します。これらには、質的変動のインデックスと、最も頻繁な値と最も頻度の低い値が含まれます。

デフォルトFALSE
allScales=TRUE | FALSE

True に設定すると、すべての尺度の推定値が計算されます。

デフォルトFALSE
allSkewnesses=TRUE | FALSE

True に設定すると、すべての歪度の推定値が計算されます。

デフォルトFALSE
alpha=double

位置推定値の信頼区間の有意水準を指定します。

デフォルト0.05
kurtoses=list("AVGQUANTILE", "CLASSICAL", "MOORS", "QUANTILE") | list("string-1" <, "string-2", ...>)

計算する尖度推定値タイプのリストを指定します。

AVGQUANTILE平均分位点ベースの歪度推定値を使用します。
CLASSICAL古典的尖度推定値を使用します。
MOORSMoor 尖度推定値を使用します。
QUANTILE尖度推定値を使用します。
kurtosisAlphaQuantile=double

分位点または平均分位点の尖度推定量の下限(アルファ)分位点を指定します。

別名kurtAlphaQuantile
デフォルト2.5
範囲(0–50]
kurtosisBetaQuantile=double

分位点または平均分位点の尖度推定量の上限(ベータ)分位点を指定します。

別名kurtBetaQuantile
デフォルト25
範囲(0–50]
locationBiweightTuning=double

Tukey 双加重位置推定量の調整係数 を指定します。

別名locBiweightTuning
デフォルト6
最小値 (含まない)0
locationLowerPercentile=double

パーセント点を必要とする位置推定値の下限パーセント点を指定します。

別名locLowerPerc
デフォルト5
範囲(0, 50)
locations=list("BIWEIGHT", "GEOMETRICMEAN", "HARMONICMEAN", "MEAN", "MEDIAN", "TRIMMEDMEAN", "WINSORIZEDMEAN") | list("string-1" <, "string-2", ...>)

計算する位置推定値タイプのリストを指定します。

BIWEIGHT位置の Tukey biweight ベースの推定値を使用します。
GEOMETRICMEAN位置の幾何平均を使用します。
HARMONICMEAN位置の調和平均を使用します。
MEAN位置の算術平均を使用します。
MEDIAN位置の中央値を使用します。
TRIMMEDMEAN位置のトリム平均を使用します。lowerPerc、upperPerc、symPerc の各パラメータで境界を指定できます。
WINSORIZEDMEAN位置のウィンザー化平均を使用します。lowerPerc、upperPerc、symPerc の各パラメータで境界を指定できます。
locationSymmetricPercentile=double

パーセント点を必要とする位置推定値の対称パーセント点を指定します。例えば、値が 20 の場合は、下限パーセント点を 10 に、上限パーセント点を 90 に設定することを示します。

別名locSymPerc
デフォルト10
範囲(0, 100)
locationUpperPercentile=double

パーセント点を必要とする位置推定値の上限パーセント点を指定します。

別名locUpperPerc
デフォルト95
範囲(50, 100)
maxOrder=integer

計算する中心化モーメントの最大次数を指定します。

別名nMoments
デフォルト4
最大値6
nPercentiles=integer

均等な頻度パーセント点を計算します。例えば、値を 3 に設定すると、25、50、75 のパーセント点の計算が求められます。

デフォルト0
最小値0
percentiles=list(double-1 <, double-2, ...>)

計算する分位点またはパーセント点のリストを指定します。

scaleBiweightTuning=double

Tukey 双加重尺度推定量の調整係数を指定します。

別名sclBiweightTuning
デフォルト9
最小値 (含まない)0
scales=list("AAD", "BIWEIGHT", "GINI", "IQR", "MAD", "STD") | list("string-1" <, "string-2", ...>)

計算する尺度推定値の種類のリストを指定します。

AAD平均または中央値に関する絶対偏差を尺度として使用します。
BIWEIGHT尺度に Tukey biweight ベースの推定値を使用します。
GINI尺度に Gini スケールを使用します。
IQR尺度に四分位範囲を使用します。
MAD尺度に中央値に関する絶対偏差の中央値を使用します。
STD尺度に標準偏差を使用します。
skewnesses=list("AVGQUANTILE", "CLASSICAL", "PEARMED", "QUANTILE") | list("string-1" <, "string-2", ...>)

歪度推定値の種類のリストを指定します。

AVGQUANTILE平均分位点に基づく歪度の推定値を使用します。
CLASSICAL歪度に古典的歪度係数を使用します。
PEARMED歪度にピアソン中央値歪度係数を使用します。
QUANTILE分位点ベースの歪度推定値を使用します。
skewnessQuantile=double

分位点歪度推定量の分位点を指定します。

別名skewQuantile
デフォルト25
範囲(0, 50)
standardizeMoments=TRUE | FALSE

中心化モーメントの代わりに、標準化モーメントが生成されることを指定します。

別名stdMoments
デフォルトFALSE

seed=integer

シード値を指定します。シードは、ランダムな値を生成するために使用されます。

デフォルト0

standardError=TRUE | FALSE

True に設定すると、位置の標準誤差が結果に含まれます。

別名stdErr
デフォルトFALSE

* table=list(castable)

テーブル名、caslib、他の共通パラメータを指定します。

table パラメーターの指定の詳細については、共通 castable パラメーターを参照してください。

tolerance=double

反復するロバストな単変量統計量のトレランスを指定します。

デフォルト1E-05

unbiased=TRUE | FALSE

True に設定すると、標準偏差、分散、古典的歪度、古典的尖度がバイアスに対して補正されます。

デフォルトTRUE

varsToArgumentsMap=list(integer-1 <, integer-2, ...>)

各変数に対して計算する要求パッケージを指定します。nArgsForEachVar パラメータに値が指定されている場合は、これを設定する必要があります。それ以外の場合は、両方のパラメータが無視され、すべての要求パッケージがすべての変数に対して計算されます。

weight="variable-name"

重み変数を指定します。

最終更新: 2022/10/04