LDA トピックモデリング アクションセット: 構文

LDA モデルを使用して LDA トピックモデルとスコアリング文書を学習するアクションを提供します

ldaTrain アクション

潜在的 Dirichlet 配分法トピックモデルを学習します。

参照項目:潜在的ディリクレ配分トピックアクションの概要
潜在的ディリクレ配分法を使用したドキュメントのトピックモデルの学習
潜在的ディリクレ配分トピック法を使用したドキュメントの学習とスコアリング
ldaTopic.ldaTrain <result=results> <status=rc> /
alpha=double,
beta=double,
casOut
={
caslib="string",
compress=TRUE | FALSE,
indexVars={"variable-name-1" <, "variable-name-2", ...>},
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
memoryFormat="DVR" | "INHERIT" | "STANDARD",
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
replication=integer,
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE",
threadBlockSize=64-bit-integer,
timeStamp="string",
where={"string-1" <, "string-2", ...>}
},
docDistOut
={
caslib="string",
compress=TRUE | FALSE,
indexVars={"variable-name-1" <, "variable-name-2", ...>},
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
memoryFormat="DVR" | "INHERIT" | "STANDARD",
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
replication=integer,
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE",
threadBlockSize=64-bit-integer,
timeStamp="string",
where={"string-1" <, "string-2", ...>}
},
required parameter docId="variable-name",
k=64-bit-integer,
keepWords
={
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
computedVarsProgram="string",
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
orderBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=TRUE | FALSE,
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable
={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
likelihood=TRUE | FALSE,
meanEstimate=TRUE | FALSE,
nBurnin=integer,
nIters=integer,
seed=double,
stopWords
={
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
computedVarsProgram="string",
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
orderBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=TRUE | FALSE,
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable
={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
required parameter table
={
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
computedVarsProgram="string",
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
orderBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=TRUE | FALSE,
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable
={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
required parameter text
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
tm
={
binaryLocation="string",
entities="NONE" | "STD",
language="ARABIC" | "CHINESE" | "CROATIAN" | "CZECH" | "DANISH" | "DUTCH" | "ENGLISH" | "FARSI" | "FINNISH" | "FRENCH" | "GERMAN" | "GREEK" | "HEBREW" | "HINDI" | "HUNGARIAN" | "INDONESIAN" | "ITALIAN" | "JAPANESE" | "KAZAKH" | "KOREAN" | "NORWEGIAN" | "POLISH" | "PORTUGUESE" | "ROMANIAN" | "RUSSIAN" | "SLOVAK" | "SLOVENE" | "SPANISH" | "SWEDISH" | "TAGALOG" | "THAI" | "TURKISH" | "VIETNAMESE",
nounGroups=TRUE | FALSE,
stemming=TRUE | FALSE
}
;
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

 keepWords

—

分析のために保持する単語を含む入力 CAS テーブルを指定します。

 stopWords

—

分析から除外する単語を含む入力 CAS テーブルを指定します。

required parametertable

—

入力テーブルの設定を指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

 casOut

—

トピック分布を格納するインメモリテーブルを指定します。

 docDistOut

—

文書のトピック比率を格納するインメモリテーブルを指定します。

パラメーターの説明

alpha=double

文書のトピック比率の Dirichlet ハイパーパラメーターを指定します。

デフォルト0.1
最小値 (含まない)0

beta=double

トピック分布の Dirichlet ハイパーパラメーターを指定します。

デフォルト0.1
最小値 (含まない)0

casOut={casouttable}

トピック分布を格納するインメモリテーブルを指定します。

casOut パラメーターの指定の詳細については、共通 casouttable (形式 1) パラメーターを参照してください。

別名topicDistOut
topicDist
ldamodel

docDistOut={casouttable}

文書のトピック比率を格納するインメモリテーブルを指定します。

docDistOut パラメーターの指定の詳細については、共通 casouttable (形式 1) パラメーターを参照してください。

別名topicPropOut
topicProp
topicProportion
docDist

* docId="variable-name"

各文書の ID を含む入力テーブルの文字変数または数値変数を指定します。

別名docIdVar

k=64-bit-integer

モデルで考慮するトピック数を指定します。

別名nTopic
numTopics
numTopic
デフォルト2
最小値1

keepWords={castable}

分析のために保持する単語を含む入力 CAS テーブルを指定します。

keepWords パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

別名startList

likelihood=TRUE | FALSE

True に設定すると、尤度と条件付き尤度の両方が計算されます。

デフォルトFALSE

meanEstimate=TRUE | FALSE

True に設定すると、トピック分布と文書のトピック比率の推定値は、すべての反復から Gibbs サンプルを平均して計算されます。デフォルトでは、推定値は最終反復でのみ Gibbs サンプルから計算されます。

デフォルトFALSE

nBurnin=integer

Burn-In として考慮する Gibbs サンプリングの反復回数、または破棄する反復回数を指定します。これらの Burn-in 反復回数は、nIters パラメーターで指定された最大反復回数にはカウントされないことに注意してください。

デフォルト0
最小値0

nIters=integer

最大反復回数を指定します。

別名nIter
maxIters
デフォルト10
最小値1

seed=double

乱数生成器のシードを指定します。デフォルトでは、乱数ストリームはコンピュータークロックに基づいています。負の値を指定すると、コンピュータークロックに基づいて乱数ストリームが生成されます。実行の間に再現可能な乱数シーケンスが必要な場合は、0 より大きい値を指定してください。

デフォルト0
最小値0

stopWords={castable}

分析から除外する単語を含む入力 CAS テーブルを指定します。

stopWords パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

別名stopList

* table={castable}

入力テーブルの設定を指定します。

table パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

* text={{casinvardesc-1} <, {casinvardesc-2}, ...>}

モデルの学習に使用する入力テーブルのテキスト変数を指定します。

text パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名texts
input
inputs

tm={castm}

テキスト解析の設定を指定します。

長い形式tm={entities="NONE" | "STD"}
短い形式tm="NONE" | "STD"

castm の値は次のいずれかになります:

binaryLocation="string"

言語バイナリファイルの場所を指定します。場所は有効でなければなりません。指定されていない場合は、デフォルトのインストール場所が使用されます。

別名taBinLoc
entities="NONE" | "STD"

解析でエンティティを抽出するかどうかを指定します。None に設定すると、エンティティは出力されません。STD に設定すると、標準エンティティが出力されます。

デフォルトNONE
language="ARABIC" | "CHINESE" | "CROATIAN" | "CZECH" | "DANISH" | "DUTCH" | "ENGLISH" | "FARSI" | "FINNISH" | "FRENCH" | "GERMAN" | "GREEK" | "HEBREW" | "HINDI" | "HUNGARIAN" | "INDONESIAN" | "ITALIAN" | "JAPANESE" | "KAZAKH" | "KOREAN" | "NORWEGIAN" | "POLISH" | "PORTUGUESE" | "ROMANIAN" | "RUSSIAN" | "SLOVAK" | "SLOVENE" | "SPANISH" | "SWEDISH" | "TAGALOG" | "THAI" | "TURKISH" | "VIETNAMESE"

入力文書テーブルのテキスト変数で使用される言語を指定します。

デフォルトENGLISH
nounGroups=TRUE | FALSE

True に設定すると、解析中に名詞グループが抽出されます。

デフォルトFALSE
stemming=TRUE | FALSE

True に設定すると、解析中に語幹抽出が実行されます。

デフォルトFALSE

ldaTrain アクション

潜在的 Dirichlet 配分法トピックモデルを学習します。

参照項目:潜在的ディリクレ配分トピックアクションの概要
潜在的ディリクレ配分法を使用したドキュメントのトピックモデルの学習
潜在的ディリクレ配分トピック法を使用したドキュメントの学習とスコアリング
results, info = s:ldaTopic_ldaTrain{
alpha=double,
beta=double,
casOut
={
caslib="string",
compress=true | false,
indexVars={"variable-name-1" <, "variable-name-2", ...>},
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
memoryFormat="DVR" | "INHERIT" | "STANDARD",
name="table-name",
promote=true | false,
replace=true | false,
replication=integer,
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE",
threadBlockSize=64-bit-integer,
timeStamp="string",
where={"string-1" <, "string-2", ...>}
},
docDistOut
={
caslib="string",
compress=true | false,
indexVars={"variable-name-1" <, "variable-name-2", ...>},
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
memoryFormat="DVR" | "INHERIT" | "STANDARD",
name="table-name",
promote=true | false,
replace=true | false,
replication=integer,
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE",
threadBlockSize=64-bit-integer,
timeStamp="string",
where={"string-1" <, "string-2", ...>}
},
required parameter docId="variable-name",
k=64-bit-integer,
keepWords
={
caslib="string",
computedOnDemand=true | false,
computedVars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
computedVarsProgram="string",
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
orderBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=true | false,
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable
={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
likelihood=true | false,
meanEstimate=true | false,
nBurnin=integer,
nIters=integer,
seed=double,
stopWords
={
caslib="string",
computedOnDemand=true | false,
computedVars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
computedVarsProgram="string",
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
orderBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=true | false,
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable
={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
required parameter table
={
caslib="string",
computedOnDemand=true | false,
computedVars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
computedVarsProgram="string",
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
orderBy
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=true | false,
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable
={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
},
required parameter text
={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
tm
={
binaryLocation="string",
entities="NONE" | "STD",
language="ARABIC" | "CHINESE" | "CROATIAN" | "CZECH" | "DANISH" | "DUTCH" | "ENGLISH" | "FARSI" | "FINNISH" | "FRENCH" | "GERMAN" | "GREEK" | "HEBREW" | "HINDI" | "HUNGARIAN" | "INDONESIAN" | "ITALIAN" | "JAPANESE" | "KAZAKH" | "KOREAN" | "NORWEGIAN" | "POLISH" | "PORTUGUESE" | "ROMANIAN" | "RUSSIAN" | "SLOVAK" | "SLOVENE" | "SPANISH" | "SWEDISH" | "TAGALOG" | "THAI" | "TURKISH" | "VIETNAMESE",
nounGroups=true | false,
stemming=true | false
}
}
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

 keepWords

—

分析のために保持する単語を含む入力 CAS テーブルを指定します。

 stopWords

—

分析から除外する単語を含む入力 CAS テーブルを指定します。

required parametertable

—

入力テーブルの設定を指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

 casOut

—

トピック分布を格納するインメモリテーブルを指定します。

 docDistOut

—

文書のトピック比率を格納するインメモリテーブルを指定します。

パラメーターの説明

alpha=double

文書のトピック比率の Dirichlet ハイパーパラメーターを指定します。

デフォルト0.1
最小値 (含まない)0

beta=double

トピック分布の Dirichlet ハイパーパラメーターを指定します。

デフォルト0.1
最小値 (含まない)0

casOut={casouttable}

トピック分布を格納するインメモリテーブルを指定します。

casOut パラメーターの指定の詳細については、共通 casouttable (形式 1) パラメーターを参照してください。

別名topicDistOut
topicDist
ldamodel

docDistOut={casouttable}

文書のトピック比率を格納するインメモリテーブルを指定します。

docDistOut パラメーターの指定の詳細については、共通 casouttable (形式 1) パラメーターを参照してください。

別名topicPropOut
topicProp
topicProportion
docDist

* docId="variable-name"

各文書の ID を含む入力テーブルの文字変数または数値変数を指定します。

別名docIdVar

k=64-bit-integer

モデルで考慮するトピック数を指定します。

別名nTopic
numTopics
numTopic
デフォルト2
最小値1

keepWords={castable}

分析のために保持する単語を含む入力 CAS テーブルを指定します。

keepWords パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

別名startList

likelihood=true | false

True に設定すると、尤度と条件付き尤度の両方が計算されます。

デフォルトfalse

meanEstimate=true | false

True に設定すると、トピック分布と文書のトピック比率の推定値は、すべての反復から Gibbs サンプルを平均して計算されます。デフォルトでは、推定値は最終反復でのみ Gibbs サンプルから計算されます。

デフォルトfalse

nBurnin=integer

Burn-In として考慮する Gibbs サンプリングの反復回数、または破棄する反復回数を指定します。これらの Burn-in 反復回数は、nIters パラメーターで指定された最大反復回数にはカウントされないことに注意してください。

デフォルト0
最小値0

nIters=integer

最大反復回数を指定します。

別名nIter
maxIters
デフォルト10
最小値1

seed=double

乱数生成器のシードを指定します。デフォルトでは、乱数ストリームはコンピュータークロックに基づいています。負の値を指定すると、コンピュータークロックに基づいて乱数ストリームが生成されます。実行の間に再現可能な乱数シーケンスが必要な場合は、0 より大きい値を指定してください。

デフォルト0
最小値0

stopWords={castable}

分析から除外する単語を含む入力 CAS テーブルを指定します。

stopWords パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

別名stopList

* table={castable}

入力テーブルの設定を指定します。

table パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

* text={{casinvardesc-1} <, {casinvardesc-2}, ...>}

モデルの学習に使用する入力テーブルのテキスト変数を指定します。

text パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名texts
input
inputs

tm={castm}

テキスト解析の設定を指定します。

長い形式tm={entities="NONE" | "STD"}
短い形式tm="NONE" | "STD"

castm の値は次のいずれかになります:

binaryLocation="string"

言語バイナリファイルの場所を指定します。場所は有効でなければなりません。指定されていない場合は、デフォルトのインストール場所が使用されます。

別名taBinLoc
entities="NONE" | "STD"

解析でエンティティを抽出するかどうかを指定します。None に設定すると、エンティティは出力されません。STD に設定すると、標準エンティティが出力されます。

デフォルトNONE
language="ARABIC" | "CHINESE" | "CROATIAN" | "CZECH" | "DANISH" | "DUTCH" | "ENGLISH" | "FARSI" | "FINNISH" | "FRENCH" | "GERMAN" | "GREEK" | "HEBREW" | "HINDI" | "HUNGARIAN" | "INDONESIAN" | "ITALIAN" | "JAPANESE" | "KAZAKH" | "KOREAN" | "NORWEGIAN" | "POLISH" | "PORTUGUESE" | "ROMANIAN" | "RUSSIAN" | "SLOVAK" | "SLOVENE" | "SPANISH" | "SWEDISH" | "TAGALOG" | "THAI" | "TURKISH" | "VIETNAMESE"

入力文書テーブルのテキスト変数で使用される言語を指定します。

デフォルトENGLISH
nounGroups=true | false

True に設定すると、解析中に名詞グループが抽出されます。

デフォルトfalse
stemming=true | false

True に設定すると、解析中に語幹抽出が実行されます。

デフォルトfalse

ldaTrain アクション

潜在的 Dirichlet 配分法トピックモデルを学習します。

参照項目:潜在的ディリクレ配分トピックアクションの概要
潜在的ディリクレ配分法を使用したドキュメントのトピックモデルの学習
潜在的ディリクレ配分トピック法を使用したドキュメントの学習とスコアリング
results=s.ldaTopic.ldaTrain(
alpha=double,
beta=double,
casOut
={
"caslib":"string",
"compress":True | False,
"indexVars":["variable-name-1" <, "variable-name-2", ...>],
"label":"string",
"lifetime":64-bit-integer,
"maxMemSize":64-bit-integer,
"memoryFormat":"DVR" | "INHERIT" | "STANDARD",
"name":"table-name",
"promote":True | False,
"replace":True | False,
"replication":integer,
"tableRedistUpPolicy":"DEFER" | "NOREDIST" | "REBALANCE",
"threadBlockSize":64-bit-integer,
"timeStamp":"string",
"where":["string-1" <, "string-2", ...>]
},
docDistOut
={
"caslib":"string",
"compress":True | False,
"indexVars":["variable-name-1" <, "variable-name-2", ...>],
"label":"string",
"lifetime":64-bit-integer,
"maxMemSize":64-bit-integer,
"memoryFormat":"DVR" | "INHERIT" | "STANDARD",
"name":"table-name",
"promote":True | False,
"replace":True | False,
"replication":integer,
"tableRedistUpPolicy":"DEFER" | "NOREDIST" | "REBALANCE",
"threadBlockSize":64-bit-integer,
"timeStamp":"string",
"where":["string-1" <, "string-2", ...>]
},
required parameter docId="variable-name",
k=64-bit-integer,
keepWords
={
"caslib":"string",
"computedOnDemand":True | False,
"computedVars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"computedVarsProgram":"string",
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>},
"groupBy"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"groupByMode":"NOSORT" | "REDISTRIBUTE",
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter "name":"table-name",
"orderBy"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"singlePass":True | False,
"vars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"where":"where-expression",
"whereTable"
:{
"casLib":"string"
"dataSourceOptions":{adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter "name":"table-name"
"vars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>]
"where":"where-expression"
}
},
likelihood=True | False,
meanEstimate=True | False,
nBurnin=integer,
nIters=integer,
seed=double,
stopWords
={
"caslib":"string",
"computedOnDemand":True | False,
"computedVars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"computedVarsProgram":"string",
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>},
"groupBy"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"groupByMode":"NOSORT" | "REDISTRIBUTE",
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter "name":"table-name",
"orderBy"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"singlePass":True | False,
"vars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"where":"where-expression",
"whereTable"
:{
"casLib":"string"
"dataSourceOptions":{adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter "name":"table-name"
"vars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>]
"where":"where-expression"
}
},
required parameter table
={
"caslib":"string",
"computedOnDemand":True | False,
"computedVars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"computedVarsProgram":"string",
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>},
"groupBy"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"groupByMode":"NOSORT" | "REDISTRIBUTE",
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter "name":"table-name",
"orderBy"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"singlePass":True | False,
"vars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"where":"where-expression",
"whereTable"
:{
"casLib":"string"
"dataSourceOptions":{adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter "name":"table-name"
"vars"
:[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>]
"where":"where-expression"
}
},
required parameter text
=[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
tm
={
"binaryLocation":"string",
"entities":"NONE" | "STD",
"language":"ARABIC" | "CHINESE" | "CROATIAN" | "CZECH" | "DANISH" | "DUTCH" | "ENGLISH" | "FARSI" | "FINNISH" | "FRENCH" | "GERMAN" | "GREEK" | "HEBREW" | "HINDI" | "HUNGARIAN" | "INDONESIAN" | "ITALIAN" | "JAPANESE" | "KAZAKH" | "KOREAN" | "NORWEGIAN" | "POLISH" | "PORTUGUESE" | "ROMANIAN" | "RUSSIAN" | "SLOVAK" | "SLOVENE" | "SPANISH" | "SWEDISH" | "TAGALOG" | "THAI" | "TURKISH" | "VIETNAMESE",
"nounGroups":True | False,
"stemming":True | False
}
)
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

 keepWords

—

分析のために保持する単語を含む入力 CAS テーブルを指定します。

 stopWords

—

分析から除外する単語を含む入力 CAS テーブルを指定します。

required parametertable

—

入力テーブルの設定を指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

 casOut

—

トピック分布を格納するインメモリテーブルを指定します。

 docDistOut

—

文書のトピック比率を格納するインメモリテーブルを指定します。

パラメーターの説明

alpha=double

文書のトピック比率の Dirichlet ハイパーパラメーターを指定します。

デフォルト0.1
最小値 (含まない)0

beta=double

トピック分布の Dirichlet ハイパーパラメーターを指定します。

デフォルト0.1
最小値 (含まない)0

casOut={casouttable}

トピック分布を格納するインメモリテーブルを指定します。

casOut パラメーターの指定の詳細については、共通 casouttable (形式 1) パラメーターを参照してください。

別名topicDistOut
topicDist
ldamodel

docDistOut={casouttable}

文書のトピック比率を格納するインメモリテーブルを指定します。

docDistOut パラメーターの指定の詳細については、共通 casouttable (形式 1) パラメーターを参照してください。

別名topicPropOut
topicProp
topicProportion
docDist

* docId="variable-name"

各文書の ID を含む入力テーブルの文字変数または数値変数を指定します。

別名docIdVar

k=64-bit-integer

モデルで考慮するトピック数を指定します。

別名nTopic
numTopics
numTopic
デフォルト2
最小値1

keepWords={castable}

分析のために保持する単語を含む入力 CAS テーブルを指定します。

keepWords パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

別名startList

likelihood=True | False

True に設定すると、尤度と条件付き尤度の両方が計算されます。

デフォルトFalse

meanEstimate=True | False

True に設定すると、トピック分布と文書のトピック比率の推定値は、すべての反復から Gibbs サンプルを平均して計算されます。デフォルトでは、推定値は最終反復でのみ Gibbs サンプルから計算されます。

デフォルトFalse

nBurnin=integer

Burn-In として考慮する Gibbs サンプリングの反復回数、または破棄する反復回数を指定します。これらの Burn-in 反復回数は、nIters パラメーターで指定された最大反復回数にはカウントされないことに注意してください。

デフォルト0
最小値0

nIters=integer

最大反復回数を指定します。

別名nIter
maxIters
デフォルト10
最小値1

seed=double

乱数生成器のシードを指定します。デフォルトでは、乱数ストリームはコンピュータークロックに基づいています。負の値を指定すると、コンピュータークロックに基づいて乱数ストリームが生成されます。実行の間に再現可能な乱数シーケンスが必要な場合は、0 より大きい値を指定してください。

デフォルト0
最小値0

stopWords={castable}

分析から除外する単語を含む入力 CAS テーブルを指定します。

stopWords パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

別名stopList

* table={castable}

入力テーブルの設定を指定します。

table パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

* text=[{casinvardesc-1} <, {casinvardesc-2}, ...>]

モデルの学習に使用する入力テーブルのテキスト変数を指定します。

text パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名texts
input
inputs

tm={castm}

テキスト解析の設定を指定します。

長い形式tm={"entities":"NONE" | "STD"}
短い形式tm="NONE" | "STD"

castm の値は次のいずれかになります:

"binaryLocation":"string"

言語バイナリファイルの場所を指定します。場所は有効でなければなりません。指定されていない場合は、デフォルトのインストール場所が使用されます。

別名taBinLoc
"entities":"NONE" | "STD"

解析でエンティティを抽出するかどうかを指定します。None に設定すると、エンティティは出力されません。STD に設定すると、標準エンティティが出力されます。

デフォルトNONE
"language":"ARABIC" | "CHINESE" | "CROATIAN" | "CZECH" | "DANISH" | "DUTCH" | "ENGLISH" | "FARSI" | "FINNISH" | "FRENCH" | "GERMAN" | "GREEK" | "HEBREW" | "HINDI" | "HUNGARIAN" | "INDONESIAN" | "ITALIAN" | "JAPANESE" | "KAZAKH" | "KOREAN" | "NORWEGIAN" | "POLISH" | "PORTUGUESE" | "ROMANIAN" | "RUSSIAN" | "SLOVAK" | "SLOVENE" | "SPANISH" | "SWEDISH" | "TAGALOG" | "THAI" | "TURKISH" | "VIETNAMESE"

入力文書テーブルのテキスト変数で使用される言語を指定します。

デフォルトENGLISH
"nounGroups":True | False

True に設定すると、解析中に名詞グループが抽出されます。

デフォルトFalse
"stemming":True | False

True に設定すると、解析中に語幹抽出が実行されます。

デフォルトFalse

ldaTrain アクション

潜在的 Dirichlet 配分法トピックモデルを学習します。

参照項目:潜在的ディリクレ配分トピックアクションの概要
潜在的ディリクレ配分法を使用したドキュメントのトピックモデルの学習
潜在的ディリクレ配分トピック法を使用したドキュメントの学習とスコアリング
results <– cas.ldaTopic.ldaTrain(s,
alpha=double,
beta=double,
casOut
=list(
caslib="string",
compress=TRUE | FALSE,
indexVars=list("variable-name-1" <, "variable-name-2", ...>),
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
memoryFormat="DVR" | "INHERIT" | "STANDARD",
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
replication=integer,
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE",
threadBlockSize=64-bit-integer,
timeStamp="string",
where=list("string-1" <, "string-2", ...>)
),
docDistOut
=list(
caslib="string",
compress=TRUE | FALSE,
indexVars=list("variable-name-1" <, "variable-name-2", ...>),
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
memoryFormat="DVR" | "INHERIT" | "STANDARD",
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
replication=integer,
tableRedistUpPolicy="DEFER" | "NOREDIST" | "REBALANCE",
threadBlockSize=64-bit-integer,
timeStamp="string",
where=list("string-1" <, "string-2", ...>)
),
required parameter docId="variable-name",
k=64-bit-integer,
keepWords
=list(
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
computedVarsProgram="string",
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>),
groupBy
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters),
required parameter name="table-name",
orderBy
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
singlePass=TRUE | FALSE,
vars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
where="where-expression",
whereTable
=list(
casLib="string"
dataSourceOptions=list(adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters)
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
required parameter name="table-name"
vars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>)
where="where-expression"
)
),
likelihood=TRUE | FALSE,
meanEstimate=TRUE | FALSE,
nBurnin=integer,
nIters=integer,
seed=double,
stopWords
=list(
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
computedVarsProgram="string",
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>),
groupBy
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters),
required parameter name="table-name",
orderBy
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
singlePass=TRUE | FALSE,
vars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
where="where-expression",
whereTable
=list(
casLib="string"
dataSourceOptions=list(adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters)
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
required parameter name="table-name"
vars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>)
where="where-expression"
)
),
required parameter table
=list(
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
computedVarsProgram="string",
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>),
groupBy
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
groupByMode="NOSORT" | "REDISTRIBUTE",
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters),
required parameter name="table-name",
orderBy
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
singlePass=TRUE | FALSE,
vars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
where="where-expression",
whereTable
=list(
casLib="string"
dataSourceOptions=list(adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | hadoop-parameters | hana-parameters | impala-parameters | informix-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sapiq-parameters | sforce-parameters | singlestore_standard-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | ss_noreq-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters)
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
required parameter name="table-name"
vars
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>)
where="where-expression"
)
),
required parameter text
=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
tm
=list(
binaryLocation="string",
entities="NONE" | "STD",
language="ARABIC" | "CHINESE" | "CROATIAN" | "CZECH" | "DANISH" | "DUTCH" | "ENGLISH" | "FARSI" | "FINNISH" | "FRENCH" | "GERMAN" | "GREEK" | "HEBREW" | "HINDI" | "HUNGARIAN" | "INDONESIAN" | "ITALIAN" | "JAPANESE" | "KAZAKH" | "KOREAN" | "NORWEGIAN" | "POLISH" | "PORTUGUESE" | "ROMANIAN" | "RUSSIAN" | "SLOVAK" | "SLOVENE" | "SPANISH" | "SWEDISH" | "TAGALOG" | "THAI" | "TURKISH" | "VIETNAMESE",
nounGroups=TRUE | FALSE,
stemming=TRUE | FALSE
)
)
必須パラメーター

要約: 入力テーブルと出力テーブル

行にサブパラメーターが含まれる場合は、サブパラメーターに名前、caslibなどを指定できます。サブパラメーターが含まれない場合は、パラメーターに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメーター

パラメーター

サブパラメーター

説明

 keepWords

—

分析のために保持する単語を含む入力 CAS テーブルを指定します。

 stopWords

—

分析から除外する単語を含む入力 CAS テーブルを指定します。

required parametertable

—

入力テーブルの設定を指定します。

出力テーブルの作成パラメーター

パラメーター

サブパラメーター

説明

 casOut

—

トピック分布を格納するインメモリテーブルを指定します。

 docDistOut

—

文書のトピック比率を格納するインメモリテーブルを指定します。

パラメーターの説明

alpha=double

文書のトピック比率の Dirichlet ハイパーパラメーターを指定します。

デフォルト0.1
最小値 (含まない)0

beta=double

トピック分布の Dirichlet ハイパーパラメーターを指定します。

デフォルト0.1
最小値 (含まない)0

casOut=list(casouttable)

トピック分布を格納するインメモリテーブルを指定します。

casOut パラメーターの指定の詳細については、共通 casouttable (形式 1) パラメーターを参照してください。

別名topicDistOut
topicDist
ldamodel

docDistOut=list(casouttable)

文書のトピック比率を格納するインメモリテーブルを指定します。

docDistOut パラメーターの指定の詳細については、共通 casouttable (形式 1) パラメーターを参照してください。

別名topicPropOut
topicProp
topicProportion
docDist

* docId="variable-name"

各文書の ID を含む入力テーブルの文字変数または数値変数を指定します。

別名docIdVar

k=64-bit-integer

モデルで考慮するトピック数を指定します。

別名nTopic
numTopics
numTopic
デフォルト2
最小値1

keepWords=list(castable)

分析のために保持する単語を含む入力 CAS テーブルを指定します。

keepWords パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

別名startList

likelihood=TRUE | FALSE

True に設定すると、尤度と条件付き尤度の両方が計算されます。

デフォルトFALSE

meanEstimate=TRUE | FALSE

True に設定すると、トピック分布と文書のトピック比率の推定値は、すべての反復から Gibbs サンプルを平均して計算されます。デフォルトでは、推定値は最終反復でのみ Gibbs サンプルから計算されます。

デフォルトFALSE

nBurnin=integer

Burn-In として考慮する Gibbs サンプリングの反復回数、または破棄する反復回数を指定します。これらの Burn-in 反復回数は、nIters パラメーターで指定された最大反復回数にはカウントされないことに注意してください。

デフォルト0
最小値0

nIters=integer

最大反復回数を指定します。

別名nIter
maxIters
デフォルト10
最小値1

seed=double

乱数生成器のシードを指定します。デフォルトでは、乱数ストリームはコンピュータークロックに基づいています。負の値を指定すると、コンピュータークロックに基づいて乱数ストリームが生成されます。実行の間に再現可能な乱数シーケンスが必要な場合は、0 より大きい値を指定してください。

デフォルト0
最小値0

stopWords=list(castable)

分析から除外する単語を含む入力 CAS テーブルを指定します。

stopWords パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

別名stopList

* table=list(castable)

入力テーブルの設定を指定します。

table パラメーターの指定の詳細については、共通 castable (形式 1) パラメーターを参照してください。

* text=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

モデルの学習に使用する入力テーブルのテキスト変数を指定します。

text パラメーターの指定の詳細については、共通 casinvardesc パラメーターを参照してください。

別名texts
input
inputs

tm=list(castm)

テキスト解析の設定を指定します。

長い形式tm=list(entities="NONE" | "STD")
短い形式tm="NONE" | "STD"

castm の値は次のいずれかになります:

binaryLocation="string"

言語バイナリファイルの場所を指定します。場所は有効でなければなりません。指定されていない場合は、デフォルトのインストール場所が使用されます。

別名taBinLoc
entities="NONE" | "STD"

解析でエンティティを抽出するかどうかを指定します。None に設定すると、エンティティは出力されません。STD に設定すると、標準エンティティが出力されます。

デフォルトNONE
language="ARABIC" | "CHINESE" | "CROATIAN" | "CZECH" | "DANISH" | "DUTCH" | "ENGLISH" | "FARSI" | "FINNISH" | "FRENCH" | "GERMAN" | "GREEK" | "HEBREW" | "HINDI" | "HUNGARIAN" | "INDONESIAN" | "ITALIAN" | "JAPANESE" | "KAZAKH" | "KOREAN" | "NORWEGIAN" | "POLISH" | "PORTUGUESE" | "ROMANIAN" | "RUSSIAN" | "SLOVAK" | "SLOVENE" | "SPANISH" | "SWEDISH" | "TAGALOG" | "THAI" | "TURKISH" | "VIETNAMESE"

入力文書テーブルのテキスト変数で使用される言語を指定します。

デフォルトENGLISH
nounGroups=TRUE | FALSE

True に設定すると、解析中に名詞グループが抽出されます。

デフォルトFALSE
stemming=TRUE | FALSE

True に設定すると、解析中に語幹抽出が実行されます。

デフォルトFALSE
最終更新: 2026年3月26日