Data Discovery アクションセット: 構文
Data Discovery サービスを実行するアクションを提供します。
profile アクション
テーブルのプロファイリングメトリックを提供します。
CASL 構文
要約: 入力テーブルと出力テーブル
行にサブパラメータが含まれる場合は、サブパラメータに名前、caslibなどを指定できます。サブパラメータが含まれない場合は、パラメータに名前、caslibなどを指定できます。
|
パラメータ |
サブパラメータ |
説明 |
|---|---|---|
|
— |
入力テーブルの設定を指定します。 |
|
パラメータ |
サブパラメータ |
説明 |
|---|---|---|
|
— |
出力 CAS ライブラリ設定を指定します。 |
パラメータの説明
algorithm="PRIMARY" | "SECONDARY"
batchColumns=integer
同時に処理される入力データセットに含まれる列の数を指定します。値を大きくすると、パフォーマンスはよくなりますが、より多くのメモリを消費します。
| デフォルト | 256 |
|---|
casOut={casouttable}
出力 CAS ライブラリ設定を指定します。
| 長い形式 | casOut={name="table-name"} |
|---|---|
| 短い形式 | casOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
compress=TRUE | FALSE
True に設定すると、テーブルにデータ圧縮が適用されます。
| デフォルト | FALSE |
|---|
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
label="string"
テーブルに関連付ける説明ラベルを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
maxMemSize=64-bit-integer
メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
|---|
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
replication=integer
フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
threadBlockSize=64-bit-integer
出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。
| 別名 | blockSize |
|---|---|
| デフォルト | 1048576 |
| 最小値 | 0 |
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
timeStamp="string"
タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。
columns={"variable-name-1" <, "variable-name-2", ...>}
プロファイルする列のリスト。指定しない場合はすべての列がプロファイルされます。
| 別名 | inputs |
|---|---|
| input |
cutoff=64-bit-integer
列を廃棄する前に集める一意の値の数を指定します。この数を超えた場合は。列のプロファイルメトリックは不完全になります。この目的はカーディナリティの多い列に対して過大なメモリ使用を防ぐことにあります。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
format=TRUE | FALSE
形式が適用されたデータの値をプロファイルするかどうか指定します。True の場合はプロファイルメトリックは形式が適用された値に基づきます。False の場合はすべてのプロファイルメトリックが形式なし (raw) の値に基づきます。
| デフォルト | FALSE |
|---|
frequencies=integer
それぞれの列をレポートするための一意の値の数を指定します。この数は最も多く発生する数と最も少なく発生する値の両方を反映します。
| デフォルト | 1000 |
|---|---|
| 最小値 | 0 |
identities={{identitiesDefinition-1} <, {identitiesDefinition-2}, ...>}
プロファイル中に使用される ID のリストを指定します。パターンにマッチする値は指定された種類に割り当てられます。
identitiesDefinition の値は次のいずれかになります:
definition="string"
QKB の ID 分析定義を指定します。指定されると、QKB は ID 分析に使用されます。
pattern="string"
種類を特定する際に使用する正規表現を指定します。'PAT=' で始まる値を指定した場合は、アルファベットにマッチさせるには'A' を、数値にマッチさせるには '9' を指定してください。正規表現による検索が実行される前に列のデータはこのパターンの表記に変換されます。句読点と空白はそのまま残ります。例えば、PAT=9{3}-99-9{4} は アメリカのソーシャルセキュリティ番号にマッチする ID パターンです。QKB ID 分析が使用されている場合、この正規表現が分析結果に適用されます。つまり、ほとんどの場合、この値はマッチするように ".*" に設定します。
prefix="string"
QKB ID 分析結果がこの値の前に付加されます。定義キーワードが指定された時のみ有効です。
score=integer
マルチ ID を使用し、QKB ID 分析を使用していない時に、分析結果に割り当てられるスコアを指定します。
| デフォルト | 1 |
|---|
* type="string"
ID の種類に適用するラベルを指定します。QKB ID 分析が使用されている場合、この値はほとんどの場合、"*" に設定します。他の値に設定されている場合、QKB ID 分析の出力の代わりにその値が出力されます。
locale="string"
QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値がデフォルトの QKB ロケールを上書きします。指定されたすべての定義がロケール内にある必要があります。
minmax=integer
レポートする最小と最大の値を指定します。数値データにおいては、最小または最大の値はそれぞれ最も小さいまたは最も大きい数値です。文字データにおいてはそれぞれソートした時の最初または最後の値です。
| 別名 | outliers |
|---|---|
| デフォルト | 10 |
| 最小値 | 0 |
multiIdentity=TRUE | FALSE
True に設定されている場合、複数のマッチが有効になります。有効の場合、入力データの各要素が複数の ID にマッチが可能になり、それぞれのマッチの強さに応じてスコアが返されます。False に設定すると、入力データの各要素は 1 つの ID にのみマッチします。
| デフォルト | FALSE |
|---|
nThreads=integer
サーバーのそれぞれのマシンで使用されるスレッドの数を指定します。デフォルトでは、サーバーは SAS ソフトウェアがライセンスされている CPU ごとに 1 スレッドを使用します。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
qkb="string"
QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値が QKB 名を上書きします。
table={castable}
入力テーブルの設定を指定します。
| 長い形式 | table={name="table-name"} |
|---|---|
| 短い形式 | table="table-name" |
castable の値は次のいずれかになります:
caslib="string"
アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。
computedOnDemand=TRUE | FALSE
True に設定すると、アクションの開始時ではなく、テーブルがロードされたときに計算される変数が作成されます。
| 別名 | compOnDemand |
|---|---|
| デフォルト | FALSE |
computedVars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
作成する計算変数の名前を指定します。computedVarsProgram パラメータの各変数の式を指定します。このパラメータを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。
| 別名 | compVars |
|---|
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
computedVarsProgram="string"
computedVars パラメータに含める各計算変数の式を指定します。
| 別名 | compPgm |
|---|
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
groupBy={{casinvardesc-1} <, {casinvardesc-2}, ...>}
結果のグループ化に使用する変数の名前を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
groupByMode="NOSORT" | "REDISTRIBUTE"
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。
* name="table-name"
入力テーブルの名前を指定します。
onDemand=TRUE | FALSE
このパラメータは非推奨です。
| デフォルト | TRUE |
|---|
orderBy={{casinvardesc-1} <, {casinvardesc-2}, ...>}
パーティション内でオブザベーションの並べ替えに使用する変数を指定します。このパラメータは、パーティション化されたテーブルに適用されるか、groupByMode パラメータの値が REDISTRIBUTE に設定されている場合に、groupBy パラメータで指定された変数と組み合わせることができます。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
singlePass=TRUE | FALSE
True に設定すると、サーバー上に一時テーブルは作成されません。このパラメータを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。
| デフォルト | FALSE |
|---|
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
アクションで使用する変数を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
入力データをサブセット化する式を指定します。
whereTable={groupbytable}
WHERE フィルタとして使用する行を含む入力テーブルを指定します。vars パラメータが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメータとこのパラメータが指定されている場合、このフィルタリングテーブルが最初に適用されます。
groupbytable の値は次のいずれかになります:
casLib="string"
フィルタテーブルの caslib を指定します。 デフォルトでは、アクティブな caslib が使用されます。
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | greenplum-parameters | hadoop-parameters | hana-parameters | hdfs-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | netezza-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。
* name="table-name"
フィルタテーブルの名前を指定します。
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
フィルタテーブルから使用する変数名を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
フィルタテーブルからデータをサブセット化する式を指定します。
profile アクション
テーブルのプロファイリングメトリックを提供します。
Lua 構文
要約: 入力テーブルと出力テーブル
行にサブパラメータが含まれる場合は、サブパラメータに名前、caslibなどを指定できます。サブパラメータが含まれない場合は、パラメータに名前、caslibなどを指定できます。
|
パラメータ |
サブパラメータ |
説明 |
|---|---|---|
|
— |
入力テーブルの設定を指定します。 |
|
パラメータ |
サブパラメータ |
説明 |
|---|---|---|
|
— |
出力 CAS ライブラリ設定を指定します。 |
パラメータの説明
algorithm="PRIMARY" | "SECONDARY"
batchColumns=integer
同時に処理される入力データセットに含まれる列の数を指定します。値を大きくすると、パフォーマンスはよくなりますが、より多くのメモリを消費します。
| デフォルト | 256 |
|---|
casOut={casouttable}
出力 CAS ライブラリ設定を指定します。
| 長い形式 | casOut={name="table-name"} |
|---|---|
| 短い形式 | casOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
compress=true | false
True に設定すると、テーブルにデータ圧縮が適用されます。
| デフォルト | false |
|---|
indexVars={"variable-name-1" <, "variable-name-2", ...>}
出力データにインデックスを作成する変数のリストを指定します。
label="string"
テーブルに関連付ける説明ラベルを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
maxMemSize=64-bit-integer
メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
|---|
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=true | false
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | false |
|---|
replace=true | false
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | false |
|---|
replication=integer
フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
threadBlockSize=64-bit-integer
出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。
| 別名 | blockSize |
|---|---|
| デフォルト | 1048576 |
| 最小値 | 0 |
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
timeStamp="string"
タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。
columns={"variable-name-1" <, "variable-name-2", ...>}
プロファイルする列のリスト。指定しない場合はすべての列がプロファイルされます。
| 別名 | inputs |
|---|---|
| input |
cutoff=64-bit-integer
列を廃棄する前に集める一意の値の数を指定します。この数を超えた場合は。列のプロファイルメトリックは不完全になります。この目的はカーディナリティの多い列に対して過大なメモリ使用を防ぐことにあります。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
format=true | false
形式が適用されたデータの値をプロファイルするかどうか指定します。True の場合はプロファイルメトリックは形式が適用された値に基づきます。False の場合はすべてのプロファイルメトリックが形式なし (raw) の値に基づきます。
| デフォルト | false |
|---|
frequencies=integer
それぞれの列をレポートするための一意の値の数を指定します。この数は最も多く発生する数と最も少なく発生する値の両方を反映します。
| デフォルト | 1000 |
|---|---|
| 最小値 | 0 |
identities={{identitiesDefinition-1} <, {identitiesDefinition-2}, ...>}
プロファイル中に使用される ID のリストを指定します。パターンにマッチする値は指定された種類に割り当てられます。
identitiesDefinition の値は次のいずれかになります:
definition="string"
QKB の ID 分析定義を指定します。指定されると、QKB は ID 分析に使用されます。
pattern="string"
種類を特定する際に使用する正規表現を指定します。'PAT=' で始まる値を指定した場合は、アルファベットにマッチさせるには'A' を、数値にマッチさせるには '9' を指定してください。正規表現による検索が実行される前に列のデータはこのパターンの表記に変換されます。句読点と空白はそのまま残ります。例えば、PAT=9{3}-99-9{4} は アメリカのソーシャルセキュリティ番号にマッチする ID パターンです。QKB ID 分析が使用されている場合、この正規表現が分析結果に適用されます。つまり、ほとんどの場合、この値はマッチするように ".*" に設定します。
prefix="string"
QKB ID 分析結果がこの値の前に付加されます。定義キーワードが指定された時のみ有効です。
score=integer
マルチ ID を使用し、QKB ID 分析を使用していない時に、分析結果に割り当てられるスコアを指定します。
| デフォルト | 1 |
|---|
* type="string"
ID の種類に適用するラベルを指定します。QKB ID 分析が使用されている場合、この値はほとんどの場合、"*" に設定します。他の値に設定されている場合、QKB ID 分析の出力の代わりにその値が出力されます。
locale="string"
QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値がデフォルトの QKB ロケールを上書きします。指定されたすべての定義がロケール内にある必要があります。
minmax=integer
レポートする最小と最大の値を指定します。数値データにおいては、最小または最大の値はそれぞれ最も小さいまたは最も大きい数値です。文字データにおいてはそれぞれソートした時の最初または最後の値です。
| 別名 | outliers |
|---|---|
| デフォルト | 10 |
| 最小値 | 0 |
multiIdentity=true | false
True に設定されている場合、複数のマッチが有効になります。有効の場合、入力データの各要素が複数の ID にマッチが可能になり、それぞれのマッチの強さに応じてスコアが返されます。False に設定すると、入力データの各要素は 1 つの ID にのみマッチします。
| デフォルト | false |
|---|
nThreads=integer
サーバーのそれぞれのマシンで使用されるスレッドの数を指定します。デフォルトでは、サーバーは SAS ソフトウェアがライセンスされている CPU ごとに 1 スレッドを使用します。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
qkb="string"
QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値が QKB 名を上書きします。
table={castable}
入力テーブルの設定を指定します。
| 長い形式 | table={name="table-name"} |
|---|---|
| 短い形式 | table="table-name" |
castable の値は次のいずれかになります:
caslib="string"
アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。
computedOnDemand=true | false
True に設定すると、アクションの開始時ではなく、テーブルがロードされたときに計算される変数が作成されます。
| 別名 | compOnDemand |
|---|---|
| デフォルト | false |
computedVars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
作成する計算変数の名前を指定します。computedVarsProgram パラメータの各変数の式を指定します。このパラメータを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。
| 別名 | compVars |
|---|
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
computedVarsProgram="string"
computedVars パラメータに含める各計算変数の式を指定します。
| 別名 | compPgm |
|---|
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
groupBy={{casinvardesc-1} <, {casinvardesc-2}, ...>}
結果のグループ化に使用する変数の名前を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
groupByMode="NOSORT" | "REDISTRIBUTE"
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。
* name="table-name"
入力テーブルの名前を指定します。
onDemand=true | false
このパラメータは非推奨です。
| デフォルト | true |
|---|
orderBy={{casinvardesc-1} <, {casinvardesc-2}, ...>}
パーティション内でオブザベーションの並べ替えに使用する変数を指定します。このパラメータは、パーティション化されたテーブルに適用されるか、groupByMode パラメータの値が REDISTRIBUTE に設定されている場合に、groupBy パラメータで指定された変数と組み合わせることができます。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
singlePass=true | false
True に設定すると、サーバー上に一時テーブルは作成されません。このパラメータを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。
| デフォルト | false |
|---|
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
アクションで使用する変数を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
入力データをサブセット化する式を指定します。
whereTable={groupbytable}
WHERE フィルタとして使用する行を含む入力テーブルを指定します。vars パラメータが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメータとこのパラメータが指定されている場合、このフィルタリングテーブルが最初に適用されます。
groupbytable の値は次のいずれかになります:
casLib="string"
フィルタテーブルの caslib を指定します。 デフォルトでは、アクティブな caslib が使用されます。
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | greenplum-parameters | hadoop-parameters | hana-parameters | hdfs-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | netezza-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。
* name="table-name"
フィルタテーブルの名前を指定します。
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}
フィルタテーブルから使用する変数名を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
フィルタテーブルからデータをサブセット化する式を指定します。
profile アクション
テーブルのプロファイリングメトリックを提供します。
Python 構文
要約: 入力テーブルと出力テーブル
行にサブパラメータが含まれる場合は、サブパラメータに名前、caslibなどを指定できます。サブパラメータが含まれない場合は、パラメータに名前、caslibなどを指定できます。
|
パラメータ |
サブパラメータ |
説明 |
|---|---|---|
|
— |
入力テーブルの設定を指定します。 |
|
パラメータ |
サブパラメータ |
説明 |
|---|---|---|
|
— |
出力 CAS ライブラリ設定を指定します。 |
パラメータの説明
algorithm="PRIMARY" | "SECONDARY"
batchColumns=integer
同時に処理される入力データセットに含まれる列の数を指定します。値を大きくすると、パフォーマンスはよくなりますが、より多くのメモリを消費します。
| デフォルト | 256 |
|---|
casOut={casouttable}
出力 CAS ライブラリ設定を指定します。
| 長い形式 | casOut={"name":"table-name"} |
|---|---|
| 短い形式 | casOut="table-name" |
casouttable の値は次のいずれかになります:
"caslib":"string"
出力テーブルの caslib の名前を指定します。
"compress":True | False
True に設定すると、テーブルにデータ圧縮が適用されます。
| デフォルト | False |
|---|
"indexVars":["variable-name-1" <, "variable-name-2", ...>]
出力データにインデックスを作成する変数のリストを指定します。
"label":"string"
テーブルに関連付ける説明ラベルを指定します。
"lifetime":64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
"maxMemSize":64-bit-integer
メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
|---|
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"
"name":"table-name"
出力テーブルの名前を指定します。
"promote":True | False
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | False |
|---|
"replace":True | False
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | False |
|---|
"replication":integer
フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
"threadBlockSize":64-bit-integer
出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。
| 別名 | blockSize |
|---|---|
| デフォルト | 1048576 |
| 最小値 | 0 |
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
"timeStamp":"string"
タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。
columns=["variable-name-1" <, "variable-name-2", ...>]
プロファイルする列のリスト。指定しない場合はすべての列がプロファイルされます。
| 別名 | inputs |
|---|---|
| input |
cutoff=64-bit-integer
列を廃棄する前に集める一意の値の数を指定します。この数を超えた場合は。列のプロファイルメトリックは不完全になります。この目的はカーディナリティの多い列に対して過大なメモリ使用を防ぐことにあります。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
format=True | False
形式が適用されたデータの値をプロファイルするかどうか指定します。True の場合はプロファイルメトリックは形式が適用された値に基づきます。False の場合はすべてのプロファイルメトリックが形式なし (raw) の値に基づきます。
| デフォルト | False |
|---|
frequencies=integer
それぞれの列をレポートするための一意の値の数を指定します。この数は最も多く発生する数と最も少なく発生する値の両方を反映します。
| デフォルト | 1000 |
|---|---|
| 最小値 | 0 |
identities=[{identitiesDefinition-1} <, {identitiesDefinition-2}, ...>]
プロファイル中に使用される ID のリストを指定します。パターンにマッチする値は指定された種類に割り当てられます。
identitiesDefinition の値は次のいずれかになります:
"definition":"string"
QKB の ID 分析定義を指定します。指定されると、QKB は ID 分析に使用されます。
"pattern":"string"
種類を特定する際に使用する正規表現を指定します。'PAT=' で始まる値を指定した場合は、アルファベットにマッチさせるには'A' を、数値にマッチさせるには '9' を指定してください。正規表現による検索が実行される前に列のデータはこのパターンの表記に変換されます。句読点と空白はそのまま残ります。例えば、PAT=9{3}-99-9{4} は アメリカのソーシャルセキュリティ番号にマッチする ID パターンです。QKB ID 分析が使用されている場合、この正規表現が分析結果に適用されます。つまり、ほとんどの場合、この値はマッチするように ".*" に設定します。
"prefix":"string"
QKB ID 分析結果がこの値の前に付加されます。定義キーワードが指定された時のみ有効です。
"score":integer
マルチ ID を使用し、QKB ID 分析を使用していない時に、分析結果に割り当てられるスコアを指定します。
| デフォルト | 1 |
|---|
* "type":"string"
ID の種類に適用するラベルを指定します。QKB ID 分析が使用されている場合、この値はほとんどの場合、"*" に設定します。他の値に設定されている場合、QKB ID 分析の出力の代わりにその値が出力されます。
locale="string"
QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値がデフォルトの QKB ロケールを上書きします。指定されたすべての定義がロケール内にある必要があります。
minmax=integer
レポートする最小と最大の値を指定します。数値データにおいては、最小または最大の値はそれぞれ最も小さいまたは最も大きい数値です。文字データにおいてはそれぞれソートした時の最初または最後の値です。
| 別名 | outliers |
|---|---|
| デフォルト | 10 |
| 最小値 | 0 |
multiIdentity=True | False
True に設定されている場合、複数のマッチが有効になります。有効の場合、入力データの各要素が複数の ID にマッチが可能になり、それぞれのマッチの強さに応じてスコアが返されます。False に設定すると、入力データの各要素は 1 つの ID にのみマッチします。
| デフォルト | False |
|---|
nThreads=integer
サーバーのそれぞれのマシンで使用されるスレッドの数を指定します。デフォルトでは、サーバーは SAS ソフトウェアがライセンスされている CPU ごとに 1 スレッドを使用します。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
qkb="string"
QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値が QKB 名を上書きします。
table={castable}
入力テーブルの設定を指定します。
| 長い形式 | table={"name":"table-name"} |
|---|---|
| 短い形式 | table="table-name" |
castable の値は次のいずれかになります:
"caslib":"string"
アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。
"computedOnDemand":True | False
True に設定すると、アクションの開始時ではなく、テーブルがロードされたときに計算される変数が作成されます。
| 別名 | compOnDemand |
|---|---|
| デフォルト | False |
"computedVars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]
作成する計算変数の名前を指定します。computedVarsProgram パラメータの各変数の式を指定します。このパラメータを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。
| 別名 | compVars |
|---|
casinvardesc の値は次のいずれかになります:
"format":"string"
変数に適用するフォーマットを指定します。
"formattedLength":integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
"label":"string"
変数の説明ラベルを指定します。
* "name":"variable-name"
変数の名前を指定します。
"nfd":integer
フォーマット精度の長さを指定します。
"nfl":integer
フォーマットフィールドの長さを指定します。
"computedVarsProgram":"string"
computedVars パラメータに含める各計算変数の式を指定します。
| 別名 | compPgm |
|---|
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
"groupBy":[{casinvardesc-1} <, {casinvardesc-2}, ...>]
結果のグループ化に使用する変数の名前を指定します。
casinvardesc の値は次のいずれかになります:
"format":"string"
変数に適用するフォーマットを指定します。
"formattedLength":integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
"label":"string"
変数の説明ラベルを指定します。
* "name":"variable-name"
変数の名前を指定します。
"nfd":integer
フォーマット精度の長さを指定します。
"nfl":integer
フォーマットフィールドの長さを指定します。
"groupByMode":"NOSORT" | "REDISTRIBUTE"
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import_ |
|---|
importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。
* "name":"table-name"
入力テーブルの名前を指定します。
"onDemand":True | False
このパラメータは非推奨です。
| デフォルト | True |
|---|
"orderBy":[{casinvardesc-1} <, {casinvardesc-2}, ...>]
パーティション内でオブザベーションの並べ替えに使用する変数を指定します。このパラメータは、パーティション化されたテーブルに適用されるか、groupByMode パラメータの値が REDISTRIBUTE に設定されている場合に、groupBy パラメータで指定された変数と組み合わせることができます。
casinvardesc の値は次のいずれかになります:
"format":"string"
変数に適用するフォーマットを指定します。
"formattedLength":integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
"label":"string"
変数の説明ラベルを指定します。
* "name":"variable-name"
変数の名前を指定します。
"nfd":integer
フォーマット精度の長さを指定します。
"nfl":integer
フォーマットフィールドの長さを指定します。
"singlePass":True | False
True に設定すると、サーバー上に一時テーブルは作成されません。このパラメータを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。
| デフォルト | False |
|---|
"vars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]
アクションで使用する変数を指定します。
casinvardesc の値は次のいずれかになります:
"format":"string"
変数に適用するフォーマットを指定します。
"formattedLength":integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
"label":"string"
変数の説明ラベルを指定します。
* "name":"variable-name"
変数の名前を指定します。
"nfd":integer
フォーマット精度の長さを指定します。
"nfl":integer
フォーマットフィールドの長さを指定します。
"where":"where-expression"
入力データをサブセット化する式を指定します。
"whereTable":{groupbytable}
WHERE フィルタとして使用する行を含む入力テーブルを指定します。vars パラメータが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメータとこのパラメータが指定されている場合、このフィルタリングテーブルが最初に適用されます。
groupbytable の値は次のいずれかになります:
"casLib":"string"
フィルタテーブルの caslib を指定します。 デフォルトでは、アクティブな caslib が使用されます。
"dataSourceOptions":{adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | greenplum-parameters | hadoop-parameters | hana-parameters | hdfs-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | netezza-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import_ |
|---|
importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。
* "name":"table-name"
フィルタテーブルの名前を指定します。
"vars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]
フィルタテーブルから使用する変数名を指定します。
casinvardesc の値は次のいずれかになります:
"format":"string"
変数に適用するフォーマットを指定します。
"formattedLength":integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
"label":"string"
変数の説明ラベルを指定します。
* "name":"variable-name"
変数の名前を指定します。
"nfd":integer
フォーマット精度の長さを指定します。
"nfl":integer
フォーマットフィールドの長さを指定します。
"where":"where-expression"
フィルタテーブルからデータをサブセット化する式を指定します。
profile アクション
テーブルのプロファイリングメトリックを提供します。
R 構文
要約: 入力テーブルと出力テーブル
行にサブパラメータが含まれる場合は、サブパラメータに名前、caslibなどを指定できます。サブパラメータが含まれない場合は、パラメータに名前、caslibなどを指定できます。
|
パラメータ |
サブパラメータ |
説明 |
|---|---|---|
|
— |
入力テーブルの設定を指定します。 |
|
パラメータ |
サブパラメータ |
説明 |
|---|---|---|
|
— |
出力 CAS ライブラリ設定を指定します。 |
パラメータの説明
algorithm="PRIMARY" | "SECONDARY"
batchColumns=integer
同時に処理される入力データセットに含まれる列の数を指定します。値を大きくすると、パフォーマンスはよくなりますが、より多くのメモリを消費します。
| デフォルト | 256 |
|---|
casOut=list(casouttable)
出力 CAS ライブラリ設定を指定します。
| 長い形式 | casOut=list(name="table-name") |
|---|---|
| 短い形式 | casOut="table-name" |
casouttable の値は次のいずれかになります:
caslib="string"
出力テーブルの caslib の名前を指定します。
compress=TRUE | FALSE
True に設定すると、テーブルにデータ圧縮が適用されます。
| デフォルト | FALSE |
|---|
indexVars=list("variable-name-1" <, "variable-name-2", ...>)
出力データにインデックスを作成する変数のリストを指定します。
label="string"
テーブルに関連付ける説明ラベルを指定します。
lifetime=64-bit-integer
最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
maxMemSize=64-bit-integer
メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
|---|
memoryFormat="DVR" | "INHERIT" | "STANDARD"
name="table-name"
出力テーブルの名前を指定します。
promote=TRUE | FALSE
True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。
| デフォルト | FALSE |
|---|
replace=TRUE | FALSE
True に設定すると、同じ名前の既存のテーブルは上書きされます。
| デフォルト | FALSE |
|---|
replication=integer
フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。
| デフォルト | 1 |
|---|---|
| 最小値 | 0 |
threadBlockSize=64-bit-integer
出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。
| 別名 | blockSize |
|---|---|
| デフォルト | 1048576 |
| 最小値 | 0 |
| ヒント | 値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。 |
timeStamp="string"
タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。
columns=list("variable-name-1" <, "variable-name-2", ...>)
プロファイルする列のリスト。指定しない場合はすべての列がプロファイルされます。
| 別名 | inputs |
|---|---|
| input |
cutoff=64-bit-integer
列を廃棄する前に集める一意の値の数を指定します。この数を超えた場合は。列のプロファイルメトリックは不完全になります。この目的はカーディナリティの多い列に対して過大なメモリ使用を防ぐことにあります。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
format=TRUE | FALSE
形式が適用されたデータの値をプロファイルするかどうか指定します。True の場合はプロファイルメトリックは形式が適用された値に基づきます。False の場合はすべてのプロファイルメトリックが形式なし (raw) の値に基づきます。
| デフォルト | FALSE |
|---|
frequencies=integer
それぞれの列をレポートするための一意の値の数を指定します。この数は最も多く発生する数と最も少なく発生する値の両方を反映します。
| デフォルト | 1000 |
|---|---|
| 最小値 | 0 |
identities=list( list(identitiesDefinition-1) <, list(identitiesDefinition-2), ...>)
プロファイル中に使用される ID のリストを指定します。パターンにマッチする値は指定された種類に割り当てられます。
identitiesDefinition の値は次のいずれかになります:
definition="string"
QKB の ID 分析定義を指定します。指定されると、QKB は ID 分析に使用されます。
pattern="string"
種類を特定する際に使用する正規表現を指定します。'PAT=' で始まる値を指定した場合は、アルファベットにマッチさせるには'A' を、数値にマッチさせるには '9' を指定してください。正規表現による検索が実行される前に列のデータはこのパターンの表記に変換されます。句読点と空白はそのまま残ります。例えば、PAT=9{3}-99-9{4} は アメリカのソーシャルセキュリティ番号にマッチする ID パターンです。QKB ID 分析が使用されている場合、この正規表現が分析結果に適用されます。つまり、ほとんどの場合、この値はマッチするように ".*" に設定します。
prefix="string"
QKB ID 分析結果がこの値の前に付加されます。定義キーワードが指定された時のみ有効です。
score=integer
マルチ ID を使用し、QKB ID 分析を使用していない時に、分析結果に割り当てられるスコアを指定します。
| デフォルト | 1 |
|---|
* type="string"
ID の種類に適用するラベルを指定します。QKB ID 分析が使用されている場合、この値はほとんどの場合、"*" に設定します。他の値に設定されている場合、QKB ID 分析の出力の代わりにその値が出力されます。
locale="string"
QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値がデフォルトの QKB ロケールを上書きします。指定されたすべての定義がロケール内にある必要があります。
minmax=integer
レポートする最小と最大の値を指定します。数値データにおいては、最小または最大の値はそれぞれ最も小さいまたは最も大きい数値です。文字データにおいてはそれぞれソートした時の最初または最後の値です。
| 別名 | outliers |
|---|---|
| デフォルト | 10 |
| 最小値 | 0 |
multiIdentity=TRUE | FALSE
True に設定されている場合、複数のマッチが有効になります。有効の場合、入力データの各要素が複数の ID にマッチが可能になり、それぞれのマッチの強さに応じてスコアが返されます。False に設定すると、入力データの各要素は 1 つの ID にのみマッチします。
| デフォルト | FALSE |
|---|
nThreads=integer
サーバーのそれぞれのマシンで使用されるスレッドの数を指定します。デフォルトでは、サーバーは SAS ソフトウェアがライセンスされている CPU ごとに 1 スレッドを使用します。
| デフォルト | 0 |
|---|---|
| 最小値 | 0 |
qkb="string"
QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値が QKB 名を上書きします。
table=list(castable)
入力テーブルの設定を指定します。
| 長い形式 | table=list(name="table-name") |
|---|---|
| 短い形式 | table="table-name" |
castable の値は次のいずれかになります:
caslib="string"
アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。
computedOnDemand=TRUE | FALSE
True に設定すると、アクションの開始時ではなく、テーブルがロードされたときに計算される変数が作成されます。
| 別名 | compOnDemand |
|---|---|
| デフォルト | FALSE |
computedVars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)
作成する計算変数の名前を指定します。computedVarsProgram パラメータの各変数の式を指定します。このパラメータを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。
| 別名 | compVars |
|---|
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
computedVarsProgram="string"
computedVars パラメータに含める各計算変数の式を指定します。
| 別名 | compPgm |
|---|
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>)
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
groupBy=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)
結果のグループ化に使用する変数の名前を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
groupByMode="NOSORT" | "REDISTRIBUTE"
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。
* name="table-name"
入力テーブルの名前を指定します。
onDemand=TRUE | FALSE
このパラメータは非推奨です。
| デフォルト | TRUE |
|---|
orderBy=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)
パーティション内でオブザベーションの並べ替えに使用する変数を指定します。このパラメータは、パーティション化されたテーブルに適用されるか、groupByMode パラメータの値が REDISTRIBUTE に設定されている場合に、groupBy パラメータで指定された変数と組み合わせることができます。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
singlePass=TRUE | FALSE
True に設定すると、サーバー上に一時テーブルは作成されません。このパラメータを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。
| デフォルト | FALSE |
|---|
vars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)
アクションで使用する変数を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
入力データをサブセット化する式を指定します。
whereTable=list(groupbytable)
WHERE フィルタとして使用する行を含む入力テーブルを指定します。vars パラメータが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメータとこのパラメータが指定されている場合、このフィルタリングテーブルが最初に適用されます。
groupbytable の値は次のいずれかになります:
casLib="string"
フィルタテーブルの caslib を指定します。 デフォルトでは、アクティブな caslib が使用されます。
dataSourceOptions=list(adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | greenplum-parameters | hadoop-parameters | hana-parameters | hdfs-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | netezza-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters)
データソースオプションを指定します。
| 別名 | options |
|---|---|
| dataSource |
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
データソースからテーブルを読み込むための設定を指定します。
| 別名 | import |
|---|
importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。
* name="table-name"
フィルタテーブルの名前を指定します。
vars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)
フィルタテーブルから使用する変数名を指定します。
casinvardesc の値は次のいずれかになります:
format="string"
変数に適用するフォーマットを指定します。
formattedLength=integer
フォーマットフィールドの長さとフォーマット精度の長さを指定します。
label="string"
変数の説明ラベルを指定します。
* name="variable-name"
変数の名前を指定します。
nfd=integer
フォーマット精度の長さを指定します。
nfl=integer
フォーマットフィールドの長さを指定します。
where="where-expression"
フィルタテーブルからデータをサブセット化する式を指定します。