Data Discovery アクションセット: 構文

Data Discovery サービスを実行するアクションを提供します。

profile アクション

テーブルのプロファイリングメトリックを提供します。

CASL 構文

dataDiscovery.profile <result=results> <status=rc> /
batchColumns=integer,
casOut={
caslib="string",
compress=TRUE | FALSE,
indexVars={"variable-name-1" <, "variable-name-2", ...>},
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
replication=integer,
threadBlockSize=64-bit-integer,
timeStamp="string"
},
columns={"variable-name-1" <, "variable-name-2", ...>},
cutoff=64-bit-integer,
format=TRUE | FALSE,
frequencies=integer,
identities={{
definition="string",
pattern="string",
prefix="string",
score=integer,
required parameter type="string"
}, {...}},
locale="string",
minmax=integer,
multiIdentity=TRUE | FALSE,
nThreads=integer,
qkb="string",
table={
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
onDemand=TRUE | FALSE,
orderBy={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=TRUE | FALSE,
vars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | greenplum-parameters | hadoop-parameters | hana-parameters | hdfs-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | netezza-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
}
;

要約: 入力テーブルと出力テーブル

行にサブパラメータが含まれる場合は、サブパラメータに名前、caslibなどを指定できます。サブパラメータが含まれない場合は、パラメータに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメータ

パラメータ

サブパラメータ

説明

 table

—

入力テーブルの設定を指定します。

出力テーブルの作成パラメータ

パラメータ

サブパラメータ

説明

 casOut

—

出力 CAS ライブラリ設定を指定します。

パラメータの説明

algorithm="PRIMARY" | "SECONDARY"

プロファイル操作に使用されるアルゴリズムを指定します。

デフォルトPRIMARY
PRIMARY

ベストのパフォーマンスを提供しますが最もメモリを消費します。

SECONDARY

メモリを節約しますがプライマリアルゴリズムよりも遅くなります。

batchColumns=integer

同時に処理される入力データセットに含まれる列の数を指定します。値を大きくすると、パフォーマンスはよくなりますが、より多くのメモリを消費します。

デフォルト256

casOut={casouttable}

出力 CAS ライブラリ設定を指定します。

長い形式casOut={name="table-name"}
短い形式casOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

compress=TRUE | FALSE

True に設定すると、テーブルにデータ圧縮が適用されます。

デフォルトFALSE
indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

label="string"

テーブルに関連付ける説明ラベルを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
maxMemSize=64-bit-integer

メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。

ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
replication=integer

フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。

デフォルト1
最小値0
threadBlockSize=64-bit-integer

出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。

別名blockSize
デフォルト1048576
最小値0
ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
timeStamp="string"

タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。

columns={"variable-name-1" <, "variable-name-2", ...>}

プロファイルする列のリスト。指定しない場合はすべての列がプロファイルされます。

別名inputs
input

cutoff=64-bit-integer

列を廃棄する前に集める一意の値の数を指定します。この数を超えた場合は。列のプロファイルメトリックは不完全になります。この目的はカーディナリティの多い列に対して過大なメモリ使用を防ぐことにあります。

デフォルト0
最小値0

format=TRUE | FALSE

形式が適用されたデータの値をプロファイルするかどうか指定します。True の場合はプロファイルメトリックは形式が適用された値に基づきます。False の場合はすべてのプロファイルメトリックが形式なし (raw) の値に基づきます。

デフォルトFALSE

frequencies=integer

それぞれの列をレポートするための一意の値の数を指定します。この数は最も多く発生する数と最も少なく発生する値の両方を反映します。

デフォルト1000
最小値0

identities={{identitiesDefinition-1} <, {identitiesDefinition-2}, ...>}

プロファイル中に使用される ID のリストを指定します。パターンにマッチする値は指定された種類に割り当てられます。

identitiesDefinition の値は次のいずれかになります:

definition="string"

QKB の ID 分析定義を指定します。指定されると、QKB は ID 分析に使用されます。

pattern="string"

種類を特定する際に使用する正規表現を指定します。'PAT=' で始まる値を指定した場合は、アルファベットにマッチさせるには'A' を、数値にマッチさせるには '9' を指定してください。正規表現による検索が実行される前に列のデータはこのパターンの表記に変換されます。句読点と空白はそのまま残ります。例えば、PAT=9{3}-99-9{4} は アメリカのソーシャルセキュリティ番号にマッチする ID パターンです。QKB ID 分析が使用されている場合、この正規表現が分析結果に適用されます。つまり、ほとんどの場合、この値はマッチするように ".*" に設定します。

prefix="string"

QKB ID 分析結果がこの値の前に付加されます。定義キーワードが指定された時のみ有効です。

score=integer

マルチ ID を使用し、QKB ID 分析を使用していない時に、分析結果に割り当てられるスコアを指定します。

デフォルト1
* type="string"

ID の種類に適用するラベルを指定します。QKB ID 分析が使用されている場合、この値はほとんどの場合、"*" に設定します。他の値に設定されている場合、QKB ID 分析の出力の代わりにその値が出力されます。

locale="string"

QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値がデフォルトの QKB ロケールを上書きします。指定されたすべての定義がロケール内にある必要があります。

minmax=integer

レポートする最小と最大の値を指定します。数値データにおいては、最小または最大の値はそれぞれ最も小さいまたは最も大きい数値です。文字データにおいてはそれぞれソートした時の最初または最後の値です。

別名outliers
デフォルト10
最小値0

multiIdentity=TRUE | FALSE

True に設定されている場合、複数のマッチが有効になります。有効の場合、入力データの各要素が複数の ID にマッチが可能になり、それぞれのマッチの強さに応じてスコアが返されます。False に設定すると、入力データの各要素は 1 つの ID にのみマッチします。

デフォルトFALSE

nThreads=integer

サーバーのそれぞれのマシンで使用されるスレッドの数を指定します。デフォルトでは、サーバーは SAS ソフトウェアがライセンスされている CPU ごとに 1 スレッドを使用します。

デフォルト0
最小値0

qkb="string"

QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値が QKB 名を上書きします。

table={castable}

入力テーブルの設定を指定します。

長い形式table={name="table-name"}
短い形式table="table-name"

castable の値は次のいずれかになります:

caslib="string"

アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。

computedOnDemand=TRUE | FALSE

True に設定すると、アクションの開始時ではなく、テーブルがロードされたときに計算される変数が作成されます。

別名compOnDemand
デフォルトFALSE
computedVars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

作成する計算変数の名前を指定します。computedVarsProgram パラメータの各変数の式を指定します。このパラメータを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。

別名compVars

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

computedVarsProgram="string"

computedVars パラメータに含める各計算変数の式を指定します。

別名compPgm
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>}

データソースオプションを指定します。

別名options
dataSource
groupBy={{casinvardesc-1} <, {casinvardesc-2}, ...>}

結果のグループ化に使用する変数の名前を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

groupByMode="NOSORT" | "REDISTRIBUTE"

グループの作成方法を指定します。

デフォルトNOSORT
NOSORT

各マシン上で並べ替えを行わずにデータをグループ化し、コントローラ上で再度データをグループ化します。

REDISTRIBUTE

ノード間で行を転送し、グループ内での順序を保証します。この方法は遅くなります。

importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。

* name="table-name"

入力テーブルの名前を指定します。

onDemand=TRUE | FALSE

このパラメータは非推奨です。

デフォルトTRUE
orderBy={{casinvardesc-1} <, {casinvardesc-2}, ...>}

パーティション内でオブザベーションの並べ替えに使用する変数を指定します。このパラメータは、パーティション化されたテーブルに適用されるか、groupByMode パラメータの値が REDISTRIBUTE に設定されている場合に、groupBy パラメータで指定された変数と組み合わせることができます。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

singlePass=TRUE | FALSE

True に設定すると、サーバー上に一時テーブルは作成されません。このパラメータを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。

デフォルトFALSE
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

アクションで使用する変数を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

入力データをサブセット化する式を指定します。

whereTable={groupbytable}

WHERE フィルタとして使用する行を含む入力テーブルを指定します。vars パラメータが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメータとこのパラメータが指定されている場合、このフィルタリングテーブルが最初に適用されます。

groupbytable の値は次のいずれかになります:

casLib="string"

フィルタテーブルの caslib を指定します。 デフォルトでは、アクティブな caslib が使用されます。

importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。

* name="table-name"

フィルタテーブルの名前を指定します。

vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

フィルタテーブルから使用する変数名を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

フィルタテーブルからデータをサブセット化する式を指定します。

profile アクション

テーブルのプロファイリングメトリックを提供します。

Lua 構文

results, info = s:dataDiscovery_profile{
batchColumns=integer,
casOut={
caslib="string",
compress=true | false,
indexVars={"variable-name-1" <, "variable-name-2", ...>},
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
name="table-name",
promote=true | false,
replace=true | false,
replication=integer,
threadBlockSize=64-bit-integer,
timeStamp="string"
},
columns={"variable-name-1" <, "variable-name-2", ...>},
cutoff=64-bit-integer,
format=true | false,
frequencies=integer,
identities={{
definition="string",
pattern="string",
prefix="string",
score=integer,
required parameter type="string"
}, {...}},
locale="string",
minmax=integer,
multiIdentity=true | false,
nThreads=integer,
qkb="string",
table={
caslib="string",
computedOnDemand=true | false,
computedVars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>},
groupBy={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter name="table-name",
onDemand=true | false,
orderBy={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
singlePass=true | false,
vars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}},
where="where-expression",
whereTable={
casLib="string"
dataSourceOptions={adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | greenplum-parameters | hadoop-parameters | hana-parameters | hdfs-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | netezza-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter name="table-name"
vars={{
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
}, {...}}
where="where-expression"
}
}
}

要約: 入力テーブルと出力テーブル

行にサブパラメータが含まれる場合は、サブパラメータに名前、caslibなどを指定できます。サブパラメータが含まれない場合は、パラメータに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメータ

パラメータ

サブパラメータ

説明

 table

—

入力テーブルの設定を指定します。

出力テーブルの作成パラメータ

パラメータ

サブパラメータ

説明

 casOut

—

出力 CAS ライブラリ設定を指定します。

パラメータの説明

algorithm="PRIMARY" | "SECONDARY"

プロファイル操作に使用されるアルゴリズムを指定します。

デフォルトPRIMARY
PRIMARY

ベストのパフォーマンスを提供しますが最もメモリを消費します。

SECONDARY

メモリを節約しますがプライマリアルゴリズムよりも遅くなります。

batchColumns=integer

同時に処理される入力データセットに含まれる列の数を指定します。値を大きくすると、パフォーマンスはよくなりますが、より多くのメモリを消費します。

デフォルト256

casOut={casouttable}

出力 CAS ライブラリ設定を指定します。

長い形式casOut={name="table-name"}
短い形式casOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

compress=true | false

True に設定すると、テーブルにデータ圧縮が適用されます。

デフォルトfalse
indexVars={"variable-name-1" <, "variable-name-2", ...>}

出力データにインデックスを作成する変数のリストを指定します。

label="string"

テーブルに関連付ける説明ラベルを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
maxMemSize=64-bit-integer

メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。

ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=true | false

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトfalse
replace=true | false

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトfalse
replication=integer

フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。

デフォルト1
最小値0
threadBlockSize=64-bit-integer

出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。

別名blockSize
デフォルト1048576
最小値0
ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
timeStamp="string"

タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。

columns={"variable-name-1" <, "variable-name-2", ...>}

プロファイルする列のリスト。指定しない場合はすべての列がプロファイルされます。

別名inputs
input

cutoff=64-bit-integer

列を廃棄する前に集める一意の値の数を指定します。この数を超えた場合は。列のプロファイルメトリックは不完全になります。この目的はカーディナリティの多い列に対して過大なメモリ使用を防ぐことにあります。

デフォルト0
最小値0

format=true | false

形式が適用されたデータの値をプロファイルするかどうか指定します。True の場合はプロファイルメトリックは形式が適用された値に基づきます。False の場合はすべてのプロファイルメトリックが形式なし (raw) の値に基づきます。

デフォルトfalse

frequencies=integer

それぞれの列をレポートするための一意の値の数を指定します。この数は最も多く発生する数と最も少なく発生する値の両方を反映します。

デフォルト1000
最小値0

identities={{identitiesDefinition-1} <, {identitiesDefinition-2}, ...>}

プロファイル中に使用される ID のリストを指定します。パターンにマッチする値は指定された種類に割り当てられます。

identitiesDefinition の値は次のいずれかになります:

definition="string"

QKB の ID 分析定義を指定します。指定されると、QKB は ID 分析に使用されます。

pattern="string"

種類を特定する際に使用する正規表現を指定します。'PAT=' で始まる値を指定した場合は、アルファベットにマッチさせるには'A' を、数値にマッチさせるには '9' を指定してください。正規表現による検索が実行される前に列のデータはこのパターンの表記に変換されます。句読点と空白はそのまま残ります。例えば、PAT=9{3}-99-9{4} は アメリカのソーシャルセキュリティ番号にマッチする ID パターンです。QKB ID 分析が使用されている場合、この正規表現が分析結果に適用されます。つまり、ほとんどの場合、この値はマッチするように ".*" に設定します。

prefix="string"

QKB ID 分析結果がこの値の前に付加されます。定義キーワードが指定された時のみ有効です。

score=integer

マルチ ID を使用し、QKB ID 分析を使用していない時に、分析結果に割り当てられるスコアを指定します。

デフォルト1
* type="string"

ID の種類に適用するラベルを指定します。QKB ID 分析が使用されている場合、この値はほとんどの場合、"*" に設定します。他の値に設定されている場合、QKB ID 分析の出力の代わりにその値が出力されます。

locale="string"

QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値がデフォルトの QKB ロケールを上書きします。指定されたすべての定義がロケール内にある必要があります。

minmax=integer

レポートする最小と最大の値を指定します。数値データにおいては、最小または最大の値はそれぞれ最も小さいまたは最も大きい数値です。文字データにおいてはそれぞれソートした時の最初または最後の値です。

別名outliers
デフォルト10
最小値0

multiIdentity=true | false

True に設定されている場合、複数のマッチが有効になります。有効の場合、入力データの各要素が複数の ID にマッチが可能になり、それぞれのマッチの強さに応じてスコアが返されます。False に設定すると、入力データの各要素は 1 つの ID にのみマッチします。

デフォルトfalse

nThreads=integer

サーバーのそれぞれのマシンで使用されるスレッドの数を指定します。デフォルトでは、サーバーは SAS ソフトウェアがライセンスされている CPU ごとに 1 スレッドを使用します。

デフォルト0
最小値0

qkb="string"

QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値が QKB 名を上書きします。

table={castable}

入力テーブルの設定を指定します。

長い形式table={name="table-name"}
短い形式table="table-name"

castable の値は次のいずれかになります:

caslib="string"

アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。

computedOnDemand=true | false

True に設定すると、アクションの開始時ではなく、テーブルがロードされたときに計算される変数が作成されます。

別名compOnDemand
デフォルトfalse
computedVars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

作成する計算変数の名前を指定します。computedVarsProgram パラメータの各変数の式を指定します。このパラメータを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。

別名compVars

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

computedVarsProgram="string"

computedVars パラメータに含める各計算変数の式を指定します。

別名compPgm
dataSourceOptions={key-1=any-list-or-data-type-1 <, key-2=any-list-or-data-type-2, ...>}

データソースオプションを指定します。

別名options
dataSource
groupBy={{casinvardesc-1} <, {casinvardesc-2}, ...>}

結果のグループ化に使用する変数の名前を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

groupByMode="NOSORT" | "REDISTRIBUTE"

グループの作成方法を指定します。

デフォルトNOSORT
NOSORT

各マシン上で並べ替えを行わずにデータをグループ化し、コントローラ上で再度データをグループ化します。

REDISTRIBUTE

ノード間で行を転送し、グループ内での順序を保証します。この方法は遅くなります。

importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。

* name="table-name"

入力テーブルの名前を指定します。

onDemand=true | false

このパラメータは非推奨です。

デフォルトtrue
orderBy={{casinvardesc-1} <, {casinvardesc-2}, ...>}

パーティション内でオブザベーションの並べ替えに使用する変数を指定します。このパラメータは、パーティション化されたテーブルに適用されるか、groupByMode パラメータの値が REDISTRIBUTE に設定されている場合に、groupBy パラメータで指定された変数と組み合わせることができます。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

singlePass=true | false

True に設定すると、サーバー上に一時テーブルは作成されません。このパラメータを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。

デフォルトfalse
vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

アクションで使用する変数を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

入力データをサブセット化する式を指定します。

whereTable={groupbytable}

WHERE フィルタとして使用する行を含む入力テーブルを指定します。vars パラメータが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメータとこのパラメータが指定されている場合、このフィルタリングテーブルが最初に適用されます。

groupbytable の値は次のいずれかになります:

casLib="string"

フィルタテーブルの caslib を指定します。 デフォルトでは、アクティブな caslib が使用されます。

importOptions={fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。

* name="table-name"

フィルタテーブルの名前を指定します。

vars={{casinvardesc-1} <, {casinvardesc-2}, ...>}

フィルタテーブルから使用する変数名を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

フィルタテーブルからデータをサブセット化する式を指定します。

profile アクション

テーブルのプロファイリングメトリックを提供します。

Python 構文

results= s.dataDiscovery.profile(
batchColumns=integer,
casOut={
"caslib":"string",
"compress":True | False,
"indexVars":["variable-name-1" <, "variable-name-2", ...>],
"label":"string",
"lifetime":64-bit-integer,
"maxMemSize":64-bit-integer,
"name":"table-name",
"promote":True | False,
"replace":True | False,
"replication":integer,
"threadBlockSize":64-bit-integer,
"timeStamp":"string"
},
columns=["variable-name-1" <, "variable-name-2", ...>],
cutoff=64-bit-integer,
format=True | False,
frequencies=integer,
identities=[{
"definition":"string",
"pattern":"string",
"prefix":"string",
"score":integer,
required parameter "type":"string"
}<, {...}>],
locale="string",
minmax=integer,
multiIdentity=True | False,
nThreads=integer,
qkb="string",
table={
"caslib":"string",
"computedOnDemand":True | False,
"computedVars":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>},
"groupBy":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters},
required parameter "name":"table-name",
"onDemand":True | False,
"orderBy":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"singlePass":True | False,
"vars":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>],
"where":"where-expression",
"whereTable":{
"casLib":"string"
"dataSourceOptions":{adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | greenplum-parameters | hadoop-parameters | hana-parameters | hdfs-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | netezza-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameters}
"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}
required parameter "name":"table-name"
"vars":[{
"format":"string",
"formattedLength":integer,
"label":"string",
required parameter "name":"variable-name",
"nfd":integer,
"nfl":integer
}<, {...}>]
"where":"where-expression"
}
}
)

要約: 入力テーブルと出力テーブル

行にサブパラメータが含まれる場合は、サブパラメータに名前、caslibなどを指定できます。サブパラメータが含まれない場合は、パラメータに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメータ

パラメータ

サブパラメータ

説明

 table

—

入力テーブルの設定を指定します。

出力テーブルの作成パラメータ

パラメータ

サブパラメータ

説明

 casOut

—

出力 CAS ライブラリ設定を指定します。

パラメータの説明

algorithm="PRIMARY" | "SECONDARY"

プロファイル操作に使用されるアルゴリズムを指定します。

デフォルトPRIMARY
PRIMARY

ベストのパフォーマンスを提供しますが最もメモリを消費します。

SECONDARY

メモリを節約しますがプライマリアルゴリズムよりも遅くなります。

batchColumns=integer

同時に処理される入力データセットに含まれる列の数を指定します。値を大きくすると、パフォーマンスはよくなりますが、より多くのメモリを消費します。

デフォルト256

casOut={casouttable}

出力 CAS ライブラリ設定を指定します。

長い形式casOut={"name":"table-name"}
短い形式casOut="table-name"

casouttable の値は次のいずれかになります:

"caslib":"string"

出力テーブルの caslib の名前を指定します。

"compress":True | False

True に設定すると、テーブルにデータ圧縮が適用されます。

デフォルトFalse
"indexVars":["variable-name-1" <, "variable-name-2", ...>]

出力データにインデックスを作成する変数のリストを指定します。

"label":"string"

テーブルに関連付ける説明ラベルを指定します。

"lifetime":64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
"maxMemSize":64-bit-integer

メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。

ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
"memoryFormat":"DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

"name":"table-name"

出力テーブルの名前を指定します。

"promote":True | False

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFalse
"replace":True | False

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFalse
"replication":integer

フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。

デフォルト1
最小値0
"threadBlockSize":64-bit-integer

出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。

別名blockSize
デフォルト1048576
最小値0
ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
"timeStamp":"string"

タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。

columns=["variable-name-1" <, "variable-name-2", ...>]

プロファイルする列のリスト。指定しない場合はすべての列がプロファイルされます。

別名inputs
input

cutoff=64-bit-integer

列を廃棄する前に集める一意の値の数を指定します。この数を超えた場合は。列のプロファイルメトリックは不完全になります。この目的はカーディナリティの多い列に対して過大なメモリ使用を防ぐことにあります。

デフォルト0
最小値0

format=True | False

形式が適用されたデータの値をプロファイルするかどうか指定します。True の場合はプロファイルメトリックは形式が適用された値に基づきます。False の場合はすべてのプロファイルメトリックが形式なし (raw) の値に基づきます。

デフォルトFalse

frequencies=integer

それぞれの列をレポートするための一意の値の数を指定します。この数は最も多く発生する数と最も少なく発生する値の両方を反映します。

デフォルト1000
最小値0

identities=[{identitiesDefinition-1} <, {identitiesDefinition-2}, ...>]

プロファイル中に使用される ID のリストを指定します。パターンにマッチする値は指定された種類に割り当てられます。

identitiesDefinition の値は次のいずれかになります:

"definition":"string"

QKB の ID 分析定義を指定します。指定されると、QKB は ID 分析に使用されます。

"pattern":"string"

種類を特定する際に使用する正規表現を指定します。'PAT=' で始まる値を指定した場合は、アルファベットにマッチさせるには'A' を、数値にマッチさせるには '9' を指定してください。正規表現による検索が実行される前に列のデータはこのパターンの表記に変換されます。句読点と空白はそのまま残ります。例えば、PAT=9{3}-99-9{4} は アメリカのソーシャルセキュリティ番号にマッチする ID パターンです。QKB ID 分析が使用されている場合、この正規表現が分析結果に適用されます。つまり、ほとんどの場合、この値はマッチするように ".*" に設定します。

"prefix":"string"

QKB ID 分析結果がこの値の前に付加されます。定義キーワードが指定された時のみ有効です。

"score":integer

マルチ ID を使用し、QKB ID 分析を使用していない時に、分析結果に割り当てられるスコアを指定します。

デフォルト1
* "type":"string"

ID の種類に適用するラベルを指定します。QKB ID 分析が使用されている場合、この値はほとんどの場合、"*" に設定します。他の値に設定されている場合、QKB ID 分析の出力の代わりにその値が出力されます。

locale="string"

QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値がデフォルトの QKB ロケールを上書きします。指定されたすべての定義がロケール内にある必要があります。

minmax=integer

レポートする最小と最大の値を指定します。数値データにおいては、最小または最大の値はそれぞれ最も小さいまたは最も大きい数値です。文字データにおいてはそれぞれソートした時の最初または最後の値です。

別名outliers
デフォルト10
最小値0

multiIdentity=True | False

True に設定されている場合、複数のマッチが有効になります。有効の場合、入力データの各要素が複数の ID にマッチが可能になり、それぞれのマッチの強さに応じてスコアが返されます。False に設定すると、入力データの各要素は 1 つの ID にのみマッチします。

デフォルトFalse

nThreads=integer

サーバーのそれぞれのマシンで使用されるスレッドの数を指定します。デフォルトでは、サーバーは SAS ソフトウェアがライセンスされている CPU ごとに 1 スレッドを使用します。

デフォルト0
最小値0

qkb="string"

QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値が QKB 名を上書きします。

table={castable}

入力テーブルの設定を指定します。

長い形式table={"name":"table-name"}
短い形式table="table-name"

castable の値は次のいずれかになります:

"caslib":"string"

アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。

"computedOnDemand":True | False

True に設定すると、アクションの開始時ではなく、テーブルがロードされたときに計算される変数が作成されます。

別名compOnDemand
デフォルトFalse
"computedVars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]

作成する計算変数の名前を指定します。computedVarsProgram パラメータの各変数の式を指定します。このパラメータを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。

別名compVars

casinvardesc の値は次のいずれかになります:

"format":"string"

変数に適用するフォーマットを指定します。

"formattedLength":integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

"label":"string"

変数の説明ラベルを指定します。

* "name":"variable-name"

変数の名前を指定します。

"nfd":integer

フォーマット精度の長さを指定します。

"nfl":integer

フォーマットフィールドの長さを指定します。

"computedVarsProgram":"string"

computedVars パラメータに含める各計算変数の式を指定します。

別名compPgm
"dataSourceOptions":{"key-1":{any-list-or-data-type-1} <, "key-2":{any-list-or-data-type-2}, ...>}

データソースオプションを指定します。

別名options
dataSource
"groupBy":[{casinvardesc-1} <, {casinvardesc-2}, ...>]

結果のグループ化に使用する変数の名前を指定します。

casinvardesc の値は次のいずれかになります:

"format":"string"

変数に適用するフォーマットを指定します。

"formattedLength":integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

"label":"string"

変数の説明ラベルを指定します。

* "name":"variable-name"

変数の名前を指定します。

"nfd":integer

フォーマット精度の長さを指定します。

"nfl":integer

フォーマットフィールドの長さを指定します。

"groupByMode":"NOSORT" | "REDISTRIBUTE"

グループの作成方法を指定します。

デフォルトNOSORT
NOSORT

各マシン上で並べ替えを行わずにデータをグループ化し、コントローラ上で再度データをグループ化します。

REDISTRIBUTE

ノード間で行を転送し、グループ内での順序を保証します。この方法は遅くなります。

"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import_

importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。

* "name":"table-name"

入力テーブルの名前を指定します。

"onDemand":True | False

このパラメータは非推奨です。

デフォルトTrue
"orderBy":[{casinvardesc-1} <, {casinvardesc-2}, ...>]

パーティション内でオブザベーションの並べ替えに使用する変数を指定します。このパラメータは、パーティション化されたテーブルに適用されるか、groupByMode パラメータの値が REDISTRIBUTE に設定されている場合に、groupBy パラメータで指定された変数と組み合わせることができます。

casinvardesc の値は次のいずれかになります:

"format":"string"

変数に適用するフォーマットを指定します。

"formattedLength":integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

"label":"string"

変数の説明ラベルを指定します。

* "name":"variable-name"

変数の名前を指定します。

"nfd":integer

フォーマット精度の長さを指定します。

"nfl":integer

フォーマットフィールドの長さを指定します。

"singlePass":True | False

True に設定すると、サーバー上に一時テーブルは作成されません。このパラメータを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。

デフォルトFalse
"vars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]

アクションで使用する変数を指定します。

casinvardesc の値は次のいずれかになります:

"format":"string"

変数に適用するフォーマットを指定します。

"formattedLength":integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

"label":"string"

変数の説明ラベルを指定します。

* "name":"variable-name"

変数の名前を指定します。

"nfd":integer

フォーマット精度の長さを指定します。

"nfl":integer

フォーマットフィールドの長さを指定します。

"where":"where-expression"

入力データをサブセット化する式を指定します。

"whereTable":{groupbytable}

WHERE フィルタとして使用する行を含む入力テーブルを指定します。vars パラメータが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメータとこのパラメータが指定されている場合、このフィルタリングテーブルが最初に適用されます。

groupbytable の値は次のいずれかになります:

"casLib":"string"

フィルタテーブルの caslib を指定します。 デフォルトでは、アクティブな caslib が使用されます。

"importOptions":{"fileType":"ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters}

データソースからテーブルを読み込むための設定を指定します。

別名import_

importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。

* "name":"table-name"

フィルタテーブルの名前を指定します。

"vars":[{casinvardesc-1} <, {casinvardesc-2}, ...>]

フィルタテーブルから使用する変数名を指定します。

casinvardesc の値は次のいずれかになります:

"format":"string"

変数に適用するフォーマットを指定します。

"formattedLength":integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

"label":"string"

変数の説明ラベルを指定します。

* "name":"variable-name"

変数の名前を指定します。

"nfd":integer

フォーマット精度の長さを指定します。

"nfl":integer

フォーマットフィールドの長さを指定します。

"where":"where-expression"

フィルタテーブルからデータをサブセット化する式を指定します。

profile アクション

テーブルのプロファイリングメトリックを提供します。

R 構文

results <– cas.dataDiscovery.profile(s,
batchColumns=integer,
casOut=list(
caslib="string",
compress=TRUE | FALSE,
indexVars=list("variable-name-1" <, "variable-name-2", ...>),
label="string",
lifetime=64-bit-integer,
maxMemSize=64-bit-integer,
name="table-name",
promote=TRUE | FALSE,
replace=TRUE | FALSE,
replication=integer,
threadBlockSize=64-bit-integer,
timeStamp="string"
),
columns=list("variable-name-1" <, "variable-name-2", ...>),
cutoff=64-bit-integer,
format=TRUE | FALSE,
frequencies=integer,
identities=list( list(
definition="string",
pattern="string",
prefix="string",
score=integer,
required parameter type="string"
) <, list(...)>),
locale="string",
minmax=integer,
multiIdentity=TRUE | FALSE,
nThreads=integer,
qkb="string",
table=list(
caslib="string",
computedOnDemand=TRUE | FALSE,
computedVars=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>),
groupBy=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters),
required parameter name="table-name",
onDemand=TRUE | FALSE,
orderBy=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
singlePass=TRUE | FALSE,
vars=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>),
where="where-expression",
whereTable=list(
casLib="string"
dataSourceOptions=list(adls_noreq-parameters | bigquery-parameters | cas_noreq-parameters | clouddex-parameters | db2-parameters | dnfs-parameters | esp-parameters | fedsvr-parameters | gcs_noreq-parameters | greenplum-parameters | hadoop-parameters | hana-parameters | hdfs-parameters | impala-parameters | jdbc-parameters | mongodb-parameters | mysql-parameters | netezza-parameters | odbc-parameters | oracle-parameters | path-parameters | postgres-parameters | redshift-parameters | s3-parameters | sforce-parameters | snowflake-parameters | spark-parameters | spde-parameters | sqlserver-parameters | teradata-parameters | vertica-parameters | yellowbrick-parameterslist)
importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DELIMITED" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SOUND" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)
required parameter name="table-name"
vars=list( list(
format="string",
formattedLength=integer,
label="string",
required parameter name="variable-name",
nfd=integer,
nfl=integer
) <, list(...)>)
where="where-expression"
)
)
)

要約: 入力テーブルと出力テーブル

行にサブパラメータが含まれる場合は、サブパラメータに名前、caslibなどを指定できます。サブパラメータが含まれない場合は、パラメータに名前、caslibなどを指定できます。

入力テーブルの読み込みパラメータ

パラメータ

サブパラメータ

説明

 table

—

入力テーブルの設定を指定します。

出力テーブルの作成パラメータ

パラメータ

サブパラメータ

説明

 casOut

—

出力 CAS ライブラリ設定を指定します。

パラメータの説明

algorithm="PRIMARY" | "SECONDARY"

プロファイル操作に使用されるアルゴリズムを指定します。

デフォルトPRIMARY
PRIMARY

ベストのパフォーマンスを提供しますが最もメモリを消費します。

SECONDARY

メモリを節約しますがプライマリアルゴリズムよりも遅くなります。

batchColumns=integer

同時に処理される入力データセットに含まれる列の数を指定します。値を大きくすると、パフォーマンスはよくなりますが、より多くのメモリを消費します。

デフォルト256

casOut=list(casouttable)

出力 CAS ライブラリ設定を指定します。

長い形式casOut=list(name="table-name")
短い形式casOut="table-name"

casouttable の値は次のいずれかになります:

caslib="string"

出力テーブルの caslib の名前を指定します。

compress=TRUE | FALSE

True に設定すると、テーブルにデータ圧縮が適用されます。

デフォルトFALSE
indexVars=list("variable-name-1" <, "variable-name-2", ...>)

出力データにインデックスを作成する変数のリストを指定します。

label="string"

テーブルに関連付ける説明ラベルを指定します。

lifetime=64-bit-integer

最後にアクセスした後にテーブルをメモリに保持する秒数を指定します。指定した秒数にアクセスできない場合、テーブルは削除されます。

デフォルト0
最小値0
maxMemSize=64-bit-integer

メモリマップされたファイルに変換する前に、各スレッドがインメモリブロックに割り当てる必要があるメモリの最大容量をバイト単位で指定します。ファイルは、CAS_DISK_CACHE 環境変数で指定されたディレクトリに書き込まれます。

ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
memoryFormat="DVR" | "INHERIT" | "STANDARD"

出力テーブルのメモリフォーマットを指定します。

デフォルトINHERIT
DVR

重複値削減メモリフォーマットを使用します。このメモリフォーマットでは、入力データに重複する値が含まれている場合に、メモリの消費量とファイルサイズを削減できます。

INHERIT

サーバーに設定されているデフォルトのメモリフォーマットを使用します。デフォルトでは、サーバーは標準のメモリフォーマットを使用します。管理者が CAS_DEFAULT_MEMORY_FORMAT 環境変数を DVR に設定した場合、DVR メモリフォーマットがサーバーのデフォルトとして設定されます。

STANDARD

標準メモリフォーマットを使用します。

name="table-name"

出力テーブルの名前を指定します。

promote=TRUE | FALSE

True に設定すると、出力テーブルはグローバルスコープで追加されます。これにより、アクセスコントロールの対象となる他のセッションがテーブルにアクセスできるようになります。ターゲット caslib には、グローバルスコープも必要です。

デフォルトFALSE
replace=TRUE | FALSE

True に設定すると、同じ名前の既存のテーブルは上書きされます。

デフォルトFALSE
replication=integer

フォールトトレランスのために作成するテーブルのコピー数を指定します。値を大きくすると、パフォーマンスが低下し、より多くのメモリが使用されますが、ノードに障害が発生した場合のデータの可用性が向上します。データの冗長性は、分散サーバーにのみ適用されます。

デフォルト1
最小値0
threadBlockSize=64-bit-integer

出力テーブルのブロックに使用するバイト数を指定します。ブロックはスレッドによって読み取られます。数百万行または数十億行の大きなテーブルがあり、パフォーマンスを調整している場合は、この値を徐々に増やします。値を大きくすると、インデックス付きテーブルのパフォーマンスが向上します。ただし、値が大きすぎる場合、スレッドが動作するためのブロックが少なすぎるため、スレッド不足が発生する可能性があります。

別名blockSize
デフォルト1048576
最小値0
ヒント値を引用符で囲み、B、K、M、G または T を接尾辞として指定して単位を示せます。たとえば、"8M" は 8 MB を示します。
timeStamp="string"

タイムスタンプ列をテーブルに追加することを指定します。timeStamp のサポートはアクション固有です。セッションロケールに適した形式で値を指定します。

columns=list("variable-name-1" <, "variable-name-2", ...>)

プロファイルする列のリスト。指定しない場合はすべての列がプロファイルされます。

別名inputs
input

cutoff=64-bit-integer

列を廃棄する前に集める一意の値の数を指定します。この数を超えた場合は。列のプロファイルメトリックは不完全になります。この目的はカーディナリティの多い列に対して過大なメモリ使用を防ぐことにあります。

デフォルト0
最小値0

format=TRUE | FALSE

形式が適用されたデータの値をプロファイルするかどうか指定します。True の場合はプロファイルメトリックは形式が適用された値に基づきます。False の場合はすべてのプロファイルメトリックが形式なし (raw) の値に基づきます。

デフォルトFALSE

frequencies=integer

それぞれの列をレポートするための一意の値の数を指定します。この数は最も多く発生する数と最も少なく発生する値の両方を反映します。

デフォルト1000
最小値0

identities=list( list(identitiesDefinition-1) <, list(identitiesDefinition-2), ...>)

プロファイル中に使用される ID のリストを指定します。パターンにマッチする値は指定された種類に割り当てられます。

identitiesDefinition の値は次のいずれかになります:

definition="string"

QKB の ID 分析定義を指定します。指定されると、QKB は ID 分析に使用されます。

pattern="string"

種類を特定する際に使用する正規表現を指定します。'PAT=' で始まる値を指定した場合は、アルファベットにマッチさせるには'A' を、数値にマッチさせるには '9' を指定してください。正規表現による検索が実行される前に列のデータはこのパターンの表記に変換されます。句読点と空白はそのまま残ります。例えば、PAT=9{3}-99-9{4} は アメリカのソーシャルセキュリティ番号にマッチする ID パターンです。QKB ID 分析が使用されている場合、この正規表現が分析結果に適用されます。つまり、ほとんどの場合、この値はマッチするように ".*" に設定します。

prefix="string"

QKB ID 分析結果がこの値の前に付加されます。定義キーワードが指定された時のみ有効です。

score=integer

マルチ ID を使用し、QKB ID 分析を使用していない時に、分析結果に割り当てられるスコアを指定します。

デフォルト1
* type="string"

ID の種類に適用するラベルを指定します。QKB ID 分析が使用されている場合、この値はほとんどの場合、"*" に設定します。他の値に設定されている場合、QKB ID 分析の出力の代わりにその値が出力されます。

locale="string"

QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値がデフォルトの QKB ロケールを上書きします。指定されたすべての定義がロケール内にある必要があります。

minmax=integer

レポートする最小と最大の値を指定します。数値データにおいては、最小または最大の値はそれぞれ最も小さいまたは最も大きい数値です。文字データにおいてはそれぞれソートした時の最初または最後の値です。

別名outliers
デフォルト10
最小値0

multiIdentity=TRUE | FALSE

True に設定されている場合、複数のマッチが有効になります。有効の場合、入力データの各要素が複数の ID にマッチが可能になり、それぞれのマッチの強さに応じてスコアが返されます。False に設定すると、入力データの各要素は 1 つの ID にのみマッチします。

デフォルトFALSE

nThreads=integer

サーバーのそれぞれのマシンで使用されるスレッドの数を指定します。デフォルトでは、サーバーは SAS ソフトウェアがライセンスされている CPU ごとに 1 スレッドを使用します。

デフォルト0
最小値0

qkb="string"

QKB ID 分析が使用される場合、使用される QKB ロケールを指定します。この値が QKB 名を上書きします。

table=list(castable)

入力テーブルの設定を指定します。

長い形式table=list(name="table-name")
短い形式table="table-name"

castable の値は次のいずれかになります:

caslib="string"

アクションで使用する入力テーブルの caslib を指定します。デフォルトでは、アクティブな caslib が使用されます。別の caslib からテーブルにアクセスする必要がある場合にのみ値を指定します。

computedOnDemand=TRUE | FALSE

True に設定すると、アクションの開始時ではなく、テーブルがロードされたときに計算される変数が作成されます。

別名compOnDemand
デフォルトFALSE
computedVars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

作成する計算変数の名前を指定します。computedVarsProgram パラメータの各変数の式を指定します。このパラメータを指定しない場合、computeVarsProgram のすべての変数が自動的に含まれます。

別名compVars

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

computedVarsProgram="string"

computedVars パラメータに含める各計算変数の式を指定します。

別名compPgm
dataSourceOptions=list(key-1=list(any-list-or-data-type-1) <, key-2=list(any-list-or-data-type-2), ...>)

データソースオプションを指定します。

別名options
dataSource
groupBy=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

結果のグループ化に使用する変数の名前を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

groupByMode="NOSORT" | "REDISTRIBUTE"

グループの作成方法を指定します。

デフォルトNOSORT
NOSORT

各マシン上で並べ替えを行わずにデータをグループ化し、コントローラ上で再度データをグループ化します。

REDISTRIBUTE

ノード間で行を転送し、グループ内での順序を保証します。この方法は遅くなります。

importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。

* name="table-name"

入力テーブルの名前を指定します。

onDemand=TRUE | FALSE

このパラメータは非推奨です。

デフォルトTRUE
orderBy=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

パーティション内でオブザベーションの並べ替えに使用する変数を指定します。このパラメータは、パーティション化されたテーブルに適用されるか、groupByMode パラメータの値が REDISTRIBUTE に設定されている場合に、groupBy パラメータで指定された変数と組み合わせることができます。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

singlePass=TRUE | FALSE

True に設定すると、サーバー上に一時テーブルは作成されません。このパラメータを True に設定すると効率的ですが、繰り返し実行時にデータの順序が安定しない場合があります。

デフォルトFALSE
vars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

アクションで使用する変数を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

入力データをサブセット化する式を指定します。

whereTable=list(groupbytable)

WHERE フィルタとして使用する行を含む入力テーブルを指定します。vars パラメータが指定されていない場合は、入力テーブルとフィルタリングテーブルに共通するすべての変数名を使用して一致する行を検索します。入力テーブルの where パラメータとこのパラメータが指定されている場合、このフィルタリングテーブルが最初に適用されます。

groupbytable の値は次のいずれかになります:

casLib="string"

フィルタテーブルの caslib を指定します。 デフォルトでは、アクティブな caslib が使用されます。

importOptions=list(fileType="ANY" | "AUDIO" | "AUTO" | "BASESAS" | "CSV" | "DOCUMENT" | "DTA" | "ESP" | "EXCEL" | "FMT" | "HDAT" | "IMAGE" | "JMP" | "LASR" | "PARQUET" | "SPSS" | "VIDEO" | "XLS", fileType-specific-parameters)

データソースからテーブルを読み込むための設定を指定します。

別名import

importOptions パラメータの指定の詳細については、共通 importOptions パラメータを参照してください。

* name="table-name"

フィルタテーブルの名前を指定します。

vars=list( list(casinvardesc-1) <, list(casinvardesc-2), ...>)

フィルタテーブルから使用する変数名を指定します。

casinvardesc の値は次のいずれかになります:

format="string"

変数に適用するフォーマットを指定します。

formattedLength=integer

フォーマットフィールドの長さとフォーマット精度の長さを指定します。

label="string"

変数の説明ラベルを指定します。

* name="variable-name"

変数の名前を指定します。

nfd=integer

フォーマット精度の長さを指定します。

nfl=integer

フォーマットフィールドの長さを指定します。

where="where-expression"

フィルタテーブルからデータをサブセット化する式を指定します。

最終更新: 2022/09/16