コンセプトノードの対話型ウィンドウの使用

事前定義済みコンセプトについて

SAS Visual Text Analyticsは事前定義済みコンセプトを提供します。これは、ルールがすでに作成されているコンセプトです。コンセプトの編集タブのルールコードエディターで追加のルールを提供して、その動作を変更または拡張できます。事前定義済みコンセプトでは、組織名や日付など、一般的に使用されるコンセプトとその定義を提供できるため、時間を節約できます。事前定義済みコンセプトの名前変更はできません。また、その基本定義の表示や編集もできません。事前定義済みコンセプトには、重複する一致が発生したときにどの一致が返されるかを決定するために使用される事前設定された優先度値があります。

使用可能な事前定義済みコンセプトは、データで特定されたプロジェクト言語によって異なります。コンセプト分類の言語がパイプラインのプロジェクト言語と異なる場合、コンセプト分類の言語は、コンセプトノードを実行するとパイプライン言語と一致するように更新されます。

ただし、入力データに複数の言語が含まれている場合に、コンセプト分類の言語を手動で更新できるようになりました。

注: コンセプトノードでは、事前定義済みコンセプトに追加される新しいコンセプトルールは常に大文字と小文字が区別されません。事前定義済みコンセプトに大文字と小文字を区別するルールを追加するのと同じ効果を得るには、事前定義済みコンセプトを参照するカスタムコンセプトを作成し、カスタムコンセプトで大文字と小文字の区別を設定し、カスタムコンセプトにルールを追加します。compileConceptアクションを使用する場合、大文字と小文字を区別するルールを事前定義済みコンセプトに追加できます。compileConceptアクションの詳細については、コンセプトのコンパイル (SAS Visual Text Analytics: プログラミングガイド)を参照してください。

分析に事前定義済みコンセプトを含める方法については、コンセプトノードの設定の指定および事前定義済みコンセプトの使用を参照してください。すべての言語の事前定義済みコンセプトとその優先度値のリストについては、事前定義済みコンセプトの優先度値についてを参照してください。

カスタムコンセプトを作成するときの考慮事項

カスタムコンセプトに名前を付けるときは、次の点に注意してください。

  • 有効な文字(数字、アルファベット文字、アンダースコア(_))を使用します。アンダースコアと2バイト文字の使用の詳細については、このリストの末尾にある注を参照してください。
  • コンセプト名は大文字と小文字が区別されます。
  • 通常のワードではない名前を作成します。読みやすくするために大文字と小文字を混在させて使用します。たとえば、MyConceptまたはmyConceptは良い名前です。テキスト内で一致する可能性のあるワード(Problem やMechanics)をカスタムコンセプトの名前に使用しないでください。かわりに、MyNewConceptなどの解釈不可能な名前を使用してください。
    注: コンセプト名には1バイト文字のみ使用できます。2バイトの文字を含む言語では、名前にASCII文字のみを使用する必要があります。

コンセプト名にアンダースコア(_)が使用されている場合は、次のガイドラインに従って、コンセプトルールが期待どおりに機能するようにします。

  • コンセプト名のいずれかの端にアンダースコアを使用する場合は、コンセプト名のもう一方の端にも対応するアンダースコアが必要です。たとえば、_Domestic_は許可されていますが、Domestic_は許可されていません。
  • 通常、コンセプト名では連続するアンダースコアは許可されません。ただし、コンセプト名の最初と最後に対応するアンダースコアがある場合は、連続するアンダースコアを使用できます。たとえば、_Country__Names_は許可されていますが、Country__Namesは許可されていません。
  • コンセプト名には_Qを含めないでください。この文字の組み合わせはアプリケーションで予約されています。
  • コンセプト名がアンダースコアで始まる場合、次の文字は文字でなければなりません。たとえば、コンセプト名_25anniv_は使用できません。

一致するドキュメントは、コンセプト動作がプライマリに設定されているコンセプトに対してのみ表示されます。コンセプト動作がサポートに設定されているコンセプトは、一致するドキュメントを生成しません。カスタムコンセプトのコンセプト動作をプライマリからサポートに変更するには、カスタムコンセプトを右クリックし、コンセプト動作の設定次にサポートを選択します。

注: コンセプトノードにカスタムコンセプトが存在する場合、少なくとも1つのカスタムコンセプトのコンセプト動作設定をプライマリに設定する必要があります。

このトピックについては、 SAS Text Analytics for Business Applications: Concept Rules for Information Extraction Modelsの第5章で詳しく説明されています。

カスタムコンセプトの作成

カスタムコンセプトは、指定した一連のルールによって定義されるユーザー作成のコンセプトです。次の説明では、コンセプトノードの対話型ウィンドウがすでに表示されていると想定します。カスタムコンセプトを作成する前に、カスタムコンセプトを作成するときの考慮事項で提供されているガイドラインをよく理解してください。カスタムコンセプトを作成するには、次の手順を実行します。

  1. コンセプトペインでカスタムコンセプトを選択し、カスタムコンセプトの新規作成をクリックします。 カスタムコンセプトの追加ウィンドウが表示されます。
  2. カスタムコンセプトの追加ウィンドウにコンセプト名を入力し、 OKをクリックします。
    注: カスタムコンセプトを作成すると、コンセプトの編集タブの横にサンドボックスタブが作成されます。サンドボックス環境の使用の詳細については、サンドボックスタブの使用を参照してください。
  3. LITI構文を使用して、コンセプトの編集タブのルールエディターでカスタムコンセプトのルールを作成します。コンセプト抽出のためのルールを作成する場合、オートコンプリート機能を使用すると、ユーザーはユーザーが入力したテキストに基づいてルールの種類を表示および選択できます。
    注: オートコンプリートでは、大文字と小文字が区別されます。選択可能なルールの種類のリストを表示するには、大文字を使用する必要があります。
    入力支援ポップアップ

    この機能を無効にする場合は、コンセプトの編集ツールバーのドロップダウンメニューからオートコンプリートリストの表示オプションを選択解除します。

    入力支援の選択

    LITI構文の使用の詳細については、コンセプトルールの作成: 基本LITI構文を参照してください。

    ヒントサンドボックスタブを使用してコンセプトルールをテストしてから、カスタムコンセプトに追加することで時間を節約できます。サンドボックス環境でテストする場合、サンドボックス内のルールと、それらが依存するコンセプトのみがモデルにコンパイルされます。これにより、ドキュメントコレクションに対する評価版ルールの高速かつ完全なテストが可能になります。サンドボックスの使用の詳細については、サンドボックスタブの使用を参照してください。
  4. カスタムコンセプトのルールの作成が終了したら、ルールエディターの上にあるツールバーのルールの検証アイコンをクリックして、ルールを検証します。構文エラーが特定されている場合は、コンセプトノードを実行する前に修正する必要があります。
  5. カスタムコンセプトのルールが検証されたら、ページの右上隅にあるノードの実行をクリックします。これにより、最新の基準に一致するドキュメントのみが一致したドキュメントタブに表示されるようになります。
    注: コンセプトを複製した場合は、コンセプトノードを再実行する必要があります。

コンセプトノードを実行した後、コンセプトノードの対話型ウィンドウにアクセスして、コンセプトルールを編集できます。

注: 複数の正規表現を含むカスタムコンセプトを使用してコンセプトノードを実行すると、多くのメモリが必要になる可能性があります。正規表現ルールが多すぎると、コンセプトノードをフローで実行するときに処理の問題が発生し、エラーが発生する可能性があります。最適なパフォーマンスを得るには、適切な場合にルールを組み合わせます。たとえば、正規表現ルールが文字の範囲、ワイルドカード演算子、およびワード文字(\w)を使用する場合、メモリ使用量が増加する可能性があります。次の正規表現について考えてみます。
  • REGEX:[A-Za-z]*any[A-Za-z]*
  • REGEX:[A-Za-z]*every[A-Za-z]*

このような場合は、メモリ要求を制限するルールを組み合わせることをお勧めします。たとえば、次のようにして先の正規表現を組み合わせます。

REGEX:[A-Za-z]*(?:any|every)[A-Za-z]*

コンセプトルールの編集

コンセプトノードの対話型ウィンドウでは、コンセプト分類に存在する各コンセプトのルールを編集できます。次の説明では、コンセプトノードの対話型ウィンドウがすでに表示されていると想定します。コンセプト分類内のコンセプトのルールを編集するには、次の手順を実行します。

  1. ウィンドウの左側にあるコンセプトペインからコンセプトを選択します。そのコンセプトのルールは、コンセプトの編集タブのルールエディターに表示されます。
  2. ルールエディター内をクリックして、選択したコンセプトのルールを変更します。
    注: 複数のユーザーが同じコンセプトを同時に編集しようとすると、"このプロジェクトまたはデータは最新ではありません。変更する前に、プロジェクトまたはデータを更新してください。"という警告メッセージが表示されます。
  3. 選択したコンセプトのルールの変更が終了したら、ルールエディターの上にあるツールバーのルールの検証アイコンをクリックして、ルールを検証します。構文エラーが特定されている場合は、コンセプトノードを実行する前に修正する必要があります。
  4. カスタムコンセプトのルールが検証されたら、ページの右上隅にあるノードの実行をクリックします。これにより、最新の基準に一致するドキュメントのみが一致したドキュメントタブに表示されるようになります。

サンドボックスタブの使用

コンセプトの編集タブに加えて、各カスタムコンセプトと事前定義済みコンセプトに関連付けられたサンドボックスタブがあります。コンセプトを削除しない限り、関連するサンドボックスはそのコンセプトとペアになったままになります。サンドボックスタブでは、次の機能が提供されます。

  • サンドボックスを使用して新しいルールをテストし、それらのルールの結果のみが表示されるようにします。
  • ドキュメントコレクションに対してモデルのサブセットをテストします。サンドボックス環境でテストする場合、サンドボックス内のルールと、それらが依存するコンセプトのみがモデルにコンパイルされます。これにより、ドキュメントコレクションに対するモデルのより迅速なテストが可能になります。
  • まだプロダクションの準備ができていないルールを、コンセプトに関するドキュメントとともにサンドボックスに保存します。
  • それらのルールのテストによって期待される動作が発生したら、サンドボックスから関連するコンセプトのルールエディターに新しいルールを簡単に追加できます。

サンドボックスタブを使用する場合は、次の点に注意してください。

  • サンドボックスコンセプトルールを含むコンセプトノードを実行すると、サンドボックスの結果が削除されます。
  • サンドボックスに関連付けられたコンセプトのルールを参照することを選択した場合は、それらのルールをメインコンセプトに戻さないように注意してください。この操作により、循環参照エラーが発生します。
  • 事前定義済みコンセプトに関連付けられているサンドボックスにルールを追加すると、サンドボックスは事前定義済みコンセプトルールと追加したルールの両方の一致を返します。
  • キーワード_SELF_をREMOVE_ITEMおよびNO_BREAKルールと組み合わせて使用して、サンドボックスから一致をフィルタリングします。たとえば、コンセプトFruitに、さまざまな種類の果物を識別するいくつかのCLASSIFIERルールが含まれているとします。ルールCLASSIFIER:Orangeが含まれ、"orange"という語を含むドキュメントを返します。文字列"orange marmalade"を含むドキュメントで一致を取得しないようにするには、サンドボックスタブのCLASSIFIERルールの既存のリストにREMOVE_ITEM:(ALIGNED,"_c{_SELF_} marmalade","_SELF_ marmalade")というルールを追加することでテストできます。このルールは、コンセプトの編集タブのルールコードエディターに直接コピーして貼り付けることができます。
    注: REMOVE_ITEMおよびNO_BREAKルールをサンドボックスタブからコンセプトの編集タブにコピーした後にコンセプトノードを再実行すると、分類内の他のコンセプトの結果に影響が及ぶ可能性があります。これは、これらがグローバルステートメントであり、コンセプトノード内の分類全体に適用されるためです。これらのルールの種類については、SAS Text Analytics for Business Applications: Concept Rules for Information Extraction Modelsの第9章で詳しく説明されています。

    サンドボックスタブのルールエディターからコンセプトの編集タブに_SELF_キーワードを使用してルールを貼り付けると、_SELF_キーワードは、サンドボックスではなくコンセプトの編集タブのルールを参照します。

  • プロジェクト内の各コンセプトノードは、一度に3つまでのコンセプトのサンドボックス結果を保持できます。複数のユーザーが、分類内の最大3つの異なるコンセプトのコンセプトルールを同時に編集およびテストできます。1つのコンセプトノードで3つを超えるサンドボックスが実行された場合、以前のサンドボックスの結果は新しいサンドボックスの結果に置き換えられます。以前のサンドボックスの結果は、古いものから新しいものの順に置き換えられます。

ドキュメントコレクションの語からコンセプトルールを作成

CLASSIFIERルールは、ドキュメントタブのコンセプトにルールを追加機能を使用して、簡単かつ迅速に作成できます。ドキュメントタブでテキストからCLASSIFIERルールを作成するには、次の手順を実行します。

  1. コンセプトペインで事前定義済みコンセプトかカスタムコンセプトを選択します。
  2. カーソルを使用して、分類器として追加するテキストをドキュメントタブで強調表示します。
  3. ドキュメントタブの右上隅にあるコンセプトにルールを追加アイコンをクリックします。選択したコンセプトに新しいCLASSIFIERルールが作成されます。
  4. コンセプトの編集タブの右上隅にあるコンセプトルールの検証アイコンをクリックしてコンセプトルールを検証し、コンセプトノードを再実行します。

コンセプトに対するサンプルテキストのテスト

サンプルテキストテストタブを使用すると、コンセプトノードを実行せずに、サンプルテキストに対してコンセプトルールをテストできます。この機能を使用すると、作成したコンセプトルールが抽出するキーワードやフレーズと一致するようになります。サンプルテキストをコンセプトルールに対してテストするには、次の手順を実行します。

  1. コンセプトノードの対話型ウィンドウのコンセプトペインからコンセプトを選択します。
  2. サンプルテキストテストタブをクリックします。
  3. サンプルテキストテストタブのエディターで、コンセプトルールに対してテストするテキストを入力します。
  4. サンプルテキストテストタブの左上隅にあるサンプルテキストテストをクリックします。サンプルテキストで見つかった一致が強調表示されます。

サンプルテキストをテストするときは、次の点を考慮してください。

  • オペレーティングシステムに応じて、改行はドキュメントタブで\r\nまたは\nとして表されます。ただし、サンプルテキストテストタブでは、改行は\nとして表されます。したがって、改行を含むテキストをドキュメントタブからサンプルテキストテストタブにコピーして貼り付けると、一致がサンプルテキストテストタブに返されない場合があります。REGEXルールで改行文字をまたいで一致させる場合は、ルールがすべてのコンテキストで一貫して一致するように、両方の種類の改行文字(\r\nおよび\n)を必ずモデリングしてください。
  • サンプルテキストをテストする場合、REMOVE_ITEMルールとNO_BREAKルールはグローバルでは機能しません。つまり、REMOVE_ITEMルールとNO_BREAKルールは、それらのルールが含まれるコンセプトのサンプルテキストにのみ適用されます。
  • テキストの長さが32,000文字を超える場合、カスタムまたは事前定義済みコンセプトを使用すると、結果に一貫性がなくなる可能性があります。予期しない一致を避けるには、テキストをバッチに分割し、各バッチが32,000文字未満になるようにすることを検討してください。

コンセプトルールの自動生成

カスタムコンセプトを含むコンセプトノードを実行するときに、そのコンセプトを選択してコンセプトルールを自動生成できます。この機能は、各コンセプトルールのあいまいさと頻度に基づいて、コンセプトに追加するコンセプトルールを作成および提案します。出現頻度の高いルールは高い評価を受け、出現頻度の低いルールよりも有用であると見なされます。複数のコンセプトで自動コンセプトルール生成を同時に実行する場合、この機能により、同じルールが複数のコンセプトで生成されないようになります。同じルールの複数のインスタンスは、コンセプトを区別するのに役立ちません。この機能を使用することで、作成する各カスタムコンセプトの有効性を最適化し、カスタムコンセプトのルールの作成にかかる時間を大幅に短縮できます。

コンセプトルールの自動生成に使用されるアルゴリズムは、コンセプト間の重複を最小限に抑えるように調整されています。たとえば、同じパイプラインを2回実行するとします。最初のパイプライン実行で、自動ルール生成のためにconceptAとconceptBを選択し、2番目のパイプライン実行で、自動ルール生成のためにConceptAとConceptCを選択します。これにより、パイプライン実行ごとに異なるコンセプトルールがConceptAに生成される可能性があります。

ルール内の循環依存関係により、モデルが失敗したり、正しく実行されなかったりする可能性があります。コンセプトルールの自動生成を使用する場合に循環依存関係を回避するには、次の点に注意してください。

  • 事前定義済みコンセプトにルールを追加する場合は、事前定義済みコンセプトを参照するカスタムコンセプトを作成してから、そのカスタムコンセプトにルールを追加します。たとえば、事前定義済みコンセプトnlpPlaceにルールを追加する場合は、ルールCONCEPT:nlpPlaceを使用してカスタムコンセプトを作成し、追加するその他のルールを追加します。これにより、ルール生成によって循環依存関係が生成されなくなります。
  • データで通常のトークンであるコンセプト名を使用することは避けてください。

作成できるルールの種類は次のとおりです。

  • CLASSIFIER

    生成されたCLASSIFIERルールは、C_CONCEPTルールを入力として使用する場合に特に役立ちます。これらのルールで表されるターゲットコンテンツが必要とする内容を確認できます。たとえば、医療データセットを扱っていて、体の左側にある体の部位を探すとします。このタスクを実行するには、C_CONCEPT:left_c{_w}などの元のルールを使用する場合があります。

  • C_CONCEPT

    これらのルールは、一致するアイテムを中心にコンテキストを確立するのに役立ちます。_c{}修飾子の内部にない要素はコンテキスト要素です。

    C_CONCEPTルールの種類のコンセプトルール生成は、n-gramテンプレートを使用してルールを作成します。このルールは、元のルールの一致とそれらの一致のコンテキストに基づいて生成されます。コンテキストに基づいてルールを生成する場合、既存の一致の両側にある最大2つのトークンがコンテキストパターンを識別するために使用されます。これらのルールの一致がランク付けされ、ルールのサブセットがユーザーに返されます。

    これらのルールは、モデルで使用する前に調整が必要な場合があります。ただし、これらはよい一致と悪い一致の例を識別するのに役立ち、その後、それらを使用してモデルをさらにテストし、調整することができます。

  • CONCEPT_RULE

    これらのルールは、事前定義済みコンセプトをコンセプトノードに含めるときに表示されます。これらのルールは、文のコンテキストで追加要素の存在を要求することで、一致が見つかるコンテキストを絞り込むのに役立ちます。これらのコンテキスト要素は、名詞グループまたはnlpTime、nlpDate、nlpMoney、nlpPercentなどの特定の事前定義済みコンセプトへの参照を表すリテラル文字列にすることができます。

新しく生成されたルールは、サンドボックスの下部に追加されます。タイムスタンプコメントは、ルールの上下にあります。

自動生成されたコンセプトルールは一般的に適合率が低く、再現率が高い可能性があります。生成されるCLASSIFIERルールとC_CONCEPTルールは、元のルールセットに対して返される一致の範囲を拡張します。それとは対照的に、CONCEPT_RULE種類のルールは、元のルールを絞り込むための方法を提案します。この機能は、モデリングに適したデータを識別する場合に特に便利です。ルールが生成されない場合は、コンセプトノードのログをチェックしてメッセージを確認します。

注: コンセプトルールの自動生成の対象としてマークされたコンセプトは、新しいルールを生成するために一致が必要です。その結果、コンセプト動作がSupportingに設定されているコンセプトに対してルールを生成することはできません。コンセプトが持つことができる一致数に制限はありません。

コンセプトルールを自動生成するには、次の手順を実行します。

  1. パイプラインタブに移動し、コンセプトノードを選択します。
  2. コンセプトノードを右クリックし、開くを選択します。
  3. コンセプトペインからカスタムコンセプトを選択します。カスタムコンセプトを作成していない場合は、カスタムコンセプトの作成の手順に従って作成してください。
  4. コンセプトペインの上のツールバーでルールの自動生成アイコンをクリックします。
  5. ドロップダウンリストからコンセプトルールの自動生成を選択すると、選択したコンセプトの横にインジケーターが表示されます。さらに、コンセプトが自動ルール生成の準備ができていることを確認するメッセージがルールコードエディターの上に表示されます。
    ルールの自動生成ドロップダウンリスト
  6. 選択したコンセプトのルールを生成するには、コンセプトノードを再実行します。コンセプトノードが実行されると、生成されるすべてのルールがサンドボックスタブに配置されます。作成されるルールは25個までです。
    注:
    • 生成されたルールのリストは、実行ごとに異なる場合があります。
    • 元の25個に加えてより多くのルールを生成するには、元のルールをサンドボックス環境からコンセプトの編集タブのルールエディターに移動し、手順1から7を繰り返します。
  7. サンドボックスタブの右上隅にある生成ルールのルールコードエディターへの移動アイコンをクリックします。これにより、サンドボックスタブで生成されたすべてのルールが既存のコンセプトルールに追加されます。
  8. コンセプトルールの検証アイコンをクリックしてコンセプトルールを検証し、コンセプトノードを再実行します。
  9. 生成されたルールのすべてをコンセプトに追加したくない場合は、次の手順を実行します。
    1. 既存のコンセプトルールに追加するルールをカーソルで強調表示して選択します。
    2. サンドボックスタブのルールエディター内で右クリックし、ポップアップメニューからコピーを選択します。
    3. コンセプトの編集タブに移動し、Ctrl+Vを押して、選択したルールを既存のコンセプトルールに追加します。
    4. コンセプトルールの検証アイコンをクリックしてコンセプトルールを検証し、コンセプトノードを再実行します。

ファクトルールの自動生成

SAS Visual Text Analyticsには、PREDICATE_RULEとSEQUENCEの2種類のファクトルールがあります。これらのルールは、コンテキストに関連するカスタムコンセプトを見つけて一致させるために使用されます。

自動ファクトルール生成には、少なくとも3つのカスタムコンセプトが存在し、それらのカスタムコンセプトのうち少なくとも2つが一致している必要があります。これは、ファクトルール生成が、ファクトルールを作成するために指定した2つのカスタムコンセプトから見つかった一致を使用するためです。

この機能を使用すると、1つまたは2つのルールが生成されます。ルールが1つだけ生成された場合、それはベースラインルールです。ベースラインルールは1つの文内のすべての一致を識別し、SENT演算子のみを含みます。このルールは、SENT演算子をORD、PARA、SENT_n、ANDのいずれかの演算子で置き換えることで範囲を拡張できます。

ベースラインルールに加えて、制限付きルールを生成することもできます。これらのルールは、距離、順序、またはその両方に制限を加え、演算子ORDDIST_n、ORD、およびDIST_nを使用します。制限付きルールは、データ内の最も一般的なパターンを識別し、一致の85%をカットオフポイントとして使用して、次を決定します。

  • 一致は通常、特定の順序ですか。
  • 一致は通常、互いに6トークン内にありますか。

ファクトルールを自動生成するには、次の手順を実行します。

  1. ファクトルールを生成するカスタムコンセプトを選択します。
  2. コンセプトペインの上のツールバーでルールの自動生成アイコンをクリックします。
  3. ドロップダウンリストからファクトルールの自動生成を選択します。ファクトルールの生成ウィンドウが表示されます。
  4. 使用可能コンセプトリストからコンセプトを選択し、コンセプトの選択をクリックします。
  5. 使用可能コンセプトリストから別のコンセプトを選択し、コンセプトの選択をクリックします。
  6. ファクトルールの生成ウィンドウの右下隅にあるルールの生成をクリックします。
  7. ページの右上隅にあるノードの実行をクリックします。ノードが正常に実行されると、ファクトルールの自動生成のために選択されたコンセプトの横にインジケーターが表示されます。
    ファクトルールが生成されたことを示すインジケーター
  8. サンドボックスタブに移動して、選択したコンセプトに対して生成されたファクトルールを確認します。
  9. サンドボックスタブの右上隅にある生成ルールのルールコードエディターへの移動アイコンをクリックします。これにより、サンドボックスタブで生成されたすべてのルールがコンセプトの編集ルールエディターに追加されます。
  10. コンセプトルールの検証アイコンをクリックしてコンセプトルールを検証し、コンセプトノードを再実行します。
  11. 生成されたルールのすべてをコンセプトに追加したくない場合は、次の手順を実行します。
    1. コンセプトに追加するルールをカーソルで強調表示して選択します。
    2. サンドボックスタブのルールエディター内で右クリックし、ポップアップメニューからコピーを選択します。
    3. コンセプトの編集タブに移動し、Ctrl+Vを押して、選択したファクトルールをコンセプトに追加します。
    4. コンセプトルールの検証アイコンをクリックしてコンセプトルールを検証し、コンセプトノードを再実行します。

ファクトとその構成要素の詳細については、コンセプトとファクトを参照してください。

ファクトルールの種類については、SAS Text Analytics for Business Applications: Concept Rules for Information Extraction Modelsの第8章で詳しく説明されています。

一致するドキュメントをコンセプト別に表示

コンセプトに対してドキュメントセットをテストする場合、3種類の一致が発生する可能性があります。ドキュメントには、一致したアイテム、一致したファクト、または重複している一致を含めることができます。一致は、3種類の一致のどれと見なされるかに基づいて、一意にフォーマットされます。一致は、最適な一致法を使用して決定されます。最適な一致法の詳細については、最適な一致法とはを参照してください。コンセプトに対してドキュメントセットをテストするには、次の手順を実行します。

  1. コンセプトペインから事前定義済みコンセプトまたはカスタムコンセプトを選択します。
  2. ドキュメントペインの左上隅で、一致を選択します。一致を含む各ドキュメントが表示され、各一致がドキュメント内で強調表示されます。
  3. ドキュメントコレクションで見つかった各一致の一致の種類を識別するには、一致タブの右上隅にある凡例をクリックします。
    コンセプトの一致の種類の凡例

一致したファクトを含むドキュメントの場合、そのドキュメントを選択し、選択されたドキュメントの一致ファクトを表示アイコンをクリックして結果を詳細に表示できます。単一のファクトはPREDICATE_RULEルールまたはSEQUENCEルールのいずれかに対応し、各ルールの種類には複数の一致するラベルを含めることができます。一致した各ファクトに関連付けられている一致した文字列、一致したラベル、および一致したテキストが表示されます。

不一致タブには、選択したコンセプトと一致しないドキュメントが表示されます。

注:
  • 不一致タブは、2024.11から追加されました。
  • コーパスに空のドキュメントが含まれている場合、ドキュメントペインのドキュメント数はドキュメントの開始数とは異なる場合があります。これは、空のドキュメントが不一致タブから除外されないためです。

ファクトとその構成要素の詳細については、コンセプトとファクトを参照してください。

最適な一致法とは

テキストの範囲が複数のコンセプトに一致する場合、最適な一致法を使用して返される一致が決定されます。この方法では、次のファクターに基づいて一致を決定します。

  • テキストの範囲が複数のコンセプトに一致する場合、優先度値が最も高いコンセプトが一致として返されます。カスタムコンセプトのデフォルトの優先度値は10です。事前定義済みコンセプトの優先度値のリストについては、事前定義済みコンセプトの優先度値についてを参照してください。
  • テキストの範囲が複数のコンセプトに一致し、それらのコンセプトの優先度値が同じ場合、最も長い一致を生成するコンセプトが返されます。
  • テキストの範囲が複数のコンセプトに一致し、それらのコンセプトが同じ優先度値を持ち、等しい長さの一致を生成する場合、コンパイルされた最初のコンセプトが最適な一致として返されます。
ヒントサーバーが入力データの処理に必要とするメモリが、コンセプトノードには不十分である可能性があります。この場合は、入力データを複数の小さなファイルに分割することを検討してください。

コンセプトとドキュメントのビューの変更

コンセプトノードの対話型ウィンドウが開くと、タイルビューが表示されます(タイルビュー)。ビューを左右に並べたレイアウトに変更するには、左右に並べたビューをクリックします。

最終更新: 2025年6月9日