Analisi dei cluster: impostazione delle opzioni dei risultati

Nel riquadro di selezione, fare clic su Risultati per accedere a queste opzioni.

Analisi dei cluster: risultati

Nome opzione

Descrizione

Salvataggio dei dati di output

genera un data set di output. È possibile scegliere fra le seguenti opzioni:

  • Dati ad albero dei cluster crea un data set di output che può essere utilizzato per disegnare un diagramma ad albero della gerarchia dei cluster. Il data set contiene un'osservazione per ogni osservazione nel data set di input, più un'osservazione per ogni cluster di due o più osservazioni (cioè, un'osservazione per ogni nodo del diagramma ad albero). Il numero totale di osservazioni di output è solitamente 2n-1, dove n è il numero di osservazioni di input.
  • Output ad albero crea un data set di output per il metodo del legame medio, il metodo centroide e il metodo della varianza minima di Ward. Il data set contiene un'osservazione per ogni oggetto nel diagramma ad albero e le variabili CLUSTER e CLUSNAME che mostrano l'appartenenza dei cluster a un qualsiasi livello specificato nel diagramma ad albero.

    È anche possibile specificare il numero di cluster o livelli da includere nella tabella.

    • Per specificare il numero di cluster da includere nel data set di output, selezionare la casella di controllo Cluster. Di default, il numero di cluster è 10. Tuttavia, il numero di cluster potrebbe essere diverso dal numero specificato se una qualsiasi delle seguenti condizioni venisse soddisfatta:
      • Il numero di foglie nella struttura ad albero è minore del numero di cluster desiderati.
      • Il numero di strutture ad albero non connesse nel data set è maggiore del numero di cluster desiderati.
      • Una struttura ad albero a più vie non contiene un livello con il numero di cluster specificato.
    • Per specificare il numero di livelli da includere nel data set di output, selezionare la casella di controllo Rimuovi inutilizzati e specificare il livello della struttura ad albero che definisce i cluster separati nel data set di output. Sono visualizzati soltanto i cluster fra la radice e l'altezza del livello specificato.
  • Cluster k-medie crea un data set di output per il metodo dell'algoritmo delle k-medie. Il data set di output contiene tutti i dati originali, più le variabili CLUSTER e DISTANCE che sono generate dall'analisi dei cluster.

Nota: SAS Enterprise Guide esegue una ricerca nell'elenco di librerie definito nell'area Processi > Libreria di output della finestra Opzioni e salva i dati di output nella prima libreria scrivibile di tale elenco.

SAS Add-In for Microsoft Office memorizza i dati di output nella libreria Work. Per designare un percorso di archiviazione differente per i dati di output, fare clic su Sfoglia.

Visualizza output

visualizza l'output. È possibile specificare le seguenti opzioni:

  • Visualizza output visualizza informazioni sulla cronologia del processo di clusterizzazione. Ciò include il numero di cluster, i nomi dei cluster che sono uniti e il numero di osservazioni nel nuovo cluster. Utilizzare la casella Generazioni cluster per specificare il numero di generazioni della cronologia dei cluster da visualizzare.
  • Statistiche di riepilogo semplici visualizza medie, deviazioni standard, skewness, curtosi e un coefficiente di bimodalità.
  • Criterio di clusterizzazione cubica (CCC) visualizza il criterio di clusterizzazione cubica e l'R-quadro atteso approssimato per l'ipotesi nulla uniforme. Questa opzione si applica soltanto ai dati delle coordinate. Queste statistiche sono utili per determinare il numero di cluster nei dati. I valori di CCC superiori a 2 o 3 indicano cluster validi; i valori compresi tra 0 e 2 indicano cluster potenziali, ma devono essere considerati con cautela; elevati valori negativi possono indicare outlier.

    Nota: Questa opzione non è disponibile se il data set di input è di tipo DISTANCE.

  • Statistiche pseudo F e t quadrato visualizza le statistiche pseudo F e t-quadrato. Queste statistiche possono essere utili indicatori del numero di cluster. Valori relativamente grandi della statistica pseudo F indicano un punto di interruzione. Una regola generale per l'interpretazione dei valori della statistica pseudo t-quadro è scendere lungo la colonna fino a trovare il primo valore marcatamente maggiore del valore precedente e quindi risalire la colonna di un cluster.

    Nota: Quando si seleziona questa opzione, sono generati diagrammi delle statistiche pseudo F e t-quadrato sia che si selezionino le statistiche pseudo F che le statistiche pseudo t-quadrato nel riquadro Diagrammi.

Nota: Visualizza output è l'unica opzione di visualizzazione disponibile con il metodo di analisi dei cluster Algoritmo delle k-medie.

Ultimo aggiornamento: 18 aprile 2024