Lezione (2025-11-11)
Rappresentazioni in clustering
Section titled “Rappresentazioni in clustering”- rappresentazione esterna: per ogni entità, l’informazione è data dalla relazione tra essa e un’altra.
- rappresentazione interna: ogni entità è identificata da un vettore di numeri.
Raggruppare vettori simili conoscendo la rappresentazione interna è molto facile, basta calcolare la distanza euclidea. Eccetto in alcuni casi in cui l’input non può essere normalizzato.
Alcuni esempi di distanza:
-
Distanza euclidea:
-
Norma di Manhattan: distanza misurata solo muovendosi in verticale o in orizzontale:
-
Angolo del prodotto scalare:
Può essere utile normalizzare le componenti dei vettori quando si calcola la distanza euclidea:
Queste misure di distanza sono invece una rappresentazione esterna.
Hard e soft clustering
Section titled “Hard e soft clustering”- Hard clustering: gli insiemi di partizione sono disgiunti, l’obiettivo è quello di minimizzare le dissimilarità tra elementi dello stesso sottoinsieme e di massimizzare la distanza tra elementi di insiemi diversi.
- Soft clustering: l’appartenenza ad una certa classe è espressa da un numero, quindi i confini tra i sottoinsiemi si sovrappongono parzialmente.
K-means
Section titled “K-means”L’algoritmo di k-means è un algoritmo divisivo: inizia con l’intero insieme e lo suddivide man mano in sottoinsiemi sempre più piccoli.
Per ogni cluster, il prototipo (la media delle componenti di solito) è calcolata minimizzando l’errore di quantizzazione.
- Scelgo il numero di clusters ();
- Genero in maniera casuale prototipi;
- Ripeto fino a quanto un certo criterio viene raggiunto:
- Assegno ogni punto al centroide del cluster più vicino;
- Muovo il centroide del prototipo nel punto dato dalla media di quelli che gli appartengono;

Soft clustering
Section titled “Soft clustering”In alcuni casi, l’assegnamento di un’entità ad un cluster non è netto ma dipende da una probabilità:
Il valore di appartenenza ad un certo cluster può essere dato da:
L’aggiornamento dei centroidi può essere eseguito leggermente diversa. Il centroide viene ‘tirato’ da ogni entità di una distanza proporzionale al grado di membership.
Ci sono 2 versioni leggermente differenti:
- online update: ogni volta che testo un’entità, sposto immediatamente il centroide;
- batch update: prima trovo tutte le entità appartenenti al gruppo, poi sposto il centroide con la somma di tutti i contributi;