Lezione (2025-11-04)
Classificazione di testi
Section titled “Classificazione di testi”Per classificare un testo in base al suo contenuto devo ottenere un vettore input.
Prendo un vettore con le parole più significative del ‘dizionario’. Poi per ogni parola trovata nel testo, aumento di 1 la corrispettiva componente nel vettore (bag of words).
Ignoriamo per il momento che viene persa l’informazione data dall’ordine delle parole.
Otteniamo un grande vettore di ingresso. Ora dobbiamo capire quali sono le features più significative. Per trovare correlazioni tra coppie di parole posso calcolare la loro indipendenza.
Se il valore della differenza è alto, allora c’è alta dipendenza tra le variabili.
Test del Chi quadro
Section titled “Test del Chi quadro”Si usa per testare la dipendenza degli output dall’input.
Dove è il numero di occorrenze del valore per una data classe e è il numero totale di esempi nel dataset.
Le features migliori sono quelle con il più grande.
Entropia
Section titled “Entropia”Si usa per misurare quanta informazione fornisce una certa feature, maggiore è l’incertezza, maggiore sarà il valore:
Quando conosco un valore d’ingresso , ottengo l’entropia condizionale. Essa sarà minore di quella iniziale.
L’informazione mutua di è definita come la differenza tra l’entropia iniziale e quella condizionale.
Se e sono indipendenti, allora e possiamo scartare la feature.
L’informazione mutua è in grado di catturare dipendenze non lineari arbitrarie tra 2 variabili, quindi ci dice se otteniamo informazioni anche quando il coefficiente di correlazione è 0.
Clustering
Section titled “Clustering”Il clustering è l’operazione di riconoscere nuovi input (in maniera non supervisionata) e assegnare etichette ad essi.
A livello matematico, significa riconoscere delle singole varietà all’interno di spazi altamente dimensionali. Fatto questo, molte features diventeranno ridondanti e quindi potranno essere scartate.
La compressione dell’informazione avviene attraverso i prototipi. Ogni prototipo riassume l’informazione contenuta nel sottoinsieme di casi che rappresenta. In questo caso riassumere significa una funzione dove .
Approci per l’apprendimento non supervisionato
Section titled “Approci per l’apprendimento non supervisionato”- top-down: decido il numero di classi e poi divido i miei dati in queste classi.
- bottom-up: inizio a raggruppare i dati e mi fermo quando ha senso per la specifica applicazione.