Progettodic 2025 – gen 2026
Transfer learning dal text-motion retrieval alla classificazione della violenza
Le azioni violente sono rare nei dataset di movimento, e i classificatori standard finiscono per ignorarle. Adattiamo gli embedding di movimento allineati al testo di TMR++ con MAML del primo ordine e una loss specifica per la violenza: con 30 esempi per classe il modello riconosce il 73,1% delle azioni violente con l’1% di falsi positivi.
Riconoscere la violenza dal movimento 3D dello scheletro è utile per la videosorveglianza, la moderazione dei contenuti e la robotica assistiva, ma le azioni violente sono rare: nei dataset tipici hanno decine di esempi, mentre camminare ne ha migliaia. I modelli supervisionati addestrati su questo squilibrio imparano a ignorare le classi rare. La domanda era se le rappresentazioni imparate per il text-to-motion retrieval contengano abbastanza significato da riconoscere azioni violente partendo da pochi esempi etichettati.
Approccio
- Backbone: TMR++. Un encoder Transformer del movimento (6 layer, 4 teste) pre-addestrato ad allineare movimento e testo su HumanML3D e KIT-ML. Trasforma feature articolari a 263 dimensioni campionate a 20 Hz in un embedding a 256 dimensioni.
- Testa few-shot. Prototipi di classe costruiti dagli esempi di supporto e adattati con MAML del primo ordine (20 passi interni), così lo spazio degli embedding può spostarsi verso le classi rare.
- Episodi orientati alla violenza. Sei categorie violente (calcio, pugno, colpo, arti marziali, schivata, afferrare una persona) costituiscono il 40% delle classi di ogni episodio di training, così ogni aggiornamento le vede.
- Tre loss. Binary cross-entropy per il compito multi-etichetta, una center loss per tenere compatta ogni azione e una hinge loss che allontana il centroide dei prototipi violenti da quello dei non violenti.
Risultati su BABEL-120
Sull’intero vocabolario di 120 classi, valutato sui 1.911 esempi di test:
| Modello | mAP | Tasso di rilevamento violenza | Falsi positivi |
|---|---|---|---|
| Prototipi, 30 esempi | 0,516 | 67,7% | 0,9% |
| MAML, 30 esempi | 0,585 | 73,1% | 1,0% |
| Completamente supervisionato | 0,683 | 63,4% | 0,6% |
MAML supera i prototipi statici con qualsiasi numero di esempi. Con un solo esempio per classe porta il tasso di rilevamento dal 62,4% al 66,7% dimezzando i falsi positivi, e negli episodi 5-way 5-shot alza l’accuratezza Top-1 dal 75,8% al 78,6%.
Cosa non ha funzionato
Una prima versione spingeva tutti gli esempi violenti in un unico cluster con una semplice loss contrastiva. Finiva per fondere “pugno” e “calcio” in un generico concetto di “violenza” e peggiorava l’accuratezza fine, una forma di class collapse. Separare l’obiettivo tra center loss (per singola azione) e hinge loss (solo sui centroidi di gruppo) ha risolto il problema.
Il modello completamente supervisionato ha ancora circa 10 punti di mAP in più: il meta-learning è lo strumento giusto quando le etichette scarseggiano o bisogna aggiungere in fretta un nuovo tipo di violenza, non un sostituto dell’addestramento sui dati completi.