Vai al contenuto
FRFederico Raponi
Tutti i lavori

Progettodic 2025 – gen 2026

Transfer learning dal text-motion retrieval alla classificazione della violenza

Le azioni violente sono rare nei dataset di movimento, e i classificatori standard finiscono per ignorarle. Adattiamo gli embedding di movimento allineati al testo di TMR++ con MAML del primo ordine e una loss specifica per la violenza: con 30 esempi per classe il modello riconosce il 73,1% delle azioni violente con l’1% di falsi positivi.

Riconoscere la violenza dal movimento 3D dello scheletro è utile per la videosorveglianza, la moderazione dei contenuti e la robotica assistiva, ma le azioni violente sono rare: nei dataset tipici hanno decine di esempi, mentre camminare ne ha migliaia. I modelli supervisionati addestrati su questo squilibrio imparano a ignorare le classi rare. La domanda era se le rappresentazioni imparate per il text-to-motion retrieval contengano abbastanza significato da riconoscere azioni violente partendo da pochi esempi etichettati.

Approccio

  • Backbone: TMR++. Un encoder Transformer del movimento (6 layer, 4 teste) pre-addestrato ad allineare movimento e testo su HumanML3D e KIT-ML. Trasforma feature articolari a 263 dimensioni campionate a 20 Hz in un embedding a 256 dimensioni.
  • Testa few-shot. Prototipi di classe costruiti dagli esempi di supporto e adattati con MAML del primo ordine (20 passi interni), così lo spazio degli embedding può spostarsi verso le classi rare.
  • Episodi orientati alla violenza. Sei categorie violente (calcio, pugno, colpo, arti marziali, schivata, afferrare una persona) costituiscono il 40% delle classi di ogni episodio di training, così ogni aggiornamento le vede.
  • Tre loss. Binary cross-entropy per il compito multi-etichetta, una center loss per tenere compatta ogni azione e una hinge loss che allontana il centroide dei prototipi violenti da quello dei non violenti.

Risultati su BABEL-120

Sull’intero vocabolario di 120 classi, valutato sui 1.911 esempi di test:

Modello mAP Tasso di rilevamento violenza Falsi positivi
Prototipi, 30 esempi 0,516 67,7% 0,9%
MAML, 30 esempi 0,585 73,1% 1,0%
Completamente supervisionato 0,683 63,4% 0,6%

MAML supera i prototipi statici con qualsiasi numero di esempi. Con un solo esempio per classe porta il tasso di rilevamento dal 62,4% al 66,7% dimezzando i falsi positivi, e negli episodi 5-way 5-shot alza l’accuratezza Top-1 dal 75,8% al 78,6%.

Cosa non ha funzionato

Una prima versione spingeva tutti gli esempi violenti in un unico cluster con una semplice loss contrastiva. Finiva per fondere “pugno” e “calcio” in un generico concetto di “violenza” e peggiorava l’accuratezza fine, una forma di class collapse. Separare l’obiettivo tra center loss (per singola azione) e hinge loss (solo sui centroidi di gruppo) ha risolto il problema.

Il modello completamente supervisionato ha ancora circa 10 punti di mAP in più: il meta-learning è lo strumento giusto quando le etichette scarseggiano o bisogna aggiungere in fretta un nuovo tipo di violenza, non un sostituto dell’addestramento sui dati completi.