Progettomar – giu 2025
Oltre il contrastive learning: retrieval immagine–testo variazionale con RoBERTa e DINOv2
Adattiamo VMSST, un modello variazionale nato per il retrieval multilingue, a immagini e testo. Resta a circa 6,5 punti da una baseline CLIP su MS-COCO, la supera nel trasferimento zero-shot da Flickr30k a COCO e mantiene uno spazio latente strutturato che un modello contrastivo non ha.
I modelli contrastivi come CLIP sono lo standard per il retrieval immagine–testo, ma imparano solo ad avvicinare le coppie corrispondenti: lo spazio degli embedding non ha altra struttura e non permette di generare nulla. Volevamo misurare quanto costa chiedere di più, cioè uno spazio latente che separi il significato condiviso dai dettagli propri di ciascuna modalità, e cosa si ottiene in cambio.
Metodo
Abbiamo adattato VMSST (Variational Multi-Modal Semantic-Style Translation), nato per il retrieval di testo multilingue, al dominio immagine–testo.
- Backbone congelati, feature in cache. DINOv2 per le immagini e RoBERTa Large per il testo, con tutti gli embedding calcolati una volta sola, così il budget di addestramento va ai moduli di allineamento.
- Due spazi latenti per modalità. Uno semantico, condiviso tra immagine e testo e usato per il retrieval, e uno privato di rumore/stile per cose come la texture o la formulazione della frase.
- Projection head profonde. MLP residuali, più profonde sul ramo semantico che su quello del rumore, così l’informazione importante si concentra nello spazio condiviso.
- Una loss composita: traduzione tra modalità, un termine di pura ricostruzione con peso elevato che ricostruisce l’input dal solo latente semantico, allineamento semantico e la regolarizzazione standard di un VAE. Pesi e dropout sono stati ottimizzati con Optuna (30 prove, campionatore TPE con median pruning).
Risultati
Recall@1 testo→immagine, addestrando su un dataset e valutando sullo stesso o, in zero-shot, sull’altro:
| Addestramento → valutazione | Baseline CLIP | VMSST |
|---|---|---|
| COCO → COCO | 58,57 | 52,02 |
| Flickr30k → Flickr30k | 55,14 | 54,82 |
| Flickr30k → COCO (zero-shot) | 28,80 | 30,80 |
Sul grande benchmark COCO il vincolo generativo costa circa 6,5 punti. Sul più piccolo Flickr30k la differenza quasi sparisce, e nel trasferimento da Flickr30k a COCO VMSST è avanti su tutte le metriche di retrieval: segno che l’obiettivo variazionale aiuta soprattutto quando i dati sono pochi.
Perché serve il termine di pura ricostruzione
Addestrato con le impostazioni originali di VMSST, senza quel termine, il modello collassava: coppie positive e negative finivano con similarità coseno di 0,99 e 0,89, tutto schiacciato in un cono stretto, e la Recall@1 scendeva intorno al 19%. Obbligare il decoder a lavorare dal solo latente semantico è ciò che tiene lo spazio ben distribuito e utilizzabile.