Vai al contenuto
FRFederico Raponi
Tutti i lavori

Progettomar – giu 2025

Oltre il contrastive learning: retrieval immagine–testo variazionale con RoBERTa e DINOv2

Adattiamo VMSST, un modello variazionale nato per il retrieval multilingue, a immagini e testo. Resta a circa 6,5 punti da una baseline CLIP su MS-COCO, la supera nel trasferimento zero-shot da Flickr30k a COCO e mantiene uno spazio latente strutturato che un modello contrastivo non ha.

I modelli contrastivi come CLIP sono lo standard per il retrieval immagine–testo, ma imparano solo ad avvicinare le coppie corrispondenti: lo spazio degli embedding non ha altra struttura e non permette di generare nulla. Volevamo misurare quanto costa chiedere di più, cioè uno spazio latente che separi il significato condiviso dai dettagli propri di ciascuna modalità, e cosa si ottiene in cambio.

Metodo

Abbiamo adattato VMSST (Variational Multi-Modal Semantic-Style Translation), nato per il retrieval di testo multilingue, al dominio immagine–testo.

  • Backbone congelati, feature in cache. DINOv2 per le immagini e RoBERTa Large per il testo, con tutti gli embedding calcolati una volta sola, così il budget di addestramento va ai moduli di allineamento.
  • Due spazi latenti per modalità. Uno semantico, condiviso tra immagine e testo e usato per il retrieval, e uno privato di rumore/stile per cose come la texture o la formulazione della frase.
  • Projection head profonde. MLP residuali, più profonde sul ramo semantico che su quello del rumore, così l’informazione importante si concentra nello spazio condiviso.
  • Una loss composita: traduzione tra modalità, un termine di pura ricostruzione con peso elevato che ricostruisce l’input dal solo latente semantico, allineamento semantico e la regolarizzazione standard di un VAE. Pesi e dropout sono stati ottimizzati con Optuna (30 prove, campionatore TPE con median pruning).

Risultati

Recall@1 testo→immagine, addestrando su un dataset e valutando sullo stesso o, in zero-shot, sull’altro:

Addestramento → valutazione Baseline CLIP VMSST
COCO → COCO 58,57 52,02
Flickr30k → Flickr30k 55,14 54,82
Flickr30k → COCO (zero-shot) 28,80 30,80

Sul grande benchmark COCO il vincolo generativo costa circa 6,5 punti. Sul più piccolo Flickr30k la differenza quasi sparisce, e nel trasferimento da Flickr30k a COCO VMSST è avanti su tutte le metriche di retrieval: segno che l’obiettivo variazionale aiuta soprattutto quando i dati sono pochi.

Perché serve il termine di pura ricostruzione

Addestrato con le impostazioni originali di VMSST, senza quel termine, il modello collassava: coppie positive e negative finivano con similarità coseno di 0,99 e 0,89, tutto schiacciato in un cono stretto, e la Recall@1 scendeva intorno al 19%. Obbligare il decoder a lavorare dal solo latente semantico è ciò che tiene lo spazio ben distribuito e utilizzabile.