Un'architettura del modello multimodale che apprende rappresentazioni condivise tra testo e immagini.