Una arquitectura de modelo multimodal que aprende representaciones compartidas entre texto e imágenes.