Uma arquitetura de modelo multimodal que aprende representações compartilhadas entre texto e imagens.