Multimodális modellarchitektúra, amely megtanulja a szöveg és a képek közötti megosztott ábrázolásokat.