Modèles multimodaux Reka AI
Reka AI est une société de recherche qui construit des modèles nativement multimodaux qui comprennent ensemble le texte, les images, la vidéo et l'audio.
Aperçu
Its compact, efficient models aim to match much larger rivals while being deployable by enterprises on their own infrastructure.
Plongée profonde
Reka AI a été fondée en 2022 par des chercheurs dont Yi Tay et Dani Yogatama, anciens élèves de Google Brain, DeepMind et FAIR. Sa famille phare, Reka Core, Flash et Edge, a été conçue dès le départ pour être multimodale plutôt que de fusionner la vision sur un modèle de texte. Reka Core est en concurrence avec les modèles pionniers tandis que Flash et Edge ciblent la vitesse et des empreintes plus petites, avec Edge dimensionné pour les paramètres sur appareil ou contraints. Une caractéristique déterminante est la capacité de raisonner sur la vidéo et l’audio, et pas seulement sur des images fixes, afin qu’un modèle puisse regarder un clip et répondre à des questions sur des événements au fil du temps. Reka met l'accent sur l'efficacité des données et permet aux entreprises d'exécuter des modèles dans des déploiements privés, répondant ainsi aux problèmes de résidence des données et de sécurité qui empêchent certaines entreprises d'utiliser des API uniquement dans le cloud.
Aperçu technique
La multimodalité native signifie que les images, les images vidéo et l'audio sont tokenisés et introduits dans le même Transformer aux côtés du texte, de sorte que l'attention intermodale relie un mot parlé, un objet à l'écran et une question écrite dans une représentation partagée. Pour la vidéo, le modèle échantillonne les images au fil du temps et code l'ordre temporel, permettant ainsi de poser des questions sur les séquences d'événements. Reka investit également massivement dans des données d'entraînement efficaces et organisées, en visant une qualité élevée par paramètre plutôt qu'une échelle maximale.
Impact stratégique
Stratégie du fournisseur
Les feuilles de route des fournisseurs influencent les fonctionnalités que votre équipe peut ensuite créer.
Coût et budget
Les conditions commerciales et les options de déploiement affectent les coûts et les risques à long terme.
Risques et sécurité
Les incitations des entreprises façonnent les défauts des produits, la posture de sécurité et l’ouverture.
L’avenir des modèles multimodaux Reka AI
Attendez-vous à ce que Reka approfondisse la compréhension des vidéos longues, l'interaction audio en temps réel et les flux de travail agents dans lesquels un modèle perçoit un écran ou une scène et prend des mesures. Son angle de déploiement professionnel et privé le positionne pour les industries réglementées qui souhaitent des capacités de pointe sans envoyer de données à des tiers. Alors que le multimodal devient un enjeu de table, Reka parie que l'efficacité et le contrôle sur site, et pas seulement la taille brute, gagneront les clients professionnels en quête de contrôle sur les coûts et les données.
Mise en œuvre dans le monde réel
Résumer et répondre aux questions sur des vidéos de réunions ou de conférences d'une heure, y compris qui a dit quoi et quand
Analyser ensemble les images de produits et les avis audio des clients pour obtenir des informations sur la vente au détail
Exécution d'un assistant multimodal privé sur site au sein d'une banque ou d'un hôpital qui ne peut pas utiliser les API du cloud public
Alimenter des outils d'accessibilité qui décrivent les scènes vidéo et transcrivent l'audio simultanément pour les utilisateurs
Risques et garde-fous
Les annonces de lancement peuvent dépasser la stabilité des flux de production réels.
La tarification des API ou les changements de politique peuvent briser les hypothèses du jour au lendemain.
La dépendance à un seul fournisseur augmente les coûts de verrouillage et de migration.
Feuille de route de mise en œuvre
Évaluez les fournisseurs à l’aide de vos propres tâches et ensembles de données.
Vérifiez les conditions de confidentialité, de sécurité et juridiques avant l’intégration.
Maintenez un plan de secours entre les modèles ou les fournisseurs.
Surveillez les notes de version afin que les modifications de la feuille de route ne surprennent pas les équipes.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reka AI Multimodal Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Modèles de conduite Wayve et de bout en bout
Questions fréquemment posées
What is Reka AI Multimodal Models?
Reka AI est une société de recherche qui construit des modèles nativement multimodaux qui comprennent ensemble le texte, les images, la vidéo et l'audio. Ses modèles compacts et efficaces visent à rivaliser avec des concurrents beaucoup plus grands tout en étant déployables par les entreprises sur leur propre infrastructure.
Que signifie « nativement multimodal » pour les modèles Reka ?
Reka a construit ses modèles pour traiter ensemble le texte, les images, la vidéo et l'audio plutôt que de fusionner la vision sur un modèle contenant uniquement du texte.
Quelle capacité distingue Reka au-delà de la compréhension classique des images ?
Les modèles Reka peuvent regarder des clips vidéo et traiter l'audio, en raisonnant sur des séquences d'événements au fil du temps.
Quels sont les trois principaux niveaux de la famille de modèles Reka ?
Reka propose les niveaux Core (le plus performant), Flash (rapide) et Edge (compact).
Pourquoi Reka privilégie-t-elle les interventions privées ?
Le déploiement privé répond aux problèmes de résidence des données et de sécurité qui empêchent certaines entreprises d'utiliser des API uniquement cloud.
Dans quels types d'organisations les fondateurs de Reka ont-ils travaillé auparavant ?
Reka a été fondée par des chercheurs de laboratoires tels que Google Brain, DeepMind et FAIR.