BigScience et le modèle BLOOM
BigScience était une collaboration de recherche ouverte d'un an rassemblant plus de 1 000 chercheurs qui ont produit BLOOM, l'un des premiers grands modèles de langage véritablement multilingues et ouvertement publiés.
Aperçu
It matters as a landmark in transparent, community-driven AI built outside Big Tech.
Plongée profonde
BigScience était un atelier de recherche d'un an se déroulant de 2021 à 2022, coordonné par Hugging Face et réunissant plus de 1 000 chercheurs bénévoles de plus de 60 pays et 250 institutions. Son principal résultat, publié en juillet 2022, était BLOOM, un modèle de langage autorégressif de 176 milliards de paramètres. BLOOM était volontairement multilingue, formé sur le corpus ROOTS couvrant 46 langues naturelles et 13 langages de programmation, avec une forte représentation de langues sous-représentées comme plusieurs langues africaines et sud-asiatiques. La formation s'est déroulée pendant plusieurs mois sur le supercalculateur public Jean Zay en France, utilisant environ 384 GPU. BLOOM a été publié sous la licence Responsible AI avec une documentation complète de ses données, de sa formation et de ses utilisations prévues, contrastant fortement avec le développement fermé de modèles comparables.
Aperçu technique
BLOOM est un transformateur uniquement décodeur d'échelle similaire à GPT-3, utilisant des intégrations de position ALiBi au lieu de vecteurs de position appris, ce qui l'aide à extrapoler à des séquences plus longues que celles observées lors de la formation. Il applique également une normalisation de couche d'intégration qui a amélioré la stabilité de la formation à grande échelle. Le corpus multilingue ROOTS a été soigneusement assemblé et documenté afin que la combinaison de langues et les sources de données soient transparentes et vérifiables, une rupture délibérée avec les ensembles de données opaques récupérés.
Impact stratégique
Stratégie du fournisseur
Les feuilles de route des fournisseurs influencent les fonctionnalités que votre équipe peut ensuite créer.
Coût et budget
Les conditions commerciales et les options de déploiement affectent les coûts et les risques à long terme.
Risques et sécurité
Les incitations des entreprises façonnent les défauts des produits, la posture de sécurité et l’ouverture.
L'avenir de BigScience et le modèle BLOOM
BigScience a démontré qu’une IA à grande échelle et ouvertement gouvernée est possible, et son modèle a influencé les versions ouvertes ultérieures et la poussée plus large en faveur de la transparence. Les futurs travaux multilingues s’appuieront probablement sur les enseignements tirés de la documentation des données et de la couverture linguistique inclusive, tandis que des modèles plus récents et plus efficaces ont surpassé BLOOM en termes de capacité brute. Son héritage durable est la norme de publication de cartes modèles, de déclarations de données et de licences responsables, ainsi que la preuve que l'informatique publique peut former des modèles à l'échelle frontière.
Mise en œuvre dans le monde réel
Générer et compléter du texte dans des dizaines de langues, y compris celles mal desservies par les modèles commerciaux
Servir de base de recherche ouverte pour étudier les biais, le transfert multilingue et le comportement de mise à l'échelle
Optimisation des variantes spécifiques à une tâche ou suivant des instructions, telles que BLOOMZ pour les communautés non anglophones
Fournir un modèle entièrement documenté aux universitaires qui étudient la provenance des données de formation et les licences responsables en matière d'IA
Risques et garde-fous
Les annonces de lancement peuvent dépasser la stabilité des flux de production réels.
La tarification des API ou les changements de politique peuvent briser les hypothèses du jour au lendemain.
La dépendance à un seul fournisseur augmente les coûts de verrouillage et de migration.
Feuille de route de mise en œuvre
Évaluez les fournisseurs à l’aide de vos propres tâches et ensembles de données.
Vérifiez les conditions de confidentialité, de sécurité et juridiques avant l’intégration.
Maintenez un plan de secours entre les modèles ou les fournisseurs.
Surveillez les notes de version afin que les modifications de la feuille de route ne surprennent pas les équipes.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the BigScience and the BLOOM Model quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Modèles de code à contexte long Magic AI
Questions fréquemment posées
What is BigScience and the BLOOM Model?
BigScience était une collaboration de recherche ouverte d'un an rassemblant plus de 1 000 chercheurs qui ont produit BLOOM, l'un des premiers grands modèles de langage véritablement multilingues et ouvertement publiés. Il s’agit d’un jalon dans l’IA transparente et axée sur la communauté, construite en dehors des grandes technologies.
Quel était l'objectif principal du modèle BLOOM par rapport aux modèles de taille similaire de l'époque ?
BLOOM a été conçu pour être véritablement multilingue et a été publié ouvertement avec une documentation complète, contrairement aux modèles fermés d'échelle comparable.
Combien de paramètres environ possède BLOOM ?
BLOOM est un modèle de 176 milliards de paramètres, ce qui le place à une échelle similaire à celle de GPT-3.
Pour combien de langues naturelles BLOOM a-t-il été formé ?
Le corpus de formation ROOTS de BLOOM couvrait 46 langages naturels ainsi que 13 langages de programmation.
Quelle organisation a coordonné la collaboration BigScience ?
Hugging Face a coordonné BigScience, un atelier réunissant plus de 1 000 chercheurs bénévoles.
Où BLOOM a-t-il été formé ?
BLOOM a été formé sur le supercalculateur Jean Zay en France, démontrant que l'informatique publique pouvait former un modèle à l'échelle frontière.