Als nächstesNächster Leitfaden
Magic AI-Langkontext-Codemodelle
Unternehmen
Leitfaden für Unternehmen
BigScience war eine einjährige offene Forschungskooperation von über 1.000 Forschern, die BLOOM hervorbrachte, eines der ersten wirklich mehrsprachigen, offen veröffentlichten großen Sprachmodelle.
It matters as a landmark in transparent, community-driven AI built outside Big Tech.
BigScience war ein einjähriger Forschungsworkshop von 2021 bis 2022, der von Hugging Face koordiniert wurde und mehr als 1.000 freiwillige Forscher aus über 60 Ländern und 250 Institutionen zusammenbrachte. Die im Juli 2022 veröffentlichte Hauptausgabe war BLOOM, ein autoregressives Sprachmodell mit 176 Milliarden Parametern. BLOOM war bewusst mehrsprachig und auf dem ROOTS-Korpus geschult, der 46 natürliche Sprachen und 13 Programmiersprachen abdeckt, wobei unterrepräsentierte Sprachen wie mehrere afrikanische und südasiatische Sprachen stark vertreten sind. Das Training lief mehrere Monate lang auf dem öffentlich finanzierten Supercomputer Jean Zay in Frankreich mit rund 384 GPUs. BLOOM wurde unter der Responsible AI-Lizenz mit vollständiger Dokumentation seiner Daten, Schulungen und beabsichtigten Verwendungszwecke veröffentlicht, was in scharfem Kontrast zur geschlossenen Entwicklung vergleichbarer Modelle steht.
Anbieter-Roadmaps beeinflussen, welche Funktionen Ihr Team als Nächstes entwickeln kann.
Kommerzielle Bedingungen und Bereitstellungsoptionen wirken sich auf die langfristigen Kosten und Risiken aus.
Unternehmensanreize prägen Produktstandards, Sicherheitslage und Offenheit.
BigScience hat gezeigt, dass groß angelegte, offen gesteuerte KI möglich ist, und sein Modell beeinflusste spätere offene Veröffentlichungen und das breitere Streben nach Transparenz. Zukünftige mehrsprachige Arbeiten werden wahrscheinlich auf den Lehren aus der Datendokumentation und der umfassenden Sprachabdeckung aufbauen, während neuere, effizientere Modelle BLOOM in Bezug auf die Rohleistung übertroffen haben. Sein bleibendes Erbe ist die Norm der Veröffentlichung von Modellkarten, Datenerklärungen und verantwortungsvollen Lizenzen sowie der Beweis, dass öffentliche Computer Modelle im Grenzmaßstab trainieren können.
Generieren und Vervollständigen von Texten in Dutzenden von Sprachen, auch solchen, die von kommerziellen Modellen nicht abgedeckt werden
Dient als offene Forschungsgrundlage für die Untersuchung von Voreingenommenheit, mehrsprachigem Transfer und Skalierungsverhalten
Feinabstimmung auf aufgabenspezifische oder anweisungenfolgende Varianten wie BLOOMZ für nicht-englische Communities
Bereitstellung eines vollständig dokumentierten Modells für Akademiker, die sich mit der Herkunft von Trainingsdaten und der verantwortungsvollen KI-Lizenzierung befassen
Markteinführungsankündigungen können die Stabilität realer Produktionsabläufe übertreffen.
API-Preise oder Richtlinienänderungen können Annahmen über Nacht zunichte machen.
Die Abhängigkeit von einem einzigen Anbieter erhöht die Bindungs- und Migrationskosten.
Bewerten Sie Anbieter anhand Ihrer eigenen Aufgaben und Datensätze.
Lesen Sie vor der Integration Datenschutz, Sicherheit und rechtliche Bestimmungen.
Pflegen Sie einen Fallback-Plan für alle Modelle oder Anbieter.
Überwachen Sie die Versionshinweise, damit Roadmap-Änderungen die Teams nicht überraschen.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
BigScience war eine einjährige offene Forschungskooperation von über 1.000 Forschern, die BLOOM hervorbrachte, eines der ersten wirklich mehrsprachigen, offen veröffentlichten großen Sprachmodelle. Es ist ein Meilenstein für transparente, gemeinschaftsgesteuerte KI, die außerhalb von Big Tech entwickelt wurde.
BLOOM wurde als echte Mehrsprachigkeit konzipiert und im Gegensatz zu geschlossenen Modellen vergleichbaren Umfangs offen mit vollständiger Dokumentation veröffentlicht.
BLOOM ist ein Modell mit 176 Milliarden Parametern und liegt damit in einer ähnlichen Größenordnung wie GPT-3.
Das ROOTS-Schulungskorpus von BLOOM umfasste 46 natürliche Sprachen sowie 13 Programmiersprachen.
Hugging Face koordinierte BigScience, einen Workshop mit mehr als 1.000 freiwilligen Forschern.
BLOOM wurde auf dem Jean-Zay-Supercomputer in Frankreich trainiert und zeigte, dass öffentliche Computer ein Modell im Grenzmaßstab trainieren können.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Magic AI-Langkontext-Codemodelle
Unternehmen