BedriftsGUIDE

LAION og åpne datasett

LAION er en tysk ideell organisasjon som ga ut massive åpne bildetekst-datasett, mest kjent LAION-5B, som drev opplæring av åpne generative modeller som Stable Diffusion.

2 min lesingSist oppdatert

Oversikt

It matters because it made web-scale multimodal data freely available to researchers outside large corporations.

Dypdykk

LAION (Large-scale Artificial Intelligence Open Network) er en tysk ideell organisasjon grunnlagt i 2021 for å demokratisere forskning på maskinlæring ved å gi ut store åpne datasett. Den mest kjente utgivelsen, LAION-5B, inneholder omtrent 5,85 milliarder bilde-tekst-par filtrert fra Common Crawl-nettdata ved å bruke OpenAIs CLIP-modell for å holde parene der bildeteksten og bildet stemmer overens. Avgjørende er at LAION ikke er vert for bildene selv; den distribuerer URL-er og metadata, slik at brukere laster ned bilder fra de originale nettkildene. Disse datasettene var medvirkende til å trene stabil diffusjon og andre åpne tekst-til-bilde-modeller. LAION har møtt alvorlig gransking: I 2023 fant forskere koblinger til ulovlige misbruksbilder i datasettet, noe som fikk LAION til å ta det ned, rense det og gi ut en sikrere versjon på nytt, og fremheve risikoen for ufiltrert skraping på nettskala.

Teknisk innsikt

LAION-5B ble bygget ved å skanne Common Crawl for HTML-bildekoder med alt-tekst, og deretter bruke CLIP for å beregne likheten mellom hvert bilde og dets bildetekst. Par under en cosinus-likhetsterskel ble forkastet, så bare rimelig samsvarende bilde-tekst-par gjensto. Datasettet er delt etter språk og inkluderer forhåndsberegnet CLIP-innbygging, som muliggjør raskt likhetssøk. Fordi bare URL-er lagres, reduserer koblingsråte gradvis reproduserbarheten over tid.

Strategisk innvirkning

Vendor strategy

Leverandørveikart påvirker hvilke funksjoner teamet ditt kan bygge videre.

Cost and budget

Kommersielle vilkår og distribusjonsalternativer påvirker langsiktige kostnader og risiko.

Risiko og sikkerhet

Selskapets insentiver former produktstandarder, sikkerhetsstilling og åpenhet.

Fremtiden til LAION og åpne datasett

Åpne multimodale datasett vil møte økende press rundt opphavsrett, samtykke og skadelig innhold, og presser mot sterkere filtrering, lisensieringsbevisste innsamling og bortvalgsregistre. LAIONs gjenutgivelse av et renset datasett signaliserer et skifte mot sikkerhetsrevisjon som standardtrinn. Forvent mer syntetiske eller lisensierte data, herkomststandarder og deteksjonsverktøy. Spenningen mellom åpen tilgang for små laboratorier og de juridiske og etiske risikoene ved nettskrapte data vil definere neste fase av datasettbygging.

Real-World Implementering

Trene åpne tekst-til-bilde-modeller som Stable Diffusion på milliarder av bildetekst-par

Bygging og benchmarking CLIP-stil bilde-tekst henting og null-shot klassifiseringssystemer

Undersøker datasettskjevhet, innholdssikkerhet og dataopprinnelse i nettskala

Filtrering av delsett etter språk, oppløsning eller estetisk poengsum for å lage spesialiserte finjusteringsdatasett

Risikoer og rekkverk

Lanseringskunngjøringer kan overgå stabiliteten i ekte produksjonsarbeidsflyter.

API-priser eller endringer i retningslinjene kan bryte antagelser over natten.

Avhengighet av én leverandør øker kostnadene for innlåsing og migrering.

Veikart for implementering

1

Evaluer leverandører ved å bruke dine egne oppgaver og datasett.

2

Se gjennom personvern, sikkerhet og juridiske vilkår før integrering.

3

Oppretthold en reserveplan på tvers av modeller eller leverandører.

4

Overvåk utgivelsesnotater slik at endringer i veikart ikke overrasker teamene.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the LAION and Open Datasets quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ofte stilte spørsmål

What is LAION and Open Datasets?

LAION er en tysk ideell organisasjon som ga ut massive åpne bildetekst-datasett, mest kjent LAION-5B, som drev opplæring av åpne generative modeller som Stable Diffusion. Det betyr noe fordi det gjorde web-skala multimodale data fritt tilgjengelig for forskere utenfor store selskaper.

Hva distribuerer LAION primært i sine bilde-tekstdatasett?

LAION er ikke vert for bilder; den distribuerer URL-er og metadata, slik at brukere henter bilder fra sine originale nettkilder.

Omtrent hvor mange bilde-tekst-par er det i LAION-5B?

LAION-5B inneholder omtrent 5,85 milliarder bilde-tekst-par, derav '5B' i navnet.

Hvilken modell brukte LAION for å filtrere bilde-tekst-par for justering av kvalitet?

LAION brukte OpenAIs CLIP for å måle bildetekstlikhet og forkaste dårlig samsvarende par.

Hvilken fremtredende åpen generativ modell ble trent ved å bruke LAION-data?

Stable Diffusion, en åpen tekst-til-bilde-modell, ble trent på LAION bilde-tekst-data.

Hvilket alvorlig problem oppdaget forskere i LAION-5B i 2023?

Forskere fant koblinger til ulovlig barnemishandlingsmateriale, noe som førte til at LAION tok ned datasettet, renset det og utgav en sikrere versjon på nytt.