Visuell AI GUIDE

DALL-E

DALL-E er OpenAIs familie av tekst-til-bilde-modeller som gjør en skriftlig beskrivelse til et originalt bilde.

2 min lesingSist oppdatert

Oversikt

It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.

Dypdykk

DALL-E ble lansert i januar 2021, og genererer bilder fra tekst ved å forutsi bildetokens én om gangen, som en språkmodell for piksler. DALL-E 2 (2022) byttet til en diffusjonstilnærming styrt av CLIP-innbygginger, og ga skarpere, mer fotorealistiske resultater. DALL-E 3 (oktober 2023) strammet opp forespørselen og er innebygd i ChatGPT, slik at chatboten kan skrive om den grove forespørselen din til en rikt detaljert forespørsel før den genererer. En fremtredende forbedring er å gjengi lesbar tekst i bilder, som skilt og etiketter, som tidligere modeller forvansket. DALL-E støtter også inpainting (redigering av deler av et bilde) og outpainting (utvider det utover dets opprinnelige grenser). Den produserer flere variasjoner fra en enkelt forespørsel, og hjelper brukerne med å utforske kreative alternativer raskt.

Teknisk innsikt

DALL-E 3 er en diffusjonsmodell: den starter fra tilfeldig støy og fjerner den trinn for trinn, styrt på hvert trinn av en koding av tekstmeldingen din, til et sammenhengende bilde dukker opp. Den trener på enorme sett med bildetekstpar, og lærer hvordan ord kartlegges til visuelle funksjoner, romlige arrangementer og stiler. Et nøkkeltriks er forbedrede bildetekster under trening pluss en språkmodell som utvider den korte forespørselen din til en detaljert, og det er grunnen til at DALL-E 3 følger instruksjonene langt mer trofast enn sine forgjengere.

Strategisk innvirkning

Speed and scale

Visual AI kan automatisere inspeksjons-, deteksjons- og merkeoppgaver i stor skala.

Build choices

Kreative team kan prototype konsepter raskere med færre manuelle revisjoner.

Team and workflow

Operasjoner kan bruke bilde- og videosignaler som tidligere var vanskelige å behandle.

Fremtiden til DALL-E

DALL-Es avstamning brettes inn i bredere, multimodale systemer der én modell håndterer tekst, bilder og redigeringer sammen i stedet for som et separat verktøy. Forvent strammere samtaleredigering ("gjør himmelen oransje, behold alt annet"), bedre tekstgjengivelse og høyere oppløsning. Herkomstsignaler som C2PA-metadata og vannmerking vil bli standard for å flagge AI-genererte bilder. Konkurranse fra modellene til Midjourney, Stable Diffusion og Google fører til raske kvalitetsgevinster, mens debatter om opplæringsdata, artistsamtykke og opphavsrett vil fortsette å forme hva disse systemene har lov til å lære av.

Real-World Implementering

En blogger genererer en egendefinert overskriftsillustrasjon for en artikkel i stedet for å søke i arkivfotobiblioteker

En lærer lager enkle diagrammer med bildetekst for å forklare et naturvitenskapelig konsept for unge elever

En liten bedrift gjør narr av flere logo- og emballasjekonsepter før de ansetter en designer for å foredle en

En spilldesigner produserer raskt konseptkunst for karakterer og miljøer for å pitche en idé

Risikoer og rekkverk

Bilderettigheter og samtykke kan bli juridiske risikoer hvis herkomst er uklart.

Modellytelsen kan variere på tvers av belysning, demografi og miljøer.

Falske positive kan forbli ubemerket med mindre konfidensgrenser overvåkes.

Veikart for implementering

1

Definer akseptkriterier for presisjons-, tilbakekallings- og feilkostnader.

2

Test med data som samsvarer med reelle produksjonsforhold.

3

Legg til menneskelig vurdering for spådommer med lav selvtillit eller stor innvirkning.

4

Spor modelldrift og revalider etter endringer i kamera eller datasett.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DALL-E quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Nevrale utstrålingsfelt

Ofte stilte spørsmål

What is DALL-E?

DALL-E er OpenAIs familie av tekst-til-bilde-modeller som gjør en skriftlig beskrivelse til et originalt bilde. Det gjorde "skriv en setning, få et bilde" til en mainstream-ide og presset bildegenerering fra forskningsdemoer inn i hverdagsverktøy.

Hva gjør DALL-E 3 primært?

DALL-E er et tekst-til-bilde-system: du beskriver en scene med ord, og den produserer et nytt bilde som matcher den beskrivelsen.

Hvilken underliggende teknikk bruker DALL-E 3 for å lage et bilde?

DALL-E 3 er en diffusjonsmodell som starter fra tilfeldig støy og foredler den trinn for trinn, styrt av spørsmålet ditt, til et sammenhengende bilde.

Hvorfor følger DALL-E 3 instruksjonene bedre når den brukes i ChatGPT?

I ChatGPT omskriver språkmodellen en kort forespørsel til en fyldigere, mer spesifikk melding, og forbedrer hvor trofast bildet samsvarer med det du ønsket.

Hva er en bemerkelsesverdig forbedring av DALL-E 3 i forhold til tidligere versjoner?

Tidligere modeller forvansket tekst i bildet, men DALL-E 3 kan gjengi leselige ord på skilt, etiketter og plakater mye mer pålitelig.

Hva lar 'inpainting' deg gjøre med et DALL-E-bilde?

Inpainting redigerer en valgt del av et bilde (for eksempel bytting av et objekt) mens området rundt forblir intakt.