Mwongozo wa AI unaoonekana

Imagen Maandishi-kwa-Picha

Imagen ni mfumo wa Google wa kubadilisha maandishi hadi picha ambao hubadilisha maelezo yaliyoandikwa kuwa picha halisi.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

Its headline finding was that a large frozen language model, not a bigger image network, was the biggest driver of quality.

Dive ya kina

Iliyotangazwa na Google Utafiti wa 2022, Imagen ilionyesha kuwa kuelewa kwa kina kidokezo ni muhimu kama vile kuchora vizuri. Badala ya kisimbaji cha maandishi cha mtindo wa CLIP, Imagen hutumia kisimbaji kikubwa cha maandishi kilichozoezwa awali (T5-XXL) ambacho huwekwa kisisonge, kisha hulisha upachikaji huo wa lugha tajiri katika muundo wa usambaaji. Hutoa taswira ndogo ya 64x64 na hutumia hatua mbili za uenezaji wa azimio kuu ili kuongeza kiwango hadi 1024x1024. Timu pia ilianzisha 'kizingiti kinachobadilika' ili kuweka rangi thabiti katika uelekezi wa hali ya juu, na ikaunda DrawBench, alama ya kipimo cha majaribio ya vishawishi, mahusiano ya anga na michanganyiko adimu. Matoleo ya baadaye, Imagen 2 na Imagen 3, maelezo yaliyoboreshwa, uwasilishaji wa maandishi, na uaminifu wa haraka, na sasa tumia zana za picha za Google.

Ufahamu wa Kiufundi

Chaguo bora la Imagen ni kuongeza kisimbaji maandishi badala ya jenereta ya picha. T5-XXL, iliyofunzwa kwenye maandishi pekee, hutoa upachikaji ambao unanasa lugha potofu, na watafiti waligundua kuwa kuikuza kuliboresha upatanishi wa maandishi-picha zaidi ya kupanua muundo wa usambaaji. Kizazi kimepunguzwa: muundo wa uenezaji wa msingi hutengeneza picha ya mwonekano wa chini, kisha miundo ya uenezaji wa azimio bora zaidi huiinua hatua kwa hatua, ikiwa na thamani za pikseli zinazobana kizingiti ili kuepuka matokeo yasiyosafishwa chini ya uelekezi thabiti.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Maandishi ya Imagen-hadi-Picha

Ukoo wa Imagen unaelekea kwenye uwasilishaji bora wa maandishi ndani ya picha, kufuata kwa haraka kwa matukio changamano, na sampuli za haraka zaidi. Tarajia muunganisho wa kina na miundo ya lugha ili mfumo 'usababu' kuhusu ombi kabla ya kuchora, pamoja na uangazishaji thabiti zaidi kama SynthID kwa utangulizi. Inapojumuisha katika bidhaa za Google na Gemini mfumo wa ikolojia, mwelekeo huhamia kwenye kizazi cha kuaminika, salama na kinachoweza kudhibitiwa badala ya ubunifu mbichi.

Utekelezaji wa Ulimwengu Halisi

Inazalisha taswira za uuzaji zenye picha halisi kutoka kwa muhtasari ulioandikwa bila upigaji picha

Kuunda vielelezo vya dhana vya kusimulia hadithi au vitabu vya watoto kutoka kwa sentensi zenye maelezo

Kutengeneza nakala za bidhaa na tofauti za matukio kwa uorodheshaji wa biashara ya mtandaoni

Kuangazia mawazo ya kisayansi au kielimu, kama utafsiri wa msanii unaofafanuliwa kwa lugha rahisi

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen Text-to-Image quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Imagen 2 na Usambazaji Ulioboreshwa kwa Zawadi

Maswali yanayoulizwa mara kwa mara

What is Imagen Text-to-Image?

Imagen ni mfumo wa Google wa kubadilisha maandishi hadi picha ambao hubadilisha maelezo yaliyoandikwa kuwa picha halisi. Ugunduzi wake wa kichwa ulikuwa kwamba modeli kubwa ya lugha iliyogandishwa, sio mtandao mkubwa wa picha, ilikuwa kiendeshaji kikubwa zaidi cha ubora.

Je, ni ugunduzi gani wenye ushawishi mkubwa wa Imagen?

Imagen ilionyesha kuwa kuongeza uelewaji wa lugha kupitia T5-XXL kuliboresha matokeo zaidi ya kuongeza muundo wa usambaaji.

Imagen inategemea kisimba gani cha maandishi?

Imagen hutumia programu kubwa ya kusimba ya T5-XXL iliyofunzwa maandishi pekee, iliyohifadhiwa wakati wa mafunzo.

Imagen inafikia vipi azimio la juu?

Hutoa taswira ya 64x64 kisha huongeza viwango vya juu kupitia miundo ya uenezaji wa azimio bora hadi 1024x1024.

'Kizingiti chenye nguvu' kinatumika kwa nini katika Imagen?

Kizingiti chenye nguvu kinabana thamani za pikseli ili uelekezi wa juu usitoe picha ambazo zimeboreshwa.

DrawBench ni nini?

DrawBench ni alama Google iliyoletwa na Imagen ili kuhesabu majaribio, mahusiano ya anga na vidokezo adimu.