VALL-E na Miundo ya Lugha ya Codec
VALL-E iliweka upya maandishi-kwa-hotuba kama tatizo la uundaji wa lugha juu ya tokeni za kodeki za sauti, kuwezesha ujumuishaji wa sauti kutoka sekunde tatu tu za sampuli.
Muhtasari
It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.
Dive ya kina
Iliyotangazwa na Microsoft mwanzoni mwa 2023, VALL-E inashughulikia usanisi wa matamshi kama vile uundaji wa lugha. Badala ya kutabiri spectrogram, inatabiri ishara za akustisk za kodeki ya neva (EnCodec), kwa hivyo kizazi kinakuwa utabiri wa ishara inayofuata juu ya msamiati wa sauti. Kwa kuzingatia rekodi ya sekunde 3 ya spika isiyoonekana pamoja na maandishi lengwa, VALL-E inaendelea kwa sauti ya mzungumzaji huyo, kuhifadhi sauti na hata mazingira ya akustisk. Ilifunzwa kwa takriban saa 60,000 za usemi, zaidi ya hifadhidata za kawaida za TTS, ambazo ziliipa uundaji thabiti wa sifuri. Kwa sababu tokeni za kodeki zimewekwa kwenye tabaka (kupitia RVQ), VALL-E hutumia hatua mbili: muundo wa kujiendesha hutabiri mtiririko wa kwanza, tokeni mbovu uliowekwa kwenye wasilisho, na modeli isiyo ya moja kwa moja hujaza tokeni za maelezo zilizosalia. Kichocheo hiki cha codec-LM kiliwahimiza warithi kama VALL-E 2 na miundo mingi ya msingi ya hotuba.
Ufahamu wa Kiufundi
Ujanja ni usimbaji mseto juu ya tokeni za kodeki za daraja la juu. Hatua ya autoregressive inatabiri tokeni muhimu zaidi za kitabu cha kwanza cha msimbo moja baada ya nyingine, ikinasa prosody na maudhui. Vitabu vya msimbo vilivyosalia, vinavyoongeza maelezo mazuri ya akustika, vinatabiriwa kwa sambamba na muundo usio wa sauti uliowekwa kwenye mtiririko wa kwanza na kidokezo cha spika. Mgawanyiko huu huweka ubora wa juu huku ukiepuka gharama ya kuzalisha kila tokeni kwa mfuatano, na kutumia kodeki humaanisha matamshi na maandishi yanaweza kuigwa kwa mashine sawa ya kibadilishaji.
Athari za kimkakati
Kufikia na kufikia
Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.
Cost and budget
Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.
Kasi na kiwango
Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.
Mustakabali wa Miundo ya Lugha ya VALL-E na Codec
Miundo ya lugha ya kodeki inaunganisha usemi na miundo mikubwa ya lugha, inayoelekeza kwenye mifumo iliyounganishwa inayosikiliza, kusababu na kuzungumza kwa mtindo mmoja. Tarajia uthabiti bora na vizalia vichache, kizazi cha utiririshaji katika wakati halisi, na udhibiti mkali wa hisia na mtindo. Uundaji sawa wa nguvu unaoifanya VALL-E kuwa muhimu kwa ufikivu na uandishi pia huongeza wasiwasi wa kina na wa idhini, kwa hivyo uwekaji alama, ulinzi wa uthibitishaji wa sauti, na mihimili ya sera inakuwa sehemu kuu ya jinsi mifumo hii inavyotumwa.
Utekelezaji wa Ulimwengu Halisi
Kuunganisha sauti kutoka kwa sekunde chache za sauti kwa wasaidizi maalum au zana za ufikivu ambazo hurejesha sauti iliyopotea
Kujanibisha na kubandika video katika lugha zingine huku ukiweka sauti ya mzungumzaji asilia
Inazalisha masimulizi ya kueleza, yanayolingana na muktadha ambayo huhifadhi mazingira ya sauti ya rekodi
Hutumika kama uti wa mgongo wa usemi katika visaidizi vya modi nyingi ambavyo vinaelewa na kutoa sauti inayotamkwa
Hatari & Walinzi
Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.
Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.
Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.
Ramani ya Utekelezaji
Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.
Jaribu ubora kwenye spika na hali mbalimbali za usuli.
Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.
Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VALL-E and Codec Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Uwezo wa Kuibuka wa Miundo Kubwa ya Lugha
Maswali yanayoulizwa mara kwa mara
What is VALL-E and Codec Language Models?
VALL-E ilibadilisha maandishi-kwa-hotuba kama tatizo la uundaji wa lugha juu ya tokeni za kodeki za sauti, kuwezesha ujumuishaji wa sauti kutoka sekunde tatu tu za sampuli. Ilionyesha kuwa utabiri ule ule unaofuata wa utabiri wa maandishi ya LLM unaweza kutoa usemi wa asili na wa kueleza.
Ni wazo gani la msingi linalotofautisha VALL-E na mifumo ya awali ya maandishi-hadi-hotuba?
VALL-E hubadilisha TTS kama ubashiri wa ishara inayofuata juu ya tokeni za kodeki za sauti, ikichukua ukuzaji wa matamshi kama muundo wa lugha.
Je, VALL-E inahitaji sauti ngapi ili kuunda sauti ya spika mpya?
VALL-E inaweza kufanya uundaji wa sauti isiyo na sifuri kutoka kwa takriban sampuli ya sekunde 3 ya spika isiyoonekana.
VALL-E hutumia kodeki gani ya neva ili kutoa tokeni zake za sauti?
VALL-E huunda kwenye EnCodec ya Meta, ikibashiri tokeni zake za akustika ili kusanisi usemi.
Kwa nini VALL-E hutumia hatua ya kujiendesha na isiyo ya kujiendesha?
Ishara za Codec ni za daraja kupitia RVQ; VALL-E hutabiri mtiririko wa kwanza korofi kiotomatiki na tokeni za maelezo zilizosalia sambamba kwa ufanisi.
Takriban ni data ngapi ya matamshi ambayo VALL-E ilifunzwa, kuwezesha uundaji thabiti wa sifuri?
VALL-E ilifunzwa kuhusu takriban saa 60,000 za usemi, zaidi ya hifadhidata za kawaida za TTS, ambazo zilikuza ujanibishaji wake usio na risasi.