GHID AI limbaj

Încorporarea contextuală ELMo

ELMo (Embeddings from Language Models) a fost o descoperire din 2018 care a oferit fiecărui cuvânt o reprezentare modelată de propoziția sa, astfel încât „bank” în „river bank” diferă de „bank” în „savings bank”. A marcat trecerea de la vectorii de cuvinte statici la NLP conștient de context.

2 minute de lecturăUltima actualizare

Scufundare în profunzime

ELMo, introdus de Institutul Allen pentru cercetătorii AI (Peters et al., 2018), produce reprezentări de cuvinte prin rularea unei propoziții printr-un model de limbaj LSTM bidirecțional profund antrenat pe un corpus de miliarde de cuvinte. Spre deosebire de Word2Vec sau GloVe, care atribuie un vector fix pe cuvânt, ELMo calculează un vector nou pentru fiecare apariție pe baza contextului înconjurător. În mod crucial, ELMo combină toate straturile interne LSTM prin greutăți învățate, specifice sarcinii, mai degrabă decât să folosească doar stratul superior. Straturile inferioare tind să capteze sintaxa (parte de vorbire, structură), în timp ce straturile superioare captează semantica și sensul cuvintelor. Adăugarea ELMo la modelele existente a produs câștiguri mari în șase sarcini de referință, inclusiv răspunsul la întrebări, analiza sentimentelor și recunoașterea entităților numite.

Perspectivă tehnică

ELMo stivuiește două LSTM-uri: un model de limbaj înainte care prezice cuvântul următor și unul înapoi care prezice cuvântul anterior, fiecare prin intrări CNN la nivel de caracter (deci se ocupă de cuvintele nevăzute). Pentru o sarcină în aval, ELMo restrânge reprezentările stratului folosind greutăți normalizate softmax plus un scalar, toate învățate în timpul reglajului fin. Aceasta înseamnă că fiecare sarcină poate decide cât de mult semnal sintactic versus semantic dorește de la biLM preantrenat înghețat.

Impact strategic

Viteză și scară

Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.

Acces și acoperire

Extinde accesul în diferite limbi și stiluri de comunicare.

Decizii mai clare

Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.

Viitorul înglobărilor contextuale ELMo

Ideea de bază a ELMo, reprezentările contextuale din preinstruirea modelului de limbaj, a devenit fundamentală, dar arhitectura sa recurentă LSTM a fost rapid eclipsată de modelele bazate pe Transformer precum BERT la sfârșitul anului 2018, care citeau propoziții întregi în paralel și scalau mult mai bine. Astăzi, ELMo are o importanță istorică și educațională în mare parte, deși gestionarea intrărilor de caractere CNN și ideile de ponderare a straturilor încă influențează munca de încorporare specializată în limbi cu resurse reduse și bogate din punct de vedere morfologic.

Implementare în lumea reală

Îmbunătățirea sistemelor de recunoaștere a entităților numite care trebuie să spună dacă „Washington” se referă la o persoană, un stat sau un oraș pe baza cuvintelor din jur

Îmbunătățirea analizei sentimentelor prin captarea faptului că „bolnav” înseamnă negativ în „Mă simt rău”, dar pozitiv în argou „ce e bolnav”

Îmbunătățirea sistemelor de răspuns la întrebări pe benchmark-ul SQuAD prin introducerea de vectori token sensibili la context în cititor

Sensurile cuvintelor dezambiguizate în traducerea automată, astfel încât cuvintele poliseme precum „plantă” se traduc corect în contextul dat

Riscuri și balustrade

Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.

Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.

Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.

Foaia de parcurs de implementare

1

Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.

2

Răspunsurile la sol cu ​​surse de încredere ori de câte ori acuratețea contează.

3

Păstrați un punct de control uman pentru rezultate cu mize mari.

4

Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ELMo Contextual Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Înglobare de cuvinte

Întrebări frecvente

What is ELMo Contextual Embeddings?

ELMo (Embeddings from Language Models) a fost o descoperire din 2018 care a oferit fiecărui cuvânt o reprezentare modelată de propoziția sa, astfel încât „bank” în „river bank” diferă de „bank” în „savings bank”. A marcat trecerea de la vectorii de cuvinte statici la NLP conștient de context.

Care este diferența cheie dintre ELMo și înglobările anterioare precum Word2Vec?

ELMo produce înglobări contextuale: vectorul unui cuvânt se modifică pe baza propoziției din jur, spre deosebire de vectorul fix unic pe cuvânt al Word2Vec.

Ce arhitectură neuronală folosește ELMo pentru a citi text?

ELMo este construit pe un LSTM bidirecțional profund antrenat ca model de limbaj, procesând secvențe în mod recurent.

Cum își combină ELMo straturile interne pentru o sarcină în aval?

ELMo învață greutăți normalizate softmax specifice sarcinii pentru a combina toate straturile biLM, permițând fiecărei sarcini să accentueze sintaxa sau semantica după cum este necesar.

Ce folosește ELMo ca unități de intrare pentru a gestiona cuvintele nevăzute?

ELMo creează intrări de cuvinte de la un CNN la nivel de caracter, astfel încât să poată reprezenta cuvinte pe care nu le-a văzut niciodată în timpul antrenamentului.

Aproximativ când a fost introdus ELMo și de către cine?

ELMo a fost publicat în 2018 de Peters et al. la Institutul Allen pentru IA (AI2).