ELMo контекстни вграждания
ELMo (Embeddings from Language Models) беше пробив от 2018 г., който даде на всяка дума представяне, оформено от нейното изречение, така че „банка“ в „речен бряг“ се различава от „банка“ в „спестовна банка“. Той отбеляза преминаването от статични вектори на думи към контекстно-зависимо НЛП.
Дълбоко гмуркане
ELMo, въведен от Allen Institute за изследователи на AI (Peters et al., 2018), създава представяния на думи чрез изпълнение на изречение през дълбок двупосочен езиков модел LSTM, обучен върху корпус от милиард думи. За разлика от Word2Vec или GloVe, които присвояват един фиксиран вектор на дума, ELMo изчислява нов вектор за всяко събитие въз основа на заобикалящия контекст. Най-важното е, че ELMo комбинира всички вътрешни LSTM слоеве чрез научени, специфични за задачата тегла, вместо да използва само горния слой. По-ниските слоеве са склонни да улавят синтаксиса (част от речта, структура), докато по-високите слоеве улавят семантиката и смисъла на думата. Добавянето на ELMo към съществуващите модели доведе до големи печалби в шест сравнителни задачи, включително отговаряне на въпроси, анализ на настроението и разпознаване на именуван обект.
Техническа информация
ELMo подрежда два LSTM: преден езиков модел, предсказващ следващата дума, и обратен, предсказващ предходната дума, всеки върху входове на CNN на ниво символ (така че обработва невидими думи). За задача надолу по веригата ELMo свива представянията на слоевете, използвайки softmax-нормализирани тегла плюс скалар, всички научени по време на фина настройка. Това означава, че всяка задача може да реши колко синтактичен спрямо семантичен сигнал иска от замразения предварително обучен biLM.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на контекстните вграждания на ELMo
Основната идея на ELMo, контекстуалните представяния от предварителното обучение на езиковия модел, стана основополагаща, но нейната повтаряща се LSTM архитектура бързо беше засенчена от базирани на Transformer модели като BERT в края на 2018 г., които четат цели изречения паралелно и се мащабират много по-добре. Днес ELMo има най-вече историческо и образователно значение, въпреки че обработката на CNN въвеждане на знаци и идеите за претегляне на слоевете все още влияят върху специализираната работа по вграждане в езици с ниски ресурси и морфологично богати.
Внедряване в реалния свят
Подобряване на системите за разпознаване на именувани обекти, които трябва да разберат дали „Вашингтон“ се отнася за лице, държава или град въз основа на околните думи
Повишаване на анализа на настроенията чрез улавяне, че „болен“ означава отрицателно в „Чувствам се болен“, но положително на жаргон „това е болно“
Подобряване на системите за отговаряне на въпроси в бенчмарка SQuAD чрез подаване на чувствителни към контекста токен вектори в четеца
Разграничаване на смисъла на думата при машинен превод, така че многозначните думи като „растение“ да се превеждат правилно в даден контекст
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the ELMo Contextual Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Вграждане на думи
Frequently asked questions
What is ELMo Contextual Embeddings?
ELMo (Embeddings from Language Models) беше пробив от 2018 г., който даде на всяка дума представяне, оформено от нейното изречение, така че „банка“ в „речен бряг“ се различава от „банка“ в „спестовна банка“. Той отбеляза преминаването от статични вектори на думи към контекстно-зависимо НЛП.
Каква е ключовата разлика между ELMo и по-ранните вграждания като Word2Vec?
ELMo произвежда контекстуални вграждания: векторът за една дума се променя на базата на заобикалящото изречение, за разлика от единичния фиксиран вектор на дума на Word2Vec.
Каква невронна архитектура използва ELMo за четене на текст?
ELMo е изграден върху дълбок двупосочен LSTM, обучен като езиков модел, обработващ последователности периодично.
Как ELMo комбинира своите вътрешни слоеве за задача надолу по веригата?
ELMo научава специфични за задачата softmax-нормализирани тегла, за да комбинира всички biLM слоеве, позволявайки на всяка задача да подчертае синтаксиса или семантиката според нуждите.
Какво използва ELMo като свои входни единици за обработка на невидими думи?
ELMo изгражда входни думи от CNN на ниво символ, така че може да представя думи, които никога не е виждал по време на обучение.
Приблизително кога беше представен ELMo и от кого?
ELMo е публикуван през 2018 г. от Peters et al. в Института Алън за ИИ (AI2).