РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Контекстные встраивания ELMo

ELMo (Embeddings from Language Models) стал прорывом 2018 года, который дал каждому слову представление, сформированное его предложением, поэтому «банк» в «береге реки» отличается от «банка» в «сберегательном банке». Это ознаменовало переход от статических векторов слов к контекстно-зависимому НЛП.

2 минуты чтенияПоследнее обновление

Глубокое погружение

ELMo, представленный Институтом исследователей искусственного интеллекта Аллена (Peters et al., 2018), создает словесные представления, пропуская предложение через глубокую двунаправленную языковую модель LSTM, обученную на корпусе из миллиарда слов. В отличие от Word2Vec или GloVe, которые присваивают каждому слову один фиксированный вектор, ELMo вычисляет новый вектор для каждого события на основе окружающего контекста. Важно отметить, что ELMo объединяет все внутренние уровни LSTM с помощью изученных весов для конкретных задач, а не использует только верхний уровень. Нижние уровни, как правило, фиксируют синтаксис (часть речи, структуру), тогда как более высокие уровни фиксируют семантику и смысл слов. Добавление ELMo к существующим моделям привело к значительным улучшениям в шести тестовых задачах, включая ответы на вопросы, анализ настроений и распознавание именованных объектов.

Техническая информация

ELMo объединяет два LSTM: прямую языковую модель, прогнозирующую следующее слово, и обратную модель, прогнозирующую предыдущее слово, каждая из которых использует входные данные CNN на уровне символов (поэтому она обрабатывает невидимые слова). Для последующей задачи ELMo сжимает представления слоев, используя веса, нормализованные по softmax, плюс скаляр, все полученные в ходе тонкой настройки. Это означает, что каждая задача может решить, какой объем синтаксического или семантического сигнала она хочет получить от замороженного предварительно обученного biLM.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее контекстных вложений ELMo

Основная идея ELMo — контекстные представления на основе предварительного обучения языковой модели — стала основополагающей, но в конце 2018 года ее рекуррентная архитектура LSTM быстро затмилась моделями на основе Transformer, такими как BERT, которые параллельно читают целые предложения и гораздо лучше масштабируются. Сегодня ELMo имеет в основном историческое и образовательное значение, хотя идеи обработки ввода символов CNN и взвешивания слоев по-прежнему влияют на специализированные работы по внедрению в языки с ограниченными ресурсами и морфологически богатыми.

Реальная реализация

Улучшение систем распознавания именованных объектов, которые должны определять, относится ли «Вашингтон» к человеку, штату или городу, на основе окружающих слов.

Повышение качества анализа настроений за счет определения того, что слово «больной» означает негативное в фразе «меня тошнит», но положительное в сленговом слове «это больно».

Улучшение системы вопросов-ответов на тесте SQuAD путем подачи контекстно-зависимых векторов токенов в считыватель.

Устранение неоднозначности значений слов в машинном переводе, чтобы многозначные слова, такие как «растение», правильно переводились в данном контексте.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ELMo Contextual Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Встраивание слов

Часто задаваемые вопросы

What is ELMo Contextual Embeddings?

ELMo (Embeddings from Language Models) стал прорывом 2018 года, который дал каждому слову представление, сформированное его предложением, поэтому «банк» в «береге реки» отличается от «банка» в «сберегательном банке». Это ознаменовало переход от статических векторов слов к контекстно-зависимому НЛП.

В чем ключевое различие между ELMo и более ранними версиями, такими как Word2Vec?

ELMo производит контекстуальные встраивания: вектор слова меняется в зависимости от окружающего предложения, в отличие от единственного фиксированного вектора Word2Vec для каждого слова.

Какую нейронную архитектуру использует ELMo для чтения текста?

ELMo построен на глубоком двунаправленном LSTM, обученном как языковая модель, периодически обрабатывающем последовательности.

Как ELMo объединяет свои внутренние уровни для решения последующих задач?

ELMo изучает нормализованные softmax веса для конкретных задач, чтобы объединить все уровни biLM, позволяя каждой задаче подчеркивать синтаксис или семантику по мере необходимости.

Что ELMo использует в качестве входных единиц для обработки невидимых слов?

ELMo создает входные слова из CNN уровня символов, поэтому он может представлять слова, которые он никогда не видел во время обучения.

Когда примерно был представлен ELMo и кем?

ELMo был опубликован в 2018 году Питерсом и др. в Институте ИИ Аллена (AI2).