Език AI РЪКОВОДСТВО

Моделиране на маскиран език

Моделирането на маскиран език учи AI да попълва умишлено скрити думи, използвайки пълния заобикалящ контекст, както отляво, така и отдясно.

2 min readПоследна актуализация

Преглед

It's the training trick behind BERT and the reason models can deeply understand sentence meaning rather than just predict what comes next.

Дълбоко гмуркане

При маскираното езиково моделиране (MLM) вие вземате изречение, скривате произволно около 15% от неговите токени със специален символ [MASK] и обучавате модела да отгатва оригиналите. Тъй като моделът вижда думи от двете страни на всяко празно място, той изгражда двупосочно разбиране на контекста. BERT, въведен от Google през 2018 г., популяризира това. Умен детайл: от маскираните позиции приблизително 80% стават [МАСКА], 10% се разменят с произволна дума и 10% остават непроменени. Това не позволява на модела да очаква само [MASK] токен по време на прогнозиране и налага устойчивост. След това предварително обучение моделът се настройва фино за задачи като класифициране, отговаряне на въпроси и разпознаване на именуван обект.

Техническа информация

MLM използва енкодер Transformer с двупосочно самонасочване, така че всеки токен се грижи за всички останали едновременно. Загубата се изчислява само върху маскираните позиции, като се използва кръстосана ентропия спрямо истинските идентификатори на токени. Тъй като вниманието не е причинно-следствено (без бъдещо маскиране), представянето за всяка дума слива левия и десния контекст в един плътен вектор. Тази двупосочност е точно това, от което следващите токени модели се отказват за способността да генерират.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на моделирането на маскиран език

Чистият MLM е частично засенчен от генеративните декодиращи модели за чатботове, но остава доминиращ за вграждане, извличане и класифициране, където разбирането побеждава генерирането. Варианти като RoBERTa, откриването на заменени токени на ELECTRA и DeBERTa продължават да настояват за точност и ефективност. Очаквайте енкодерите в стил MLM да останат централни за търсенето, семантичното сходство и като леки компоненти в по-големи мултимодални системи с разширение за извличане, където бързото, дълбоко разбиране е по-важно от текста в свободна форма.

Внедряване в реалния свят

Захранване на BERT-базирано разбиране на Google Търсене на разговорни заявки за връщане на по-подходящи страници.

Генериране на вградени изречения за системи за семантично търсене и извличане на документи.

Фина настройка на BERT за анализ на настроението при прегледи на продукти или билети за поддръжка.

Разпознаване на именуван субект, което извлича хора, организации и дати от юридически или медицински текст.

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Language Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Езиково моделиране

Frequently asked questions

What is Masked Language Modeling?

Моделирането на маскиран език учи AI да попълва умишлено скрити думи, използвайки пълния заобикалящ контекст, както отляво, така и отдясно. Това е тренировъчният трик зад BERT и причината, поради която моделите могат да разберат дълбоко значението на изречението, вместо просто да предсказват какво следва.

Каква е основната задача за обучение в моделирането на маскиран език?

MLM скрива част от токените и обучава модела да ги възстановява, като използва както ляв, така и десен контекст.

Приблизително какъв процент токени BERT обикновено маскира по време на предварителното обучение?

BERT маскира приблизително 15% от входните токени, баланс между даване на достатъчно сигнал и оставяне на достатъчно контекст.

Защо MLM дава модел на двупосочно разбиране?

Кодерът на Transformer използва непричинно самовнимание, така че всеки жетон може да вижда всички останали от двете страни.

В схемата за маскиране на BERT какво се случва с около 10% от избраните позиции, вместо да станат [МАСКА]?

За да се подобри устойчивостта, 10% от маскираните позиции се разменят с произволен жетон и 10% остават непроменени.

На кои позиции се изчислява загубата на MLM?

Загубата на кръстосана ентропия се прилага само към маскираните позиции, сравнявайки прогнозите с оригиналните идентификатори на токени.