XLNet пермутационно моделиране
XLNet съчетава двупосочния контекст на BERT с авторегресивното предсказване на GPT чрез обучение върху произволно подреждане на думи.
Преглед
This permutation trick lets it learn from all positions without ever masking tokens.
Дълбоко гмуркане
XLNet, въведен през 2019 г. от Carnegie Mellon и Google Brain, е проектиран да поправи недостатък в предварителното обучение в стил BERT. BERT маскира токените и ги прогнозира, но изкуственият символ [MASK] никога не се появява по време на фина настройка, създавайки несъответствие на влак/тест, и BERT приема, че маскираните токени са независими. XLNet вместо това използва „моделиране на пермутационен език“: той максимизира очакваната логаритмична вероятност за всички възможни подреждания на думите в последователност. Чрез прогнозиране на всеки токен, даден произволно подмножество от другите, моделът ефективно вижда двупосочен контекст, като същевременно остава правилен авторегресивен модел без маскиране. Изграден на базата на Transformer-XL за памет с голям обхват, XLNet превъзхожда BERT при около 20 задачи, включително отговаряне на въпроси, анализ на настроението и класиране на документи.
Техническа информация
XLNet физически не разбърква думите; той променя реда на факторизиране чрез маски за внимание, така че информацията за позицията се запазва. За да направи това да работи, той използва „внимание от два потока“: поток от съдържание, който кодира както токена, така и неговия контекст, и поток от заявки, който знае позицията на целта, но не и нейното съдържание, което позволява прогнозиране без изтичане на отговора. Повторението и относителното позиционно кодиране на Transformer-XL му осигуряват памет в дълги сегменти, подобрявайки работата с дълги документи.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на пермутационното моделиране на XLNet
XLNet беше влиятелно доказателство, че авторегресивните цели могат да уловят двупосочен контекст, замъглявайки разделението между BERT и GPT. Докато полето до голяма степен се консолидира около маскирани енкодери или големи авторегресивни декодери, идеята за пермутация на XLNet и повторението на Transformer-XL информира по-късна работа върху моделиране на дълъг контекст и унифицирани цели за предварително обучение. Неговите прозрения остават уместни, тъй като изследователите търсят архитектури, които комбинират силно контекстно моделиране с ефективно генериране без маска.
Внедряване в реалния свят
Постигане на най-добри резултати при бенчмаркове за отговаряне на въпроси като SQuAD
Справяне със задачи с дълги документи като RACE тест за четене и разбиране чрез Transformer-XL памет
Поддържа системи за класиране на документи и извличане на информация
Подобряване на класификацията на настроенията и категоризацията на текста спрямо базовите линии на BERT
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the XLNet Permutation Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Моделиране на теми
Frequently asked questions
What is XLNet Permutation Modeling?
XLNet съчетава двупосочния контекст на BERT с авторегресивното предсказване на GPT чрез обучение върху произволно подреждане на думи. Този трик за пермутация му позволява да се учи от всички позиции, без изобщо да маскира токени.
Каква цел за предварително обучение използва XLNet?
XLNet максимизира очакваната логаритмична вероятност за всички пермутации на реда на факторизиране на токените, наречено моделиране на пермутационен език.
За справяне с коя слабост на BERT XLNet е специално проектиран?
Изкуственият символ [MASK] на BERT никога не се появява по време на фина настройка и той третира маскираните прогнози като независими; XLNet избягва и двата проблема.
Какво разделя двупоточното самовнимание на XLNet?
Потокът от съдържание кодира токена и контекста, докато потокът от заявки знае позицията на целта, но не и нейното съдържание, което позволява прогнозиране без изтичане.
XLNet разбърква ли физически думите в изречението?
XLNet променя реда на прогнозиране (факторизация) чрез маски за внимание; оригиналните позиции на токените се запазват чрез позиционно кодиране.
Коя архитектура служи като гръбнак на XLNet за дългосрочен контекст?
XLNet се основава на Transformer-XL, който добавя повторение на сегмента и относително позиционно кодиране за обработка на дълги последователности.