Архитектури енкодер-декодер
Архитектурите на енкодер-декодер разделят модел на две половини: една, която чете и компресира вход в богато вътрешно представяне, и една, която генерира изход от него.
Преглед
This design powers translation, summarization, and any task where the input and output are different sequences.
Дълбоко гмуркане
Един модел енкодер-декодер обработва проблем на два етапа. Кодерът чете цялата входна последователност (да речем английско изречение) и я превръща в набор от контекстуални вектори, които улавят значението. След това декодерът произвежда изходната последователност (да речем, френски) един токен наведнъж, поглеждайки назад към собствените си предишни изходи и към представянията на енкодера. Оригиналният Transformer от 2017 г. беше енкодер-декодер, създаден за превод. Модели като T5 и BART използват тази форма и рамкират всяка задача като въвеждане на текст, извеждане на текст. Разделянето е мощно, защото енкодерът може да види целия вход наведнъж (двупосочен контекст), докато декодерът генерира отляво надясно. Това прави дизайна естествено подходящ за проблеми от последователност до последователност, където дължината и съдържанието на изхода се различават от входа.
Техническа информация
Кодерът използва двупосочно самонасочване, така че всеки входен токен се грижи за всеки друг токен наведнъж. Декодерът е авторегресивен и използва маскирано самовнимание, което означава, че всяка позиция може да вижда само по-ранни позиции, за да запази причинно-следственото генериране. Свързването им е кръстосано внимание: слоевете на декодера запитват крайните скрити състояния на енкодера. Това разделяне позволява на енкодера да изгради пълно разбиране, независимо от реда, докато декодерът се ангажира с един токен наведнъж.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на енкодер-декодер архитектурите
Моделите само с декодер като GPT сега доминират в чата с общо предназначение, защото един стек се мащабира лесно и се справя с много задачи чрез подкани. Но дизайнът на енкодер-декодер продължава да съществува, когато разбирането на входа и генерирането на изхода са наистина различни: разпознаване на реч (Whisper), обобщаване на документи и мултимодални системи, съчетаващи визуален енкодер с текстов декодер. Очаквайте хибридни архитектури, които заимстват двупосочното разбиране на енкодера за извличане и заземяване, като същевременно запазват гъвкавостта на декодера, особено когато моделите обединяват текст, аудио и изображения.
Внедряване в реалния свят
Google Translate и DeepL използват енкодер-декодер Transformers, за да насочат изречение на един език към друг.
Whisper на OpenAI кодира аудио спектрограми и ги декодира в транскрибиран или преведен текст.
T5 и BART захранват абстрактното обобщаване, свивайки дългите статии в кратки резюмета.
Системите за надписи на изображения свързват визуален енкодер с текстов декодер, за да опишат снимките с думи.
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Encoder-Decoder Architectures quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Кръстосани енкодери срещу би-енкодери
Frequently asked questions
What is Encoder-Decoder Architectures?
Архитектурите на енкодер-декодер разделят модел на две половини: една, която чете и компресира вход в богато вътрешно представяне, и една, която генерира изход от него. Този дизайн позволява превод, обобщение и всяка задача, при която входът и изходът са различни последователности.
Каква е основната задача на енкодера в модел енкодер-декодер?
Кодерът използва цялата входна последователност и произвежда контекстуални вектори, улавящи нейното значение, което декодерът след това използва.
Защо декодерът използва маскирано (каузално) самовнимание?
Маскирането гарантира, че всяка изходна позиция се отнася само за по-ранни позиции, запазвайки авторегресивния ред на генериране отляво надясно.
Какъв механизъм свързва декодера с представянията на енкодера?
Кръстосаното внимание позволява на всеки декодерен слой да прави заявки за скритите състояния на енкодера, свързвайки разбирането на входа с генерирането на изхода.
Кой от тези модели е архитектура енкодер-декодер (последователност към последователност)?
T5 (и BART) са класически модели енкодер-декодер, които рамкират задачите като текст към текст. BERT е само за енкодер, а GPT-3 е само за декодер.
Защо дизайнът на енкодер-декодер е естествено подходящ за превод?
Преводът преобразува една последователност в друга, така че четенето на целия източник (енкодер) и генерирането на нова цел (декодер) пасва идеално.