Език AI РЪКОВОДСТВО

Word2Vec Skip-Gram и CBOW

Word2Vec е техника от 2013 г. от Google, която научава плътни вектори на думи чрез предсказване на думи от техните съседи, превръщайки езика в геометрия, където подобни думи стоят близо една до друга.

2 min readПоследна актуализация

Преглед

It made the famous "king - man + woman ≈ queen" analogy possible and kicked off the modern embedding era.

Дълбоко гмуркане

Word2Vec, въведен от Томас Миколов и колеги от Google през 2013 г., научава вектор (обикновено 100-300 числа) за всяка дума чрез обучение на плитка двуслойна невронна мрежа върху плъзгащ се контекстен прозорец. Предлага се в два вкуса. CBOW (Continuous Bag of Words) взема заобикалящите контекстни думи и прогнозира липсващата централна дума, като осреднява контекстните вектори заедно. Skip-Gram обръща това: взема централната дума и се опитва да предскаже всяка заобикаляща я контекстна дума. Моделът никога не се интересува от самата задача за прогнозиране; целта е тегловната матрица, която научава по пътя, чиито редове стават вектори на думите. Думите, които се появяват в подобен контекст, завършват с подобни вектори, улавяйки значението чисто от съвместно срещане.

Техническа информация

Обучението на пълния softmax върху огромен речник е твърде бавно, така че Word2Vec използва трикове като отрицателна извадка, която преформулира прогнозата като двоична класификация: разграничете истинска контекстна дума от шепа произволни „отрицателни“ думи. Той също така взема подизвадки от често срещани думи като "the" и използва разпределение с униграм, повишено до 0,75, за да избира отрицателни. CBOW е по-бърз и по-добър за често срещани думи; Skip-Gram с отрицателна проба се справя по-добре с редки думи и малки корпуси.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на Word2Vec Skip-Gram и CBOW

Статичните вграждания като Word2Vec са до голяма степен заменени от контекстуални модели (ELMo, BERT, трансформатори), които дават на думата различни вектори в зависимост от контекста на изречението, решавайки проблема с полисемията, където „банка“ има един фиксиран вектор. И все пак Word2Vec издържа там, където скоростта, простотата и интерпретируемостта имат значение: системи за препоръки, търсене и като основа за обучение. Неговата основна идея, че значението произтича от статистиката на съвместното възникване, остава концептуалната основа на всички съвременни езикови модели.

Внедряване в реалния свят

Spotify и Airbnb адаптираха Skip-Gram за научаване на вграждания на песни и списъци („item2vec“) от поредици от потребителски сесии за препоръки

Подпомага семантичното търсене и разширяването на синонимите, така че заявка за „лаптоп“ също да показва „ноутбук“ и „компютър“

Откриване на аналогии и връзки в текста, като двойки столица-държава (Париж е за Франция, както Токио е за Япония)

Инициализиране на входния слой на по-големи NLP конвейери за анализ на настроението и класифициране на документи върху ограничени данни

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Word2Vec Skip-Gram and CBOW quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Магистрални мрежи и пропускащи връзки

Frequently asked questions

What is Word2Vec Skip-Gram and CBOW?

Word2Vec е техника от 2013 г. от Google, която научава плътни вектори на думи чрез предсказване на думи от техните съседи, превръщайки езика в геометрия, където подобни думи стоят близо една до друга. Това направи възможна известната аналогия "крал - мъж + жена ≈ кралица" и постави началото на модерната ера на вграждане.

Какво предвижда архитектурата на Skip-Gram?

Skip-Gram взема една централна дума и се опитва да предвиди всяка от заобикалящите я контекстни думи, обратното на CBOW.

Какъв е действителният полезен резултат от обучението на модел Word2Vec?

Задачата за прогнозиране е само средство за постигане на цел; целта е научената матрица на теглото, чиито редове се превръщат в плътни вграждания на думи.

Защо Word2Vec използва отрицателна извадка?

Отрицателната извадка преформулира проблема като двоична класификация срещу няколко произволни думи, избягвайки скъпоструващ мек максимум за десетки хиляди думи.

Кой вариант на Word2Vec обикновено се представя по-добре при редки думи и малки набори от данни?

Skip-Gram с отрицателно вземане на проби има тенденция да улавя по-добре редки думи, докато CBOW е по-бърз и предпочита честите думи.

Кое известно свойство на векторите на Word2Vec е илюстрирано с "крал - мъж + жена ≈ кралица"?

Векторите Word2Vec кодират връзки, така че семантичните аналогии да могат да бъдат решени с просто добавяне и изваждане на вектори.