Отрицателно вземане на проби и контрастно оценяване на шума
Отрицателното вземане на проби и контрастната оценка на шума (NCE) са трикове, които позволяват на моделите да се обучават върху огромни речници, без да изчисляват скъпоструващ пълен софтмакс.
Преглед
Instead of scoring every possible output, they teach the model to tell real (positive) examples from a handful of fake (negative) ones.
Дълбоко гмуркане
Когато един речник има стотици хиляди думи, нормалният softmax трябва да се нормализира върху всяка дума за всяка стъпка на обучение - твърде бавно. Noise Contrastive Estimation преформулира проблема като двоична класификация: дадена цел и няколко "шумови" извадки, извлечени от известно разпределение, научете се да разграничавате истинската проба от шума, което имплицитно възстановява желаните вероятности без изрична нормализация. Отрицателното вземане на проби, популяризирано от модела skip-gram на word2vec, е опростен братовчед: за всяка истинска двойка (дума, контекст) той взема проби k отрицателни и обучава модела да присвоява висок резултат на истинската двойка и нисък резултат на фалшивите, използвайки сигмоидна цел. И двата превръщат скъп многокласов проблем в много евтини бинарни, което прави обучението за широкомащабно вграждане практично. Изборът на разпределение на шума (често униграма, повишена до степен 3/4) силно влияе върху качеството.
Техническа информация
NCE оценява модел чрез класифициране на данни спрямо шум и тъй като броят на пробите на шум нараства, той доказуемо се доближава до максималната вероятност с подходящ нормализиран мек максимум. Отрицателното вземане на проби отпада напълно условията за нормализиране на NCE, оптимизирайки log σ(положителен резултат) + Σ log σ(−отрицателен резултат). Това го прави по-бърз, но вече не е последователен оценител на плътност — той е настроен за изучаване на добри вграждания, а не на калибрирани вероятности. Вземането на проби от негативи от изгладено униграмно разпределение (честота^0,75) балансира общи и редки думи.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на отрицателното вземане на проби и контрастната оценка на шума
Основната идея — учене чрез контрастиране на положителни срещу извадени отрицателни — сега е в основата на модерното самоконтролирано и контрастно представяне на обучение чрез визия, език и препоръки. Бъдещата работа се фокусира върху твърдо отрицателно копаене (избиране на информативни негативи вместо произволни), отстраняване на отклонения за фалшиви негативи и евтино мащабиране на негативи чрез големи банки памет или партидно вземане на проби. С нарастването на моделите ефикасните извадкови цели остават от съществено значение навсякъде, където изходните пространства или наборите от кандидати са огромни, като например извличане и широкомащабни препоръки.
Внедряване в реалния свят
word2vec skip-gram с отрицателна извадка, вграждане на думи за учене от милиарди токени без пълен softmax.
Езикови модели, използващи исторически NCE за ефективно обучение върху речници от стотици хиляди думи.
Системи за препоръки и извличане, вземащи проби от „отрицателни“ елементи, с които потребителят не е взаимодействал, за да обучат модели за вграждане с две кули.
Вграждане на графики и графи на знанието (напр. повреждане на главата или опашката на тройка) с използване на отрицателни проби за изучаване на връзки на обекти.
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Negative Sampling and Noise Contrastive Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Онлайн и твърд негативен майнинг
Frequently asked questions
What is Negative Sampling and Noise Contrastive Estimation?
Отрицателното вземане на проби и контрастната оценка на шума (NCE) са трикове, които позволяват на моделите да се обучават върху огромни речници, без да изчисляват скъпоструващ пълен софтмакс. Вместо да оценяват всеки възможен резултат, те учат модела да разграничава истински (положителни) примери от шепа фалшиви (отрицателни).
Какъв проблем основно решават отрицателните проби и NCE?
И двата метода избягват нормализирането върху огромен речник, като преформулират обучението като по-евтина двоична дискриминация.
Как Noise Contrastive Estimation преформулира учебната задача?
NCE обучава модела да разграничава реални проби от проби, извлечени от известно разпределение на шума.
Кой модел популяризира отрицателно вземане на проби за изучаване на вграждане на думи?
Отрицателното вземане на проби беше въведено и популяризирано от варианта за пропускане на грам на word2vec.
Как се различава отрицателната проба от пълния NCE?
Отрицателната извадка опростява NCE чрез премахване на нормализацията, търгувайки с вероятностна коректност за скорост и добри вграждания.
Защо негативите често се вземат проби от униграмното разпределение, повдигнато на степен 3/4?
Показателят 0,75 изглажда честотното разпределение, така че общите думи не доминират и редките думи все още се появяват.