РЪКОВОДСТВО по основи

Самоконтролирано обучение

Самоконтролираното обучение обучава модели върху немаркирани данни чрез измисляне на задача, чийто отговор е скрит в самите данни.

2 min readПоследна актуализация

Преглед

It is how modern language and vision foundation models learn from the raw internet without armies of human labelers.

Дълбоко гмуркане

Ръчното етикетиране на данни е бавно и скъпо, но светът е пълен с немаркиран текст, изображения, аудио и видео. Самостоятелното обучение го отключва чрез създаване на „задачи с претекст“, където данните предоставят свой собствен отговор. Класическият пример е моделирането на маскиран език, използвано от BERT: скрийте някои думи в изречение и обучете модела да ги предсказва от контекста. Моделите в стил GPT предвиждат следващата дума. Във визията, контрастни методи като SimCLR показват на модела две увеличени изрязвания на едно и също изображение и го учат, че те принадлежат едно към друго, докато раздалечават различни изображения. Решаването на тези самостоятелно направени пъзели принуждава модела да изгради богати вътрешни представяния на значение и структура. След това тези представяния се прехвърлят мощно към реални задачи надолу по веригата с малко или никакви етикетирани данни.

Техническа информация

Номерът е безплатно генериране на сигнал за наблюдение. При маскираното моделиране скритият токен е етикетът, така че загубата може да бъде изчислена без човешка анотация. При контрастно обучение, две увеличения на едно изображение образуват „положителна двойка“, която трябва да стои близо в пространството за вграждане, докато други изображения са „негативи“, отблъснати. Така или иначе, моделът е оптимизиран върху етикети, извлечени изцяло от собствената структура на данните, изучавайки общи характеристики, които по-късно се нуждаят само от лека фина настройка.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на самоконтролираното обучение

Самоконтролираното обучение е двигателят зад днешните базови модели и тази роля тепърва ще нараства. Ясната тенденция е към мултимодално предварително обучение, при което един модел се учи съвместно от текст, изображения, аудио и видео, използвайки самоконтролирани цели. Изследователите преминават отвъд контрастните методи към подходи за маскирано предсказване във зрението и техники за самодестилация, които не се нуждаят от отрицателни примери. Тъй като висококачествените етикетирани данни се превръщат в пречка, изучаването на полезна структура директно от огромни немаркирани потоци ще остане централната стратегия за мащабиране на AI.

Внедряване в реалния свят

BERT изучава език чрез предсказване на маскирани думи, след което фино настроен за търсене, настроения или отговаряне на въпроси

SimCLR предварително обучава енкодер за изображения върху немаркирани снимки, така че по-късно да може да класифицира с много малко етикети

Модели в стил GPT, които се учат да пишат чрез многократно предсказване на следващия токен в огромни текстови корпуси

Говорни модели, предварително обучени върху сурово немаркирано аудио (предсказващи маскирани звукови сегменти), преди да бъдат адаптирани към транскрипция

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде самоконтролираното обучение помага и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Supervised Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Контролирано обучение

Frequently asked questions

What is Self-Supervised Learning?

Самоконтролираното обучение обучава модели върху немаркирани данни чрез измисляне на задача, чийто отговор е скрит в самите данни. Това е начинът, по който съвременните модели на език и визия се учат от необработения интернет без армии от човешки етикети.

Какво прави ученето „самоконтролирано“?

Самоконтролираното обучение измисля претекстова задача, където отговорът е скрит в данните, така че не е необходимо човешко етикетиране.

Защо самоконтролираното обучение е толкова ценно за моделите на основата?

Тъй като сигналът за наблюдение идва от самите данни, моделите могат да бъдат предварително обучени върху огромни немаркирани корпуси от мрежата.

Какво обикновено се случва по-нататък след предварително обучение под самоконтрол?

Предварителното обучение изгражда общи представяния, които се пренасят добре, така че за конкретни задачи е необходима само лека фина настройка на етикетирани данни.

Как се различава самоконтролираната задача на модел в стил GPT от тази на BERT?

Моделите в стил GPT са обучени да предсказват следващия токен в последователност, докато BERT предсказва маскирани токени, използвайки ляв и десен контекст.