РЪКОВОДСТВО по основи

Изглаждане на етикети

Изглаждането на етикетите е прост трик за регулиране, който смекчава твърдите цели за еднократно обучение, като казва на модела, че правилният отговор е много вероятен, но не е 100 процента сигурен.

2 min readПоследна актуализация

Преглед

It improves calibration and generalization across image and language models with almost no extra cost.

Дълбоко гмуркане

Обикновено класификаторът се обучава на еднократни етикети: истинският клас получава цел 1.0, а всичко останало 0.0. В комбинация с крос-ентропия и softmax, това тласка модела да направи правилната логическа стойност безкрайно по-голяма от останалите, насърчавайки прекомерната увереност и пренастройването. Изглаждането на етикета замества целта с (1 - епсилон) за истинския клас и епсилон/(K-1), разпределени в другите класове K, където епсилонът е малък (обикновено 0,1). Сега моделът се стреми към уверено, но не и абсолютно разпределение. Въведен в работата Inception-v3 от 2016 г. и по-късно анализиран от групата на Хинтън, той подобри точността на ImageNet и е стандартен в Transformers, където оригиналната хартия Attention Is All You Need използва епсилон от 0,1.

Техническа информация

С твърдите етикети, минимизирането на кръстосаната ентропия кара правилния logit към положителна безкрайност спрямо другите, което е непостижимо и тласка теглата до крайности. Изглаждането задава ограничена оптимална празнина между правилния logit и останалите, така че logits остават ограничени и моделът престава да бъде максимално уверен. Проучванията показват, че това стяга клъстерите от същия клас и създава по-добре калибрирани вероятности, прогнозираната увереност съвпада с действителната точност. Компромисът: може да изтрие фина информация за сходство между класове, което понякога вреди на дестилацията на знания, когато тези меки връзки имат значение.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на изглаждането на етикетите

Изглаждането на етикетите остава по подразбиране в широкомащабното обучение, но изследванията се движат към адаптивно и научено изглаждане, което коригира епсилон за пример или клас, вместо да използва една плоска стойност. Фокусирани върху калибриране методи, като загуба на фокус и температурно мащабиране, често се претеглят или се комбинират с него. Тъй като моделите се разрастват и надеждните оценки на несигурността стават критични за безопасността, очаквайте изглаждането да бъде един от многото инструменти за получаване на надеждни оценки на доверието, като се обърне специално внимание на неговия известен конфликт с дестилацията.

Внедряване в реалния свят

Класификация на ImageNet: Inception-v3 използва изглаждане на етикети (epsilon 0.1), за да повиши точността на топ 1 и да намали прекомерната увереност.

Машинен превод: оригиналният Transformer приложи изглаждане на етикета от 0,1, търгувайки с малко объркване за по-високи BLEU резултати.

Разпознаване на реч: изгладените цели намаляват твърде уверените погрешни разпознавания и подобряват калибрирането при шумен звук.

Модели за медицинско изобразяване: изглаждането дава по-добре калибрирани вероятности, важно, когато оценката на достоверността информира клиничните решения.

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде изглаждането на етикетите помага и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Label Smoothing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

K-означава групиране

Frequently asked questions

What is Label Smoothing?

Изглаждането на етикетите е прост трик за регулиране, който смекчава твърдите цели за еднократно обучение, като казва на модела, че правилният отговор е много вероятен, но не е 100 процента сигурен. Подобрява калибрирането и обобщаването в моделите на изображения и език почти без допълнителни разходи.

Какво променя изглаждането на етикетите относно целите за обучение?

Вместо твърда цел 1.0/0.0, изглаждането на етикета присвоява (1 - епсилон) на истинския клас и разпределя епсилон в останалите.

Какъв проблем с твърдите едногорещи етикети решава изглаждането?

Минимизирането на кръстосаната ентропия при едно-горещи цели задвижва правилния logit към безкрайност спрямо другите, насърчавайки прекомерната самоувереност и прекомерното оборудване.

Кои забележителни архитектури помогнаха за популяризирането на изглаждането на етикетите?

Изглаждането на етикетите беше въведено в документа Inception-v3 от 2016 г. и прието от Transformer (Вниманието е всичко, от което се нуждаете) с epsilon 0.1.

Освен точността, с какво е известно изглаждането на етикетите?

Изглаждането подобрява калибрирането, прогнозираната достоверност съвпада по-близо с истинската вероятност да бъде правилна.

Какъв е документираният недостатък на изглаждането на етикетите?

Чрез стягане на клъстери и изравняване на меките връзки между класовете, изглаждането може да премахне информацията, на която разчита дестилацията на знания.