Изглаждане на етикети
Изглаждането на етикетите е прост трик за регулиране, който смекчава твърдите цели за еднократно обучение, като казва на модела, че правилният отговор е много вероятен, но не е 100 процента сигурен.
Преглед
It improves calibration and generalization across image and language models with almost no extra cost.
Дълбоко гмуркане
Обикновено класификаторът се обучава на еднократни етикети: истинският клас получава цел 1.0, а всичко останало 0.0. В комбинация с крос-ентропия и softmax, това тласка модела да направи правилната логическа стойност безкрайно по-голяма от останалите, насърчавайки прекомерната увереност и пренастройването. Изглаждането на етикета замества целта с (1 - епсилон) за истинския клас и епсилон/(K-1), разпределени в другите класове K, където епсилонът е малък (обикновено 0,1). Сега моделът се стреми към уверено, но не и абсолютно разпределение. Въведен в работата Inception-v3 от 2016 г. и по-късно анализиран от групата на Хинтън, той подобри точността на ImageNet и е стандартен в Transformers, където оригиналната хартия Attention Is All You Need използва епсилон от 0,1.
Техническа информация
С твърдите етикети, минимизирането на кръстосаната ентропия кара правилния logit към положителна безкрайност спрямо другите, което е непостижимо и тласка теглата до крайности. Изглаждането задава ограничена оптимална празнина между правилния logit и останалите, така че logits остават ограничени и моделът престава да бъде максимално уверен. Проучванията показват, че това стяга клъстерите от същия клас и създава по-добре калибрирани вероятности, прогнозираната увереност съвпада с действителната точност. Компромисът: може да изтрие фина информация за сходство между класове, което понякога вреди на дестилацията на знания, когато тези меки връзки имат значение.
Стратегическо въздействие
Clearer decisions
Помага ви да отделите ясните технически твърдения от маркетинговия език.
Cost and budget
Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.
Team and workflow
Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.
Бъдещето на изглаждането на етикетите
Изглаждането на етикетите остава по подразбиране в широкомащабното обучение, но изследванията се движат към адаптивно и научено изглаждане, което коригира епсилон за пример или клас, вместо да използва една плоска стойност. Фокусирани върху калибриране методи, като загуба на фокус и температурно мащабиране, често се претеглят или се комбинират с него. Тъй като моделите се разрастват и надеждните оценки на несигурността стават критични за безопасността, очаквайте изглаждането да бъде един от многото инструменти за получаване на надеждни оценки на доверието, като се обърне специално внимание на неговия известен конфликт с дестилацията.
Внедряване в реалния свят
Класификация на ImageNet: Inception-v3 използва изглаждане на етикети (epsilon 0.1), за да повиши точността на топ 1 и да намали прекомерната увереност.
Машинен превод: оригиналният Transformer приложи изглаждане на етикета от 0,1, търгувайки с малко объркване за по-високи BLEU резултати.
Разпознаване на реч: изгладените цели намаляват твърде уверените погрешни разпознавания и подобряват калибрирането при шумен звук.
Модели за медицинско изобразяване: изглаждането дава по-добре калибрирани вероятности, важно, когато оценката на достоверността информира клиничните решения.
Рискове и предпазни огради
Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.
Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.
Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.
Пътна карта за изпълнение
Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.
Изберете един показател за успех и едно условие за неуспех преди тестване.
Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.
Документирайте къде изглаждането на етикетите помага и къде по-простите методи са по-добри.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Label Smoothing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
K-означава групиране
Frequently asked questions
What is Label Smoothing?
Изглаждането на етикетите е прост трик за регулиране, който смекчава твърдите цели за еднократно обучение, като казва на модела, че правилният отговор е много вероятен, но не е 100 процента сигурен. Подобрява калибрирането и обобщаването в моделите на изображения и език почти без допълнителни разходи.
Какво променя изглаждането на етикетите относно целите за обучение?
Вместо твърда цел 1.0/0.0, изглаждането на етикета присвоява (1 - епсилон) на истинския клас и разпределя епсилон в останалите.
Какъв проблем с твърдите едногорещи етикети решава изглаждането?
Минимизирането на кръстосаната ентропия при едно-горещи цели задвижва правилния logit към безкрайност спрямо другите, насърчавайки прекомерната самоувереност и прекомерното оборудване.
Кои забележителни архитектури помогнаха за популяризирането на изглаждането на етикетите?
Изглаждането на етикетите беше въведено в документа Inception-v3 от 2016 г. и прието от Transformer (Вниманието е всичко, от което се нуждаете) с epsilon 0.1.
Освен точността, с какво е известно изглаждането на етикетите?
Изглаждането подобрява калибрирането, прогнозираната достоверност съвпада по-близо с истинската вероятност да бъде правилна.
Какъв е документираният недостатък на изглаждането на етикетите?
Чрез стягане на клъстери и изравняване на меките връзки между класовете, изглаждането може да премахне информацията, на която разчита дестилацията на знания.