ПОСІБНИК З ОСНОВ

Згладжування міток

Згладжування міток — це простий трюк регулярізації, який пом’якшує жорсткі тренувальні цілі, повідомляючи моделі, що правильна відповідь дуже ймовірна, але не на 100 відсотків певна.

2 хвилини читанняОстаннє оновлення

Огляд

It improves calibration and generalization across image and language models with almost no extra cost.

Глибоке занурення

Зазвичай класифікатор навчається на одноразових мітках: справжній клас отримує ціль 1.0, а все інше – 0.0. У поєднанні з перехресною ентропією та softmax це змушує модель робити правильний логіт нескінченно більшим за решта, заохочуючи надмірну впевненість і переобладнання. Згладжування міток замінює ціль на (1 - епсилон) для справжнього класу та епсилон/(K-1), розподілений між іншими класами K, де епсилон малий (зазвичай 0,1). Тепер модель націлена на впевнений, але не абсолютний розподіл. Представлений у роботі Inception-v3 2016 року та пізніше проаналізований групою Хінтона, він покращив точність ImageNet і є стандартним у Transformers, де оригінальний папір Attention Is All You Need використовував епсилон 0,1.

Технічне розуміння

З жорсткими мітками мінімізація перехресної ентропії спрямовує правильний логіт до позитивної нескінченності відносно інших, що є недосяжним і штовхає ваги до крайнощів. Згладжування встановлює кінцевий оптимальний розрив між правильним логітом та рештою, тому логіти залишаються обмеженими, а модель перестає бути максимально впевненою. Дослідження показують, що це звужує кластери одного класу та створює краще відкалібровані ймовірності, прогнозована впевненість відповідає фактичній точності. Компроміс: це може стерти дрібнозернисту інформацію про подібність між класами, що іноді шкодить дистиляції знань, де ці м’які зв’язки мають значення.

Стратегічний вплив

Чіткіші рішення

Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.

Вартість і бюджет

Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.

Команда та робочий процес

Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.

Майбутнє згладжування міток

Згладжування міток залишається за замовчуванням у великомасштабному навчанні, але дослідження рухаються до адаптивного та навченого згладжування, яке регулює епсилон для прикладу чи класу, а не використовує одне рівне значення. Методи, орієнтовані на калібрування, як-от фокусні втрати та масштабування температури, часто порівнюють або поєднують із ним. Оскільки моделі зростають і надійні оцінки невизначеності стають критичними для безпеки, очікуйте, що згладжування стане одним із багатьох інструментів для отримання достовірних оцінок достовірності, приділяючи особливу увагу його відомому конфлікту з дистиляцією.

Реалізація в реальному світі

Класифікація ImageNet: Inception-v3 використовувало згладжування міток (епсилон 0,1), щоб підвищити точність першого рівня та зменшити надмірну впевненість.

Машинний переклад: оригінальний Transformer застосував згладжування міток 0,1, обмінюючи невелике здивування на вищі оцінки BLEU.

Розпізнавання мовлення: згладжені цілі зменшують надмірно впевнені помилки розпізнавання та покращують калібрування шумного звуку.

Моделі медичної візуалізації: згладжування дає краще відкалібровані ймовірності, що важливо, коли оцінка достовірності інформує клінічні рішення.

Ризики та огорожі

Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.

Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.

Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.

Дорожня карта впровадження

1

Почніть із простого визначення необхідного результату.

2

Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.

3

Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.

4

Задокументуйте, де згладжування міток допомагає, а де простіші методи кращі.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Label Smoothing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Кластеризація K-Means

Часті запитання

What is Label Smoothing?

Згладжування міток — це простий трюк регулярізації, який пом’якшує жорсткі тренувальні цілі, повідомляючи моделі, що правильна відповідь дуже ймовірна, але не на 100 відсотків певна. Це покращує калібрування та узагальнення моделей зображень і мови майже без додаткових витрат.

Що змінює згладжування міток щодо навчальних цілей?

Замість жорсткої цілі 1.0/0.0 згладжування міток призначає (1 - епсилон) справжньому класу та розподіляє епсилон між іншими.

Яку проблему з одноразовими мітками вирішує згладжування?

Зведення до мінімуму перехресної ентропії на одноразових цілях збільшує правильну логіт до нескінченності відносно інших, заохочуючи надмірну впевненість і переобладнання.

Які знакові архітектури допомогли популяризувати згладжування міток?

Згладжування міток було представлено в документі Inception-v3 2016 року та прийнято Transformer (Attention Is All You Need) з epsilon 0.1.

Окрім точності, чим відоме згладжування міток?

Згладжування покращує калібрування, прогнозована достовірність більше узгоджується зі справжньою ймовірністю правильності.

Який задокументований недолік згладжування міток?

Звужуючи кластери та вирівнюючи м’які зв’язки між класами, згладжування може видалити інформацію, на яку спирається дистиляція знань.