Техническо РЪКОВОДСТВО

Пакетно нормализиране

Пакетното нормализиране е техника, която премащабира входовете към всеки слой на невронна мрежа по време на обучение, което прави дълбоките мрежи да се обучават по-бързо и по-надеждно.

2 min readПоследна актуализация

Преглед

It became one of the most widely used tricks in deep learning.

Дълбоко гмуркане

Тъй като данните протичат през дълбока мрежа, разпределението на стойностите, захранващи всеки слой, продължава да се измества, докато по-ранните слоеве се актуализират, което забавя и дестабилизира обучението. Пакетната нормализация, въведена от Ioffe и Szegedy през 2015 г., се справя с това чрез нормализиране на входовете на всеки слой в текущата мини-партида, така че те да имат приблизително нулева средна стойност и дисперсия на единица. След това прилага два параметъра, които могат да се научат, гама и бета, които позволяват на мрежата да мащабира и измести нормализираните стойности обратно, ако това помогне, така че не губи представителна сила. Печалбата е голяма: мрежите толерират по-високи нива на обучение, конвергират в по-малко епохи, са по-малко чувствителни към инициализация на теглото и често генерализират малко по-добре. Уловката е, че поведението зависи от статистиката на партидите, така че много малки партиди могат да го направят нестабилно.

Техническа информация

За всяка характеристика в минипартида партидната норма изчислява средната стойност на партидата и дисперсията, изважда средната стойност и разделя на стандартното отклонение (плюс малък епсилон за стабилност). След това извежда гама, умножена по нормализираната стойност плюс бета, където гама и бета се научават. По време на обучението той използва партидна статистика на живо, като същевременно поддържа текущи средни стойности; по време на извод той превключва към тези съхранени текущи средни стойности, така че прогнозите не зависят от това кои други примери споделят партидата. Обикновено се вмъква между линейната стъпка на слоя и неговата функция за активиране.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на пакетната нормализация

Пакетната нормализация остава работен кон в моделите на конволюционна визия, но нейната зависимост от партидната статистика е неудобна за повтарящи се мрежи, малки партиди и разпределено обучение. Това доведе до приемането на алтернативи като нормализиране на слоеве, което нормализира функциите в рамките на един пример и сега доминира в трансформаторните архитектури, плюс нормализация на групи и екземпляри за конкретни домейни. Продължава изследването на мрежи без нормализиране, които съответстват на предимствата му чрез внимателно инициализиране и мащабиране. Очаквайте нормализацията да остане съществена, като конкретният вариант е избран да пасва на архитектурата.

Внедряване в реалния свят

Вмъкване на партидни нормални слоеве в класификатор на изображения ResNet, така че да може да се обучава с по-висока скорост на обучение и да се сближава в много по-малко епохи.

Стабилизиране на обучението на дълбока конволюционна мрежа за медицински изображения, която преди това се е разминавала без нормализиране.

Намаляване на чувствителността към инициализация на теглото в персонализиран CNN, така че инженерите прекарват по-малко време в ръчна настройка на началните стойности.

Превключване от партидна статистика в режим на обучение към съхранени текущи средни стойности при внедряване на модел, така че прогнозите за едно изображение да останат последователни.

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Batch Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

RMSNorm и нормализиране на предварителния слой

Frequently asked questions

What is Batch Normalization?

Пакетното нормализиране е техника, която премащабира входовете към всеки слой на невронна мрежа по време на обучение, което прави дълбоките мрежи да се обучават по-бързо и по-надеждно. Това се превърна в един от най-широко използваните трикове в дълбокото обучение.

Какво нормализира партидната нормализация?

Пакетната норма стандартизира входовете на даден слой, като използва средната стойност и дисперсията, изчислени в текущата мини-партида, поддържайки активациите в стабилен диапазон, докато обучението продължава.

Защо пакетната нормализация включва параметри, които могат да се научат гама и бета?

След нормализиране до нулева средна стойност и дисперсия на единица, гама и бета позволяват на мрежата да премащабира и премести стойностите, ако това е от полза, така че нормализирането не ограничава това, което слоят може да представлява.

Каква е често цитираната практическа полза от нормализирането на партиди?

Чрез поддържане на входните данни на слоевете добре мащабирани, пакетната норма позволява на мрежите да се обучават с по-високи скорости на обучение, да се сближават по-бързо и да бъдат по-малко чувствителни към инициализация.

По време на извод (предсказване на нови данни), какви статистики използва партидната нормализация?

Използването на статистики за партида на живо при извод ще направи прогнозата да зависи от това кои други примери споделят партидата. Вместо това партидната норма използва фиксирани текущи средни стойности, съхранени по време на обучението.

Защо нормализирането на партиди може да се държи лошо с много малки размери на партиди?

Нормата на партидата зависи от оценката на средната стойност и дисперсията от партидата. С много малко примери, тези оценки са шумни, което може да дестабилизира обучението.