PRZEWODNIK techniczny

Modele oparte na energii

Modele oparte na energii (EBM) uczą się skalarnej funkcji „energii”, która przypisuje niskie wartości wiarygodnym danym i wysokie wartości nieprawdopodobnym danym, definiując rozkład prawdopodobieństwa bez wymuszania jego łatwej normalizacji.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

This flexibility makes them a unifying lens for much of machine learning, from classifiers to generative models.

Głębokie nurkowanie

Model oparty na energii definiuje prawdopodobieństwo za pomocą rozkładu Boltzmanna (Gibbsa): p(x) jest proporcjonalne do exp(-E(x)), gdzie E(x) jest wyuczoną funkcją energii, często siecią neuronową. Trening obniża energię prawdziwych danych i podnosi energię wszystkiego innego. Element catch to funkcja podziału Z, suma lub całka exp(-E(x)) po wszystkich możliwych danych wejściowych, której obliczenie jest zwykle trudne. Zatem EBM są szkoleni za pomocą przybliżeń: dywergencji kontrastowej, dopasowywania wyników lub estymacji kontrastowej szumu, a następnie pobierają próbki za pomocą metod MCMC, takich jak dynamika Langevina, które podążają za gradientem energii. Klasyczne przykłady obejmują sieci Hopfielda i ograniczone maszyny Boltzmanna; współczesne prace łączą EBM z modelami dyfuzji, GAN, a nawet zwykłymi klasyfikatorami reinterpretowanymi jako funkcje energii.

Wgląd techniczny

Model przypisuje prawdopodobieństwo p(x) = exp(-E(x)) / Z. Ponieważ Z (normalizator na wszystkich danych wejściowych) jest trudne, rzadko oblicza się prawdopodobieństwo bezpośrednio. Zamiast tego dopasowywanie wyników i próbkowanie Langevina wykorzystują fakt, że gradient log p(x) jest równy -gradientowi E(x), więc Z odpada. Następnie dynamika Langevina generuje próbki poprzez wielokrotne przesuwanie x w dół w energii i dodawanie szumu, kierując się w stronę obszarów o niskiej energii i wysokim prawdopodobieństwie.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość modeli opartych na energii

EBM cieszą się ponownym zainteresowaniem, ponieważ stanowią teoretyczny pomost pomiędzy modelami dyfuzji, modelami generatywnymi opartymi na wynikach i sieciami dyskryminacyjnymi, a wynik, którego uczy się model dyfuzji, to zasadniczo gradient energii. Można się spodziewać większej liczby systemów hybrydowych, które wykorzystują funkcje energetyczne do tworzenia elastycznych, komponowalnych ograniczeń (łączenie wielu energii w celu sterowania generowaniem), lepszego i szybszego próbkowania niż MCMC oraz zastosowań w wnioskowaniu i planowaniu, gdzie „znalezienie konfiguracji o najniższej energii” w naturalny sposób wyraża optymalizację i satysfakcję z ograniczeń.

Implementacja w świecie rzeczywistym

Sieci Hopfielda działające jako pamięć asocjacyjna, która przywołuje zapisany wzorzec z zaszumionego lub częściowego sygnału wejściowego poprzez przejście w stan niskiego zużycia energii

Ograniczone maszyny Boltzmanna używane w przeszłości do wspólnego filtrowania i wstępnego uczenia sieci głębokich przekonań

Reinterpretacja standardowego klasyfikatora jako modelu opartego na energii (podejście JEM) w celu poprawy kalibracji, niezawodności i wykrywania braku dystrybucji

Ustrukturyzowane przewidywanie i spełnianie ograniczeń, w przypadku których rozwiązania można znaleźć poprzez minimalizację wyuczonej energii w odniesieniu do wielu oddziałujących zmiennych (np. oszacowanie pozycji lub układ)

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Energy-Based Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Modele generatywne oparte na wynikach

Często zadawane pytania

What is Energy-Based Models?

Modele oparte na energii (EBM) uczą się skalarnej funkcji „energii”, która przypisuje niskie wartości wiarygodnym danym i wysokie wartości nieprawdopodobnym danym, definiując rozkład prawdopodobieństwa bez wymuszania jego łatwej normalizacji. Ta elastyczność sprawia, że ​​stanowią one jednoczący obiektyw dla większości systemów uczących się, od klasyfikatorów po modele generatywne.

Jak w modelu opartym na energii energia jest powiązana z prawdopodobieństwem punktu danych?

Dzięki rozkładowi Boltzmanna p(x) jest proporcjonalne do exp(-E(x)), zatem wiarygodnym danym przypisuje się niską energię i wysokie prawdopodobieństwo.

Co sprawia, że szkolenie modeli opartych na energii jest trudne?

Obliczanie Z wymaga zsumowania lub całkowania exp(-E(x)) po całej przestrzeni wejściowej, co jest generalnie niewykonalne, wymuszając przybliżone metody uczenia.

Która metoda pobierania próbek jest powszechnie stosowana do pobierania próbek z EBM?

Dynamika Langevina iteracyjnie przesuwa próbki w dół wzdłuż gradientu energii, dodając jednocześnie szum, zbiegając się w kierunku obszarów o niskiej energii.

Dlaczego metody takie jak dopasowywanie wyników mogą uniknąć obliczania funkcji podziału Z?

Ponieważ Z nie zależy od x, różnicowanie log p(x) względem x znosi to, pozostawiając jedynie gradient energii, który można zastosować.

Który z nich jest klasycznym modelem opartym na energii?

Sieci Hopfielda to wczesny model oparty na energii, który przechowuje wzorce jako stany o niskiej energii i przywołuje je poprzez minimalizację energii.