PODSTAWOWY PRZEWODNIK

Szkolenie optymalne pod kątem obliczeń dla szynszyli

Z ustaleń DeepMind z 2022 r. Chinchilla wynika, że większość dużych modeli językowych była źle przeszkolona: w przypadku stałego budżetu obliczeniowego należy mniej więcej równomiernie skalować parametry i dane, a nie tylko budować większy model.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It reshaped how the industry balances model size against training data.

Głębokie nurkowanie

W artykule DeepMind dotyczącym szynszyli ponownie omówiono skalowanie i przeszkolono ponad 400 modeli w celu znalezienia optymalnej równowagi obliczeniowej. Główna zasada: rozmiar modelu i żetony szkoleniowe powinny rosnąć stopniowo, około 20 żetonów szkoleniowych na parametr. Aby to udowodnić, przeszkolili Chinchillę, model o 70 miliardach parametrów na 1,4 biliona tokenów, korzystając z tych samych obliczeń, co Gopher o 280 miliardach parametrów trenowany na znacznie mniejszej liczbie tokenów. Szynszyla, mimo że jest czterokrotnie mniejsza, radzi sobie lepiej niż Gopher, GPT-3 i inni giganci w niemal każdym benchmarku. Ta lekcja obaliła wcześniejszy wniosek OpenAI, który głosił, że rozmiar jest ważniejszy od danych, pokazując, że wiele flagowych modeli nie spełnia oczekiwań wydajności, ponieważ są zbyt duże i zbyt mało danych.

Wgląd techniczny

Utrata dopasowania szynszyli jako L(N,D) = E + A·N^(-α) + B·D^(-β), przy α i β w pobliżu 0,34, co oznacza, że ​​parametry i dane mają prawie symetryczny udział. Optymalizacja tego przy ustalonych ograniczeniach obliczeniowych (obliczenie ≈ 6·N·D dla transformatorów) daje wynik o równym skalowaniu. Mniejszy, bogaty w dane model jest również tańszy w uruchamianiu na podstawie wnioskowania, więc jego zaleta wiąże się z wdrażaniem, a nie tylko szkoleniem.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość szynszyli w zakresie optymalnego treningu obliczeniowego

Nowoczesne modele, takie jak Llama 3, celowo wykraczają daleko poza współczynnik Chinchilla wynoszący 20 tokenów na parametr, trenując małe modele na bilionach tokenów, aby wnioskowanie było tanie, akceptując nieoptymalne obliczenia szkoleniowe. W miarę jak brakuje dobrych danych, rośnie zainteresowanie powtarzalnymi epokami, danymi syntetycznymi i filtrowaniem jakościowym. Szynszyla pozostaje punktem odniesienia, ale optymalność w coraz większym stopniu zależy od kosztów wnioskowania w ciągu całego życia, a nie tylko od jednorazowego budżetu na szkolenie.

Implementacja w świecie rzeczywistym

Wybór uczenia modelu o 7 miliardach parametrów na 2 bilionach tokenów zamiast modelu o 30 miliardach na zbyt małej ilości danych przy tym samym budżecie.

Szacowanie, że model o 10 miliardach parametrów wymaga, aby około 200 miliardów tokenów trafiło w optymalny dla obliczeń optymalny punkt.

Uzasadnienie mniejszego wdrożonego modelu w celu obniżenia kosztów wnioskowania na zapytanie przy jednoczesnym dorównaniu jakością większemu rywalowi.

Audyt istniejącego modelu i stwierdzenie, że jest on niedotrenowany, a następnie zaplanowanie dłuższej serii szkoleniowej zamiast zwiększania parametrów.

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokument, w którym pomocne jest szkolenie Chinchilla Compute-Optimal Training i gdzie prostsze metody są lepsze.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Szkolenie w czasie testu

Często zadawane pytania

What is Chinchilla Compute-Optimal Training?

Z ustaleń DeepMind z 2022 r. Chinchilla wynika, że większość dużych modeli językowych była źle przeszkolona: w przypadku stałego budżetu obliczeniowego należy mniej więcej równomiernie skalować parametry i dane, a nie tylko budować większy model. Zmieniło to sposób, w jaki branża równoważy wielkość modelu z danymi szkoleniowymi.

Jaka jest słynna praktyczna zasada Chinszyli dotycząca treningu z optymalizacją obliczeniową?

DeepMind odkrył, że parametry i tokeny powinny skalować się razem przy około 20 tokenach na parametr przy danym budżecie obliczeniowym.

Jak wypada szynszyla o parametrze 70B w porównaniu z gopherem o parametrze 280B?

Wyszkolona na znacznie większej liczbie tokenów i przy tych samych obliczeniach, Chinchilla pokonała znacznie większego Gophera w większości testów porównawczych.

Jaki kluczowy problem ujawnił artykuł dotyczący szynszyli dotyczący wcześniejszych dużych modeli?

Modele takie jak GPT-3 i Gopher były zbyt duże w stosunku do danych szkoleniowych, przez co wydajność była niezrealizowana.

W przybliżeniu, ile tokenów sugeruje reguła szynszyli dla modelu o 10 miliardach parametrów?

Przy 20 tokenach na parametr 10 miliardów parametrów oznacza około 200 miliardów tokenów szkoleniowych.

Dlaczego mniejszy, bogaty w dane model jest atrakcyjny we wdrożeniu, poza wydajnością szkolenia?

Mniej parametrów oznacza mniejszą liczbę obliczeń na zapytanie, więc oszczędności są zwiększane przy każdym użyciu modelu.