PRZEWODNIK Językowy AI

Przepisy dotyczące skalowania szynszyli

Przepisy dotyczące skalowania szynszyli opracowane przez DeepMind w 2022 r. pokazały, że większość dużych modeli językowych była słabo przeszkolona: w przypadku stałego budżetu obliczeniowego należy skalować rozmiar modelu i dane szkoleniowe mniej więcej w równych proporcjach.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Ma to znaczenie, ponieważ na nowo zdefiniowało, co oznacza „optymalny” rozmiar modelu i na nowo ukształtowało sposób, w jaki laboratoria wykorzystują moc obliczeniową.

Głębokie nurkowanie

Przed szynszylą panowała tendencja do budowania coraz większych modeli (takich jak GPT-3 z parametrem 175B) podczas uczenia na stosunkowo skromnych ilościach danych. DeepMind przeszkolił ponad 400 modeli dla różnych rozmiarów i budżetów danych, a następnie dopasował krzywe przewidujące straty jako funkcję parametrów i tokenów w ramach stałego budżetu obliczeniowego (FLOP). Ich odkrycie: parametry i tokeny szkoleniowe powinny skalować się razem, mniej więcej w stosunku 1 do 1, co oznacza około 20 tokenów danych szkoleniowych na parametr. Aby to udowodnić, wytrenowali Chinchillę, model o parametrach 70B na 1,4 biliona tokenów, który działał lepiej niż znacznie większy Gopher o parametrach 280B pomimo użycia tych samych obliczeń, ponieważ został wytrenowany na znacznie większej liczbie danych.

Wgląd techniczny

Prawa wynikają z dopasowania parametrycznej funkcji straty L(N, D), gdzie N to parametry, a D to tokeny, w tym terminy dotyczące straty nieredukowalnej, rozmiaru modelu i rozmiaru danych. Minimalizowanie strat podlegających ograniczeniom obliczeniowym (obliczenia są w przybliżeniu proporcjonalne do N razy D) daje wynik, w którym optymalne N i D rosną jako potęga obliczeniowa z podobnymi wykładnikami, więc optymalny stosunek obliczeń pozostaje w pobliżu 20 tokenów na parametr.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość przepisów dotyczących skalowania szynszyli

Chinchilla przesunęła dziedzinę ze śledzenia liczby parametrów na dostarczanie modelom znacznie większej ilości danych wysokiej jakości, a nowoczesne modele często trenują znacznie dalej niż punkt „optymalny obliczeniowo”, aby wnioskowanie było tańsze. Ponieważ wysokiej jakości teksty internetowe stają się rzadkością, uwaga skupia się na selekcji danych, danych syntetycznych, wielu epokach i danych multimodalnych, aby zachować skalowanie. Podstawowa lekcja pozostaje niezmienna: dane i parametry muszą być zrównoważone, a sam rozmiar nie jest już celem.

Implementacja w świecie rzeczywistym

Szynszyla o parametrach 70B firmy DeepMind pokonuje Gophera 280B w testach porównawczych przy użyciu takich samych mocy obliczeniowych, trenując na znacznie większej liczbie danych

Kierowanie zespołami w celu zaplanowania budżetu około 20 tokenów szkoleniowych na parametr podczas planowania modelu od podstaw

Uzasadnienie mniejszych modeli bogatych w dane, takich jak LLaMA, których uruchomienie jest tańsze w czasie wnioskowania

Oszacowanie, czy planowany model jest „niedostatecznie przeszkolony” i czy skorzystałby bardziej z dodatkowych danych niż dodatkowych parametrów

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Prawa skalowania dla sieci neuronowych

Często zadawane pytania

Jakie są przepisy dotyczące skalowania szynszyli?

Przepisy dotyczące skalowania szynszyli opracowane przez DeepMind w 2022 r. pokazały, że większość dużych modeli językowych była słabo przeszkolona: w przypadku stałego budżetu obliczeniowego należy skalować rozmiar modelu i dane szkoleniowe mniej więcej w równych proporcjach. Ma to znaczenie, ponieważ na nowo zdefiniowało, co oznacza „optymalny” rozmiar modelu i na nowo ukształtowało sposób, w jaki laboratoria wykorzystują moc obliczeniową.

Jakie było główne odkrycie przepisów dotyczących łuszczenia się szynszyli?

Chinchilla pokazała, że ​​przy stałym budżecie obliczeniowym parametry i tokeny szkoleniowe powinny rosnąć razem, mniej więcej 1 do 1.

W przybliżeniu, ile tokenów szkoleniowych na parametr Chinchilla sugerowała jako optymalna pod względem obliczeniowym?

Optymalny współczynnik obliczeniowy wynosi około 20 tokenów szkoleniowych dla każdego parametru modelu.

Który model Chinchilla radził sobie lepiej, mimo że był znacznie mniejszy?

Szynszyla o parametrze 70B pokonała Gophera o parametrze 280B firmy DeepMind przy użyciu tych samych obliczeń, ponieważ trenowała na znacznie większej liczbie danych.

Co Chinchilla sugerowała wówczas na temat modeli takich jak GPT-3?

Wiele dużych modeli z tamtej epoki było niedostatecznie przeszkolonych, co oznacza, że ​​radziłyby sobie lepiej, gdyby miały znacznie więcej danych dotyczących liczby parametrów.

W przybliżeniu, jak przybliżono obliczenia w analizie szynszyli?

Obliczenia szkoleniowe (FLOP) są w przybliżeniu proporcjonalne do liczby parametrów pomnożonej przez liczbę tokenów szkoleniowych.