Przepisy dotyczące skalowania szynszyli
Przepisy dotyczące skalowania szynszyli opracowane przez DeepMind w 2022 r. pokazały, że większość dużych modeli językowych była słabo przeszkolona: w przypadku stałego budżetu obliczeniowego należy skalować rozmiar modelu i dane szkoleniowe mniej więcej w równych proporcjach.
Przegląd
Ma to znaczenie, ponieważ na nowo zdefiniowało, co oznacza „optymalny” rozmiar modelu i na nowo ukształtowało sposób, w jaki laboratoria wykorzystują moc obliczeniową.
Głębokie nurkowanie
Przed szynszylą panowała tendencja do budowania coraz większych modeli (takich jak GPT-3 z parametrem 175B) podczas uczenia na stosunkowo skromnych ilościach danych. DeepMind przeszkolił ponad 400 modeli dla różnych rozmiarów i budżetów danych, a następnie dopasował krzywe przewidujące straty jako funkcję parametrów i tokenów w ramach stałego budżetu obliczeniowego (FLOP). Ich odkrycie: parametry i tokeny szkoleniowe powinny skalować się razem, mniej więcej w stosunku 1 do 1, co oznacza około 20 tokenów danych szkoleniowych na parametr. Aby to udowodnić, wytrenowali Chinchillę, model o parametrach 70B na 1,4 biliona tokenów, który działał lepiej niż znacznie większy Gopher o parametrach 280B pomimo użycia tych samych obliczeń, ponieważ został wytrenowany na znacznie większej liczbie danych.
Wgląd techniczny
Prawa wynikają z dopasowania parametrycznej funkcji straty L(N, D), gdzie N to parametry, a D to tokeny, w tym terminy dotyczące straty nieredukowalnej, rozmiaru modelu i rozmiaru danych. Minimalizowanie strat podlegających ograniczeniom obliczeniowym (obliczenia są w przybliżeniu proporcjonalne do N razy D) daje wynik, w którym optymalne N i D rosną jako potęga obliczeniowa z podobnymi wykładnikami, więc optymalny stosunek obliczeń pozostaje w pobliżu 20 tokenów na parametr.
Wpływ strategiczny
Szybkość i skala
Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.
Dostęp i zasięg
Rozszerza dostęp w różnych językach i stylach komunikacji.
Jaśniejsze decyzje
Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.
Przyszłość przepisów dotyczących skalowania szynszyli
Chinchilla przesunęła dziedzinę ze śledzenia liczby parametrów na dostarczanie modelom znacznie większej ilości danych wysokiej jakości, a nowoczesne modele często trenują znacznie dalej niż punkt „optymalny obliczeniowo”, aby wnioskowanie było tańsze. Ponieważ wysokiej jakości teksty internetowe stają się rzadkością, uwaga skupia się na selekcji danych, danych syntetycznych, wielu epokach i danych multimodalnych, aby zachować skalowanie. Podstawowa lekcja pozostaje niezmienna: dane i parametry muszą być zrównoważone, a sam rozmiar nie jest już celem.
Implementacja w świecie rzeczywistym
Szynszyla o parametrach 70B firmy DeepMind pokonuje Gophera 280B w testach porównawczych przy użyciu takich samych mocy obliczeniowych, trenując na znacznie większej liczbie danych
Kierowanie zespołami w celu zaplanowania budżetu około 20 tokenów szkoleniowych na parametr podczas planowania modelu od podstaw
Uzasadnienie mniejszych modeli bogatych w dane, takich jak LLaMA, których uruchomienie jest tańsze w czasie wnioskowania
Oszacowanie, czy planowany model jest „niedostatecznie przeszkolony” i czy skorzystałby bardziej z dodatkowych danych niż dodatkowych parametrów
Zagrożenia i poręcze
Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.
Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.
Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.
Plan wdrożenia
Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.
Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.
Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.
Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Prawa skalowania dla sieci neuronowych
Często zadawane pytania
Jakie są przepisy dotyczące skalowania szynszyli?
Przepisy dotyczące skalowania szynszyli opracowane przez DeepMind w 2022 r. pokazały, że większość dużych modeli językowych była słabo przeszkolona: w przypadku stałego budżetu obliczeniowego należy skalować rozmiar modelu i dane szkoleniowe mniej więcej w równych proporcjach. Ma to znaczenie, ponieważ na nowo zdefiniowało, co oznacza „optymalny” rozmiar modelu i na nowo ukształtowało sposób, w jaki laboratoria wykorzystują moc obliczeniową.
Jakie było główne odkrycie przepisów dotyczących łuszczenia się szynszyli?
Chinchilla pokazała, że przy stałym budżecie obliczeniowym parametry i tokeny szkoleniowe powinny rosnąć razem, mniej więcej 1 do 1.
W przybliżeniu, ile tokenów szkoleniowych na parametr Chinchilla sugerowała jako optymalna pod względem obliczeniowym?
Optymalny współczynnik obliczeniowy wynosi około 20 tokenów szkoleniowych dla każdego parametru modelu.
Który model Chinchilla radził sobie lepiej, mimo że był znacznie mniejszy?
Szynszyla o parametrze 70B pokonała Gophera o parametrze 280B firmy DeepMind przy użyciu tych samych obliczeń, ponieważ trenowała na znacznie większej liczbie danych.
Co Chinchilla sugerowała wówczas na temat modeli takich jak GPT-3?
Wiele dużych modeli z tamtej epoki było niedostatecznie przeszkolonych, co oznacza, że radziłyby sobie lepiej, gdyby miały znacznie więcej danych dotyczących liczby parametrów.
W przybliżeniu, jak przybliżono obliczenia w analizie szynszyli?
Obliczenia szkoleniowe (FLOP) są w przybliżeniu proporcjonalne do liczby parametrów pomnożonej przez liczbę tokenów szkoleniowych.