GUIA de IA de linguagem

Leis de dimensionamento de chinchila

As leis de dimensionamento Chinchilla, da DeepMind em 2022, mostraram que a maioria dos grandes modelos de linguagem estavam mal treinados: para um orçamento de computação fixo, você deve dimensionar o tamanho do modelo e os dados de treinamento aproximadamente em proporção igual.

2 minutos de leituraÚltima atualização

Visão geral

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

Mergulho profundo

Antes do Chinchilla, a tendência era construir modelos cada vez maiores (como o GPT-3 de 175B) enquanto treinava com quantidades relativamente modestas de dados. A DeepMind treinou mais de 400 modelos em vários tamanhos e orçamentos de dados e, em seguida, ajustou curvas que preveem perdas em função de parâmetros e tokens sob um orçamento de computação fixa (FLOP). A conclusão deles: parâmetros e tokens de treinamento devem ser dimensionados juntos, aproximadamente na proporção de 1 para 1, o que implica cerca de 20 tokens de dados de treinamento por parâmetro. Para provar isso, eles treinaram o Chinchilla, um modelo de parâmetro 70B em 1,4 trilhão de tokens, que superou o desempenho do Gopher, muito maior, de parâmetro 280B, apesar de usar a mesma computação, porque foi treinado em muito mais dados.

Visão Técnica

As leis vêm do ajuste de uma função de perda paramétrica L(N, D) onde N são parâmetros e D são tokens, incluindo termos de perda irredutível, tamanho do modelo e tamanho dos dados. Minimizar a perda sujeita a uma restrição de computação (a computação é aproximadamente proporcional a N vezes D) produz o resultado de que N e D ideais crescem como uma potência de computação com expoentes semelhantes, de modo que a proporção de computação ideal permanece próxima de 20 tokens por parâmetro.

Impacto Estratégico

Velocidade e escala

Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.

Acesso e alcance

Ele expande o acesso entre idiomas e estilos de comunicação.

Decisões mais claras

As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.

O futuro das leis de escamação de chinchilas

A Chinchilla mudou o campo de perseguir contagens de parâmetros para alimentar modelos com muito mais dados de alta qualidade, e os modelos modernos muitas vezes treinam muito além do ponto de “computação ideal” para tornar a inferência mais barata. À medida que o texto da web de alta qualidade se torna escasso, a atenção está se voltando para a curadoria de dados, dados sintéticos, múltiplas épocas e dados multimodais para continuar a escalar. A lição principal perdura: os dados e os parâmetros devem ser equilibrados, e o tamanho bruto por si só não é mais o objetivo.

Implementação no mundo real

O Chinchilla de 70B de parâmetros da DeepMind superou o Gopher de 280B em benchmarks usando computação igual, treinando com muito mais dados

Orientar as equipes a orçamentar aproximadamente 20 tokens de treinamento por parâmetro ao planejar um modelo do zero

Justificando modelos menores e ricos em dados, como o LLaMA, que são mais baratos de executar no momento da inferência

Estimar se um modelo planejado está “subtreinado” e se beneficiaria mais de dados extras do que de parâmetros extras

Riscos e guarda-corpos

Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.

A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.

Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.

Roteiro de implementação

1

Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.

2

Respostas terrestres com fontes confiáveis ​​sempre que a precisão for importante.

3

Mantenha um ponto de verificação de revisão humana para resultados de alto risco.

4

Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Leis de escala para redes neurais

Perguntas frequentes

What is Chinchilla Scaling Laws?

As leis de dimensionamento Chinchilla, da DeepMind em 2022, mostraram que a maioria dos grandes modelos de linguagem estavam mal treinados: para um orçamento de computação fixo, você deve dimensionar o tamanho do modelo e os dados de treinamento aproximadamente em proporção igual. É importante porque redefiniu o que significa tamanho de modelo “ideal” e remodelou a forma como os laboratórios gastam computação.

Qual foi a descoberta central das leis de escala da chinchila?

Chinchilla mostrou que, para um orçamento de computação fixo, os parâmetros e os tokens de treinamento deveriam crescer juntos, aproximadamente 1 para 1.

Aproximadamente quantos tokens de treinamento por parâmetro Chinchilla sugeriu serem ideais para computação?

A proporção ideal de computação resulta em aproximadamente 20 tokens de treinamento para cada parâmetro do modelo.

Qual modelo o Chinchilla superou apesar de ser muito menor?

O Chinchilla de parâmetro 70B superou o Gopher de parâmetro 280B da DeepMind usando a mesma computação, porque treinou com muito mais dados.

O que Chinchilla insinuou sobre modelos como o GPT-3 na época?

Muitos modelos grandes daquela época estavam subtreinados, o que significa que teriam um desempenho melhor com muito mais dados para a contagem de parâmetros.

Aproximadamente como o cálculo foi aproximado na análise da Chinchila?

A computação de treinamento (FLOPs) é aproximadamente proporcional ao número de parâmetros multiplicado pelo número de tokens de treinamento.