GUIA de fundamentos

Treinamento ideal para computação de chinchila

Chinchilla é uma descoberta da DeepMind de 2022 de que a maioria dos grandes modelos de linguagem estavam mal treinados: para um orçamento de computação fixo, você deve dimensionar parâmetros e dados de maneira aproximadamente igual, e não apenas construir um modelo maior.

2 minutos de leituraÚltima atualização

Visão geral

It reshaped how the industry balances model size against training data.

Mergulho profundo

O artigo Chinchilla da DeepMind revisitou o dimensionamento e treinou mais de 400 modelos para encontrar o equilíbrio ideal de computação. A regra geral: o tamanho do modelo e os tokens de treinamento devem crescer em sincronia, aproximadamente 20 tokens de treinamento por parâmetro. Para provar isso, eles treinaram o Chinchilla, um modelo de 70 bilhões de parâmetros em 1,4 trilhão de tokens, usando a mesma computação que o Gopher de 280 bilhões de parâmetros treinado em muito menos tokens. A Chinchilla, apesar de ser quatro vezes menor, superou o Gopher, o GPT-3 e outros gigantes em quase todos os benchmarks. A lição derrubou a conclusão anterior de OpenAI que favorecia o tamanho em detrimento dos dados, mostrando que muitos modelos emblemáticos estavam deixando o desempenho em risco por serem muito grandes e carentes de dados.

Visão Técnica

Perda de ajuste da chinchila como L(N,D) = E + A·N^(-α) + B·D^(-β), com α e β ambos próximos de 0,34, o que significa que parâmetros e dados contribuem quase simetricamente. Otimizar isso sob uma restrição de cálculo fixa (cálculo ≈ 6·N·D para transformadores) produz o resultado de escala igual. Um modelo menor e rico em dados também é mais barato para executar na inferência, portanto, sua vantagem aumenta na implantação, não apenas no treinamento.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro do treinamento otimizado para computação de chinchila

Modelos modernos como o Llama 3 ultrapassam deliberadamente a proporção de 20 tokens por parâmetro do Chinchilla, treinando pequenos modelos em trilhões de tokens para tornar a inferência barata, aceitando computação de treinamento abaixo do ideal. À medida que os dados de boa qualidade se tornam escassos, aumenta o interesse em épocas repetidas, dados sintéticos e filtragem de qualidade. A chinchila continua a ser o ponto de referência, mas o óptimo depende cada vez mais do custo de inferência ao longo da vida, e não apenas do orçamento de formação único.

Implementação no mundo real

Optar por treinar um modelo de 7 bilhões de parâmetros em 2 trilhões de tokens, em vez de um modelo de 30 bilhões com poucos dados para o mesmo orçamento.

Estimando que um modelo de 10 bilhões de parâmetros deseja que cerca de 200 bilhões de tokens atinjam o ponto ideal de computação.

Justificar um modelo implantado menor para reduzir os custos de inferência por consulta e, ao mesmo tempo, corresponder à qualidade de um rival maior.

Auditar um modelo existente e concluir que ele estava subtreinado e, em seguida, planejar uma execução de treinamento mais longa em vez de um aumento de parâmetro.

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde o Chinchilla Compute-Optimal Training ajuda e onde métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Treinamento em tempo de teste

Perguntas frequentes

What is Chinchilla Compute-Optimal Training?

Chinchilla é uma descoberta da DeepMind de 2022 de que a maioria dos grandes modelos de linguagem estavam mal treinados: para um orçamento de computação fixo, você deve dimensionar parâmetros e dados de maneira aproximadamente igual, e não apenas construir um modelo maior. Ele reformulou a forma como a indústria equilibra o tamanho do modelo em relação aos dados de treinamento.

Qual é a famosa regra prática de Chinchilla para treinamento com otimização de computação?

Os parâmetros e tokens encontrados pela DeepMind devem ser dimensionados juntos em aproximadamente 20 tokens por parâmetro para um determinado orçamento de computação.

Como a Chinchila de parâmetro 70B se compara ao Gopher de parâmetro 280B?

Treinado em muito mais tokens com a mesma computação, o Chinchilla venceu o Gopher, muito maior, na maioria dos benchmarks.

Que problema principal o artigo da Chinchilla revelou sobre os grandes modelos anteriores?

Modelos como GPT-3 e Gopher eram muito grandes em relação aos dados de treinamento, deixando o desempenho irrealizado.

Aproximadamente quantos tokens a regra da Chinchilla sugere para um modelo de 10 bilhões de parâmetros?

Com 20 tokens por parâmetro, 10 bilhões de parâmetros implicam em cerca de 200 bilhões de tokens de treinamento.

Além da eficiência do treinamento, por que um modelo menor e rico em dados é atraente para implantação?

Menos parâmetros significam menor cálculo por consulta, portanto, a economia aumenta sempre que o modelo é usado.