GUIA de fundamentos

Ajuste fino de reprodução automática

O ajuste fino do autojogo melhora um modelo, fazendo-o competir ou aprender com seus próprios resultados anteriores, gerando seu próprio sinal de treinamento.

2 minutos de leituraÚltima atualização

Visão geral

It matters because it can push performance beyond the supervised data using little or no extra human labeling.

Mergulho profundo

O autojogo tem raízes profundas na IA dos jogos: AlphaGo Zero e AlphaZero alcançaram o jogo sobre-humano simplesmente por jogar milhões de partidas contra si mesmos, sem registros de jogos humanos. O mesmo espírito aparece agora no ajuste fino do modelo de linguagem. No SPIN (Self-Play FIne-TuNing), o modelo atual gera respostas aos prompts, e o treinamento leva o modelo a distinguir suas próprias respostas geradas das respostas originais escritas por humanos, tratando-se tanto como jogador quanto como oponente. Ao longo de iterações sucessivas, o “oponente” (o ponto de verificação anterior) fica mais forte, por isso o modelo deve continuar a melhorar, fechando gradualmente a lacuna com a distribuição alvo. O grande apelo é a eficiência dos dados: um conjunto de dados fixo e supervisionado pode ser reduzido para obter mais ganhos sem recolher novas demonstrações ou preferências humanas.

Visão Técnica

O SPIN enquadra o ajuste fino como um jogo para dois jogadores com uma perda no estilo DPO: o modelo é treinado para atribuir maior probabilidade às respostas de referência humanas do que às suas próprias respostas autogeradas na iteração anterior. Como o ponto de verificação anterior fornece os negativos, a dificuldade aumenta automaticamente à medida que o modelo melhora. Nos sistemas de jogo, o autojogo é combinado com a pesquisa (por exemplo, MCTS) e uma rede de valor, gerando um currículo interminável de oponentes progressivamente mais difíceis, sem dados externos.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro do ajuste fino de reprodução automática

O autojogo é um dos principais candidatos para quebrar o muro de dados, uma vez que fabrica o seu próprio currículo em vez de depender de escassos rótulos humanos. Espere crescimento em domínios verificáveis, como matemática, código e prova de teoremas, onde verificadores automáticos avaliam tentativas autogeradas. Os riscos incluem hacking de recompensas e colapso do modelo devido ao treinamento com muitos resultados sintéticos, de modo que os sistemas futuros provavelmente combinarão o autojogo com sinais de aterramento, verificadores e feedback periódico humano ou do mundo real.

Implementação no mundo real

AlphaGo Zero e AlphaZero alcançando Go, xadrez e shogi sobre-humanos inteiramente por meio do jogo autônomo, sem jogos humanos

SPIN aumentando as pontuações de benchmark de um LLM, distinguindo iterativamente seus próprios resultados das respostas de referência humana

Modelos matemáticos e de codificação gerando tentativas de solução e, em seguida, treinando aquelas verificadas por verificadores automáticos ou testes unitários

Agentes de negociação e diálogo melhorando a estratégia ao jogar repetidamente os dois lados de uma conversa contra si mesmos

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde o Self-Play Fine-Tuning ajuda e onde métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Play Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Self-Play Fine-Tuning?

O ajuste fino do autojogo melhora um modelo, fazendo-o competir ou aprender com seus próprios resultados anteriores, gerando seu próprio sinal de treinamento. É importante porque pode levar o desempenho além dos dados supervisionados usando pouca ou nenhuma rotulagem humana extra.

Qual sistema famoso alcançou o jogo Go sobre-humano usando apenas o autojogo e nenhum registro de jogo humano?

AlphaGo Zero aprendeu inteiramente com jogos que jogou contra si mesmo, começando com jogos aleatórios e superando versões anteriores treinadas em jogos humanos.

No SPIN, qual é o papel do “oponente” que o modelo deve vencer?

O SPIN trata o ajuste fino como um jogo de jogo automático, onde os resultados autogerados da iteração anterior servem como negativos que o modelo aprende a superar.

Qual é a principal vantagem de eficiência de dados do ajuste fino de reprodução automática?

A reprodução automática fabrica seu próprio sinal de treinamento, portanto, um conjunto fixo e supervisionado pode gerar melhorias adicionais sem coletar novas demonstrações.

No objetivo de treinamento do SPIN, o que o modelo é incentivado a fazer?

O SPIN usa uma perda no estilo DPO que recompensa a distinção entre respostas de referência humana (positivas) das respostas autogeradas anteriores do modelo (negativas).

Por que a dificuldade no ajuste fino da reprodução automática aumenta automaticamente ao longo das iterações?

Como os pontos negativos de cada iteração provêm de um modelo anterior mais forte, o modelo enfrenta um desafio cada vez mais difícil sem a concepção curricular manual.