Voltar às notícias
InovaçãoInstruções AI Understanding

Google apresenta ajuste automático para pós-treinamento autônomo de LLM

Google lançou o autofinetune, uma ferramenta que usa agentes de IA para automatizar o ajuste e otimização de hiperparâmetros de processos pós-treinamento LLM em TPUs.

4 min readRead the primary source
Source-provided image accompanying Google introduces autofinetune for autonomous LLM post-training
Documento de origem primáriaFonte registrada
Editora
developers.googleblog.com
Link da fonte
developers.googleblog.comhttps://developers.googleblog.com/autonomous-llm-post-training-with-tunix-on-tpus/
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Modelo de linguagem grande (LLM)
Um modelo de linguagem treinado em corpora de texto massivo para gerar e analisar texto.
Pós-treinamento
Etapas de treinamento aplicadas após o pré-treinamento, como ajuste de instrução, otimização de preferência e ajuste de segurança.
LoRA (adaptação de baixa classificação)
Um método de ajuste fino com parâmetros eficientes que adiciona matrizes adaptadoras de classificação baixa.
Teste você mesmoQuestionário sobre agentes de IA

O que aconteceu

Google lançou o autofinetune, um sistema que automatiza o pós-treinamento LLM usando agentes de IA para otimizar iterativamente hiperparâmetros para ajuste fino supervisionado (SFT) e aprendizado por reforço (RL). A ferramenta integra a biblioteca Tunix do Google, modelos Gemma e Cloud TPUs, orquestrados via Antigravity CLI e Gemini Flash 3.7. Em estudos de caso, o agente ajustou parâmetros de forma autônoma, como classificações LoRA e taxas de aprendizagem, melhorando a precisão do modelo e as pontuações de recompensa sem intervenção manual.

Google anunciou o lançamento do autofinetune, um projeto desenvolvido para automatizar o pós-treinamento de Large Language Models (LLMs). O sistema utiliza um ciclo de pesquisa autônomo onde um agente de IA explora e otimiza iterativamente as configurações de treinamento. Esta abordagem é inspirada no projeto de autopesquisa anterior, que demonstrou a exploração autônoma pré-treinamento.

A ferramenta aproveita toda a pilha de IA do Google, usando especificamente a biblioteca Tunix para treinamento, modelos Gemma como base e Cloud TPUs para computação. A orquestração é feita pelo Antigravity CLI e Gemini Flash 3.7. O objetivo principal é substituir o ciclo manual tradicional de ajuste de hiperparâmetros por um processo automatizado que executa experimentos durante a noite e envia melhorias verificadas ao Git.

No primeiro estudo de caso, o agente otimizou o modelo google/functiongemma-270m-it no conjunto de dados google/mobile-actions usando Supervised Fine-Tuning (SFT). O agente ajustou automaticamente parâmetros como classificação LoRA, alfa, otimizador e taxa de aprendizagem. Os resultados mostraram uma melhoria consistente na capacidade do modelo de gerar chamadas de função corretas, demonstrando a capacidade do agente de “subir colinas” em direção a uma melhor precisão.

O segundo estudo de caso focou no Aprendizado por Reforço (RL) usando o método GRPO para treinar Gemma 3 1B para raciocínio matemático no conjunto de dados GSM8K. RL é conhecido por sua sensibilidade a hiperparâmetros e instabilidade. O agente autônomo identificou melhores configurações para LoRA, temperatura de implementação, penalidade KL e prompts do sistema. Isso resultou em uma melhoria de aproximadamente 10% na recompensa total, indicando melhor precisão numérica e de formato nas respostas do modelo.

Detalhes da fonte: developers.googleblog.com ↗

Por que isso importa

Este desenvolvimento reduz significativamente a barreira de entrada para o ajuste fino do LLM de alta qualidade, eliminando a necessidade de experimentação manual e repetitiva. Ao automatizar a busca por hiperparâmetros ideais, permite que os desenvolvedores obtenham melhor desempenho do modelo com menos conhecimento especializado e tempo. Esta mudança para ciclos de investigação autónomos poderia acelerar o ciclo de iteração para os criadores de IA, tornando as técnicas avançadas de pós-formação mais acessíveis e eficientes para uma gama mais ampla de organizações e investigadores individuais.

O pós-treinamento autônomo aborda um gargalo significativo no desenvolvimento de IA: o tempo e a experiência necessários para ajustar manualmente os hiperparâmetros. Ao automatizar esse processo, Google está tornando a otimização avançada de modelos mais acessível para desenvolvedores que podem não ter profundo conhecimento em aprendizado por reforço ou ajuste fino de mecânica.

A integração de agentes de IA no ciclo de formação representa uma mudança em direção a sistemas de IA auto-aperfeiçoáveis. Se os agentes puderem otimizar de forma confiável seus próprios parâmetros de treinamento, o ritmo de melhoria do modelo poderá acelerar, reduzindo potencialmente o custo e o tempo associados ao desenvolvimento de LLMs especializados para tarefas específicas.

Esta ferramenta é particularmente relevante para organizações que usam Cloud TPUs Google, pois fornece um fluxo de trabalho nativo e otimizado para aproveitar esse hardware. Ele também destaca o papel crescente da IA ​​agente na engenharia de software e nos fluxos de trabalho de pesquisa, indo além da simples geração de código para o design e execução experimental complexo.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

O que assistir a seguir

Monitore a adoção do autofinetune na comunidade de desenvolvedores e quaisquer atualizações subsequentes na biblioteca Tunix. Fique atento a benchmarks independentes que verificam os ganhos de desempenho reivindicados nos estudos de caso do Google, particularmente no que diz respeito à estabilidade do ajuste RL autônomo. Além disso, observe se outros grandes fornecedores de IA lançam ferramentas autônomas de pós-treinamento semelhantes, o que poderia sinalizar uma mudança mais ampla da indústria em direção a pipelines de desenvolvimento de modelos auto-otimizados.

A verificação independente dos ganhos de desempenho é crucial. Embora Google relate uma melhoria de recompensa de aproximadamente 10% no estudo de caso de RL, serão necessários benchmarks de terceiros para confirmar esses resultados em diferentes conjuntos de dados e tamanhos de modelo.

A estabilidade do ajuste RL autônomo é uma área importante a ser monitorada. RL é notoriamente instável e resta saber até que ponto o agente lida com casos extremos ou evita hackeamento de recompensas em cenários mais complexos.

As métricas de adoção para o repositório autofinetune GitHub indicarão o interesse do desenvolvedor. Se a ferramenta ganhar força significativa, poderá influenciar o ecossistema mais amplo de bibliotecas e ferramentas de treinamento LLM.

Guias e questionários relacionados

Agentes de IATreinamento de IAModelos de IA explicadosTeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?