Tilbake til Nyheter
InnovasjonAI Understanding orientering

Google introduserer autofinjustering for autonom LLM etter trening

Google har gitt ut autofinetune, et verktøy som bruker AI-agenter for å automatisere hyperparameterinnstilling og optimalisering av LLM-ettertreningsprosesser på TPU-er.

4 min readRead the primary source
Source-provided image accompanying Google introduces autofinetune for autonomous LLM post-training
PrimærkildedokumentKilde registrert
Utgiver
developers.googleblog.com
Kilde lenke
developers.googleblog.comhttps://developers.googleblog.com/autonomous-llm-post-training-with-tunix-on-tpus/
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Etter trening
Treningstrinn brukt etter forhåndstrening, for eksempel instruksjonsinnstilling, preferanseoptimalisering og sikkerhetsinnstilling.
LoRA (Low-Rank Adaptation)
En parametereffektiv finjusteringsmetode som legger til lavrangerte adaptermatriser.
Test deg selvAI Agents Quiz

Hva skjedde

Google ga ut autofinetune, et system som automatiserer LLM etter trening ved å bruke AI-agenter for iterativt å optimalisere hyperparametre for Supervised Fine-Tuning (SFT) og Reinforcement Learning (RL). Verktøyet integrerer Googles Tunix-bibliotek, Gemma-modeller og Cloud TPU-er, orkestrert via Antigravity CLI og Gemini Flash 3.7. I casestudier justerte agenten autonomt parametere som LoRA-rangeringer og læringsrater, og forbedret modellens nøyaktighet og belønningsscore uten manuell intervensjon.

Google kunngjorde utgivelsen av autofinetune, et prosjekt designet for å automatisere etteropplæringen av store språkmodeller (LLM). Systemet bruker en autonom forskningssløyfe der en AI-agent iterativt utforsker og optimaliserer treningskonfigurasjoner. Denne tilnærmingen er inspirert av det tidligere autoforskningsprosjektet, som demonstrerte autonom utforskning før trening.

Verktøyet utnytter Googles fulle AI-stabel, spesielt ved å bruke Tunix-biblioteket for trening, Gemma-modeller som base og Cloud TPU-er for databehandling. Orkestreringen håndteres av Antigravity CLI og Gemini Flash 3.7. Hovedmålet er å erstatte den tradisjonelle manuelle syklusen med å justere hyperparametre med en automatisert prosess som kjører eksperimenter over natten og forplikter bekreftede forbedringer til Git.

I den første casestudien optimaliserte agenten google/functiongemma-270m-it-modellen på google/mobile-actions-datasettet ved hjelp av Supervised Fine-Tuning (SFT). Agenten justerte automatisk parametere som LoRA-rangering, alfa, optimizer og læringshastighet. Resultatene viste en konsekvent forbedring i modellens evne til å generere korrekte funksjonsanrop, og demonstrerte agentens evne til å "klatre i bakke" mot bedre nøyaktighet.

Den andre casestudien fokuserte på Reinforcement Learning (RL) ved å bruke GRPO-metoden for å trene Gemma 3 1B for matematisk resonnement på GSM8K-datasettet. RL er kjent for sin følsomhet for hyperparametre og ustabilitet. Den autonome agenten identifiserte bedre konfigurasjoner for LoRA, utrullingstemperatur, KL-straff og systemmeldinger. Dette resulterte i en forbedring på omtrent 10 % i total belønning, noe som indikerer bedre numerisk og formatnøyaktighet i modellens svar.

Kildedetaljer: developers.googleblog.com ↗

Hvorfor det betyr noe

Denne utviklingen reduserer markant adgangsbarrieren for høykvalitets LLM-finjustering ved å fjerne behovet for manuell, repeterende eksperimentering. Ved å automatisere søket etter optimale hyperparametre, lar det utviklere oppnå bedre modellytelse med mindre spesialisert ekspertise og tid. Dette skiftet mot autonome forskningssløyfer kan akselerere iterasjonssyklusen for AI-utviklere, og gjøre avanserte ettertreningsteknikker mer tilgjengelige og effektive for et bredere spekter av organisasjoner og individuelle forskere.

Autonom ettertrening adresserer en betydelig flaskehals i AI-utvikling: tiden og ekspertisen som kreves for å justere hyperparametre manuelt. Ved å automatisere denne prosessen, gjør Google avansert modelloptimalisering mer tilgjengelig for utviklere som kanskje ikke har dyp ekspertise innen forsterkningslæring eller finjustering av mekanikk.

Integreringen av AI-agenter i treningssløyfen representerer et skifte mot selvforbedrende AI-systemer. Hvis agenter pålitelig kan optimalisere sine egne treningsparametere, kan tempoet i modellforbedring øke, og potensielt redusere kostnadene og tiden forbundet med å utvikle spesialiserte LLM-er for spesifikke oppgaver.

Dette verktøyet er spesielt relevant for organisasjoner som bruker Google Cloud TPU-er, siden det gir en innebygd, optimalisert arbeidsflyt for å utnytte denne maskinvaren. Det fremhever også den økende rollen til agent AI i programvareutvikling og forskningsarbeidsflyter, og går fra enkel kodegenerering til kompleks eksperimentell design og utførelse.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Hva du skal se neste

Overvåk bruken av autofinjustering i utviklerfellesskapet og eventuelle påfølgende oppdateringer til Tunix-biblioteket. Se etter uavhengige benchmarks som bekrefter ytelsesgevinstene som hevdes i Googles casestudier, spesielt angående stabiliteten til autonom RL-innstilling. I tillegg kan du observere om andre store AI-leverandører slipper lignende autonome verktøy etter opplæring, som kan signalisere et bredere bransjeskifte mot selvoptimaliserende modellutviklingspipelines.

Uavhengig verifisering av ytelsesgevinstene er avgjørende. Mens Google rapporterer en ~10 % belønningsforbedring i RL-casestudien, vil tredjeparts benchmarks være nødvendig for å bekrefte disse resultatene på tvers av forskjellige datasett og modellstørrelser.

Stabiliteten til autonom RL-innstilling er et nøkkelområde å overvåke. RL er notorisk ustabil, og det gjenstår å se hvor godt agenten håndterer edge-saker eller forhindrer belønningshacking i mer komplekse scenarier.

Adopsjonsberegninger for autofinetune GitHub-depotet vil indikere utviklerinteresse. Hvis verktøyet får betydelig trekkraft, kan det påvirke det bredere økosystemet til LLM-treningsbiblioteker og -verktøy.

Relaterte guider og quizer

AI-agenterAI treningAI-modeller forklartTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?