Înapoi la Știri
InovațieAI Understanding briefing

Google introduce autofinetune pentru post-training autonom LLM

Google a lansat autofinetune, un instrument care utilizează agenți AI pentru a automatiza reglarea hiperparametrului și optimizarea proceselor de post-formare LLM pe TPU.

4 min readRead the primary source
Source-provided image accompanying Google introduces autofinetune for autonomous LLM post-training
Document sursă primarăSursa înregistrată
Editor
developers.googleblog.com
Link sursă
developers.googleblog.comhttps://developers.googleblog.com/autonomous-llm-post-training-with-tunix-on-tpus/
Tip sursă
Document principal — un anunț oficial, hârtie, depunere sau pagină primară pe care o citim direct.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

Model de limbă mare (LLM)
Un model de limbaj instruit pe corpuri de text masive pentru a genera și analiza text.
Post-antrenament
Pași de antrenament aplicați după antrenament preliminar, cum ar fi reglarea instrucțiunilor, optimizarea preferințelor și reglarea siguranței.
LoRA (adaptare la rang scăzut)
O metodă de reglare fină eficientă din punct de vedere al parametrilor care adaugă matrice adaptoare de rang scăzut.
Testează-teTest pentru agenții AI

Ce sa întâmplat

Google a lansat autofinetune, un sistem care automatizează post-formarea LLM prin utilizarea agenților AI pentru a optimiza iterativ hiperparametrii pentru reglarea fină supravegheată (SFT) și învățarea prin consolidare (RL). Instrumentul integrează biblioteca Tunix a lui Google, modelele Gemma și Cloud TPU-uri, orchestrate prin Antigravity CLI și Gemini Flash 3.7. În studiile de caz, agentul a ajustat în mod autonom parametri precum rangurile LoRA și ratele de învățare, îmbunătățind acuratețea modelului și scorurile de recompensă fără intervenție manuală.

Google a anunțat lansarea autofinetune, un proiect conceput pentru a automatiza post-formarea modelelor de limbaj mari (LLM). Sistemul utilizează o buclă de cercetare autonomă în care un agent AI explorează și optimizează iterativ configurațiile de antrenament. Această abordare este inspirată de proiectul anterior de autoresearch, care a demonstrat explorarea autonomă înainte de antrenament.

Instrumentul folosește stiva completă de inteligență artificială a lui Google, utilizând în special biblioteca Tunix pentru antrenament, modelele Gemma ca bază și TPU-urile Cloud pentru calcul. Orchestrarea este gestionată de Antigravity CLI și Gemini Flash 3.7. Scopul principal este de a înlocui ciclul manual tradițional de ajustare a hiperparametrilor cu un proces automat care rulează experimente peste noapte și angajează îmbunătățiri verificate pentru Git.

În primul studiu de caz, agentul a optimizat modelul google/functiongemma-270m-it pe setul de date google/mobile-actions utilizând reglajul fin supravegheat (SFT). Agentul a ajustat automat parametri precum rangul LoRA, alfa, optimizatorul și rata de învățare. Rezultatele au arătat o îmbunătățire consecventă a capacității modelului de a genera apeluri corecte de funcție, demonstrând capacitatea agentului de a „urca dealul” spre o mai bună acuratețe.

Al doilea studiu de caz s-a concentrat pe Învățarea prin întărire (RL) folosind metoda GRPO pentru a antrena Gemma 3 1B pentru raționamentul matematic pe setul de date GSM8K. RL este remarcat pentru sensibilitatea sa la hiperparametri și instabilitate. Agentul autonom a identificat configurații mai bune pentru LoRA, temperatura de lansare, penalizarea KL și solicitările de sistem. Acest lucru a dus la o îmbunătățire cu aproximativ 10% a recompensei totale, indicând o mai bună acuratețe numerică și de format în răspunsurile modelului.

Detalii sursa: developers.googleblog.com ↗

De ce contează

Această dezvoltare reduce în mod semnificativ bariera de intrare pentru reglarea fină a LLM de înaltă calitate, eliminând nevoia de experimentare manuală, repetitivă. Prin automatizarea căutării hiperparametrilor optimi, le permite dezvoltatorilor să obțină o performanță mai bună a modelului cu mai puțină expertiză specializată și timp. Această trecere către bucle de cercetare autonome ar putea accelera ciclul de iterație pentru dezvoltatorii AI, făcând tehnicile avansate de post-formare mai accesibile și mai eficiente pentru o gamă mai largă de organizații și cercetători individuali.

Post-instruirea autonomă abordează un blocaj semnificativ în dezvoltarea AI: timpul și expertiza necesare pentru a regla manual hiperparametrii. Prin automatizarea acestui proces, Google face optimizarea avansată a modelului mai accesibilă pentru dezvoltatorii care nu au o experiență profundă în învățarea prin consolidare sau mecanica de reglare fină.

Integrarea agenților AI în bucla de antrenament reprezintă o schimbare către sistemele AI auto-îmbunătățitoare. Dacă agenții își pot optimiza în mod fiabil proprii parametri de formare, ritmul de îmbunătățire a modelului s-ar putea accelera, reducând potențial costurile și timpul asociate cu dezvoltarea de LLM-uri specializate pentru sarcini specifice.

Acest instrument este deosebit de relevant pentru organizațiile care utilizează Google Cloud TPU-uri, deoarece oferă un flux de lucru nativ și optimizat pentru utilizarea acestui hardware. De asemenea, evidențiază rolul din ce în ce mai mare al AI agentic în ingineria software și fluxurile de lucru de cercetare, trecând dincolo de simpla generare de cod la proiectare și execuție experimentală complexă.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Ce să urmărești în continuare

Monitorizați adoptarea autofinetune în comunitatea de dezvoltatori și orice actualizări ulterioare ale bibliotecii Tunix. Urmăriți benchmark-uri independente care verifică câștigurile de performanță afirmate în studiile de caz ale Google, în special în ceea ce privește stabilitatea reglajului RL autonom. În plus, observați dacă alți furnizori importanți de IA lansează instrumente autonome similare post-formare, care ar putea semnala o schimbare mai largă a industriei către conductele de dezvoltare a modelelor cu auto-optimizare.

Verificarea independentă a câștigurilor de performanță este crucială. În timp ce Google raportează o îmbunătățire a recompensei cu ~10% în studiul de caz RL, vor fi necesare benchmark-uri terță parte pentru a confirma aceste rezultate în diferite seturi de date și dimensiuni de model.

Stabilitatea reglajului RL autonom este un domeniu cheie de monitorizat. RL este notoriu de instabil și rămâne de văzut cât de bine gestionează agentul cazurile marginale sau previne hackingul de recompense în scenarii mai complexe.

Valorile de adoptare pentru depozitul autofinetune GitHub vor indica interesul dezvoltatorului. Dacă instrumentul câștigă o tracțiune semnificativă, acesta poate influența ecosistemul mai larg al bibliotecilor și instrumentelor de formare LLM.

Ghiduri și chestionare conexe

Agenți AIAntrenament AIModelele AI explicateTestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?