Zpět na Novinky
InovaceInstruktáž AI Understanding

Google představuje autofinetune pro autonomní LLM po tréninku

Google vydala autofinetune, nástroj, který využívá agenty AI k automatizaci ladění hyperparametrů a optimalizaci procesů po tréninku LLM na TPU.

4 min readRead the primary source
Source-provided image accompanying Google introduces autofinetune for autonomous LLM post-training
Primární zdrojový dokumentZdroj zaznamenán
Vydavatel
developers.googleblog.com
Odkaz na zdroj
developers.googleblog.comhttps://developers.googleblog.com/autonomous-llm-post-training-with-tunix-on-tpus/
Typ zdroje
Primární dokument — oficiální oznámení, papír, podání nebo stránka první strany, kterou čteme přímo.
KontextPochopte to za 60 sekund

Začněte zde

Klíčové pojmy

Velký jazykový model (LLM)
Jazykový model trénovaný na masivních textových korpusech pro generování a analýzu textu.
Po tréninku
Školicí kroky aplikované po předběžném školení, jako je ladění instrukcí, optimalizace preferencí a ladění bezpečnosti.
LoRA (adaptace nízkého hodnocení)
Parametrově efektivní metoda jemného ladění, která přidává matice adaptérů nízké úrovně.
Otestujte seKvíz AI agentů

Co se stalo

Google vydal autofinetune, systém, který automatizuje následné školení LLM pomocí agentů AI k opakované optimalizaci hyperparametrů pro Supervised Fine-Tuning (SFT) a Reinforcement Learning (RL). Tento nástroj integruje knihovnu Tunix Google, modely Gemma a cloudové TPU, organizované prostřednictvím Antigravity CLI a Gemini Flash 3.7. V případových studiích agent autonomně upravoval parametry, jako je hodnocení LoRA a rychlost učení, čímž se zlepšila přesnost modelu a skóre odměn bez ručního zásahu.

Google oznámila vydání autofinetune, projektu určeného k automatizaci následného školení velkých jazykových modelů (LLM). Systém využívá autonomní výzkumnou smyčku, kde agent AI iterativně zkoumá a optimalizuje tréninkové konfigurace. Tento přístup je inspirován dřívějším projektem autoresearch, který demonstroval autonomní předtréninkový průzkum.

Nástroj využívá plný zásobník umělé inteligence Google, konkrétně používá knihovnu Tunix pro školení, modely Gemma jako základ a cloudové TPU pro výpočty. O orchestraci se stará Antigravity CLI a Gemini Flash 3.7. Primárním cílem je nahradit tradiční manuální cyklus úprav hyperparametrů automatizovaným procesem, který přes noc spouští experimenty a zavádí ověřená vylepšení Gitu.

V první případové studii agent optimalizoval model google/functiongemma-270m-it na datové sadě google/mobile-actions pomocí Supervised Fine-Tuning (SFT). Agent automaticky upravoval parametry, jako je hodnocení LoRA, alfa, optimalizátor a rychlost učení. Výsledky ukázaly konzistentní zlepšení ve schopnosti modelu generovat správná volání funkcí, což prokázalo schopnost agenta „šplhat do kopce“ směrem k vyšší přesnosti.

Druhá případová studie se zaměřila na Reinforcement Learning (RL) pomocí metody GRPO k trénování Gemmy 3 1B pro matematické uvažování na datové sadě GSM8K. RL je známý svou citlivostí na hyperparametry a nestabilitou. Autonomní agent identifikoval lepší konfigurace pro LoRA, teplotu zavádění, penalizaci KL a systémové výzvy. To vedlo k přibližně 10% zlepšení celkové odměny, což ukazuje na lepší numerickou a formátovou přesnost v odpovědích modelu.

Podrobnosti o zdroji: developers.googleblog.com ↗

Proč na tom záleží

Tento vývoj výrazně snižuje překážku vstupu pro vysoce kvalitní jemné doladění LLM tím, že odstraňuje potřebu ručního, opakovaného experimentování. Automatizací hledání optimálních hyperparametrů umožňuje vývojářům dosáhnout lepšího výkonu modelu s méně specializovanými znalostmi a časem. Tento posun směrem k autonomním výzkumným smyčkám by mohl urychlit iterační cyklus pro vývojáře AI, díky čemuž budou pokročilé post-tréninkové techniky přístupnější a efektivnější pro širší škálu organizací a jednotlivých výzkumníků.

Autonomní post-trénink řeší významnou překážku ve vývoji AI: čas a odborné znalosti potřebné k ručnímu ladění hyperparametrů. Automatizací tohoto procesu Google zpřístupňuje pokročilou optimalizaci modelu vývojářům, kteří nemusí mít hluboké odborné znalosti v oblasti posilování nebo jemného ladění mechaniky.

Integrace agentů umělé inteligence do tréninkové smyčky představuje posun směrem k sebezdokonalujícím se systémům umělé inteligence. Pokud mohou agenti spolehlivě optimalizovat své vlastní tréninkové parametry, tempo zlepšování modelu by se mohlo zrychlit a potenciálně snížit náklady a čas spojený s vývojem specializovaných LLM pro konkrétní úkoly.

Tento nástroj je zvláště důležitý pro organizace používající cloudové TPU Google, protože poskytuje nativní, optimalizovaný pracovní postup pro využití tohoto hardwaru. Zdůrazňuje také rostoucí roli agentní umělé inteligence v softwarovém inženýrství a výzkumných pracovních postupech, posouvající se od jednoduchého generování kódu ke komplexnímu experimentálnímu návrhu a provádění.

Interactive Mechanism

Interaktivní mechanismus: Jak to vlastně funguje

Interaktivně prozkoumejte základní technologii tohoto vývoje.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktivní kontrola konceptu+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Na co se dále dívat

Sledujte přijetí autofinetune ve vývojářské komunitě a jakékoli následné aktualizace knihovny Tunix. Sledujte nezávislé benchmarky, které ověřují zvýšení výkonu uváděné v případových studiích Google, zejména pokud jde o stabilitu autonomního RL ladění. Kromě toho sledujte, zda další hlavní poskytovatelé umělé inteligence uvolňují podobné autonomní nástroje po školení, což by mohlo signalizovat širší posun v odvětví směrem k samooptimalizačním vývojovým kanálům modelů.

Nezávislé ověření nárůstu výkonu je zásadní. Zatímco Google hlásí v případové studii RL ~10% zlepšení odměny, k potvrzení těchto výsledků v různých souborech dat a velikostech modelů budou zapotřebí srovnávací testy třetích stran.

Stabilita autonomního RL ladění je klíčovou oblastí, kterou je třeba sledovat. RL je notoricky nestabilní a zbývá zjistit, jak dobře agent zvládá okrajové případy nebo zabraňuje hackování odměn ve složitějších scénářích.

Metriky přijetí pro repozitář autofinetune GitHub budou naznačovat zájem vývojářů. Pokud nástroj získá významnou trakci, může ovlivnit širší ekosystém školicích knihoven a nástrojů LLM.

Související průvodci a kvízy

Agenti AIŠkolení AIVysvětlení modelů AIOtestujte si, co víte – vyzkoušejte bezplatný kvíz AIVyhledejte si termín AI v našem slovníkuPostupujte podle sledování vydání modelu AI
Považujete to za užitečné?