Zurück zu den Neuigkeiten
InnovationAI Understanding Briefing

Google führt Autofinetune für autonomes LLM-Nachtraining ein

Google hat Autofinetune veröffentlicht, ein Tool, das KI-Agenten verwendet, um die Hyperparameter-Abstimmung und Optimierung von LLM-Post-Training-Prozessen auf TPUs zu automatisieren.

4 min readRead the primary source
Source-provided image accompanying Google introduces autofinetune for autonomous LLM post-training
PrimärquellendokumentQuelle aufgezeichnet
Herausgeber
developers.googleblog.com
Quelllink
developers.googleblog.comhttps://developers.googleblog.com/autonomous-llm-post-training-with-tunix-on-tpus/
Quelltyp
Primärdokument – ​​eine offizielle Ankündigung, ein Papier, eine Akte oder eine Erstanbieterseite, die wir direkt lesen.
KontextVerstehen Sie dies in 60 Sekunden

Beginnen Sie hier

Schlüsselbegriffe

Großes Sprachmodell (LLM)
Ein Sprachmodell, das auf umfangreichen Textkorpora trainiert wurde, um Text zu generieren und zu analysieren.
Nach dem Training
Trainingsschritte, die nach dem Vortraining angewendet werden, z. B. Anweisungsoptimierung, Präferenzoptimierung und Sicherheitsoptimierung.
LoRA (Low-Rank-Anpassung)
Eine parametereffiziente Feinabstimmungsmethode, die Adaptermatrizen mit niedrigem Rang hinzufügt.
Testen Sie sich selbstKI-Agenten-Quiz

Was ist passiert?

Google hat Autofinetune veröffentlicht, ein System, das das LLM- automatisiert, indem es KI-Agenten verwendet, um Hyperparameter für Supervised Fine-Tuning (SFT) und Reinforcement Learning (RL) iterativ zu optimieren. Das Tool integriert die Tunix-Bibliothek von Google, Gemma-Modelle und Cloud-TPUs, orchestriert über Antigravity CLI und Gemini Flash 3.7. In Fallstudien passte der Agent automatisch Parameter wie LoRA-Ränge und Lernraten an und verbesserte so die Modellgenauigkeit und Belohnungswerte ohne manuelles Eingreifen.

Google kündigte die Veröffentlichung von autofinetune an, einem Projekt zur Automatisierung des Post-Trainings von Large Language Models (LLMs). Das System nutzt eine autonome Forschungsschleife, in der ein KI-Agent Trainingskonfigurationen iterativ erkundet und optimiert. Dieser Ansatz ist vom früheren Autoresearch-Projekt inspiriert, das eine autonome Erkundung vor dem Training demonstrierte.

Das Tool nutzt den vollständigen KI-Stack von Google und nutzt insbesondere die Tunix-Bibliothek für das Training, Gemma-Modelle als Basis und Cloud-TPUs für die Berechnung. Die Orchestrierung wird von Antigravity CLI und Gemini Flash 3.7 übernommen. Das Hauptziel besteht darin, den traditionellen manuellen Zyklus der Anpassung von Hyperparametern durch einen automatisierten Prozess zu ersetzen, der über Nacht Experimente durchführt und verifizierte Verbesserungen an Git übermittelt.

In der ersten Fallstudie optimierte der Agent das google/functiongemma-270m-it-Modell auf dem google/mobile-actions-Datensatz mithilfe von Supervised Fine-Tuning (SFT). Der Agent passte Parameter wie LoRA-Rang, Alpha, Optimierer und Lernrate automatisch an. Die Ergebnisse zeigten eine konsistente Verbesserung der Fähigkeit des Modells, korrekte Funktionsaufrufe zu generieren, was die Fähigkeit des Agenten verdeutlichte, eine höhere Genauigkeit zu erreichen.

Die zweite Fallstudie konzentrierte sich auf Reinforcement Learning (RL) unter Verwendung der GRPO-Methode, um Gemma 3 1B für mathematisches Denken anhand des GSM8K-Datensatzes zu trainieren. RL ist für seine Empfindlichkeit gegenüber Hyperparametern und Instabilität bekannt. Der autonome Agent identifizierte bessere Konfigurationen für LoRA, Rollout-Temperatur, KL-Strafe und Systemaufforderungen. Dies führte zu einer Verbesserung der Gesamtbelohnung um etwa 10 %, was auf eine bessere Zahlen- und Formatgenauigkeit der Antworten des Modells hinweist.

Quellenangaben: developers.googleblog.com ↗

Warum es wichtig ist

Diese Entwicklung senkt die Eintrittsbarriere für hochwertige LLM-Feinabstimmung erheblich, da keine manuellen, sich wiederholenden Experimente mehr erforderlich sind. Durch die Automatisierung der Suche nach optimalen Hyperparametern können Entwickler eine bessere Modellleistung mit weniger Fachwissen und Zeitaufwand erzielen. Diese Verlagerung hin zu autonomen Forschungsschleifen könnte den Iterationszyklus für KI-Entwickler beschleunigen und fortgeschrittene -Techniken für ein breiteres Spektrum von Organisationen und einzelnen Forschern zugänglicher und effizienter machen.

Das autonome Nachtraining behebt einen erheblichen Engpass in der KI-Entwicklung: die Zeit und das Fachwissen, die für die manuelle Abstimmung von Hyperparametern erforderlich sind. Durch die Automatisierung dieses Prozesses macht Google die erweiterte Modelloptimierung für Entwickler zugänglicher, die möglicherweise nicht über umfassende Kenntnisse im Bereich Reinforcement Learning oder Feinabstimmung von Mechaniken verfügen.

Die Integration von KI-Agenten in die Trainingsschleife stellt einen Wandel hin zu sich selbst verbessernden KI-Systemen dar. Wenn Agenten ihre eigenen Trainingsparameter zuverlässig optimieren können, könnte sich das Tempo der Modellverbesserung beschleunigen und möglicherweise die Kosten und die Zeit reduzieren, die mit der Entwicklung spezialisierter LLMs für bestimmte Aufgaben verbunden sind.

Dieses Tool ist besonders relevant für Organisationen, die Google Cloud TPUs verwenden, da es einen nativen, optimierten Workflow für die Nutzung dieser Hardware bietet. Es unterstreicht auch die wachsende Rolle der Agenten-KI in Softwareentwicklungs- und Forschungsabläufen, die über die einfache Codegenerierung hinaus bis hin zu komplexem experimentellen Design und Ausführung reicht.

Interactive Mechanism

Interaktiver Mechanismus: Wie es tatsächlich funktioniert

Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiver Konzeptcheck+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Was Sie als nächstes sehen sollten

Überwachen Sie die Einführung von Autofinetune in der Entwicklergemeinschaft und alle nachfolgenden Aktualisierungen der Tunix-Bibliothek. Achten Sie auf unabhängige Benchmarks, die die in den Fallstudien von Google behaupteten Leistungssteigerungen bestätigen, insbesondere im Hinblick auf die Stabilität der autonomen RL-Abstimmung. Beobachten Sie außerdem, ob andere große KI-Anbieter ähnliche autonome -Tools veröffentlichen, was einen breiteren Branchenwandel hin zu selbstoptimierenden Modellentwicklungspipelines signalisieren könnte.

Eine unabhängige Überprüfung der Leistungssteigerungen ist von entscheidender Bedeutung. Während Google in der RL-Fallstudie eine Belohnungsverbesserung von ca. 10 % meldet, sind Benchmarks von Drittanbietern erforderlich, um diese Ergebnisse über verschiedene Datensätze und Modellgrößen hinweg zu bestätigen.

Die Stabilität der autonomen RL-Abstimmung ist ein wichtiger Bereich, den es zu überwachen gilt. RL ist bekanntermaßen instabil und es bleibt abzuwarten, wie gut der Agent Grenzfälle bewältigt oder Belohnungs-Hacking in komplexeren Szenarien verhindert.

Akzeptanzmetriken für das Autofinetune-Repository GitHub zeigen das Interesse der Entwickler. Wenn das Tool deutlich an Bedeutung gewinnt, kann es Einfluss auf das breitere Ökosystem der LLM-Trainingsbibliotheken und -Tools haben.

Verwandte Leitfäden und Quizze

KI-AgentenKI-TrainingKI-Modelle erklärtTesten Sie, was Sie wissen – probieren Sie ein kostenloses KI-Quiz ausSuchen Sie in unserem Glossar nach einem KI-BegriffFolgen Sie dem AI-Modell-Release-Tracker
Fanden Sie das nützlich?