Вернуться к новостям
ИнновацииAI Understanding брифинг

Google представляет функцию автоматической настройки для автономного пост-обучения LLM

Google выпустила autofinetune — инструмент, который использует агенты искусственного интеллекта для автоматизации настройки гиперпараметров и оптимизации процессов постобучения LLM на TPU.

4 min readRead the primary source
Source-provided image accompanying Google introduces autofinetune for autonomous LLM post-training
ПервоисточникИсточник записан
Издатель
developers.googleblog.com
Ссылка на источник
developers.googleblog.comhttps://developers.googleblog.com/autonomous-llm-post-training-with-tunix-on-tpus/
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Модель большого языка (LLM)
Языковая модель, обученная на массивных текстовых корпусах для генерации и анализа текста.
Пост-тренинг
Этапы обучения, применяемые после предварительного обучения, такие как настройка инструкций, оптимизация предпочтений и настройка безопасности.
LoRA (Адаптация низкого ранга)
Метод точной настройки с эффективным параметром, который добавляет матрицы адаптеров низкого ранга.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

Google выпустила autofinetune — систему, которая автоматизирует постобучение LLM с помощью агентов искусственного интеллекта для итеративной оптимизации гиперпараметров для контролируемой точной настройки (SFT) и обучения с подкреплением (RL). Инструмент объединяет библиотеку Tunix Google, модели Gemma и Cloud TPU, управляемые с помощью интерфейса командной строки Antigravity и Gemini Flash 3.7. В тематических исследованиях агент самостоятельно настраивал такие параметры, как ранги LoRA и скорость обучения, повышая точность модели и показатели вознаграждения без ручного вмешательства.

Google объявил о выпуске autofinetune, проекта, предназначенного для автоматизации постобучения больших языковых моделей (LLM). Система использует автономный исследовательский цикл, в котором агент ИИ итеративно исследует и оптимизирует конфигурации обучения. Этот подход вдохновлен более ранним проектом автоисследований, который продемонстрировал автономное предварительное исследование.

Инструмент использует полный стек искусственного интеллекта Google, в частности, библиотеку Tunix для обучения, модели Gemma в качестве основы и облачные TPU для вычислений. Оркестровка осуществляется с помощью Antigradity CLI и Gemini Flash 3.7. Основная цель — заменить традиционный ручной цикл настройки гиперпараметров автоматизированным процессом, который проводит эксперименты в одночасье и фиксирует проверенные улучшения в Git.

В первом примере агент оптимизировал модель google/functiongemma-270m-it в наборе данных google/mobile-actions с помощью контролируемой точной настройки (SFT). Агент автоматически настраивал такие параметры, как рейтинг LoRA, альфа, оптимизатор и скорость обучения. Результаты показали последовательное улучшение способности модели генерировать правильные вызовы функций, демонстрируя способность агента «взбираться на холм» в сторону большей точности.

Второе тематическое исследование было посвящено обучению с подкреплением (RL) с использованием метода GRPO для обучения Gemma 3 1B математическим рассуждениям на наборе данных GSM8K. RL известен своей чувствительностью к гиперпараметрам и нестабильностью. Автономный агент определил лучшие конфигурации для LoRA, температуры развертывания, штрафа за KL и системных подсказок. Это привело к увеличению общего вознаграждения примерно на 10 %, что указывает на лучшую числовую и форматную точность ответов модели.

Подробности об источнике: developers.googleblog.com ↗

Почему это важно

Эта разработка значительно снижает входной барьер для высококачественной тонкой настройки LLM, устраняя необходимость в ручных повторяющихся экспериментах. Автоматизируя поиск оптимальных гиперпараметров, он позволяет разработчикам добиться более высокой производительности модели, используя меньше специализированных знаний и времени. Этот переход к автономным циклам исследований может ускорить цикл итераций для разработчиков ИИ, сделав передовые методы постобучения более доступными и эффективными для более широкого круга организаций и отдельных исследователей.

Автономное постобучение устраняет серьезное узкое место в разработке ИИ: время и опыт, необходимые для ручной настройки гиперпараметров. Автоматизируя этот процесс, Google делает расширенную оптимизацию модели более доступной для разработчиков, которые могут не иметь глубоких знаний в обучении с подкреплением или точной настройке механики.

Интеграция агентов ИИ в цикл обучения представляет собой переход к самосовершенствованию систем ИИ. Если агенты смогут надежно оптимизировать свои собственные параметры обучения, темпы совершенствования моделей могут ускориться, что потенциально сократит затраты и время, связанные с разработкой специализированных LLM для конкретных задач.

Этот инструмент особенно актуален для организаций, использующих облачные TPU Google, поскольку он обеспечивает собственный оптимизированный рабочий процесс для использования этого оборудования. Он также подчеркивает растущую роль агентного ИИ в разработке программного обеспечения и исследовательских рабочих процессах, переходя от простой генерации кода к сложному экспериментальному проектированию и выполнению.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Что посмотреть дальше

Следите за принятием autofinetune в сообществе разработчиков и за любыми последующими обновлениями библиотеки Tunix. Следите за независимыми тестами, которые подтверждают прирост производительности, заявленный в тематических исследованиях Google, особенно в отношении стабильности автономной настройки RL. Кроме того, обратите внимание, выпустят ли другие крупные поставщики ИИ аналогичные автономные инструменты постобучения, что может сигнализировать о более широком сдвиге отрасли в сторону самооптимизирующихся конвейеров разработки моделей.

Независимая проверка прироста производительности имеет решающее значение. Хотя Google сообщает об улучшении вознаграждения примерно на 10% в примере с RL, потребуются сторонние тесты для подтверждения этих результатов на разных наборах данных и размерах моделей.

Стабильность автономной настройки RL является ключевой областью мониторинга. RL общеизвестно нестабильен, и еще неизвестно, насколько хорошо агент обрабатывает крайние случаи или предотвращает взлом вознаграждения в более сложных сценариях.

Показатели внедрения репозитория autofinetune GitHub покажут заинтересованность разработчиков. Если инструмент получит значительную популярность, он может повлиять на более широкую экосистему учебных библиотек и инструментов LLM.

Сопутствующие руководства и викторины

ИИ-агентыОбучение искусственному интеллектуОбъяснение моделей искусственного интеллектаПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?