Вернуться к новостям
ИнновацииAI Understanding брифинг

Метод, не требующий обучения, ускоряет модели «зрение-язык-действие» на периферийном оборудовании, бумажные отчеты

AdaVLA — это онлайн-метод, который, по словам авторов, ускоряет согласование моделей «видения, языка и действий» без переобучения или доступа к обучающим данным. На Jetson AGX Orin они сообщают об ускорении в 1,87× для π0,5 и в 2,24× для X-VLA с незначительным ухудшением показателя успеха.

5 min readRead the primary source
Source-provided image accompanying Training-free method speeds up vision-language-action models on edge hardware, paper reports
ПервоисточникИсточник записан
Издатель
arxiv.org
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.29208
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Модель визуального языка (VLM)
Мультимодальная модель, совместно обрабатывающая визуальную и текстовую информацию.
Точная настройка
Продолжение обучения на предметных данных для адаптации предварительно обученной модели к конкретной задаче.
Надежность
Способность модели сохранять производительность в условиях шума, сдвигов или враждебных воздействий.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

В документе, представленном arXiv 29 августа и принятом на IROS 2026, представлен AdaVLA, не требующий обучения метод ускорения моделей «зрение-язык-действие» во время вывода. Авторы нацелены на итеративное решение обыкновенных дифференциальных уравнений, используемых в моделях согласования потоков, а также на вычислительные затраты многослойных персептронов.

AdaVLA предназначена для моделей «зрение-язык-действие», которые сочетают в себе визуальный ввод, языковые знания и рассуждения с результатами, которые направляют действия робота. В документе говорится, что эти системы могут улучшить возможности роботов, но требуют значительных вычислений, что ограничивает реакцию в реальном времени и развертывание на периферийных устройствах. Авторы фокусируются на моделях, основанных на согласовании потоков, вывод которых включает многократное решение обыкновенного дифференциального уравнения. Они утверждают, что большая часть существующих работ по ускорению концентрируется на базовой модели языка видения, а не на этом итеративном процессе генерации действий. В этом случае сокращение работы, связанной с выработкой действий, имеет решающее значение для того, чтобы сделать системы более подходящими для ограниченного развертывания.

Метод работает онлайн во время вывода и не требует точной настройки или доступа к исходному набору обучающих данных. Он использует метрику, полученную на основе кривизны траектории согласования потока, для оценки уверенности в сгенерированном действии. Согласно статье, эта оценка позволяет AdaVLA динамически сокращать количество шагов вывода. Платформа также адаптивно изменяет коэффициенты сокращения многослойных перцептронов, используя оценку важности, которую авторы описывают как эффективную и не требующую обучающих данных. Таким образом, согласно описанию в статье, метод сочетает в себе адаптивное решение вывода с адаптивным сокращением внутренней работы модели.

В тесте LIBERO, запущенном на устройстве NVIDIA Jetson AGX Orin, авторы сообщают об ускорении в 1,87 раза для модели π0,5 и в 2,24 раза для X-VLA, при этом они описывают незначительное ухудшение показателей успеха. В документе также говорится, что этот подход был протестирован на надежность при выполнении реальных роботизированных задач с использованием SmolVLA. Источник не указывает точные результаты задачи, базовое время, значения вероятности успеха, коэффициенты сокращения или энергопотребление оборудования. Эти упущения делают приведенные в заголовках сравнения полезными в качестве резюме статьи, но ограниченными в качестве основы для оценки полного профиля развертывания.

Подробности об источнике: arxiv.org ↗

Почему это важно

Если полученные результаты останутся за пределами протестированных настроек, AdaVLA может сделать некоторые системы «зрение-язык-действие» более практичными для роботов с ограниченными встроенными вычислениями. Его конструкция, не требующая обучения, может также помочь организациям, которые не могут получить доступ к собственным данным обучения или позволить себе еще один цикл тонкой настройки.

Практическая проблема важна для воплощенного ИИ, поскольку роботу часто приходится быстро преобразовывать изменяющиеся визуальные условия в действия, действуя при этом в пределах бортового оборудования. Метод, который сокращает объем работы по выводу во время выполнения, может улучшить скорость реагирования, не требуя нового обучающего прогона. Это особенно важно, когда модель является частной, когда данные обучения не могут быть переданы по соображениям конфиденциальности или когда команде развертывания необходимо оптимизировать существующую систему, а не создавать новую. В документе эта комбинация экономии времени выполнения и отсутствия необходимости в дополнительном обучении представлена ​​как основная практическая привлекательность.

Сообщаемый подход AdaVLA касается двух отдельных источников вычислений: повторяющихся шагов согласования потоков и внутренней рабочей нагрузки многослойного перцептрона. Сигнал уверенности предназначен для того, чтобы позволить системе тратить больше вычислений, когда траектория действия кажется неопределенной, и меньше, когда она кажется стабильной. В принципе, такой вид адаптивного распределения может предложить более полезный компромисс, чем повсеместное применение одного фиксированного сокращения, хотя источник не предоставляет независимого подтверждения этого механизма. Таким образом, значимость конструкции зависит от того, работают ли оба адаптивных элемента управления последовательно в тестируемых моделях и задачах.

Сообщенные результаты примечательны тем, что они были получены на периферийном устройстве, а не описаны только с точки зрения среды большого центра обработки данных. В документе также утверждается, что этот метод сохраняет показатели успеха, одновременно ускоряя две разные модели, и говорится, что он был проверен на реальных роботизированных задачах с третьей моделью. Однако это утверждения из одной исследовательской работы; источник не устанавливает готовность производства, общую надежность, безопасность в физической среде или превосходство в более широкой области роботизированного ИИ. Следовательно, результаты указывают на указанное направление оптимизации вывода, а не на однозначный вывод о более широкой ценности технологии.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Основные вопросы заключаются в том, распространяется ли ускорение на большее количество моделей, задач, конфигураций оборудования и сред, а также насколько точность меняется в сложных или быстро меняющихся условиях. Источник не предоставляет подробных результатов по каждой задаче, показателей задержки, измерений мощности или точных изменений показателя успеха.

Дальнейшая оценка должна показать полную разбивку задач LIBERO, точные базовые и ускоренные задержки, различия в показателях успеха, количество испытаний и вариации между запусками. Также было бы полезно знать, как часто AdaVLA меняет свой бюджет вывода или коэффициент сокращения, не дает ли его показатель уверенности в необычных сценах и включают ли сообщаемые ускорения все накладные расходы во время выполнения, вносимые адаптивным контроллером. Эти измерения прояснят, как возникают совокупные результаты и меняет ли сам процесс адаптации практическую выгоду.

Источник оставляет открытым вопрос о том, как ведет себя метод, когда робот сталкивается с быстрыми изменениями окружающей среды, неоднозначными инструкциями, незнакомыми объектами или критическими для безопасности действиями. Сокращение шагов вывода или сокращение сетевых компонентов может иметь неравномерный эффект для разных задач, даже если совокупные показатели успеха остаются практически неизменными. Заявление авторов о том, что надежность в реальных условиях была проверена с помощью SmolVLA, было бы более информативным, если бы содержались подробности об оборудовании, средах, количестве задач, режимах сбоев и сравнениях. Без этих подробностей заявление об устойчивости не может показать, как метод реагирует на ряд условий, связанных с физической работой.

Принятие статьи на IROS 2026 является сигналом о предстоящей публикации конференции, но не устраняет оставшуюся неопределенность. Читателям следует следить за полным текстом статьи, опубликованной реализацией или последующими оценками дополнительных систем VLA с согласованием потоков и встроенного оборудования. Сравнение с другими методами ускорения вывода, измерения энергопотребления и температурных пределов, а также тестирование в условиях физической безопасности позволят определить, имеет ли этот метод ценность, выходящую за рамки заявленных контрольных показателей. Такой дополнительный материал также облегчит оценку утверждений документа в зависимости от моделей, сред и условий развертывания.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаИИ-агентыТрансформерыОбучение искусственному интеллектуПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?