Что случилось
MarkTechPost сообщает, что Generalist AI выпустила GEN-1.5, мультимодальную модель робота, которая использует 3–12-секундную сенсомоторную демонстрацию внутри 30-секундного контекстного окна для выполнения физической задачи. В отчете говорится, что модель в среднем показала 59% успеха при выполнении 10 задач манипулирования без точной настройки и достигла 83% после 10 шагов градиента на пятиминутных данных задачи. Заявления не были независимо подтверждены из предоставленного источника.
MarkTechPost сообщает, что GEN-1.5 компании Generalist AI принимает видео, сенсорные, языковые и проприоцептивные входные данные, поддерживает 30-секундное контекстное окно и выдает траектории действий с частотой 100 Гц. Центральный механизм, который компания называет «физическим побуждением», помещает в этот контекст короткий сенсомоторный пример. Пример может включать потоки камер и датчиков наряду с демонстрируемой траекторией действия. Согласно MarkTechPost, модель затем выводит предполагаемую задачу из демонстрации и действует без языковых инструкций, обновления градиента, этапа тонкой настройки или программы для конкретной задачи. В отчете говорится, что модель в течение более восьми месяцев непрерывно подвергалась предварительному обучению на данных о физическом взаимодействии, собранных в домах, на складах и на заводах.
MarkTechPost сообщает, что средний уровень успеха составляет 59% со стандартным отклонением 10 процентных пунктов при выполнении 10 различных задач манипулирования, когда предварительно обученная модель получила одну демонстрацию. В статье говорится, что 10 шагов градиента с использованием пятиминутных данных для каждой задачи повысили средний успех до 83% со стандартным отклонением в 9 процентных пунктов. Он также сообщает, что один шаг градиента с использованием одной минуты данных достиг 66,5% в отложенной задаче. В статье эти результаты характеризуются как форма тренировки во время тестирования с низким объемом данных и говорится, что зарегистрированные изменения веса после 10 шагов были ниже 0,15%. Поставляемый источник не предоставляет список задач, количество образцов, сведения об оборудовании, определения базовых показателей или полный протокол оценки, необходимый для независимой оценки этих цифр.
В отчете описываются несколько вариантов поведения при передаче, которые MarkTechPost приписывает оценке Generalist AI. Сообщается, что два независимо записанных подсказки могут быть объединены в одно непрерывное поведение, при этом модель будет генерировать промежуточные движения, такие как изменение положения, повторный захват и исправление ошибок. Сообщается, что демонстрация, записанная в режиме моделирования, была перенесена на настоящего робота, хотя данные предварительной тренировки не содержали смоделированного видео или динамики. Также в статье описаны демонстрации, выполняемые руками человека перед камерами робота с последующим воспроизведением с помощью рук робота. По словам MarkTechPost, после небольшой доработки система может использовать банан в качестве щетки, использовать совок для перемещения блока, удалять бумагу, закрывающую миску, и работать обеими руками. В отчете также говорится, что подсказываемое поведение остается более хрупким, чем точно настроенное.
Подробности об источнике: marktechpost.com ↗
Почему это важно
В отчете описывается потенциально важный сдвиг в адаптации роботов: демонстрации могут служить контекстными подсказками, а не требовать обширного обучения конкретным задачам. Если полученные результаты выходят за рамки ограниченной оценки компании, они могут сократить объем данных и инженерную нагрузку, необходимую для обучения роботов новому поведению. Доказательства остаются ранними, а задачи были простыми, краткосрочными и не проверенными независимо.
Практическая значимость отчета заключается в том, что он рассматривает обучение роботов как контекстную проблему, а также проблему обновления веса. Обычная адаптация задач может потребовать сбора данных и выполнения множества шагов по оптимизации для каждого нового поведения. MarkTechPost сообщает, что GEN-1.5 может сразу использовать короткую демонстрацию, а небольшое дополнительное обучение существенно повышает производительность. Для операторов робототехники это в конечном итоге может облегчить адаптацию системы общего назначения к изменению объектов, макетов или процедур без создания отдельной политики для каждой задачи. Это остается опубликованным результатом исследования, а не доказательством того, что подход готов к рутинному промышленному использованию.
Приведенные примеры переноса имеют большое значение, поскольку они проверяют не только прямое копирование. MarkTechPost сообщает, что модель создавала связующие движения между отдельными демонстрациями, перешла от симулированных демонстраций к физическому исполнению и адаптировала человеческие демонстрации к действиям робота. Если такое поведение будет воспроизведено, это будет означать, что модель усвоила широкие физические закономерности, а не запоминает только одну фиксированную траекторию. Однако источник не уточняет, как часто эти передачи были успешными, насколько допускалось вмешательство человека и были ли выбраны демонстрационные и тестовые среды компанией. Таким образом, приведенные примеры указывают на направление исследований, а не на взвешенную гарантию физических рассуждений общего назначения.
Результаты также подчеркивают различие между возможностями и доступностью. MarkTechPost сообщает, что GEN-1.5 — это исследовательская версия, работающая на собственном парке роботов и системе обработки данных Generalist AI. Сообщается, что здесь нет общедоступных весов, API, страниц с ценами или продуктов самообслуживания, и потенциальные пользователи должны стремиться к прямому партнерству. Это ограничивает независимое копирование и затрудняет сравнение модели с другими системами роботизированного обучения сторонним организациям. Это также означает, что непосредственный общественный эффект носит прежде всего научный и стратегический характер: работа может повлиять на то, как исследователи разрабатывают модели мультимодальных роботов, но читатели пока не могут протестировать систему напрямую или оценить ее стоимость, надежность или эксплуатационные требования.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
Which component of an AI application is the machine-learning model itself?
Что посмотреть дальше
Основные вопросы заключаются в том, способен ли GEN-1.5 обобщать задачи, выходящие за рамки заявленных задач, как он работает в критически важных для безопасности или незнакомых условиях и могут ли результаты быть воспроизведены за пределами собственного парка и инфраструктуры данных Generalist AI. MarkTechPost сообщает, что у системы нет общедоступных весов, API, цен или доступа к самообслуживанию, поэтому независимое тестирование и практическое развертывание остаются недоступными.
Первым приоритетом является независимая проверка. В отчете MarkTechPost не указаны идентификаторы 10 задач, количество испытаний на каждую задачу, категории отказов, доверительные интервалы, системы сравнения или используемые физические платформы. Эти детали важны для интерпретации сообщаемых средних значений 59% и 83%. Последующие оценки должны проверять новые объекты, различные схемы освещения и рабочего пространства, более длительные последовательности задач и демонстрации, записанные людьми или роботами за пределами конвейера данных Generalist AI. Воспроизведение независимыми исследователями поможет определить, является ли заявленная возможность общим свойством модели или результатом, чувствительным к выбору компании по сбору и оценке.
Безопасность и надежность — еще одна нерешенная проблема. MarkTechPost сообщает, что модель работает по замкнутому циклу, может выдерживать некоторые возмущения, восстанавливаться после ошибок и импровизировать, но при этом остается более хрупкой, чем точно настроенные версии. Источник не описывает частоту столкновений, пределы силы, аварийные остановки, сбои с участием людей или производительность в многолюдных и непредсказуемых средах. Перед развертыванием в домах, на складах или на заводах оценщикам потребуются доказательства того, что происходит, когда демонстрация неоднозначна, объект отсутствует, робот теряет контроль над задачей или ошибка может привести к травме или повреждению. В отчете не представлено никаких доказательств того, что GEN-1.5 был проверен на предмет таких состояний.
Доступ и управление будут определять, станет ли исследование практически полезным. MarkTechPost сообщает, что Generalist AI не опубликовал веса, API, цены или продукты самообслуживания, оставляя систему доступной только через прямое партнерство. Будущие обновления должны уточнить, получат ли сторонние исследователи доступ к оценке, какие ограничения по управлению данными применяются к записям физического взаимодействия и можно ли проверять модель, не раскрывая конфиденциальные кадры из домов или рабочих мест. Также будет важно посмотреть, будет ли заявленная адаптация с низким объемом данных справедлива в более широком масштабе и для задач, требующих устойчивого планирования. Пока на эти вопросы не будут даны ответы, GEN-1.5 следует рассматривать как ранний исследовательский сигнал, а не как развертываемую роботизированную систему общего назначения.