Что случилось
Технический отчет, представленный arXiv 25 августа, описывает WeMM-, семейство мультимодальных моделей внедрения, разработанных для текста, изображений, видео, визуальных документов и чередующихся мультимодальных входных данных. В отчете говорится, что модели доступны с выпущенными весами и кодом и были развернуты в нескольких поисковых и рекомендательных приложениях WeChat.
В отчете WeMM- представлен как семейство универсальных мультимодальных моделей внедрения. Согласно аннотации, модели представляют текст, изображения, видео, визуальные документы и произвольно чередующиеся мультимодальные входные данные в общем пространстве с гибкими выходными размерами. Семейство включает варианты с 2 миллиардами, 4 миллиардами и 9 миллиардами параметров. Прилагаемый источник не предоставляет дополнительных технических подробностей об архитектуре модели, поддерживаемых языках или точных выходных конфигурациях.
Представленный процесс обучения состоит из двух этапов. Первый – это масштабный этап мультимодального выравнивания. Второй этап — это этап уточнения с использованием проверенных данных, детального контроля релевантности и межмасштабной передачи знаний. Эти описания показывают, что система была оптимизирована не только для соединения различных типов мультимедиа, но и для определения степени релевантности извлекаемых элементов. Источник не указывает наборы обучающих данных, их происхождение или объем используемых данных.
Авторы сообщают о лучших показателях по множеству общедоступных тестов. В конкретном сравнении, приведенном в аннотации, говорится, что вариант 2B превосходит ранее лидирующую базовую версию 8B с открытым исходным кодом на MMEB-v2. В отчете также утверждается, что вариант 9B получил новый общий современный балл 80,6. Это утверждения, содержащиеся в отчете; Поставляемая целевая страница arXiv не содержит сравнительных таблиц, условий сравнения или независимого подтверждения.
В отчете также описывается практическое тестирование приложений WeChat. В нем говорится, что WeMM- добился значительных успехов в внутреннем тесте из 26 задач, последовательно улучшил результаты в 14 онлайн-тестах A/B и был широко развернут в рекомендательных и поисковых приложениях, включая каналы WeChat, официальные учетные записи, моменты и сервисы электронной коммерции. Авторы сообщают, что вес модели и код были опубликованы, хотя в предоставленном источнике не указывается лицензия и не приводится подробное содержание выпуска.
Подробности об источнике: arxiv.org ↗
Почему это важно
В отчете представлена версия модели ИИ, связанная как с публичными тестами, так и с крупномасштабным развертыванием приложений. При независимом воспроизведении полученные результаты могут быть полезны разработчикам, выбирающим между более крупными и меньшими мультимодальными системами внедрения для поиска, рекомендаций, классификации и агентских приложений.
Мультимодальные внедрения описаны в отчете как основной компонент современных систем искусственного интеллекта. Их цель — представить различные формы контента в общем пространстве, чтобы системы могли их сравнивать, извлекать, рекомендовать или классифицировать. Это делает данное исследование актуальным для инфраструктуры, лежащей в основе поисковых и рекомендательных продуктов, а не только для отдельной демонстрации или узкого модельного теста.
Сообщенный результат 2B против 8B потенциально значим, поскольку он указывает на то, что меньшая модель превосходит более крупную базовую модель с открытым исходным кодом по приведенной оценке. Если сравнение справедливо и воспроизводимо, модели меньшего размера могут дать разработчикам еще один вариант балансировки качества с памятью, емкостью обслуживания и сложностью развертывания. Источник не сообщает о задержке, требованиях к оборудованию, потреблении энергии или общих эксплуатационных расходах, поэтому он не устанавливает эти преимущества.
Заявленное развертывание в нескольких службах WeChat придает отчету практическое измерение. Результаты офлайн-тестов не обязательно приводят к лучшим результатам в реальных продуктах, где распределение данных, модели трафика и системные ограничения могут различаться. Сообщаемый бенчмарк с 26 задачами и 14 A/B-тестами предполагают попытку измерить производительность приложения, но предоставленный источник не дает абсолютных цифр улучшения, размеров выборки, статистической значимости или подробностей о том, как проводились тесты.
Публикация весов моделей и кода может расширить доступ к исследованиям мультимодального встраивания и позволить другим исследователям проверить заявленные утверждения. Такая открытость может быть полезна для сравнения с другими системами и для построения поисковых, рекомендательных или агентских рабочих процессов. Его общедоступная ценность зависит от фактической лицензии, полноты выпуска, документации, воспроизводимости, а также происхождения и прав на использование обучающих данных, ни один из которых не установлен на предоставленной странице.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Что посмотреть дальше
Основные утверждения по-прежнему требуют тщательного изучения всей статьи, опубликованных артефактов и деталей оценки. Важные неизвестные включают лицензию, происхождение обучающих данных, методологию тестирования, абсолютный выигрыш в онлайн-тестах, масштаб развертывания, эксплуатационные расходы и могут ли независимые пользователи воспроизводить сообщаемые результаты за пределами экосистемы WeChat.
Первым приоритетом является проверка общественных оценок. Читателям следует поискать полные результаты MMEB-v2, идентичность и конфигурацию базовой линии 8B, разделение наборов данных, метрики, подсказки для оценки или предварительной обработки, а также все ли модели были протестированы в сопоставимых условиях. Заголовочную оценку 80,6 следует интерпретировать вместе с результатами по каждой задаче, поскольку общая оценка может скрывать недостатки конкретных методов или вариантов использования.
Интернет-заявления требуют столь же конкретного сообщения. Последующие материалы должны раскрывать определения 26 внутренних задач, трафик и периоды времени, охватываемые 14 A/B-тестами, измеренные размеры эффекта, статистическую обработку и любые компромиссы в задержке, надежности или использовании ресурсов. Источник сообщает, что модели были развернуты в большом масштабе, но не дает количественной оценки пользователей, запросов, регионов или доли затронутых соответствующих сервисов WeChat.
Сам релиз должен быть проверен на предмет полезного веса, исходного кода, документации и четкой лицензии. Разработчикам также необходимо будет знать, какие форматы ввода и языки поддерживаются, насколько гибкие параметры вывода реализованы, какое оборудование требуется и можно ли использовать эту версию в коммерческих целях или только для исследований. Приведенный источник не отвечает на эти вопросы.
Независимое тестирование должно проверить, распространяются ли сообщаемые достижения за пределы данных WeChat и выбранных авторами контрольных показателей. Полезные проверки будут включать многоязычный поиск и поиск со смещением домена, смешанные запросы текста и изображений, обработку визуальных документов, представление видео и случаи сбоев, связанные с нерелевантными или вводящими в заблуждение межмодальными совпадениями. Поскольку в отчете агентные системы упоминаются как область применения, будущая работа также должна прояснить, как ошибки внедрения могут повлиять на последующие автоматические решения, признавая при этом, что предоставленный источник не сообщает об оценке безопасности.