Що сталося
Технічний звіт, поданий arXiv 25 серпня, описує WeMM-, сімейство мультимодальних моделей вбудовування, розроблених для тексту, зображень, відео, візуальних документів і мультимодальних вхідних даних із чергуванням. У звіті йдеться, що моделі доступні з опублікованими вагами та кодом, а також розгорнуті в кількох пошукових і рекомендаційних програмах WeChat.
У звіті представлено WeMM- як сімейство універсальних мультимодальних моделей вбудовування. Відповідно до анотації, моделі представляють текст, зображення, відео, візуальні документи та довільно чергувані мультимодальні входи в спільному просторі з гнучкими вихідними розмірами. Сімейство включає варіанти з 2 мільярдами, 4 мільярдами та 9 мільярдами параметрів. Надане джерело не надає додаткових технічних деталей щодо архітектури моделі, підтримуваних мов або точних конфігурацій виводу.
Описаний навчальний процес має два етапи. Перший – масштабний мультимодальний етап вирівнювання. Другий етап — це етап уточнення з використанням підібраних даних, детального контролю релевантності та міжмасштабної передачі знань. Ці описи вказують на те, що систему було оптимізовано не лише для підключення різних типів носіїв, але й для розрізнення ступенів релевантності серед отриманих елементів. Джерело не визначає навчальні набори даних, їхнє походження чи обсяг використаних даних.
Автори повідомляють про найкращу продуктивність за кількома публічними тестами. У конкретному порівнянні, виділеному в анотації, варіант 2B перевершує попередній базовий рівень 8B з відкритим вихідним кодом на MMEB-v2. У звіті також стверджується, що варіант 9B досягає нової загальної сучасної оцінки 80,6. Це твердження, висунуті у звіті; цільова сторінка arXiv, що надається, не містить порівняльних таблиць, умов порівняння чи незалежного підтвердження.
У звіті також описується практичне тестування в додатках WeChat. У ньому сказано, що WeMM- забезпечила суттєві переваги у внутрішньому тесті з 26 завданнями, стабільно покращила результати в 14 онлайн-тестах A/B і була широко розгорнута в програмах рекомендацій і пошуку, включаючи канали WeChat, офіційні облікові записи, моменти та служби електронної комерції. Автори кажуть, що вага моделі та код були оприлюднені, хоча в наданому джерелі не зазначено ліцензії та не надано детального змісту випуску.
Чому це важливо
У звіті представлено випуск моделі штучного інтелекту, прив’язаний як до загальнодоступних заяв про тестування, так і до широкомасштабного розгортання додатків. У разі незалежного відтворення отримані результати можуть бути актуальними для розробників, які обирають між великими та меншими мультимодальними системами вбудовування для пошуку, рекомендацій, класифікації та агентських додатків.
Мультимодальне вбудовування описується у звіті як основний компонент сучасних систем ШІ. Їхня мета — представляти різні форми вмісту в спільному просторі, щоб системи могли порівнювати, витягувати, рекомендувати або класифікувати їх. Це робить це дослідження релевантним для інфраструктури продуктів пошуку та рекомендацій, а не лише для окремої демонстрації чи вузького тестування моделі.
Повідомлений результат 2B проти 8B є потенційно значущим, оскільки він вказує на те, що менша модель перевершує більшу базову лінію з відкритим вихідним кодом за цитованою оцінкою. Якщо порівняння буде чесним і відтворюваним, менші моделі можуть дати розробникам ще один варіант для балансування між якістю та пам’яттю, об’ємом обслуговування та складністю розгортання. Джерело не повідомляє про затримку, вимоги до апаратного забезпечення, споживання енергії чи загальну вартість експлуатації, тому не встановлює ці переваги.
Заявлене розгортання в кількох службах WeChat надає звіту практичний вимір. Результати офлайн-тестів не обов’язково призводять до кращих результатів у реальних продуктах, де розподіл даних, моделі трафіку та системні обмеження можуть відрізнятися. Повідомлений контрольний тест із 26 завдань і 14 A/B-тестів свідчать про спробу виміряти продуктивність програми, але надане джерело не надає абсолютних показників покращення, розмірів вибірки, статистичної значущості чи деталей про те, як проводилися тести.
Публікація вагових коефіцієнтів і коду моделі може розширити доступ до досліджень мультимодального вбудовування та дозволить іншим дослідникам перевірити заявлені твердження. Ця відкритість може бути корисною для порівняння з іншими системами та для створення робочих процесів пошуку, рекомендацій або агентів. Його загальнодоступна цінність залежить від фактичної ліцензії, повноти випуску, документації, відтворюваності та прав на походження та використання навчальних даних, жодне з яких не встановлено наданій сторінці.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Що дивитися далі
Основні претензії все ще вимагають ретельного вивчення повного документа, опублікованих артефактів і деталей оцінки. До важливих невідомих відомостей належать ліцензія, походження навчальних даних, методологія порівняння, абсолютний приріст у онлайн-тестах, масштаб розгортання, операційні витрати та те, чи можуть незалежні користувачі відтворити звітні результати поза екосистемою WeChat.
Першочергове завдання – перевірка громадських оцінок. Читачі повинні шукати повні результати MMEB-v2, ідентичність і конфігурацію базової лінії 8B, розділення набору даних, показники, підказки оцінки або попередню обробку, а також те, чи всі моделі були протестовані в порівнянних умовах. Заголовну оцінку 80,6 слід інтерпретувати разом із результатами для кожного завдання, оскільки загальна оцінка може приховувати слабкі сторони певних модальностей або випадків використання.
Претензії в Інтернеті вимагають такого ж конкретного звітування. Подальші матеріали повинні розкривати визначення 26 внутрішніх завдань, трафік і періоди часу, охоплені 14 тестами A/B, виміряні розміри ефекту, статистичну обробку та будь-які компроміси щодо затримки, надійності чи використання ресурсів. Джерело каже, що моделі були розгорнуті в масштабі, але не вказує кількість користувачів, запитів, регіонів або частки відповідних сервісів WeChat, які постраждали.
Сам випуск слід перевірити на придатні для використання ваги, вихідний код, документацію та чітку ліцензію. Розробникам також потрібно буде знати, які вхідні формати та мови підтримуються, як реалізовано гнучкі розміри виводу, яке апаратне забезпечення потрібне та чи можна випуск використовувати комерційно чи лише для досліджень. Надане джерело не відповідає на ці запитання.
Незалежне тестування має перевірити, чи виходять зазначені досягнення за межі даних WeChat і обраних авторами контрольних показників. Корисні перевірки включатимуть багатомовний і доменно-зміщений пошук, змішані текстові та графічні запити, обробку візуальних документів, представлення відео та випадки помилок, пов’язаних із невідповідними або оманливими міжмодальними збігами. Оскільки у звіті згадуються агентські системи як область застосування, майбутня робота також має з’ясувати, як помилки вбудовування можуть вплинути на автоматизовані рішення, які приймаються далі, визнаючи, що надане джерело не повідомляє про оцінку безпеки.