Назад до новин
ІнноваціяAI Understanding брифінг

AffectOmni навчає мультимодальний штучний інтелект пояснювати емоції за допомогою орієнтованих на людей візуальних доказів

Новий препринт описує AffectOmni, структуру навчання з підкріпленням, розроблену для того, щоб мультимодальні моделі штучного інтелекту базували емоційні судження на орієнтованих на людей сигналах, таких як вираз обличчя, мова тіла та часовий порядок. Автори повідомляють про покращення порівняно з базовими показниками 7B у відкритому коді за трьома тестами…

6 min readRead the primary source
Primary-source image accompanying AffectOmni trains multimodal AI to explain emotions using people-centered visual evidence
Першоджерельний документДжерело записано
Видавець
arxiv.org
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2608.26193
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Навчання з підкріпленням
Навчання за сигналами винагороди, коли агент навчається діям, які максимізують довгострокову віддачу.
Мультимодальна модель
Модель, яка може обробляти або генерувати кілька типів даних, таких як текст, зображення та аудіо.
Калібрування
Наскільки показники надійності моделі відповідають фактичним імовірностям правильності.
Перевір себеЩо таке ШІ? Вікторина

Що сталося

Дослідники запропонували AffectOmni, структуру для навчання мультимодальних великих мовних моделей міркувати про емоції, наміри та інші афективні сигнали в соціальних і пов’язаних з мистецтвом зображеннях або сценах. У препринті стверджується, що моделі іноді можуть отримати правильні відповіді, покладаючись на навколишній контекст, не звертаючи уваги на дані, орієнтовані на людей, які полегшать перевірку їхніх міркувань.

Препринт, надісланий до arXiv 24 ​​серпня, описує AffectOmni, структуру навчання з підкріпленням для афективного мислення, яке можна перевірити, у мультимодальних великих мовних моделях. Стаття зосереджена на соціальних і пов’язаних із мистецтвом сценах, у яких системі може знадобитися визначити емоції, наміри чи порядок подій. Автори виявляють конкретну слабкість існуючих систем: модель може дати правильну відповідь, використовуючи ярлики на основі широкого контексту сцени замість того, щоб звертати увагу на орієнтовані на людей підказки, такі як мікровирази та мова тіла.

Фреймворк додає два компоненти винагороди, які називаються Focus People і Temporal Order. Згідно з джерелом, People Focus заохочує модель вибирати докази, що стосуються людей, тоді як Temporal Order заохочує міркування, структуровані навколо того, коли відбуваються події. У документі йдеться, що ці сигнали призначені для зменшення поведінки ярликів і покращення зв’язку між відповіддю моделі та візуальними доказами, які її підтверджують. Джерело не надає достатньо деталей, щоб визначити, як ці винагороди поводяться в усіх типах сцен і чи вони запобігають скороченню в незалежних тестах.

AffectOmni також використовує внутрішньогрупове порівняльне оцінювання під час навчання з підкріпленням. Автори кажуть, що це має на меті звернення до кластеризації балів у суддівстві на основі широкомовної моделі, де багато відповідей кандидатів отримують однакові бали і, отже, виробляють слабко розрізнювальні навчальні сигнали. Після того, як модель генерує обґрунтування у вільній формі, Thinking Summarizer перетворює це обґрунтування на виконувані інструкції доказів. Потім ці інструкції об’єднуються в області доказів на рівні пікселів за допомогою SAM3, створюючи те, що автори описують як зовнішній перевіряний інтерфейс поза циклом навчання.

Джерело повідомляє про експерименти на трьох бенчмарках: IntentBench, Daily Omni і WorldSense. Порівняно з моделями з відкритим кодом за шкалою 7B автори повідомляють про постійні покращення, включаючи приріст на 4,66% у розпізнаванні емоцій і приріст на 14,29% у чутливих у часі завданнях. Джерело не уточнює, чи є ці цифри абсолютним відсотковим приростом чи відносним відсотковим покращенням, а також не надає підрахунків вибірки, довірчих інтервалів, смужок помилок або порівняння з найсильнішими власними системами. У препринті сказано, що код доступний, але джерело не надає зручне посилання на репозиторій і не описує умови ліцензування.

Деталі джерела: arxiv.org ↗

Чому це важливо

Розпізнавання афекту є невід’ємною здатністю для систем, які інтерпретують соціальні взаємодії, але правильна мітка не обов’язково показує, що модель помітила відповідну особу, вираз чи жест. Підхід AffectOmni вирішує цю проблему відстеження шляхом поєднання міркувань моделі з областями доказів, які можна перевірити поза процесом навчання. Якщо отримані результати перевищують орієнтовні показники авторів, метод може запропонувати більш підзвітний спосіб оцінки мультимодальних систем, які інтерпретують поведінку людини.

Практична проблема полягає не просто в тому, чи може мультимодальна модель назвати емоцію. У програмах, які інтерпретують соціальні сцени, користувачам може знадобитися знати, які видимі докази призвели до вироку. Система, яка правильно позначає сцену з неправильної причини, може вийти з ладу, коли змінюється фон, одяг, обстановка чи інші контекстні ознаки. Акцент у статті на доказах, орієнтованих на людей, безпосередньо вирішує цю прогалину в надійності, хоча джерело повідомляє про інтерпретацію авторів, а не про незалежно перевірений висновок.

Етап обґрунтування доказів може полегшити перевірку афективних результатів моделі. Транслюючи обґрунтування в інструкції та пов’язуючи їх із областями рівня пікселів, AffectOmni пропонує конкретний артефакт, який оцінювач може перевірити. Це більш оперативно, ніж загальний запит на пояснення моделі: вимога прив’язана до місць у вхідному зображенні. Незважаючи на це, виділені області не слід автоматично розглядати як доказ причинно-наслідкових міркувань. Джерело не встановлює, що регіони правдиво розкривають внутрішній процес, який дав відповідь.

Повідомлені покращення є потенційно корисними, оскільки часове розуміння та емоційна інтерпретація є типовими точками збою в мультимодальних системах. Покращення на 14,29% у чутливих у часі завданнях, якщо їх відтворити незалежно та чітко визначити, може мати значення для систем, які аналізують послідовності, а не ізольовані нерухомі зображення. Джерело не повідомляє, наскільки складні завдання, як були побудовані контрольні показники або чи виграш перекладається на наступне використання, таке як освіта, доступність, модерація або взаємодія людини з комп’ютером.

Робота також ілюструє ширший вибір дизайну в оцінці штучного інтелекту: винагорода не лише за результат, але й за вибір і організацію підтверджуючих доказів. Такий підхід міг би допомогти дослідникам відрізнити справжнє візуальне обґрунтування від відповідей, отриманих через асоціації наборів даних. Однак афективні судження за своєю суттю чутливі до контексту та інтерпретації. Метод, який винагороджує зосередження на видимих ​​людських підказках, все ще може кодувати припущення щодо емоційного вираження, соціальних норм або значення жестів, особливо коли ці припущення відображено в навчальних даних.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Що дивитися далі

Результати взяті з єдиного 12-сторінкового препринту arXiv і повідомлені його авторами; джерело не встановлює незалежну реплікацію, розгортання в реальному світі або продуктивність для більш широких груп населення та налаштувань. Подальша робота повинна перевірити, чи структура залишається надійною з незнайомими культурами, неоднозначними взаємодіями, низькою якістю зображення та сценами, де емоційні підказки є тонкими або суперечливими. Також буде важливо визначити, чи справді регіони доказів відображають процес прийняття рішень у моделі чи просто надають правдоподібні опорні місця після формування відповіді.

Перше питання – реплікація. AffectOmni представлено як препринт arXiv, а не як рецензований або незалежно підтверджений результат. Дослідники повинні перевірити, чи зберігаються отримані прирости за тим самим протоколом оцінки, чи залишаються вони після контролю за додатковими навчальними даними чи розміром моделі, і чи покращує метод калібрування та виявлення помилок, а не лише порівняльні бали.

Еталонний діапазон матиме значення. Джерело називає IntentBench, Daily Omni та WorldSense, але не описує їхнє демографічне охоплення, мови, якість зображення, культурні умови чи баланс соціальних ситуацій. Майбутні оцінки мають перевіряти неоднозначні емоції, змішані сигнали, закриті обличчя, незвичайні положення тіла та сцени, у яких найбільш помітна особа не є джерелом відповідних доказів. Вони також повинні повідомити результати підгруп, де інтерпретація може відрізнятися залежно від культури чи обмежень.

Твердження про можливість перевірки заслуговує цілеспрямованого тестування. Оцінювач може порівняти виділені області з людськими анотаціями, спотворити вибрані області, приховати їх або замінити фоновий контекст, зберігаючи незмінними дані, орієнтовані на людей. Такі тести допоможуть визначити, чи є доказові регіони необхідними для прийняття модельним рішенням чи створюються після факту. Джерело не повідомляє про ці експерименти, тому ступінь заявленої перевірки залишається невідомою.

Нарешті, практичні межі не встановлені. У джерелі немає інформації про затримку, вартість обчислення, ліцензування, доступність розгортання, захист конфіденційності або використання в живих системах. Автори звітують про результати порівняно з базовими рівнями 7B у відкритому коді, але джерело не показує, чи є AffectOmni конкурентоспроможним з більшими моделями чи надійним за межами трьох названих тестів. Доки відповіді на ці запитання не будуть отримані, роботу найкраще сприймати як дослідницьку пропозицію з багатообіцяючими звітними результатами, а не як перевірене рішення для інтерпретації емоцій людей.

Пов’язані посібники та вікторини

Що таке ШІ?Пояснення моделей AIтрансформериЕтика ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?