Назад до новин
ІнноваціяAI Understanding брифінг

Benchmark каже, що найкращі мультимодальні моделі набирають менше 10% результатів при читанні слів із звуків ручки та рухів руки

Нова стаття arXiv представляє тест, у якому моделі повинні вивести написане слово на основі аудіо, написаного ручкою, і відео рухів руки, без видимих чорнила. Автори повідомляють, що точність упорядкованих літер у людей перевищує 80%, а у провідних моделей – нижче 10%, і що використання моделей обох способів часто погіршує результати.

7 min readRead the primary source
Source-provided image accompanying Benchmark Says Top Multimodal Models Score Under 10% at Reading Words From Pen Sounds and Hand Motion
Першоджерельний документДжерело записано
Видавець
arxiv.org
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2608.14558
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Еталон
Стандартизований тест або набір даних, який використовується для вимірювання та порівняння продуктивності моделі.
Штучний інтелект (AI)
Широке поле побудови систем, які виконують завдання, що вимагають розпізнавання шаблонів, аргументації, мови або прийняття рішень.
Машинне навчання (ML)
Методи, які дозволяють системам вивчати шаблони з даних і вдосконалюватися з часом.
Перевір себеВікторина «Пояснення моделей ШІ».

Що сталося

Дослідники опублікували статтю з описом The Unwritten , яка пропонує мультимодальним моделям ідентифікувати написані слова, використовуючи лише звук ручки та відео рухомої руки без видимого чорнила. У анотації повідомляється, що точність впорядкованих листів людиною перевищує 80%, а провідні моделі, включаючи GPT-4o та Gemini 2.5-Pro, нижче 10%, і сказано, що поєднання двох модальностей часто погіршувало продуктивність моделі, а не покращувало її.

Троє дослідників — Гаріма Ар’я Ядав, Нілай Їлмаз і Єчжоу Янг — опублікували статтю, яка представляє те, що вони називають The Unwritten , перевірку того, чи можуть мультимодальні моделі машинного навчання розробляти те, що пише людина, навіть не бачачи самого написаного. The paper is listed on arXiv as 2608.14558, filed under artificial intelligence with a cross-listing to computer vision and pattern recognition. Автори визначають основне завдання як «акусто-кінематичний висновок слова»: моделі дається лише аудіо подряпин ручкою та відео рухів руки, без видимих ​​слідів чорнила, і вона повинна розшифрувати написане слово. The abstract says the task spans three different writing styles. The arXiv listing gives a submission date of 15 May 2026 and carries a comment stating the work is to be published in CVPR Findings 2026.

Результатом заголовка є прогалина. Відповідно до анотації, учасники-люди досягають високої точності впорядкованих літер — за словами авторів, понад 80 % — у той час як провідним мультимодальним моделям не вдається перевищити 10 %. The two models named in the abstract are GPT-4o and Gemini 2.5-Pro. У документі це розглядається не як вузька помилка розпізнавання, а як доказ обмежень у крос-модальних причинно-наслідкових міркуваннях і в тому, що автори називають мікрокінематикою письма: тонкі, швидкі рухи руки та пера, які несуть інформацію про те, яка буква утворюється.

Друга знахідка менш очікувана. Автори описують «парадоксальний ефект злиття», при якому подача як аудіо, так і відео до моделі часто погіршує її продуктивність порівняно з наданням однієї модальності. They read this as a breakdown in the models' ability to synthesise complementary perceptual cues. Анотація не повідомляє оцінки за модальністю, тому розмір цього погіршення та те, чи воно з’явилося для кожної перевіреної моделі, не встановлюються матеріалами, розглянутими тут.

This account is drawn from the arXiv abstract page only; the full paper, its appendices and any released materials were not examined. Деякі деталі, які мали б значення для оцінки результату, там не вказані. В анотації не вказується кількість слів або кліпів у наборі даних, кількість людей-учасників або умови, за яких вони проходили тестування, мова чи шрифт, що використовуються, точне визначення впорядкованої точності літер, як моделі отримували запити, як відео та аудіо відбиралися та передавались, чи будуть дані та код опубліковані. Стаття також вказана як готова до публікації у звітах про результати конференції, а не як завершена рецензована публікація, і на даний момент невідомо про незалежне тиражування.

Деталі джерела: arxiv.org

Чому це важливо

Більшість мультимодальних оцінок перевіряють розпізнавання того, що безпосередньо видно або чутно. Цей перевіряє висновок про те, що ніколи не показувалося, і повідомляє, що додавання другої модальності може завдати шкоди — результат, який суперечить поширеному припущенню, що злиття аудіо та відео є адитивним. If it holds up, it points at a weakness in how current systems combine perceptual channels, not just at a hard task.

Most widely used multimodal benchmarks test whether a system can name what is present in an image, a video or an audio clip. This one deliberately removes the answer from the input. Слово ніколи не показується; it has to be reconstructed from the physical process that produced it. Ця конструкція націлена на здатність — висновок про невидиму причину з динамічних доказів — яка ближче до того, як люди читають сцену, ніж до зіставлення шаблонів над статичним вмістом, і це здатність, яку поточні пакети оцінки в основному не виділяють.

The fusion result is arguably the more consequential of the two claims. Значна частина розробки продукту припускає, що надання моделі більше сприйнятливих каналів може лише допомогти: асистенти зустрічі поєднують мову з екранним відео, інструменти доступності поєднують вхід камери та мікрофона, а стеки робототехніки об’єднують кілька датчиків, припускаючи, що надмірність захищає. Якщо друга модальність може достовірно погіршити модель у завданні, де обидва канали передають реальний сигнал, це припущення потребує перевірки, а не довіри. Стаття не встановлює, що це відбувається загалом — вона повідомляє про це в одному завданні з невеликим набором іменованих моделей — але це конкретний випадок, коли більше вхідних даних дало гіршу відповідь.

Завдання також знаходиться біля двох практичних областей. Одна з них – це доступність і оцифровка: захоплення рукописного тексту за допомогою звуку та руху без розумної ручки чи сканера було б корисно для запису нотаток і для людей, які пишуть на звичайному папері. Інше – конфіденційність. Виведення письмового вмісту з випадкових акустичних і візуальних сигналів, в принципі, є проблемою побічного каналу, а атаки побічних каналів на клавіатуру з аудіо вивчалися роками. На підставі доказів, наведених у цій анотації, поточні моделі загального призначення далекі від того, щоб зробити це — менше 10% майже непридатні — тоді як люди, як повідомляється, можуть. That is a finding about today's model capabilities, not a durable guarantee.

Обмеження діють в обох напрямках, і їх варто пояснити прямо. Дуже низькі оцінки за нещодавно запровадженим еталонним тестом є звичайним явищем, і самі по собі вони не розрізняють справжнього дефіциту міркувань, невідповідності між форматом завдання та тим, як ці моделі завантажують відео та аудіо, і системою оцінювання, яка не була налаштована для завдання. Дві названі моделі є комерційними системами загального призначення, а не системами, створеними або налаштованими для точного аналізу руху, і потужніші або новіші моделі, можливо, не тестувалися. Базовий рівень людини повідомляється як одне число без описаних умов. І тест, розроблений тією ж командою, яка повідомляє про розрив, ще не проходив стрес-тестування ніким іншим.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
AI Models Explained Quiz

What is the best response when AI Models Explained makes a mistake in production?

Що дивитися далі

Whether the dataset, code and human-baseline protocol are released and independently reproduced; whether newer models or different prompting close the gap; and whether the reported fusion degradation shows up on other audio-video tasks or turns out to be specific to this .

Перше, на що слід звернути увагу, це випуск і відтворюваність. Від того, чи опублікують автори набір даних, код оцінки та точний протокол дослідження на людях, залежатиме, наскільки швидко можна буде перевірити заголовні цифри. Запис arXiv, розглянутий тут, не вказує на код або посилання на дані. Еталонний тест, який повідомляє про 70-бальний розрив між людиною та машиною, запрошує до незалежного повторення, і цінність твердження значною мірою залежить від того, чи можуть інші групи відтворити як оцінки моделі, так і базову лінію людини.

По-друге, чи витримає розрив контакт із кращими налаштуваннями. Оцінки за новими мультимодальними завданнями часто суттєво змінюються зі змінами, які не мають нічого спільного з міркуваннями — частотою кадрів, дискретизацією та попередньою обробкою аудіо, кількістю кадрів, які фактично бачить модель, структурою підказок або скромною кількістю тонкого налаштування для конкретного завдання. Якщо невелика технічна зміна підніме моделі значно вище 10%, результат читатиметься головним чином як проблема вхідного конвеєру. Якщо ретельне налаштування залишає їх біля підлоги, більш сильну заяву авторів про крос-модальне причинно-наслідкове міркування стає важче відхилити.

По-третє, це ефект злиття. Цікаве питання полягає в тому, чи з’являється деградація від додавання модальності в інших аудіо-відео завданнях, чи це стосується лише цієї. Якщо інші групи виявлять таку саму закономірність деінде, це вкаже на щось структурне в тому, як нинішні моделі зважують і поєднують канали, а не на примху подряпин ручкою та руху руки. Пер-модальні абляції в повній статті та спроби їх відтворити є тим місцем, яке закріплюється.

Нарешті, стежте за усиновленням. Еталонні показники мають значення, коли інші лабораторії повідомляють про них оцінки та коли цифри змінюються протягом послідовних поколінь моделей. Чи з’явиться він у треку висновків CVPR 2026, як зазначено, чи включено передовими лабораторіями його до звітів про оцінку, і чи дослідники з питань конфіденційності та безпеки підберуть фреймування бічного каналу – все це буде видно протягом найближчих місяців. Варто також зазначити, що тест, далекий від насичення, деякий час дає чіткий сигнал — доки він не зникне, після чого постає питання, чи засвоїли моделі можливості чи набір даних.

Пов’язані посібники та вікторини

Пояснення моделей AIНавчання ШІЩо таке ШІ?Перевірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосарії
Знайшли це корисним?