Volver a Noticias
InnovaciónAI Understanding sesión informativa

Benchmark dice que los mejores modelos multimodales obtienen una puntuación inferior al 10% en la lectura de palabras a partir de sonidos de bolígrafo y movimientos de la mano

Un nuevo artículo de arXiv presenta una prueba en la que los modelos deben inferir una palabra escrita a partir del audio de un lápiz y un video de movimiento de la mano, sin tinta visible. Los autores informan que los humanos tienen una precisión de letras ordenadas superior al 80% y modelos líderes por debajo del 10%, y que dar a los modelos ambas modalidades a menudo empeoraba los resultados.

Por 7 min read
A desk in a research lab holding a blank sheet of paper, a dry pen, a small microphone on a stand and a downward-facing camera on a tripod arm.
La versión corta

Un nuevo artículo de arXiv presenta una prueba en la que los modelos deben inferir una palabra escrita a partir del audio de un lápiz y un video de movimiento de la mano, sin tinta visible. Los autores informan que los humanos tienen una precisión de letras ordenadas superior al 80% y modelos líderes por debajo del 10%, y que dar a los modelos ambas modalidades a menudo empeoraba los resultados.

que paso

Los investigadores publicaron un artículo que describe The Unwriting Benchmark, que pide a modelos multimodales que identifiquen palabras escritas utilizando únicamente el sonido de un bolígrafo y el vídeo de una mano en movimiento, sin tinta visible. El resumen informa una precisión de las letras ordenadas por humanos superior al 80% y los modelos líderes, incluidos GPT-4o y Gemini 2.5-Pro, por debajo del 10%, y dice que la combinación de las dos modalidades con frecuencia degradaba el rendimiento del modelo en lugar de mejorarlo.

Tres investigadores, Garima Arya Yadav, Nilay Yilmaz y Yezhou Yang, publicaron un artículo que presenta lo que llaman The Unwriting Benchmark, una prueba para determinar si los modelos multimodales de aprendizaje automático pueden determinar lo que una persona está escribiendo sin siquiera ver la escritura en sí. El documento figura en arXiv como 2608.14558, archivado bajo inteligencia artificial con una lista cruzada de visión por computadora y reconocimiento de patrones. Los autores definen la tarea principal como "inferencia acústico-cinemática de palabras": a un modelo se le proporciona solo el audio de los arañazos del bolígrafo y el vídeo de los movimientos de la mano, sin rastros de tinta visibles, y debe descifrar la palabra que se escribe. El resumen dice que la tarea abarca tres estilos de escritura diferentes. El listado de arXiv proporciona una fecha de presentación del 15 de mayo de 2026 y incluye un comentario que indica que el trabajo se publicará en CVPR Findings 2026.

El resultado principal es una brecha. Según el resumen, los participantes humanos logran una alta precisión de las letras ordenadas (los autores dicen que más del 80%) mientras que los principales modelos multimodales no logran superar el 10%. Los dos modelos nombrados en el resumen son GPT-4o y Gemini 2.5-Pro. El artículo enmarca esto no como una falla de reconocimiento estrecha sino como evidencia de límites en el razonamiento causal intermodal y en lo que los autores llaman la microcinemática de la escritura: los movimientos finos y rápidos de la mano y el bolígrafo que transportan información sobre qué letra se está formando.

El segundo hallazgo informado es menos esperado. Los autores describen un "efecto de fusión paradójico", en el que suministrar audio y vídeo a un modelo a menudo degrada su rendimiento en comparación con proporcionar una única modalidad. Leen esto como una falla en la capacidad de los modelos para sintetizar señales perceptivas complementarias. El resumen no informa puntuaciones por modalidad, por lo que el material revisado aquí no establece el tamaño de esa degradación y si apareció para cada modelo probado.

Esta cuenta se extrae únicamente de la página de resumen de arXiv; el artículo completo, sus apéndices y cualquier material publicado no fueron examinados. Allí no se indican varios detalles que serían importantes para juzgar el resultado. El resumen no proporciona la cantidad de palabras o clips en el conjunto de datos, la cantidad de participantes humanos o las condiciones bajo las cuales fueron evaluados, el idioma o escritura involucrada, la definición exacta de la precisión de las letras ordenadas, cómo se solicitaron los modelos, cómo se muestrearon y pasaron el video y el audio, o si los datos y el código se publicarán. El artículo también figura como de próxima publicación en una sección de hallazgos de la conferencia en lugar de como una publicación completa revisada por pares, y no se conoce ninguna replicación independiente en este momento.

Lea la fuente principal: arxiv.org

Por qué es importante

La mayoría de las evaluaciones multimodales prueban el reconocimiento de lo que es directamente visible o audible. Éste pone a prueba la inferencia de algo que nunca se mostró e informa que agregar una segunda modalidad puede resultar perjudicial, un resultado que va en contra de la suposición común de que fusionar audio y video es aditivo. Si se mantiene, indica una debilidad en la forma en que los sistemas actuales combinan los canales de percepción, no sólo en una tarea difícil.

Los puntos de referencia multimodales más utilizados prueban si un sistema puede nombrar lo que está presente en una imagen, un vídeo o un clip de audio. Éste elimina deliberadamente la respuesta de la entrada. La palabra nunca se muestra; tiene que ser reconstruido a partir del proceso físico que lo produjo. Ese diseño apunta a una capacidad (inferir una causa invisible a partir de evidencia dinámica) que está más cerca de cómo las personas leen una escena que de la coincidencia de patrones sobre contenido estático, y es una capacidad que las suites de evaluación actuales en gran medida no aíslan.

Podría decirse que el resultado de la fusión es el más importante de las dos afirmaciones. Gran parte de la ingeniería de productos supone que darle a un modelo más canales de percepción sólo puede ayudar: los asistentes a las reuniones combinan la voz con el video en pantalla, las herramientas de accesibilidad combinan la entrada de la cámara y el micrófono, y las pilas robóticas fusionan varios sensores bajo el supuesto de que la redundancia es protectora. Si una segunda modalidad puede empeorar de manera confiable un modelo en una tarea en la que ambos canales transmiten una señal real, esa suposición necesita ser probada en lugar de confiar. El artículo no establece que esto suceda en general (lo informa en una tarea, con un pequeño conjunto de modelos nombrados), pero es un caso concreto en el que más información produjo una peor respuesta.

La tarea también se sitúa cerca de dos áreas prácticas. Uno es la accesibilidad y la digitalización: capturar escritura a mano a partir de sonido y movimiento, sin un lápiz inteligente o un escáner, sería útil para la captura de notas y para las personas que escriben en papel normal. La otra es la privacidad. Inferir contenido escrito a partir de señales acústicas y visuales incidentales es, en principio, un problema de canal lateral, y los ataques de canal lateral a teclados a partir de audio se han estudiado durante años. Según la evidencia de este resumen, los modelos actuales de propósito general están lejos de ser capaces de hacer esto (menos del 10% es casi inutilizable), mientras que, según se informa, los humanos sí pueden. Ése es un hallazgo sobre las capacidades del modelo actual, no una garantía duradera.

Las limitaciones van en ambas direcciones y vale la pena exponerlas claramente. Son comunes las puntuaciones muy bajas en un punto de referencia recientemente introducido, y por sí mismas no distinguen entre un déficit de razonamiento genuino, una falta de coincidencia entre el formato de la tarea y cómo estos modelos ingieren video y audio, y un arnés de evaluación que no fue ajustado para la tarea. Los dos modelos nombrados son sistemas comerciales de uso general, no sistemas construidos o ajustados para análisis de movimiento detallados, y es posible que no se hayan probado modelos más potentes o más recientes. La línea de base humana se informa como un número único sin condiciones descritas. Y un punto de referencia elaborado por el mismo equipo que informa la brecha aún no ha sido probado por nadie más.

Qué ver a continuación

Si el conjunto de datos, el código y el protocolo de referencia humana se publican y reproducen de forma independiente; si los modelos más nuevos o diferentes estímulos cierran la brecha; y si la degradación de la fusión reportada aparece en otras tareas de audio y video o resulta ser específica de este punto de referencia.

Lo primero que hay que tener en cuenta es la liberación y la reproducibilidad. Si los autores publican el conjunto de datos, el código de evaluación y el protocolo exacto del estudio en humanos determinarán la rapidez con la que se pueden verificar las cifras de los titulares. La entrada de arXiv revisada aquí no indica un código o enlace de datos. Un punto de referencia que informa una brecha entre humanos y máquinas de 70 puntos invita a una replicación independiente, y el valor de la afirmación depende en gran medida de si otros grupos pueden reproducir tanto las puntuaciones del modelo como la línea de base humana.

La segunda es si la brecha sobrevive al contacto con mejores configuraciones. Las puntuaciones en nuevas tareas multimodales a menudo cambian sustancialmente con cambios que no tienen nada que ver con el razonamiento: velocidad de fotogramas, muestreo y preprocesamiento de audio, cuántos fotogramas ve realmente un modelo, estructura de indicaciones o una modesta cantidad de ajustes específicos de la tarea. Si un pequeño cambio de ingeniería eleva los modelos muy por encima del 10%, el resultado se lee principalmente como un problema en la tubería de entrada. Si un ajuste cuidadoso los deja cerca del suelo, la afirmación más fuerte de los autores sobre el razonamiento causal intermodal se vuelve más difícil de descartar.

En tercer lugar está el efecto de fusión. La pregunta interesante es si la degradación al agregar una modalidad aparece en otras tareas de audio y video, o si es específica de ésta. Si otros grupos encuentran el mismo patrón en otros lugares, señalaría algo estructural en cómo los modelos actuales pesan y combinan canales en lugar de una peculiaridad de los rasguños del lápiz y el movimiento de la mano. Las ablaciones por modalidad en el artículo completo y los intentos de reproducirlas son el lugar donde se resuelve.

Finalmente, esté atento a la adopción. Los puntos de referencia importan cuando otros laboratorios informan puntuaciones sobre ellos y cuando los números cambian a lo largo de generaciones sucesivas de modelos. En los próximos meses será visible si este aparece en el seguimiento de los hallazgos del CVPR 2026 como se indicó, si los laboratorios fronterizos lo incluyen en los informes de evaluación y si los investigadores de privacidad y seguridad recogen el marco del canal lateral. También vale la pena señalar que un punto de referencia tan alejado de la saturación da una señal clara por un tiempo, hasta que deja de ser así, momento en el que la pregunta es si los modelos aprendieron la capacidad o el conjunto de datos.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe mensual

Obtenga las historias de IA que realmente importan.

Un breve correo electrónico al mes: qué cambió en la IA, por qué es importante, además de las herramientas y guías que valen la pena.

Gratis · Sin spam · Darse de baja en un clic