Benchmark dice que los mejores modelos multimodales obtienen una puntuación inferior al 10% en la lectura de palabras a partir de sonidos de bolígrafo y movimientos de la mano
Un nuevo artículo de arXiv presenta una prueba en la que los modelos deben inferir una palabra escrita a partir del audio de un lápiz y un video de movimiento de la mano, sin tinta visible. Los autores informan que los humanos tienen una precisión de letras ordenadas superior al 80% y modelos líderes por debajo del 10%, y que dar a los modelos ambas modalidades a menudo empeoraba los resultados.