返回新聞
創新AI Understanding 簡報

Benchmark 表示,頂級多模態模型在透過鋼筆聲音和手勢讀取單字方面得分低於 10%

一篇新的 arXiv 論文引入了一項測試,其中模型必須從筆劃音頻和手部動作視頻中推斷出書面單詞,且看不到墨水。作者報告稱,人類的有序字母準確率高於 80%,而領先模型的準確率低於 10%——而且為模型提供這兩種模式往往會使結果變得更糟。

7 min readRead the primary source
Source-provided image accompanying Benchmark Says Top Multimodal Models Score Under 10% at Reading Words From Pen Sounds and Hand Motion
主要來源文件來源記錄
出版商
arxiv.org
來源連結
arxiv.orghttps://arxiv.org/abs/2608.14558
來源類型
主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。
背景60 秒內了解這一點

從這裡開始

關鍵術語

基準測試
用於測量和比較模型性能的標準化測試或資料集。
人工智慧(AI)
建構執行需要模式識別、推理、語言或決策的任務的系統的廣泛領域。
機器學習(ML)
允許系統從數據中學習模式並隨著時間的推移進行改進的方法。
測試一下自己AI 模型解釋測驗

發生了什麼事

研究人員發表了一篇描述「不成文基準」的論文,該論文要求多模態模型僅透過筆的聲音和手移動的影片來識別正在書寫的單詞,而沒有可見的墨水。摘要報告稱,人類有序字母的準確率超過 80%,而包括 GPT-4o 和 Gemini 2.5-Pro 在內的領先模型則低於 10%,並表示將這兩種模式結合起來經常會降低模型性能,而不是提高模型性能。

加里瑪·阿里亞·亞達夫 (Garima Arya Yadav)、尼萊·耶爾馬茲 (Nilay Yilmaz) 和葉週·楊 (Yezhou Yang) 三位研究人員發表了一篇論文,介紹了他們所謂的“不成文基準”(The Unwriting ),該基準測試多模態機器學習模型是否可以在不成文的情況下寫文字本身正在看文字本身的內容。論文在 arXiv 上的編號為 2608.14558,在人工智慧項下歸檔,並與電腦視覺和模式識別交叉列出。作者將核心任務定義為“聲學運動單字推理”:僅向模型提供鋼筆划痕的音頻和手部動作的視頻,沒有可見的墨水痕跡,並且必須破譯所寫的單詞。摘要稱該任務涵蓋三種不同的寫作風格。 arXiv 清單給出的提交日期為 2026 年 5 月 15 日,並附有一條評論,指出該作品將在 CVPR Finds 2026 中發布。

整體結果是差距。根據摘要,人類參與者實現了較高的有序字母準確率(作者稱超過 80%),而領先的多模態模型未能超過 10%。摘要中命名的兩個模型分別是 GPT-4o 和 Gemini 2.5-Pro。該論文並不是將其視為狹隘的識別失敗,而是將其視為跨模式因果推理以及作者所說的書寫微觀運動學的局限性的證據:精細、快速的手和筆運動攜帶著正在形成的字母的信息。

第二個報告的發現出乎意料。作者描述了一種“矛盾的融合效應”,即與提供單一模態相比,向模型提供音訊和視訊通常會降低其性能。他們將此解讀為模型合成互補感知線索能力的崩潰。摘要沒有報告每種模式的分數,因此退化的大小以及是否出現在每個測試的模型中,都不是由此處審查的材料確定的。

此帳戶僅來自 arXiv 摘要頁面;全文、其附錄和任何發佈的資料均未經過審查。那裡沒有說明對判斷結果很重要的幾個細節。摘要沒有給出資料集中的單字或剪輯數量、人類參與者的數量或測試條件、涉及的語言或腳本、有序字母準確性的確切定義、模型如何提示、視訊和音訊如何採樣和傳入,或者資料和程式碼是否會發布。該論文也被列為即將發表的會議調查結果,而不是作為完整的同行評審出版物,目前尚無獨立的複製。

來源詳情: arxiv.org

為什麼這很重要

大多數多模式評估測驗對直接可見或可聽內容的識別。這個測試測試了從未展示過的東西的推論,並報告添加第二種模式可能會造成傷害——這一結果違背了音頻和視頻融合是相加的常見假設。如果它成立,則表示當前系統在結合感知通道方面存在弱點,而不僅僅是一項艱鉅的任務。

最廣泛使用的多模式基準測試系統是否可以命名影像、影片或音訊剪輯中存在的內容。這個故意從輸入中刪除答案。這個詞從來沒有被顯示出來;它必須從產生它的物理過程中重建。該設計的目標是一種能力——從動態證據中推斷出看不見的原因——這種能力更接近人們閱讀場景的方式,而不是靜態內容的模式匹配,而且當前的評估套件基本上沒有隔離這種能力。

融合結果可以說是兩個主張中比較重要的一個。大量產品工程假設為模型提供更多感知通道只會有所幫助:會議助理將語音與螢幕視訊結合起來,輔助工具將攝影機和麥克風輸入結合起來,機器人堆疊在冗餘具有保護性的假設下融合了多個感測器。如果第二種模式可以可靠地使模型在兩個通道都攜帶真實訊號的任務上變得更糟,那麼該假設需要測試而不是信任。這篇論文並沒有證明這種情況普遍發生——它用一小組命名模型在一項任務上報告了這種情況——但這是一個具體案例,更多的輸入會產生更糟糕的答案。

該任務也靠近兩個實際領域。一是可訪問性和數位化:無需智慧筆或掃描儀,從聲音和動作中捕獲手寫內容對於筆記捕獲和在普通紙上書寫的人來說非常有用。另一個是隱私。從偶然的聲音和視覺信號推斷書面內容原則上是一個側信道問題,並且從音頻對鍵盤的側信道攻擊已經研究了多年。根據本文摘要中的證據,目前的通用模型還遠遠無法做到這一點——低於 10% 幾乎無法使用——而據報道人類可以。這是對當今模型能力的發現,而不是持久的保證。

這些限制是雙向的,值得明確說明。新引入的基準測試得分非常低的情況很常見,而且它們本身無法區分真正的推理缺陷、任務格式與這些模型如何攝取視頻和音頻之間的不匹配,以及未針對任務進行調整的評估工具。這兩個模型是通用商業系統,不是為細粒度運動分析而建造或微調的系統,並且更強或更新的模型可能尚未經過測試。人類基線報告為單一數字,沒有描述條件。由同一團隊編寫的報告差距的基準尚未經過其他任何人的壓力測試。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
互動式概念檢查+10 Points
AI Models Explained Quiz

What is the best response when AI Models Explained makes a mistake in production?

接下來看什麼

資料集、程式碼和人類基準協定是否發布並獨立複製;較新的型號或不同的提示是否可以縮小差距;以及所報告的融合退化是否出現在其他音訊視訊任務中,或者結果是特定於該基準測試的。

首先要注意的是發布和再現性。作者是否發布資料集、評估程式碼和確切的人類研究協議將決定檢查標題數字的速度。此處查看的 arXiv 條目並不表示代碼或資料連結。報告 70 分人機差距的基準需要獨立複製,而該聲明的價值在很大程度上取決於其他團隊是否可以複製模型分數和人類基線。

第二個問題是,在與更好的設定接觸後,間隙是否仍然存在。新的多模式任務的分數通常會隨著與推理無關的變化而大幅變化——幀速率、音頻採樣和預處理、模型實際看到的幀數、提示結構或適量的特定於任務的微調。如果一個小的工程變更將模型提升遠高於 10%,則結果主要表現為輸入管道問題。如果仔細的調整讓它們接近底部,那麼作者關於跨模式因果推理的更強烈的主張就變得更難以駁回。

三是融合效應。有趣的問題是,添加模態導致的效能下降是否會出現在其他音訊視訊任務上,或者是否只針對該任務。如果其他小組在其他地方發現了相同的模式,那麼這將表明當前模型如何重量和組合通道的結構性因素,而不是筆刮痕和手部動作的怪癖。全文中的每種模式的消融以及嘗試重現它們是解決的地方。

最後,注意採用。當其他實驗室報告基準分數以及數字在連續幾代模型中變化時,基準很重要。這項問題是否出現在 CVPR 2026 調查結果軌道中,前沿實驗室是否將其納入評估報告,以及隱私和安全研究人員是否採用側通道框架,都將在未來幾個月內可見。另外值得注意的是,遠離飽和的基準在一段時間內會發出清晰的信號 - 直到它不再發出,此時問題就變成了模型是否學習了功能或資料集。

相關指引和測驗

人工智慧模型解釋人工智慧培訓什麼是人工智慧?測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語
覺得有用嗎?