基礎知識指南

考試時培訓

測試時訓練 (TTT) 讓模型在做出預測時繼續從每個新輸入中學習,而不是在訓練後保持凍結狀態。

閱讀時間約2分鐘最後更新

概述

It is a powerful way to adapt to distribution shift and squeeze extra performance out of fixed models.

深入探討

傳統的機器學習將世界一分為二:訓練,凍結權重,然後部署。測試時訓練透過在預測之前對測試範例本身執行少量突發學習來挑戰這一點。由於真實標籤在測試時未知,因此 TTT 使用自監督輔助任務,例如預測旋轉影像的方向或重建蒙版補丁,其損失可以在沒有標籤的情況下計算。在傳入樣本上優化該任務會推動共享表示以適應新數據,然後主腦做出預測。一個現代變體徹底顛覆了這個想法:TTT 層將自己的隱藏狀態視為一個微小的模型,該模型透過跨序列的梯度下降進行更新,為長上下文的注意力提供了一種可學習的替代方案。

技術洞察

在序列模型 TTT 層中,隱藏狀態不是固定向量,而是內部模型的權重,每個標記在自監督重建損失上透過一個梯度步驟進行更新。這使得循環更新像注意力一樣具有表達性,但序列長度呈線性,因為每個令牌都會觸發快速內循環優化,而不是關注所有過去的令牌。外環訓練學習這種內在學習應該如何表現。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

考試時培訓的未來

TTT 正在獲得越來越多的關注,因為它可以解決面對不斷變化的現實世界數據的凍結模型的脆弱性,並且可以作為高效長上下文建模的架構原語,可以與 Transformer 相媲美而無需二次成本。預計將 TTT 層與注意力混合在一起的混合體,在條件不斷變化的機器人和感知中更廣泛的應用,以及關於動態適應如何與可靠性相互作用的安全研究,因為在推理時自我更新的模型也可能朝意想不到的方向漂移。

現實世界的實施

當部署照片與訓練資料(新的照明、天氣或相機)不同時,動態調整影像分類器

TTT 層作為 Transformer 的替代方案,可透過線性時間更新處理非常長的序列

在單一醫院或實驗室的獨特數據上改進醫學或科學模型,而無需進行全面的再培訓

透過快速調整每個樣本的表示來提高對損壞或雜訊輸入的穩健性

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄測試時培訓在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Test-Time Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

測試時間增加

常見問題

What is Test-Time Training?

測試時訓練 (TTT) 讓模型在做出預測時繼續從每個新輸入中學習,而不是在訓練後保持凍結狀態。這是適應分佈變化並從固定模型中擠出額外性能的強大方法。

測試時訓練與標準訓練有何不同?

TTT 對傳入的測試樣本本身執行少量學習,而不是在訓練階段後凍結權重。

為什麼經典 TTT 依賴自我監督的輔助任務?

由於測試範例的真實標籤未知,TTT 使用旋轉預測或光罩重建等任務,其損失不需要標籤。

在 TTT 序列層中,隱藏狀態實際上變成了什麼?

TTT 層將其隱藏狀態視為內部模型,其權重透過每個標記上的梯度步驟進行更新。

與標準注意力相比,TTT 序列層具有哪些關鍵的效率優勢?

透過對每個令牌進行快速內循環更新而不是關注所有先前的令牌,TTT 層實現了線性時間縮放。

TTT 特別適合解決哪個現實世界問題?

當測試條件(照明、感測器、域)與訓練中看到的條件不同時,TTT 可以幫助凍結模型應對。