彩票假說
彩票假說認為,在一個大型的、隨機初始化的神經網路內部隱藏著一個小的子網路——一張「中獎彩票」——它透過相同的初始權重單獨訓練,可以匹配整個網路的準確性。
概述
這很重要,因為它暗示我們訓練的參數遠超過實際需要的。
深入探討
這個假設由麻省理工學院的喬納森·弗蘭克爾和邁克爾·卡賓於 2018 年提出,源自於修剪研究。通常,您可以將經過訓練的網路修剪至其權重的 10-20%,而不會失去準確性,但從頭開始訓練該小型網路會失敗。弗蘭克爾和卡賓找到了竅門:保留倖存連接的原始初始權重。然後,稀疏的子網路(中獎彩券)會獨立訓練到完全準確,有時比密集的原始子網路更快。他們透過「迭代幅度修剪」來識別票證:訓練,修剪最小幅度的權重,將其餘權重回滾到初始值,然後重複。結果表明,密集的超參數化主要有助於優化找到良好的稀疏結構,而不是所有這些權重都是單獨必要的。
技術洞察
核心過程是帶有權重倒帶的迭代幅度修剪:訓練後,刪除最低幅度的權重,將剩餘的權重重置為其原始初始化(或早期訓練檢查點,稱為「倒帶」的細化),然後重新訓練。特定的稀疏遮罩及其匹配的初始化的組合使得票證「獲勝」——隨機重新初始化相同的遮罩會破壞效果。
戰略影響
更明確的決策
它可以幫助您將清晰的技術聲明與行銷語言分開。
成本與預算
在花費金錢或時間之前,您可以提出更好的實施問題。
團隊與工作流程
具有共同理解的團隊可以做出更好的產品、政策和學習決策。
彩票假說的未來
彩票推動了從一開始就訓練稀疏網路以節省計算和能源的研究,以及彩票是否跨數據集和任務傳輸的研究。將迭代剪枝擴展到十億個參數模型仍然很昂貴,因此我們繼續致力於廉價地找到彩票或證明它們存在(「強」彩票假設認為彩票在初始化時就存在,根本不需要訓練)。期待與高效能的設備上模型和綠色人工智慧的搭配。
現實世界的實施
將大型影像分類器壓縮至其權重的 20% 以下,以便部署在手機上,同時保持準確性
透過僅識別和訓練稀疏獲勝子網路來加速訓練
透過重複使用在一個資料集上找到的票證來快速啟動相關資料集的訓練來研究權重可轉移性
透過運送修剪過的中獎彩票而不是密集模型來減少邊緣設備中的推理能量和內存
風險與防護欄
不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。
基準測試可能看起來很強大,但實際效能卻參差不齊。
忽視數據品質和評估計劃通常會產生脆弱的結果。
實施路線圖
從您需要的結果的簡單語言定義開始。
在測試之前選擇一種成功指標和一種失敗條件。
使用代表性資料運行小型試點,而不是完善的演示集。
記錄彩票假設在哪些方面有幫助以及在哪些方面更簡單的方法更好。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Lottery Ticket Hypothesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是樂透彩券假說?
彩票假說認為,在一個大型的、隨機初始化的神經網路內部隱藏著一個小的子網路——一張「中獎彩票」——它透過相同的初始權重單獨訓練,可以匹配整個網路的準確性。這很重要,因為它表明我們訓練的參數遠遠多於我們實際需要的參數。
這個假設中的「中獎彩券」是什麼?
中獎彩券是一個小型子網絡,當獨立於相同的初始權重進行訓練時,它可以達到與密集網絡相當的準確性。
為什麼訓練修剪後的子網路通常會失敗,除非你做了一些特別的事情?
關鍵的見解是稀疏掩碼僅在與匹配的原始初始化配對時才起作用;隨機重新初始化會破壞它。
彩票假說是誰提出的?
喬納森·弗蘭克爾 (Jonathan Frankle) 和邁克爾·卡賓 (Michael Carbin) 在 2018 年麻省理工學院的論文中介紹了這個假設。
用什麼技術來找出中獎彩券?
迭代幅度剪枝反覆訓練,刪除最小幅度的權重,並將其餘權重恢復到初始值。
對於大型過度參數化網絡,該假設有何啟示?
這項發現意味著過度參數化有助於搜尋可訓練的稀疏子網絡,而不是每個權重都是必需的。