波束搜尋
集束搜尋是一種解碼策略,它在每一步中保留幾個最有希望的部分序列,而不是貪婪地致力於一個。
概述
It matters because it produces higher-quality, more coherent text for tasks like translation and summarization than picking the single best word every time.
深入探討
當語言模型產生文字時,它會預測下一個標記的機率,然後重複。貪婪解碼總是採用單一最高機率的標記,但這可能會讓你陷入困境——早期的局部最佳選擇可能會導致整體更糟糕的句子。波束搜尋透過維護前 k 個部分序列(“波束寬度”,通常為 4-10)來進行對沖。在每一步中,它都會用可能的下一個標記擴展每個波束,透過累積對數機率對所有候選者進行評分,並僅保留前 k 個。結果是得分最高的完整序列。它成為機器翻譯的標準,並且在忠實、高機率的輸出比創造力更重要的情況下仍然很常見。
技術洞察
集束搜尋透過求和標記的對數機率對序列進行評分,這使其偏向於較短的序列(每個額外的標記都會添加一個負項)。為了解決這個問題,系統應用長度歸一化,將分數除以序列長度(有時取冪)。較大的波束寬度可以探索更多的候選者,但會花費更多的計算成本,並且與直覺相反,有時會產生更乏味或退化的文本——這是神經機器翻譯中有據可查的效果。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
集束搜尋的未來
對於開放式的創造性生成,束搜尋越來越多地被採樣方法(top-k、nucleus)所取代,因為束往往會產生重複的通用文字。但對於受限任務——翻譯、語音辨識、程式碼產生、結構化輸出——集束搜尋及其變體(多樣化集束搜尋、強制所需單字的受限集束搜尋)仍然有價值。預計將繼續採用混合方法,將波束式探索與取樣結合,再加上任務感知解碼,根據忠實性或多樣性是否優先考慮來調整策略。
現實世界的實施
神經機器翻譯系統在許多候選短語中選擇最流暢的句子翻譯
自動語音辨識根據聲學模型機率解碼最可能的轉錄本
影像字幕模型產生單一連貫的字幕,而不是隨機的看似合理的字幕
使用約束束搜尋強制特定關鍵字或術語出現在輸出中的約束生成
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Beam Search quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Beam Search?
集束搜尋是一種解碼策略,它在每一步中保留幾個最有希望的部分序列,而不是貪婪地致力於一個。這很重要,因為它可以為翻譯和摘要等任務產生更高品質、更連貫的文本,而不是每次都選擇一個最好的單字。
波束搜尋中「波束寬度」(k) 控制什麼?
波束寬度是每一步保留和擴展的頂部部分序列的數量;更大的寬度探索更多的候選者。
束搜尋與貪婪解碼有何不同?
貪婪解碼每一步只取頂部的令牌;波束搜尋透過同時追蹤幾個有希望的序列來進行對沖。
為什麼長度歸一化常用於集束搜尋?
每個額外的標記都會增加一個負對數機率,因此如果沒有標準化,較短的序列得分就會不公平地更高。
集束搜尋特別適合哪種任務?
當目標是單一準確、流暢的渲染時,束搜尋表現出色,這就是它成為翻譯標準的原因。
使用非常大的波束寬度進行開放式發電的已知缺點是什麼?
與直覺相反,神經文本生成中較寬的光束通常有利於通用的、重複的序列,而不是有趣的序列。