語言人工智慧指南

大型語言模式的新興能力

突現能力是指一旦達到一定規模就會在大型語言模型中突然出現的技能,即使較小的模型沒有表現出這些跡象。

閱讀時間約2分鐘最後更新

概述

They matter because they make capabilities hard to predict from small-scale experiments.

深入探討

Wei 及其同事在 2022 年發表的一篇論文中流行起來,「湧現」是指較小模型的表現保持接近機會的任務,然後一旦模型跨越參數、數據或計算的大小閾值,性能就會急劇跳躍。報告的範例包括多步驟算術、某些推理基準以及遵循新穎的指令。引人注目的部分是不連續性:技能並沒有逐漸提高,似乎不存在,然後又出現。 Schaeffer 及其同事在 2023 年的後續行動中認為,某些出現在一定程度上是一種測量偽影,因為嚴格的「全有或全無」指標(例如精確匹配)會誇大突然的跳躍,而在較軟的評分下,這些跳躍看起來很平滑。這場辯論重塑了研究人員報告擴展結果和選擇評估指標的方式。

技術洞察

湧現是否「真實」通常取決於衡量標準。透過精確匹配評分的任務在每一步都正確之前給出零積分,因此每個令牌準確性的穩定潛在收益可能會表現為突然的飛躍。切換到連續指標,例如代幣級可能性或部分信用,曲線通常看起來很平滑。因此,湧現反映了真正的能力成長與所選評分規則中內建的不連續性之間的交互作用。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

大型语言模型的新兴能力的未来

研究人員現在將擴展研究與多個指標結合起來,將真實的相位變化與偽影區分開來,並探討哪些功能真正達到了擴展的目的。更好的可預測性對於安全至關重要,因為不可預見的能力可能包括危險的能力。預計在提前預測能力的縮放法則方面會有更多工作,加上仔細的基準設計,以便所謂的「出現」反映模型行為而不是測量的怪癖。

現實世界的實施

大型模型解決多步驟的文字問題,而較小的模型則在機會層級上回答。

模型在跨越規模閾值後突然遵循複雜的、前所未見的指令。

只有當模型達到足夠的尺寸時,思考鏈才會促進推理。

研究人員透過部分信用評分重新規劃「突然」的基準跳躍並找到一條平滑的曲線。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Emergent Abilities of Large Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

語言模型中的阿諛奉承

常見問題

What is Emergent Abilities of Large Language Models?

突現能力是指一旦達到一定規模就會在大型語言模型中突然出現的技能,即使較小的模型沒有表現出這些跡象。它們很重要,因為它們使能力難以透過小規模實驗來預測。

什麼定義了大型語言模型中的湧現能力?

在較小的模型中,湧現能力幾乎不存在,但一旦規模超過閾值,湧現能力就會急劇出現。

Schaeffer 及其同事在 2023 年的後續行動中提出了什麼觀點?

他們表明,全有或全無的指標可以使平穩的基本收益看起來像是突然跳躍。

為什麼精確配對評分會誇大出現率?

精確匹配不會對部分進展給予功勞,因此每個代幣的穩定改進看起來像是突然的飛躍。

哪些尺度因素與湧現有關?

隨著模型參數、訓練資料和計算的增長,會出現緊急跳躍。

為什麼湧現對人工智慧安全很重要?

如果能力突然大規模出現,一些意想不到的能力可能會產生危險,從而激發更好的預測。