Nyelvi AI ÚTMUTATÓ

Utasítás hangolás

Az utasítások hangolása az a betanítási lépés, amely a nyers szöveg-előrejelzőt olyan modellvé alakítja, amely valóban követi az olyan utasításokat, mint az „összefoglalja ezt” vagy „írjon udvarias választ”. Ez az, amitől az alapmodell segítőkész és irányítható.

2 perc olvasásUtoljára frissítve

Mély merülés

Az alapnyelvi modellt csak arra tanítják, hogy megjósolja a következő tokent a webszövegben, így ha beír egy kérdést, akkor válasz helyett további kérdésekkel folytatódhat. Az utasításhangolás ezt javítja. Ez a felügyelt finomhangolás egy formája: a modell sok pár (utasítás, ideális válasz) alapján van kiképezve, amelyek több ezer feladatot fednek le – fordítás, összegzés, osztályozás, kérdések és válaszok, kódolás és még sok más. Ugyanazt az utasítást, majd hasznos választ mintát ismételten látva a modell megtanulja a „csináld, amit a felhasználó kér” általános viselkedését, és ez olyan utasításokra általánosít, amelyeket soha nem látott a képzés során. A megközelítést 2021 körül olyan munkák hozták létre, mint a FLAN, a T0 és a Natural Instructions, és központi szerepet játszott a OpenAI InstructGPT-jében, amely finomhangolta a GPT-3-at egy kurált utasítássoron. Ez az az alap, amelyre a legtöbb chat-asszisztens épül.

Technikai betekintés

Mechanikailag az utasításhangolás szabványos felügyelt tanulás: minimalizálja a különbséget a modell előrejelzett tokenek és a referencia válasz között, a színátmenetek frissítik a súlyokat. Ez különbözik az RLHF-től (megerősítő tanulás az emberi visszacsatolásból), amely után jön, és jutalmazási modell segítségével optimalizálja az emberi preferenciákat. A szokásos recept réteges: előtanulás, majd utasítás-hangolás (SFT) a feladatkövetés megtanítására, majd opcionálisan RLHF a hangnem, segítőkészség és biztonság finomítására. Az adatok sokfélesége többet számít, mint a puszta mennyiség – a széles feladatkör vezet az általánosításhoz.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

Az Instruction Tuning jövője

A mezőny a hatalmas, kézzel írott adatkészletekről a jobb minőségű, részben szintetikus adatok irányába mozdul el – néha csak néhány ezer, gondosan kiválasztott példa –, miután rájöttek, hogy az adatok minősége felülmúlja a mennyiséget. Több tartomány-specifikus (orvosi, jogi, kódolási) utasításhangolásra, többnyelvű és multimodális utasításkészletekre, valamint az utasításadatokat generáló és szűrő automatizált folyamatokra számíthat. Az utasításhangolás alapvető híd marad a nyers előképzett modell és a használható asszisztens között, egyre inkább kombinálva az igazítási preferenciák optimalizálásával.

Valós megvalósítás

Az alap GPT-stílusú modell csevegési asszisztenssé alakítása, amely válaszol a kérdésekre ahelyett, hogy megismételné azokat

FLAN-T5, számos feladatra finomhangolva, így képes követni azokat az utasításokat, amelyekre soha nem képezték ki kifejezetten

InstructGPT, ahol a GPT-3 utasítások szerint hangolt kurált promptokon, hogy sokkal hasznosabb válaszokat adjon

Belső vállalati asszisztens felépítése a támogatási és jogi csapatok által írt utasítás-válasz párok finomhangolásával

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Instruction Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Instruction Tuning?

Az utasítások hangolása az a betanítási lépés, amely a nyers szöveg-előrejelzőt olyan modellvé alakítja, amely valóban követi az olyan utasításokat, mint az „összefoglalja ezt” vagy „írjon udvarias választ”. Ez az, amitől az alapmodell segítőkész és irányítható.

Miben különbözik az utasításhangolás az RLHF-től?

Az utasításhangolás a célválaszokra felügyelt tanulás. Az RLHF ezután jön, és optimalizálja a modellt a tanult emberi preferenciákhoz.

Az utasítás-hangoló adatok melyik tulajdonsága készteti leginkább a modellt arra, hogy kövesse az új, nem látott utasításokat?

A feladatok széles körének lefedése megtanítja az utasítások követésének általános viselkedését, amely általánosít az edzés során soha nem látott utasításokra.

Mi a tipikus képzési szakaszok sorrendje egy modern chat-asszisztens számára?

A modelleket először a nyers szövegre előképzik, majd utasításokkal hangolják a feladatok követésére, és gyakran RLHF-vel finomítják a hangszín és a biztonság érdekében.