Utasítás hangolás
Az utasítások hangolása az a betanítási lépés, amely a nyers szöveg-előrejelzőt olyan modellvé alakítja, amely valóban követi az olyan utasításokat, mint az „összefoglalja ezt” vagy „írjon udvarias választ”. Ez az, amitől az alapmodell segítőkész és irányítható.
Mély merülés
Az alapnyelvi modellt csak arra tanítják, hogy megjósolja a következő tokent a webszövegben, így ha beír egy kérdést, akkor válasz helyett további kérdésekkel folytatódhat. Az utasításhangolás ezt javítja. Ez a felügyelt finomhangolás egy formája: a modell sok pár (utasítás, ideális válasz) alapján van kiképezve, amelyek több ezer feladatot fednek le – fordítás, összegzés, osztályozás, kérdések és válaszok, kódolás és még sok más. Ugyanazt az utasítást, majd hasznos választ mintát ismételten látva a modell megtanulja a „csináld, amit a felhasználó kér” általános viselkedését, és ez olyan utasításokra általánosít, amelyeket soha nem látott a képzés során. A megközelítést 2021 körül olyan munkák hozták létre, mint a FLAN, a T0 és a Natural Instructions, és központi szerepet játszott a OpenAI InstructGPT-jében, amely finomhangolta a GPT-3-at egy kurált utasítássoron. Ez az az alap, amelyre a legtöbb chat-asszisztens épül.
Technikai betekintés
Mechanikailag az utasításhangolás szabványos felügyelt tanulás: minimalizálja a különbséget a modell előrejelzett tokenek és a referencia válasz között, a színátmenetek frissítik a súlyokat. Ez különbözik az RLHF-től (megerősítő tanulás az emberi visszacsatolásból), amely után jön, és jutalmazási modell segítségével optimalizálja az emberi preferenciákat. A szokásos recept réteges: előtanulás, majd utasítás-hangolás (SFT) a feladatkövetés megtanítására, majd opcionálisan RLHF a hangnem, segítőkészség és biztonság finomítására. Az adatok sokfélesége többet számít, mint a puszta mennyiség – a széles feladatkör vezet az általánosításhoz.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
Az Instruction Tuning jövője
A mezőny a hatalmas, kézzel írott adatkészletekről a jobb minőségű, részben szintetikus adatok irányába mozdul el – néha csak néhány ezer, gondosan kiválasztott példa –, miután rájöttek, hogy az adatok minősége felülmúlja a mennyiséget. Több tartomány-specifikus (orvosi, jogi, kódolási) utasításhangolásra, többnyelvű és multimodális utasításkészletekre, valamint az utasításadatokat generáló és szűrő automatizált folyamatokra számíthat. Az utasításhangolás alapvető híd marad a nyers előképzett modell és a használható asszisztens között, egyre inkább kombinálva az igazítási preferenciák optimalizálásával.
Valós megvalósítás
Az alap GPT-stílusú modell csevegési asszisztenssé alakítása, amely válaszol a kérdésekre ahelyett, hogy megismételné azokat
FLAN-T5, számos feladatra finomhangolva, így képes követni azokat az utasításokat, amelyekre soha nem képezték ki kifejezetten
InstructGPT, ahol a GPT-3 utasítások szerint hangolt kurált promptokon, hogy sokkal hasznosabb válaszokat adjon
Belső vállalati asszisztens felépítése a támogatási és jogi csapatok által írt utasítás-válasz párok finomhangolásával
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Instruction Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Előtag hangolása
Gyakran ismételt kérdések
What is Instruction Tuning?
Az utasítások hangolása az a betanítási lépés, amely a nyers szöveg-előrejelzőt olyan modellvé alakítja, amely valóban követi az olyan utasításokat, mint az „összefoglalja ezt” vagy „írjon udvarias választ”. Ez az, amitől az alapmodell segítőkész és irányítható.
Miben különbözik az utasításhangolás az RLHF-től?
Az utasításhangolás a célválaszokra felügyelt tanulás. Az RLHF ezután jön, és optimalizálja a modellt a tanult emberi preferenciákhoz.
Az utasítás-hangoló adatok melyik tulajdonsága készteti leginkább a modellt arra, hogy kövesse az új, nem látott utasításokat?
A feladatok széles körének lefedése megtanítja az utasítások követésének általános viselkedését, amely általánosít az edzés során soha nem látott utasításokra.
Mi a tipikus képzési szakaszok sorrendje egy modern chat-asszisztens számára?
A modelleket először a nyers szövegre előképzik, majd utasításokkal hangolják a feladatok követésére, és gyakran RLHF-vel finomítják a hangszín és a biztonság érdekében.