Maszkos nyelvi modellezés
Az álarcos nyelvi modellezés megtanítja az AI-t, hogy szándékosan rejtett szavakat töltsön ki a teljes környező kontextus felhasználásával, mind a bal, mind a jobb oldalon.
Áttekintés
It's the training trick behind BERT and the reason models can deeply understand sentence meaning rather than just predict what comes next.
Mély merülés
A maszkolt nyelvi modellezésben (MLM) vesz egy mondatot, véletlenszerűen elrejti a tokenek körülbelül 15%-át egy speciális [MASK] szimbólummal, és megtanítja a modellt, hogy kitalálja az eredetiket. Mivel a modell minden üres hely mindkét oldalán szavakat lát, a kontextus kétirányú megértését építi ki. A Google által 2018-ban bevezetett BERT ezt népszerűsítette. Egy okos részlet: a maszkolt pozíciók nagyjából 80%-a [MASK] lesz, 10%-a véletlenszerű szóra cserélődik, 10%-a pedig változatlan marad. Ez megakadályozza, hogy a modell csak [MASK] tokent várjon az előrejelzési időben, és kikényszeríti a robusztusságot. Ezt az előképzést követően a modell finomhangolásra kerül olyan feladatokra, mint az osztályozás, a kérdések megválaszolása és a megnevezett entitás felismerése.
Technikai betekintés
Az MLM kétirányú önfigyeléssel rendelkező Transformer kódolót használ, így minden token egyszerre foglalkozik az összes többivel. A veszteség csak a maszkolt pozíciókon kerül kiszámításra a valódi token azonosítókkal szembeni keresztentrópia használatával. Mivel a figyelem nem kauzális (nincs jövőbeli maszkolás), az egyes szavak reprezentációja a bal és a jobb kontextust egyetlen sűrű vektorba olvasztja össze. Ez a kétirányúság pontosan az, amit a next-token modellek feladnak a generálás képességéért.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
Az álarcos nyelvmodellezés jövője
A tiszta MLM-et részben háttérbe szorították a chatbotok generatív dekódoló modelljei, de továbbra is domináns a beágyazás, visszakeresés és osztályozás terén, ahol a megértés felülmúlja a generálást. Az olyan változatok, mint a RoBERTa, az ELECTRA helyettesített token-észlelése és a DeBERTa, folyamatosan növelik a pontosságot és a hatékonyságot. Várható, hogy az MLM-stílusú kódolók központi szerepet töltsenek be a keresésben, a szemantikai hasonlóságban, valamint könnyű komponensként a nagyobb visszakereséssel kiegészített és multimodális rendszerekben, ahol a gyors, mély megértés többet jelent, mint a szabad formátumú szöveg.
Valós megvalósítás
A Google Search BERT-alapú megértése a társalgási lekérdezésekről, hogy relevánsabb oldalakat jelenítsen meg.
Mondatbeágyazások generálása szemantikai kereső és dokumentumkereső rendszerekhez.
A BERT finomhangolása a termékértékelések vagy támogatási jegyek hangulatelemzéséhez.
Nevesített entitás-felismerés, amely jogi vagy orvosi szövegből nyer ki személyeket, szervezeteket és dátumokat.
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Nyelvi modellezés
Gyakran ismételt kérdések
What is Masked Language Modeling?
Az álarcos nyelvi modellezés megtanítja az AI-t, hogy szándékosan rejtett szavakat töltsön ki a teljes környező kontextus felhasználásával, mind a bal, mind a jobb oldalon. Ez az oktatási trükk a BERT mögött, és az ok, amiért a modellek mélyen megérthetik a mondat jelentését, nem pedig csak megjósolják, mi következik.
Mi az alapvető képzési feladat a maszkolt nyelvi modellezésben?
Az MLM elrejti a tokenek egy részét, és megtanítja a modellt, hogy helyreállítsa azokat a bal és a jobb kontextus használatával.
A tokenek nagyjából hány százalékát takarja el a BERT az előképzés során?
A BERT a bemeneti tokenek hozzávetőleg 15%-át takarja el, ami egyensúly a kellő jel adása és a kellő kontextus elhagyása között.
Miért ad az MLM egy modell kétirányú megértését?
A Transformer kódoló nem kauzális önfigyelést használ, így minden token láthatja az összes többit mindkét oldalon.
A BERT maszkolási sémájában mi történik a kiválasztott pozíciók körülbelül 10%-ával ahelyett, hogy [MASK] lesz?
A robusztusság javítása érdekében a maszkolt pozíciók 10%-a véletlenszerű tokenre cserélődik, 10%-a pedig változatlan marad.
Mely pozíciókon számítják ki az MLM veszteséget?
A keresztentrópia elvesztése csak a maszkolt pozíciókra vonatkozik, összehasonlítva az előrejelzéseket az eredeti tokenazonosítókkal.