Uundaji wa Lugha Uliofichwa
Muundo wa lugha uliofichwa hufundisha AI kujaza maneno yaliyofichwa kimakusudi kwa kutumia muktadha kamili unaozunguka, kushoto na kulia.
Muhtasari
It's the training trick behind BERT and the reason models can deeply understand sentence meaning rather than just predict what comes next.
Dive ya kina
Katika uundaji wa lugha iliyofichwa (MLM), unachukua sentensi, unaficha bila mpangilio takriban 15% ya tokeni zake kwa alama maalum ya [MASK], na ufunze kielelezo kukisia asili. Kwa sababu modeli huona maneno pande zote mbili za kila tupu, huunda uelewa wa pande mbili wa muktadha. BERT, iliyoanzishwa na Google mwaka wa 2018, ilifanya hili kuwa maarufu. Maelezo ya busara: ya nafasi zilizofunikwa, takriban 80% huwa [MASK], 10% hubadilishwa kwa neno nasibu, na 10% huachwa bila kubadilika. Hii inazuia kielelezo kutarajia tu tokeni ya [MASK] wakati wa utabiri na hulazimisha uimara. Baada ya mafunzo haya ya awali, modeli hupangwa vyema kwa ajili ya kazi kama vile uainishaji, kujibu maswali, na utambuzi wa jina-huluki.
Ufahamu wa Kiufundi
MLM hutumia kisimbaji cha Transfoma chenye umakini wa kujielekeza pande mbili, kwa hivyo kila tokeni hushughulikia zingine zote kwa wakati mmoja. Hasara inakokotolewa tu kwenye nafasi zilizofichwa kwa kutumia njia tofauti dhidi ya vitambulisho vya ishara halisi. Kwa sababu umakini sio sababu (hakuna ufunikaji wa siku zijazo), uwakilishi wa kila neno huunganisha muktadha wa kushoto na kulia katika vekta moja mnene. Uelekeo huo wa pande mbili ndio hasa mifano ya ishara inayofuata huacha kwa uwezo wa kutengeneza.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa Uigaji wa Lugha Uliofichwa
MLM Safi imezidiwa kwa kiasi na miundo ya avkodare zalishaji ya chatbots, lakini inasalia kutawala kwa upachikaji, urejeshaji, na uainishaji ambapo uelewaji hushinda kizazi. Vibadala kama vile RoBERTa, utambuzi wa tokeni mbadala wa ELECTRA, na DeBERTa huendelea kusukuma usahihi na ufanisi. Tarajia visimbaji vya mtindo wa MLM zisalie katikati ya utafutaji, ufanano wa kisemantiki, na kama vipengele vyepesi ndani ya mifumo mikubwa ya urejeshaji-augmented na multimodal ambapo ufahamu wa haraka na wa kina ni muhimu zaidi kuliko maandishi ya umbo huria.
Utekelezaji wa Ulimwengu Halisi
Inawezesha Google Uelewa wa Utafutaji wa BERT wa hoja za mazungumzo ili kurejesha kurasa zinazofaa zaidi.
Inazalisha upachikaji wa sentensi kwa utafutaji wa kisemantiki na mifumo ya kurejesha hati.
Urekebishaji mzuri wa BERT kwa uchanganuzi wa hisia kwenye ukaguzi wa bidhaa au tikiti za usaidizi.
Utambuzi wa huluki uliopewa jina ambao hutoa watu, mashirika na tarehe kutoka kwa maandishi ya kisheria au matibabu.
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Kuiga Lugha
Maswali yanayoulizwa mara kwa mara
What is Masked Language Modeling?
Muundo wa lugha uliofichwa hufundisha AI kujaza maneno yaliyofichwa kimakusudi kwa kutumia muktadha kamili unaozunguka, kushoto na kulia. Ni hila ya mafunzo nyuma ya BERT na mifano ya sababu inaweza kuelewa kwa kina maana ya sentensi badala ya kutabiri tu kitakachofuata.
Je, ni kazi gani ya msingi ya mafunzo katika uundaji wa lugha iliyofichwa?
MLM huficha sehemu ya tokeni na kufunza modeli kuzirejesha kwa kutumia muktadha wa kushoto na kulia.
Takriban ni asilimia ngapi ya ishara ambazo BERT kawaida hufunika wakati wa mazoezi ya awali?
BERT hufunika takriban 15% ya tokeni za ingizo, usawa kati ya kutoa ishara ya kutosha na kuacha muktadha wa kutosha.
Kwa nini MLM inatoa uelewa wa mwelekeo wa kuigwa?
Kisimbaji cha Transformer hutumia umakini wa kibinafsi usio na sababu, kwa hivyo kila ishara inaweza kuona zingine zote pande zote mbili.
Katika mpango wa ufunikaji wa BERT, nini kinatokea kwa takriban 10% ya nafasi zilizochaguliwa badala ya kuwa [MASK]?
Ili kuboresha uimara, 10% ya nafasi zilizofunikwa hubadilishwa kwa tokeni nasibu na 10% huachwa bila kubadilika.
Je, hasara ya MLM inakokotolewa kwenye nafasi zipi?
Hasara ya kupita kiasi inatumika kwa nafasi zilizofichwa pekee, kwa kulinganisha utabiri na vitambulisho asili vya tokeni.