Kwenzekeni
Abacwaningi bahlongoze i-style-debiased direct preference optimization (SD-DPO) ukuze kuthuthukiswe ukunemba kwamamodeli wezilimi ezinkulu (LLMs) ekubuyiseni ulwazi olugciniwe. Bahlole i-SD-DPO phezu kwe-EntiGraph, indlela emele uhlangothi lokulondoloza esebenzisa ukuqeqeshwa kwangaphambi kwesikhathi (CPT) kumbhalo owenziwe kusuka ku-corpus. Imiphumela ibonise ukuthi i-SD-DPO idlula i-CPT yesisekelo kudatha yokwenziwa ye-EntiGraph kusukela kumodeli yesisekelo efanayo futhi ihlola ngenqubo efanayo.
Abacwaningi bahlongoze i-style-debiased direct preference optimization (SD-DPO) ukuze kuthuthukiswe ukunemba kwamamodeli wezilimi ezinkulu (LLMs) ekubuyiseni ulwazi olugciniwe.
Bahlole i-SD-DPO phezu kwe-EntiGraph, indlela emele uhlangothi lokulondoloza esebenzisa ukuqeqeshwa kwangaphambi kwesikhathi (CPT) kumbhalo owenziwe kusuka ku-corpus.
Imiphumela ibonise ukuthi i-SD-DPO idlula i-CPT yesisekelo kudatha yokwenziwa ye-EntiGraph kusukela kumodeli yesisekelo efanayo futhi ihlola ngenqubo efanayo.
Imininingwane yomthombo: arxiv.org โ
Kungani kubalulekile
Indlela ehlongozwayo, i-SD-DPO, ingathuthukisa ukunemba kwama-LLM ekubuyiseni ulwazi olugciniwe. Lokhu kubaluleke kakhulu ezinhlelweni ezidinga ulwazi olunembile nolwakamuva, olufana nokubuyekeza ulwazi nokuhlela. I-SD-DPO inamandla okuthuthukisa ukusebenza kwama-LLM kulezi zinhlelo zokusebenza.
Indlela ehlongozwayo, i-SD-DPO, ingathuthukisa ukunemba kwama-LLM ekubuyiseni ulwazi olugciniwe.
Lokhu kubaluleke kakhulu ezinhlelweni ezidinga ulwazi olunembile nolwakamuva, olufana nokubuyekeza ulwazi nokuhlela.
I-SD-DPO inamandla okuthuthukisa ukusebenza kwama-LLM kulezi zinhlelo zokusebenza.
I-Interactive Mechanism: Indlela Esebenza Ngayo Ngempela
Hlola ubuchwepheshe obuyisisekelo ngemuva kwalokhu kuthuthukiswa ngokuhlanganyela.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Ongakubuka ngokulandelayo
Indlela ehlongozwayo, i-SD-DPO, inamandla okuthuthukisa ukusebenza kwama-LLM ekubuyekezeni ulwazi nasekuhleleni izinhlelo zokusebenza. Ucwaningo olwengeziwe luyadingeka ukuze kuhlolwe ngokugcwele ukusebenza kwe-SD-DPO kanye nokuhlola okungenzeka ukuthi isetshenziswa.
Indlela ehlongozwayo, i-SD-DPO, inamandla okuthuthukisa ukusebenza kwama-LLM ekubuyekezeni ulwazi nasekuhleleni izinhlelo zokusebenza.
Ucwaningo olwengeziwe luyadingeka ukuze kuhlolwe ngokugcwele ukusebenza kwe-SD-DPO kanye nokuhlola okungenzeka ukuthi isetshenziswa.
Imiphumela yocwaningo iphakamisa ukuthi i-SD-DPO ingathuthukisa ukunemba kwama-LLM ekubuyiseni ulwazi olugciniwe.