PANDUAN AI Bahasa

Tokenisasi WordPiece

WordPiece ialah algoritma tokenisasi subperkataan yang memberi kuasa kepada BERT dan banyak model Google, membahagikan perkataan kepada serpihan boleh guna semula supaya model boleh mengendalikan sebarang teks dengan perbendaharaan kata tetap.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

Itulah sebabnya model yang tidak pernah melihat 'ketidakbahagiaan' masih boleh memahaminya dengan membaca 'un', '##happy', dan '##ness'.

Menyelam dalam

WordPiece membina perbendaharaan kata unit subkata daripada keseluruhan perkataan atau aksara tunggal. Bermula dari watak individu, ia dengan rakus menggabungkan pasangan simbol yang paling meningkatkan kemungkinan korpus latihan, berulang sehingga mencapai saiz perbendaharaan kata sasaran (BERT menggunakan kira-kira 30,000 token). Pada inferens, ia menandakan secara tamak kiri-ke-kanan, memadankan subkata terpanjang dalam perbendaharaan kata, kemudian meneruskan bakinya. Potongan sambungan di dalam perkataan ditandakan dengan awalan '##', jadi 'bermain' menjadi 'bermain' + '##ing'. Ini menyelesaikan masalah di luar perbendaharaan kata: perkataan yang jarang atau tidak kelihatan hanya terurai menjadi serpihan yang diketahui, turun kepada aksara tunggal jika perlu, manakala perkataan biasa kekal sebagai token tunggal untuk kecekapan.

Wawasan Teknikal

WordPiece berbeza daripada Pengekodan Byte-Pair dalam kriteria gabungannya. BPE menggabungkan pasangan bersebelahan yang paling kerap; WordPiece menggabungkan pasangan yang memaksimumkan kebarangkalian data latihan, secara kasar memilih pasangan yang frekuensi sambungannya paling banyak melebihi hasil daripada frekuensi bahagiannya. Penanda '##' membezakan bahagian awal perkataan daripada sambungan, membenarkan tokenizer membina semula sempadan perkataan dengan jelas apabila menyahkod kembali kepada teks.

Kesan Strategik

Kelajuan dan skala

Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.

Akses dan capai

Ia meluaskan akses merentas bahasa dan gaya komunikasi.

Keputusan yang lebih jelas

Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.

Masa Depan Tokenisasi WordPiece

Model bahasa besar yang lebih baharu semakin menggemari BPE (keluarga GPT) atau model unigram SentencePiece peringkat byte, yang mengelakkan prapemprosesan khusus bahasa dan mengendalikan sebarang input Unicode. WordPiece kekal asas dalam pengekod terbitan BERT yang masih digunakan secara meluas untuk carian dan klasifikasi. Jangkakan penggunaan berterusan dalam pengeluaran NLP, di samping penyelidikan ke dalam model bait dan aksara bebas tokenizer yang akhirnya boleh mengurangkan pergantungan pada perbendaharaan kata subkata tetap sama sekali.

Pelaksanaan Dunia Sebenar

BERT menandakan pertanyaan carian dalam Google Carian, memecahkan istilah yang tidak dikenali kepada subkata supaya model masih boleh memadankan halaman yang berkaitan.

BertTokenizer dari Hugging Face menggunakan WordPiece untuk menukar teks mentah kepada ID token yang disalurkan kepada BERT untuk analisis sentimen dan pengecaman entiti bernama.

BERT berbilang bahasa menggunakan perbendaharaan kata WordPiece yang dikongsi merentas 100+ bahasa, membenarkan serpihan digunakan semula merentas skrip yang berkaitan.

DistilBERT dan varian BERT klinikal/bioperubatan mewarisi WordPiece, mengendalikan istilah perubatan yang jarang berlaku seperti 'pneumonoconiosis' dengan membahagikannya kepada bahagian yang diketahui.

Risiko & Pengawal

Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.

Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.

Data teks sensitif mungkin terdedah jika kawalan akses lemah.

Hala Tuju Pelaksanaan

1

Tentukan format output, nada dan standard kualiti sebelum pelancaran.

2

Respons asas dengan sumber yang dipercayai apabila ketepatan penting.

3

Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.

4

Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Tokenisasi Subkata

Soalan lazim

Apakah itu Tokenisasi WordPiece?

WordPiece ialah algoritma tokenisasi subperkataan yang memberi kuasa kepada BERT dan banyak model Google, membahagikan perkataan kepada serpihan boleh guna semula supaya model boleh mengendalikan sebarang teks dengan perbendaharaan kata tetap. Itulah sebabnya model yang tidak pernah melihat 'ketidakbahagiaan' masih boleh memahaminya dengan membaca 'un', '##happy', dan '##ness'.

Apakah yang ditunjukkan oleh awalan '##' dalam output WordPiece?

WordPiece menandakan sambungan subkata dengan '##', jadi 'bermain' menjadi 'bermain' + '##ing', membenarkan penyahkod membina semula sempadan perkataan.

Secara kasar berapa besar perbendaharaan kata WordPiece yang digunakan oleh BERT asal?

BERT menggunakan perbendaharaan kata WordPiece kira-kira 30,000 unit subkata, mengimbangi liputan terhadap saiz jadual benam.

Bagaimanakah kriteria penggabungan WordPiece berbeza daripada Pengekodan Byte-Pair standard?

BPE menggabungkan pasangan bersebelahan yang paling kerap, manakala WordPiece menggabungkan pasangan yang paling meningkatkan kemungkinan korpus, mengutamakan pasangan yang frekuensi sambungannya melebihi hasil bahagiannya.

Bagaimanakah WordPiece mengendalikan perkataan yang tidak pernah dilihat semasa latihan?

Perkataan ghaib dipecahkan kepada subkata yang paling lama padanan yang diketahui, kembali kepada aksara tunggal, yang menyelesaikan masalah kehabisan kosa kata.

Pada masa inferens, bagaimanakah WordPiece memilih cara untuk memisahkan perkataan?

WordPiece memberi token dengan rakus, memadankan entri perbendaharaan kata terpanjang bermula pada kedudukan semasa, kemudian mengulangi pada bakinya.