PANDUAN AI Bahasa

Tokenisasi Subkata

Tokenisasi subperkataan membahagikan teks kepada unit yang lebih kecil daripada perkataan tetapi lebih besar daripada aksara, seperti 'token' campur 'isasi'.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It is the standard way modern language models turn text into the discrete IDs they actually process, balancing vocabulary size against meaning.

Menyelam dalam

Perkataan terlalu banyak untuk dihitung (perbendaharaan kata akan menjadi sangat besar dan terlepas perkataan yang jarang ditemui), manakala aksara tunggal membawa sedikit makna dan membuat urutan yang sangat panjang. Tokenisasi subkata ialah kompromi: ia mengekalkan perkataan yang kerap tetap utuh tetapi memecahkan perkataan yang jarang atau kompleks kepada serpihan yang bermakna. 'Ketidakbahagiaan' mungkin menjadi 'un', 'happi', 'ness'. Algoritma utama termasuk Pengekodan Byte-Pair (digunakan oleh GPT), WordPiece (digunakan oleh BERT), dan Unigram/SentencePiece (digunakan oleh T5 dan banyak model berbilang bahasa). Pendekatan ini mengendalikan perkataan ghaib dengan anggun, berkongsi kepingan merentas perkataan yang berkaitan ('bermain', 'bermain', 'bermain'), dan menyokong sebarang bahasa. Setiap serpihan dipetakan kepada ID integer, dan ID ini ialah apa yang ditukar oleh lapisan pembenaman model kepada vektor.

Wawasan Teknikal

Algoritma yang berbeza memilih subkata secara berbeza: BPE menggabungkan pasangan yang kerap dari bawah ke atas, pilihan WordPiece menggabungkan yang paling meningkatkan kemungkinan korpus, dan Unigram bermula dengan perbendaharaan kata yang besar dan token prun yang paling tidak menyakitkan. WordPiece menandakan kepingan dalaman perkataan dengan awalan '##', manakala SentencePiece menganggap ruang sebagai simbol khas supaya ia berfungsi secara langsung pada teks mentah tanpa pra-pemisahan pada ruang putih, sesuai untuk bahasa tanpa ruang.

Kesan Strategik

Kelajuan dan skala

Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.

Akses dan capai

Ia meluaskan akses merentas bahasa dan gaya komunikasi.

Keputusan yang lebih jelas

Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.

Masa Depan Tokenisasi Subword

Tokenisasi subkata akan kekal dominan kerana ia pantas dan padat, tetapi kelemahannya, pemisahan yang janggal dalam matematik, kod dan skrip yang jarang berlaku, serta kos token yang tidak sekata merentas bahasa, mendorong penyelidikan ke dalam model tahap bait dan bebas token. Jangkakan tokenizer yang lebih bijak, mungkin terpelajar atau adaptif dan keadilan berbilang bahasa yang lebih baik supaya teks bukan bahasa Inggeris tidak dihukum dengan lebih banyak token bagi setiap ayat.

Pelaksanaan Dunia Sebenar

BERT menggunakan tokenisasi WordPiece, menandakan potongan sambungan seperti '##ing' untuk membina semula perkataan asal.

T5 dan banyak model berbilang bahasa menggunakan SentencePiece, yang mengendalikan bahasa tanpa ruang seperti bahasa Jepun secara langsung.

Model sembang membahagikan istilah teknikal yang jarang berlaku kepada serpihan yang diketahui dan bukannya gagal pada perkataan yang tidak diketahui.

Tokenizers berkongsi subkata merentasi 'lari', 'lari' dan 'pelari', membenarkan model menyamaratakan morfologi dengan cekap.

Risiko & Pengawal

Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.

Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.

Data teks sensitif mungkin terdedah jika kawalan akses lemah.

Hala Tuju Pelaksanaan

1

Tentukan format output, nada dan standard kualiti sebelum pelancaran.

2

Respons asas dengan sumber yang dipercayai apabila ketepatan penting.

3

Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.

4

Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Subword Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Tokenisasi SentencePiece

Soalan lazim

What is Subword Tokenization?

Tokenisasi subperkataan membahagikan teks kepada unit yang lebih kecil daripada perkataan tetapi lebih besar daripada aksara, seperti 'token' campur 'isasi'. Ia adalah cara standard model bahasa moden mengubah teks menjadi ID diskret yang sebenarnya mereka proses, mengimbangi saiz perbendaharaan kata dengan makna.

Apakah masalah yang diselesaikan oleh tokenisasi subkata berbanding menggunakan keseluruhan perkataan?

Kosa kata keseluruhan perkataan adalah besar dan masih terlepas perkataan yang jarang ditemui; subkata mengekalkan perbendaharaan kata terurus dan membahagikan perkataan yang tidak diketahui dengan anggun.

Manakah antara berikut merupakan algoritma tokenisasi subkata yang digunakan oleh BERT?

BERT menggunakan WordPiece, yang memilih gabungan yang paling meningkatkan kemungkinan korpus latihan.

Bagaimanakah WordPiece biasanya menandakan sekeping yang meneruskan perkataan?

WordPiece memberi awalan perkataan-dalaman subkata dengan '##', jadi 'bermain' menjadi 'bermain' tambah '##ing'.

Mengapakah SentencePiece sangat sesuai dengan bahasa seperti Jepun?

SentencePiece beroperasi pada teks mentah dan mengekodkan ruang sebagai simbol khas, jadi ia berfungsi walaupun tanpa ruang antara perkataan.

Apakah yang akhirnya dipetakan oleh setiap serpihan subkata sebelum mencapai model?

Setiap subkata diberikan ID integer, yang mana lapisan pembenaman bertukar menjadi vektor yang boleh diproses oleh model.