PANDUAN AI Bahasa

Pengkodean Pasangan Byte

Byte-Pair Encoding (BPE) adalah algoritma yang terinspirasi dari kompresi yang membangun kosakata dengan menggabungkan pasangan simbol yang paling sering berulang kali.

2 min readTerakhir diperbarui

Ikhtisar

It is the tokenizer behind GPT models, balancing tiny vocabularies of characters against huge vocabularies of whole words.

Menyelam Lebih Dalam

BPE dimulai dengan memperlakukan teks sebagai rangkaian karakter individual (atau byte mentah). Ia kemudian menghitung setiap pasangan simbol yang berdekatan, menggabungkan pasangan yang paling sering menjadi token baru, dan mengulanginya ribuan kali. Setiap penggabungan dicatat sebagai aturan. Urutan huruf umum seperti 'th', 'ing', atau seluruh kata yang sering muncul secara bertahap menjadi token tunggal, sementara kata yang jarang tetap terpecah menjadi bagian-bagian yang lebih kecil. Awalnya merupakan metode kompresi data pada tahun 1994, kemudian diadaptasi ke NLP oleh Sennrich dkk. pada tahun 2016 untuk terjemahan mesin. GPT-2 dan GPT-4 menggunakan BPE tingkat byte, yang beroperasi pada byte UTF-8 sehingga karakter, emoji, atau bahasa apa pun selalu dapat dikodekan tanpa kegagalan di luar kosakata.

Wawasan Teknis

Pelatihan BPE menghasilkan daftar aturan penggabungan yang diurutkan. Untuk memberi token pada teks baru, algoritme membaginya menjadi byte/karakter dan menerapkan penggabungan dengan cepat dalam urutan prioritas yang sama hingga tidak ada aturan yang cocok. BPE tingkat byte menjamin kemunduran: bahkan simbol yang tidak terlihat terurai menjadi byte penyusunnya, sehingga kosakata 256 byte ditambah gabungan yang dipelajari mencakup semuanya tanpa token UNK.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Pengkodean Byte-Pair

BPE tetap menjadi tokenizer pekerja keras, namun tekanan semakin meningkat ke arah model tingkat byte atau karakter yang melewatkan tokenisasi eksplisit, menghindari kebiasaan seperti pemisahan kode, matematika, atau skrip non-Inggris yang canggung. Penelitian terhadap arsitektur bebas token dan tokenizer yang dipelajari bertujuan untuk memperbaiki bias BPE. Namun, kecepatan dan efisiensi kompresinya berarti kosakata gaya BPE akan mendukung sebagian besar LLM produksi dalam waktu dekat.

Implementasi Dunia Nyata

GPT-2 dan GPT-4 menggunakan BPE tingkat byte sehingga karakter Unicode atau emoji apa pun dapat dikodekan tanpa kesalahan.

Sistem terjemahan mesin menggunakan BPE untuk membagi kata-kata langka atau gabungan menjadi potongan-potongan subkata yang dapat digunakan kembali dan dibagikan ke berbagai bahasa.

Pustaka tokenizer Hugging Face melatih kosakata BPE untuk domain khusus seperti teks biomedis atau hukum.

Model kode memberi token pada pengidentifikasi dan kata kunci dengan BPE, menggabungkan pola umum seperti 'def' atau '==' menjadi satu token.

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Byte-Pair Encoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Tokenisasi dan Pengkodean Pasangan Byte

Pertanyaan yang sering diajukan

What is Byte-Pair Encoding?

Byte-Pair Encoding (BPE) adalah algoritma yang terinspirasi dari kompresi yang membangun kosakata dengan menggabungkan pasangan simbol yang paling sering berulang kali. Ini adalah tokenizer di balik model GPT, yang menyeimbangkan kosakata kecil dari karakter dengan kosakata besar dalam keseluruhan kata.

Apa operasi inti yang diulangi BPE untuk membangun kosakatanya?

BPE menghitung pasangan simbol yang berdekatan dan menggabungkan satu simbol yang paling sering menjadi token baru, berulang ribuan kali.

Seperti apa BPE memperlakukan teks tersebut ketika memulai pelatihan?

BPE dimulai dari unit terkecil (karakter atau byte mentah) dan mengembangkan token yang lebih besar melalui penggabungan.

Mengapa BPE tingkat byte menghindari kesalahan di luar kosakata (UNK)?

Karena kosakata dasar mencakup seluruh 256 byte, bahkan simbol yang tidak terlihat pun kembali ke representasi byte-nya.

Dari manakah algoritma BPE berasal sebelum NLP mengadopsinya?

BPE diperkenalkan sebagai teknik kompresi data pada tahun 1994 dan kemudian diadaptasi untuk tokenisasi subkata pada tahun 2016.

Saat memberi token pada teks baru, bagaimana BPE menerapkan aturan yang dipelajarinya?

Aturan penggabungan diurutkan, dan tokenisasi menerapkannya berdasarkan prioritas hingga tidak ada aturan lebih lanjut yang cocok.