PANDUAN AI Bahasa

Prediksi Token Berikutnya

Prediksi token berikutnya adalah tujuan sederhana di balik model gaya GPT: mengingat semuanya sejauh ini, tebak potongan teks berikutnya.

2 min readTerakhir diperbarui

Ikhtisar

Repeated billions of times, this single task produces models that write, reason, and converse.

Menyelam Lebih Dalam

Prediksi token berikutnya melatih model untuk menetapkan probabilitas ke token berikutnya dengan mempertimbangkan semua token sebelumnya. Teks pertama-tama dipecah menjadi token (potongan subkata) oleh tokenizer seperti pengkodean pasangan byte. Transformer khusus dekoder membaca urutan dari kiri ke kanan dan menghasilkan distribusi probabilitas pada seluruh kosakata untuk posisi berikutnya. Selama pelatihan, model diperlihatkan kumpulan teks besar-besaran dan diberi sanksi setiap kali model tersebut menetapkan probabilitas rendah ke token berikutnya yang sebenarnya. Pada waktu pembuatan, model mengambil sampel atau dengan rakus mengambil token, menambahkannya, dan mengulangi perulangan ini secara otomatis. Sasaran yang satu ini memiliki skala yang luar biasa: GPT-2, GPT-3, dan penerusnya semuanya mempelajari tata bahasa, fakta, terjemahan, dan penalaran semata-mata dengan menjadi sangat pandai dalam memprediksi token berikutnya.

Wawasan Teknis

Mekanisme kuncinya adalah perhatian diri yang bersifat kausal (tertutup): saat memprediksi posisi N, model hanya dapat memperhatikan posisi 1 hingga N-1, bukan masa depan. Lapisan keluaran memproyeksikan keadaan akhir yang tersembunyi ke dalam kosakata dan menerapkan softmax untuk mendapatkan probabilitas. Pelatihan meminimalkan entropi silang, setara dengan memaksimalkan kemungkinan teks yang diamati. Kontrol pengambilan sampel seperti suhu dan top-p membentuk ulang distribusi tersebut pada inferensi untuk mengorbankan kreativitas dan keandalan.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Prediksi Token Berikutnya

Prediksi token berikutnya pada dasarnya mendasari semua model bahasa besar modern dan akan tetap menjadi tulang punggung AI generatif. Penelitian memperluasnya dengan jendela konteks yang lebih panjang, decoding spekulatif dan paralel untuk kecepatan, dan tujuan prediksi multi-token yang menebak beberapa token masa depan sekaligus. Pembelajaran penguatan dari lapisan umpan balik manusia di atas untuk menyelaraskan keluaran. Perbatasan membuat tujuan sederhana yang sama menjadi lebih murah, lebih cepat, dan lebih terkendali dalam skala yang semakin besar.

Implementasi Dunia Nyata

Memberdayakan ChatGPT dan asisten serupa untuk menghasilkan respons percakapan satu per satu.

Pelengkapan otomatis dan saran kode di alat seperti GitHub Copilot saat Anda mengetik.

Menyusun email, artikel, dan salinan pemasaran dari perintah singkat.

Pembuatan teks waktu nyata dalam asisten menulis yang menyelesaikan kalimat Anda.

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Next-Token Prediction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pelatihan Prediksi Multi-Token

Pertanyaan yang sering diajukan

What is Next-Token Prediction?

Prediksi token berikutnya adalah tujuan sederhana di balik model gaya GPT: mengingat semuanya sejauh ini, tebak potongan teks berikutnya. Diulangi miliaran kali, tugas tunggal ini menghasilkan model yang menulis, bernalar, dan berkomunikasi.

Apa yang dihasilkan oleh model prediksi token berikutnya pada setiap langkah?

Model tersebut menghasilkan probabilitas untuk setiap kemungkinan token berikutnya, kemudian salah satu dipilih melalui pengambilan sampel atau pilihan serakah.

Jenis perhatian apa yang digunakan dekoder gaya GPT?

Penyembunyian kausal memastikan posisi N hanya dapat melihat posisi sebelumnya, menjaga pengaturan prediksi dari kiri ke kanan.

Apa yang dimaksud dengan generasi 'autoregresif' di sini?

Pembuatan autoregresif menghasilkan satu token, menambahkannya ke konteks, dan mengulangi perulangan.

Fungsi kerugian apa yang biasanya diminimalkan selama pelatihan?

Entropi silang menghukum model karena menetapkan probabilitas rendah ke token berikutnya yang sebenarnya, yang setara dengan memaksimalkan kemungkinan.

Apa gunanya menaikkan suhu selama pengambilan sampel?

Temperatur yang lebih tinggi meratakan distribusi probabilitas, meningkatkan keacakan; suhu yang lebih rendah membuat pilihan lebih konservatif.