Prediksi Token Berikutnya
Prediksi token berikutnya adalah tujuan sederhana di balik model gaya GPT: mengingat semuanya sejauh ini, tebak potongan teks berikutnya.
Ikhtisar
Repeated billions of times, this single task produces models that write, reason, and converse.
Menyelam Lebih Dalam
Prediksi token berikutnya melatih model untuk menetapkan probabilitas ke token berikutnya dengan mempertimbangkan semua token sebelumnya. Teks pertama-tama dipecah menjadi token (potongan subkata) oleh tokenizer seperti pengkodean pasangan byte. Transformer khusus dekoder membaca urutan dari kiri ke kanan dan menghasilkan distribusi probabilitas pada seluruh kosakata untuk posisi berikutnya. Selama pelatihan, model diperlihatkan kumpulan teks besar-besaran dan diberi sanksi setiap kali model tersebut menetapkan probabilitas rendah ke token berikutnya yang sebenarnya. Pada waktu pembuatan, model mengambil sampel atau dengan rakus mengambil token, menambahkannya, dan mengulangi perulangan ini secara otomatis. Sasaran yang satu ini memiliki skala yang luar biasa: GPT-2, GPT-3, dan penerusnya semuanya mempelajari tata bahasa, fakta, terjemahan, dan penalaran semata-mata dengan menjadi sangat pandai dalam memprediksi token berikutnya.
Wawasan Teknis
Mekanisme kuncinya adalah perhatian diri yang bersifat kausal (tertutup): saat memprediksi posisi N, model hanya dapat memperhatikan posisi 1 hingga N-1, bukan masa depan. Lapisan keluaran memproyeksikan keadaan akhir yang tersembunyi ke dalam kosakata dan menerapkan softmax untuk mendapatkan probabilitas. Pelatihan meminimalkan entropi silang, setara dengan memaksimalkan kemungkinan teks yang diamati. Kontrol pengambilan sampel seperti suhu dan top-p membentuk ulang distribusi tersebut pada inferensi untuk mengorbankan kreativitas dan keandalan.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Prediksi Token Berikutnya
Prediksi token berikutnya pada dasarnya mendasari semua model bahasa besar modern dan akan tetap menjadi tulang punggung AI generatif. Penelitian memperluasnya dengan jendela konteks yang lebih panjang, decoding spekulatif dan paralel untuk kecepatan, dan tujuan prediksi multi-token yang menebak beberapa token masa depan sekaligus. Pembelajaran penguatan dari lapisan umpan balik manusia di atas untuk menyelaraskan keluaran. Perbatasan membuat tujuan sederhana yang sama menjadi lebih murah, lebih cepat, dan lebih terkendali dalam skala yang semakin besar.
Implementasi Dunia Nyata
Memberdayakan ChatGPT dan asisten serupa untuk menghasilkan respons percakapan satu per satu.
Pelengkapan otomatis dan saran kode di alat seperti GitHub Copilot saat Anda mengetik.
Menyusun email, artikel, dan salinan pemasaran dari perintah singkat.
Pembuatan teks waktu nyata dalam asisten menulis yang menyelesaikan kalimat Anda.
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Next-Token Prediction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Pelatihan Prediksi Multi-Token
Pertanyaan yang sering diajukan
What is Next-Token Prediction?
Prediksi token berikutnya adalah tujuan sederhana di balik model gaya GPT: mengingat semuanya sejauh ini, tebak potongan teks berikutnya. Diulangi miliaran kali, tugas tunggal ini menghasilkan model yang menulis, bernalar, dan berkomunikasi.
Apa yang dihasilkan oleh model prediksi token berikutnya pada setiap langkah?
Model tersebut menghasilkan probabilitas untuk setiap kemungkinan token berikutnya, kemudian salah satu dipilih melalui pengambilan sampel atau pilihan serakah.
Jenis perhatian apa yang digunakan dekoder gaya GPT?
Penyembunyian kausal memastikan posisi N hanya dapat melihat posisi sebelumnya, menjaga pengaturan prediksi dari kiri ke kanan.
Apa yang dimaksud dengan generasi 'autoregresif' di sini?
Pembuatan autoregresif menghasilkan satu token, menambahkannya ke konteks, dan mengulangi perulangan.
Fungsi kerugian apa yang biasanya diminimalkan selama pelatihan?
Entropi silang menghukum model karena menetapkan probabilitas rendah ke token berikutnya yang sebenarnya, yang setara dengan memaksimalkan kemungkinan.
Apa gunanya menaikkan suhu selama pengambilan sampel?
Temperatur yang lebih tinggi meratakan distribusi probabilitas, meningkatkan keacakan; suhu yang lebih rendah membuat pilihan lebih konservatif.