PANDUAN AI Bahasa

Penskalaan Komputasi Waktu Uji

Penskalaan komputasi waktu pengujian berarti memberi model lebih banyak waktu berpikir dan komputasi saat menjawab pertanyaan, dibandingkan hanya memperbesarnya selama pelatihan.

2 min readTerakhir diperbarui

Ikhtisar

It is the breakthrough behind 'reasoning models' that can solve hard math and coding problems by deliberating before responding.

Menyelam Lebih Dalam

Selama bertahun-tahun, kemajuan AI berarti meningkatkan pelatihan: lebih banyak data, lebih banyak parameter, lebih banyak komputasi pra-pelatihan. Penskalaan komputasi waktu pengujian menambahkan sumbu kedua, sehingga menghabiskan lebih banyak komputasi pada inferensi. Alih-alih memberikan jawaban secara instan, model penalaran menghasilkan rantai pemikiran internal yang panjang, mengeksplorasi langkah-langkah, memeriksa pekerjaan, dan menelusuri kembali. Tekniknya mencakup rantai pemikiran yang diperluas, mengambil sampel dari banyak kandidat solusi dan memilih yang terbaik (konsistensi diri atau terbaik dari N), dan pencarian gaya pohon yang dipandu oleh model verifikasi atau penghargaan. Pemikiran mendalam OpenAI o1 dan o3, DeepSeek-R1, dan Claude mempopulerkan hal ini: akurasi pada matematika kompetisi dan pemrograman melonjak tajam saat Anda membiarkan model 'berpikir lebih lama', memperdagangkan latensi dan biaya untuk kebenaran pada soal yang jawaban cepatnya gagal.

Wawasan Teknis

Model tersebut dilatih dengan pembelajaran penguatan untuk menghasilkan token penalaran yang berguna, kemudian pada inferensi Anda mengalokasikan 'anggaran berpikir'. Lebih banyak token memungkinkannya menguraikan masalah, menangkap kesalahannya sendiri, dan melakukan verifikasi mandiri. Pengambilan sampel terbaik dari N dan penelusuran yang dipandu verifikator menambahkan komputasi paralel: hasilkan banyak percobaan, beri skor, pertahankan pemenangnya. Yang terpenting, model yang lebih kecil dengan komputasi waktu pengujian yang besar dapat menyamai model yang jauh lebih besar yang menjawab secara instan, sehingga membentuk kembali kurva biaya.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Penskalaan Komputasi Waktu Uji

Komputasi waktu pengujian kini menjadi pendorong penskalaan utama selain pelatihan. Harapkan anggaran adaptif di mana model memutuskan seberapa keras berpikir berdasarkan kesulitan, penalaran yang lebih murah melalui penyulingan rantai panjang menjadi rantai yang lebih pendek, dan putaran 'agentik' yang menyisipkan pemikiran dengan panggilan alat dan penelusuran web. Seiring dengan peningkatan perangkat keras inferensi, penalaran yang disengaja akan menjadi standar untuk tugas-tugas berisiko tinggi seperti penelitian ilmiah, rekayasa perangkat lunak, dan perencanaan yang rumit, sementara pencarian cepat tetap cepat dan murah.

Implementasi Dunia Nyata

Model o1 dan o3 OpenAI memikirkan soal matematika tingkat Olimpiade langkah demi langkah, secara dramatis mengungguli model jawaban instan pada AIME dan tolok ukur kompetisi.

DeepSeek-R1 menggunakan pembelajaran penguatan untuk mengajarkan penalaran rantai pemikiran yang panjang, secara terbuka menunjukkan peningkatan akurasi yang besar dari komputasi inferensi ekstra.

Mode berpikir Claude yang diperluas memungkinkan pengembang menetapkan anggaran token sehingga model berpikir lebih lama pada tugas pengkodean atau analisis yang rumit sebelum menjawab.

AlphaCode dan sistem serupa mengambil sampel ribuan kandidat program pada waktu pengujian, lalu memfilter dan memberi peringkat pada program tersebut untuk memecahkan tantangan pemrograman kompetitif.

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Test-Time Compute Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Augmentasi Waktu Tes

Pertanyaan yang sering diajukan

What is Test-Time Compute Scaling?

Penskalaan komputasi waktu pengujian berarti memberi model lebih banyak waktu berpikir dan komputasi saat menjawab pertanyaan, dibandingkan hanya memperbesarnya selama pelatihan. Ini adalah terobosan di balik 'model penalaran' yang dapat memecahkan masalah sulit matematika dan pengkodean dengan mempertimbangkannya sebelum merespons.

Apa yang dimaksud dengan 'komputasi waktu uji'?

Komputasi waktu pengujian (waktu inferensi) adalah pekerjaan yang dilakukan saat menghasilkan jawaban, berbeda dari komputasi yang digunakan selama prapelatihan.

Bagaimana model penalaran seperti o1 menggunakan komputasi waktu pengujian tambahan?

Mereka menghasilkan penalaran langkah demi langkah yang diperluas, mengeksplorasi dan memeriksa solusi sebelum melakukan respons akhir.

Apa inti trade-off dari penskalaan komputasi waktu pengujian?

Membiarkan model berpikir lebih lama akan meningkatkan kebenaran pada masalah sulit namun meningkatkan waktu respons dan biaya komputasi.

Apa yang dimaksud dengan pengambilan sampel 'best-of-N'?

Best-of-N menghasilkan beberapa upaya solusi secara paralel dan menggunakan pencetak gol atau pemverifikasi untuk mempertahankan solusi terkuat, suatu bentuk penskalaan waktu pengujian.

Mengapa komputasi waktu pengujian dianggap sebagai 'sumbu penskalaan' baru?

Selama bertahun-tahun, penskalaan berarti pelatihan yang lebih besar; komputasi waktu pengujian menambahkan cara kedua untuk meningkatkan kemampuan, dengan melakukan komputasi lebih banyak pada inferensi.