PANDUAN AI Bahasa

Strategi Pemotongan Dokumen

Pengelompokan dokumen adalah cara Anda membagi teks panjang menjadi beberapa bagian yang dapat diambil sebelum menyematkannya untuk penelusuran atau RAG.

2 min readTerakhir diperbarui

Ikhtisar

The chunk size and boundaries quietly determine retrieval quality, so getting them right often matters more than picking a fancier model.

Menyelam Lebih Dalam

Chunking mengubah dokumen besar menjadi bagian-bagian kecil yang sesuai dengan model penyematan dan selaras dengan cara pertanyaan diajukan. Pengelompokan berukuran tetap dibagi berdasarkan token atau jumlah karakter, sering kali tumpang tindih sehingga kalimat yang berada di luar batas tidak menjadi yatim piatu. Pengelompokan rekursif terbagi sepanjang hierarki pemisah (paragraf, lalu kalimat, lalu kata) untuk menghormati struktur alami. Pengelompokan semantik mengelompokkan kalimat dengan menyematkan kesamaan, memutus perubahan topik. Pengelompokan berbasis dokumen mengikuti format itu sendiri, terbagi menjadi judul penurunan harga, tag HTML, atau fungsi kode. Ketegangan inti adalah perincian: potongan kecil memberikan kecocokan yang tepat tetapi kehilangan konteks di sekitarnya, sedangkan potongan besar membawa konteks tetapi melemahkan relevansi dan mungkin melampaui batas token. Banyak saluran pipa menyimpan potongan kecil untuk diambil namun tetap memasukkan jalur induk yang diperluas ke model.

Wawasan Teknis

Tumpang tindih adalah trik keandalan yang paling sederhana: mengulangi sekitar 10 hingga 20 persen token di antara potongan-potongan yang berdekatan memastikan fakta yang terbagi melintasi batas masih tampak utuh dalam setidaknya satu potongan. Pengelompokan semantik melangkah lebih jauh dengan menyematkan setiap kalimat dan mengukur jarak kosinus antar tetangga, lalu memotong ketika jaraknya melonjak di atas ambang batas. Hal ini menghasilkan potongan panjang variabel yang koheren secara topikal, dengan mengorbankan komputasi penyematan tambahan selama pengindeksan.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Strategi Pemotongan Dokumen

Chunking beralih dari langkah pra-pemrosesan yang tetap menuju sesuatu yang adaptif dan sadar model. Pendekatan seperti pemotongan akhir menyematkan seluruh dokumen terlebih dahulu, kemudian mengumpulkan vektor potongan sehingga setiap bagian mempertahankan konteks global. Pengurai yang sadar tata letak semakin banyak mempertahankan tabel, judul, dan gambar daripada meratakannya menjadi teks yang berisik. Seiring dengan berkembangnya jendela konteks, beberapa pipeline mengambil potongan yang lebih sedikit namun lebih besar, namun potongan cerdas tetap penting untuk biaya, latensi, dan ketepatan titik, bukannya menghilang.

Implementasi Dunia Nyata

Memisahkan manual produk setebal 200 halaman pada judul bagiannya sehingga pertanyaan tentang 'ketentuan garansi' hanya mengambil bagian itu, bukan keseluruhan buku.

Menggunakan kalimat yang tumpang tindih sehingga definisi yang mencakup akhir satu paragraf dan awal paragraf berikutnya tetap utuh setidaknya dalam satu bagian.

Memotong makalah penelitian secara semantik sehingga pembahasan metode dan pembahasan hasil menjadi bagian yang terpisah dan koheren secara topik.

Memotong basis kode berdasarkan fungsi atau batasan kelas sehingga kueri pengembang mengambil unit yang lengkap dan dapat dijalankan, bukan setengah fungsi.

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Document Chunking Strategies quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Penyematan Dokumen Hipotetis HyDE

Pertanyaan yang sering diajukan

What is Document Chunking Strategies?

Pengelompokan dokumen adalah cara Anda membagi teks panjang menjadi beberapa bagian yang dapat diambil sebelum menyematkannya untuk penelusuran atau RAG. Ukuran dan batasan potongan secara diam-diam menentukan kualitas pengambilan, sehingga menentukannya dengan benar sering kali lebih penting daripada memilih model yang lebih bagus.

Mengapa sering terjadi tumpang tindih di antara bagian-bagian yang berdekatan?

Tumpang tindih mengulangi potongan token antar tetangga sehingga informasi yang berada di tengah perpecahan tidak terpotong setengah dan hilang.

Apa yang digunakan pengelompokan semantik untuk memutuskan di mana akan dipisahkan?

Pengelompokan semantik menyematkan kalimat dan memecah kalimat ketika jarak kosinus antar tetangga meningkat, menghasilkan potongan yang koheren secara topikal.

Apa trade-off utama antara bongkahan yang sangat kecil dan sangat besar?

Potongan-potongan kecil sama persis namun menghilangkan konteks di sekitarnya, sedangkan potongan-potongan besar mempertahankan konteks namun dapat melemahkan relevansi dan mencapai batas token.

Bagaimana cara pemotongan rekursif memutuskan di mana harus memecah teks?

Pengelompokan rekursif menelusuri daftar pemisah untuk mengikuti struktur alami sambil tetap berada dalam target ukuran.

Apa gagasan di balik pola pengambilan dokumen 'kecil-ke-besar' atau orang tua?

Anda mencocokkan bagian-bagian kecil untuk mendapatkan presisi, lalu memperluas ke teks induk di sekitarnya sehingga model mendapatkan konteks penuh.