PANDUAN Teknis

Dokumen Induk dan Pengambilan Kecil-ke-Besar

Pengambilan dokumen induk, juga disebut pengambilan kecil-ke-besar, menelusuri potongan teks yang kecil dan tepat, namun tetap memberikan model bahasa pada bagian atau dokumen yang lebih besar dari mana setiap potongan berasal.

  • 4 menit membaca
  • Terakhir diperbarui
Di halaman ini4 menit membaca
  1. Ikhtisar
  2. Menyelam Lebih Dalam
  3. Dampak Strategis
  4. Masa Depan Dokumen Induk dan Pengambilan Dokumen Kecil hingga Besar
  5. Implementasi Dunia Nyata
  6. Risiko & Pagar Pembatas
  7. Peta Jalan Implementasi
  8. Terus Menjelajah
  9. Pertanyaan yang sering diajukan

Ikhtisar

Hal ini penting karena menghilangkan trade-off pengelompokan yang biasa: potongan kecil mencocokkan kueri secara akurat, dan induk yang lebih besar memberikan konteks yang cukup kepada model untuk menjawab dengan benar.

Menyelam Lebih Dalam

Pengelompokan dengan ukuran tetap memaksa terjadinya trade-off. Potongan kecil, misalnya beberapa kalimat, menghasilkan embeddings yang tajam: vektor mewakili satu ide, sehingga kueri tentang ide tersebut sangat cocok dengan ide tersebut. Namun potongan dua kalimat jarang berisi konteks yang cukup agar model dapat menjawab dengan baik; dapat menghilangkan definisi tiga paragraf sebelumnya atau pengecualian pada kalimat berikutnya. Potongan besar membawa konteks tersebut, namun penyematannya mengaburkan beberapa ide, sehingga pengambilan menjadi kurang tepat dan bagian yang relevan dapat dikalahkan oleh potongan yang hanya sesuai topik. Pengambilan kecil hingga besar membagi dua pekerjaan. Sistem mengindeks potongan anak kecil untuk pencarian, dan setiap anak menyimpan penunjuk ke induk yang lebih besar: bagian, halaman, atau keseluruhan dokumen. Pada waktu kueri, ia menemukan anak-anak terbaik, lalu mencari dan mengembalikan orang tuanya. Jika beberapa anak berbagi satu orang tua, orang tua tersebut dikirim satu kali, yang juga menghapus duplikat. ParentDocumentRetriever LangChain mengimplementasikan ini dengan penyimpanan vektor untuk anak-anak dan penyimpanan dokumen terpisah untuk orang tua. LlamaIndex menawarkan pola terkait: pengambilan jendela kalimat, yang mengembalikan kalimat yang cocok ditambah sejumlah kalimat tetangga yang tetap, dan pengambilan penggabungan otomatis, yang menggantikan banyak potongan daun yang diambil dengan simpul induk bersama ketika cukup banyak yang cocok. Pendekatan ini cenderung mengalahkan pengelompokan ukuran tetap pada dokumen terstruktur seperti manual, kontrak, kebijakan, dan buku teks, yang maknanya bergantung pada bagian di sekitarnya. Hal ini tidak terlalu membantu ketika dokumen sudah pendek, atau ketika orang tua terlalu besar sehingga beberapa dari mereka melampaui jendela konteks atau mengubur jawaban dalam teks yang tidak relevan. Kesalahpahaman yang umum adalah bahwa ini hanya menggunakan potongan yang lebih besar. Hal ini tidak terjadi: unit pengambilan dan unit pembangkitan sengaja dibuat dengan ukuran yang berbeda, sehingga Anda dapat tetap mencocokkan secara tepat tanpa menghilangkan konteks model.

Dampak Strategis

Biaya dan anggaran

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Keputusan yang lebih jelas

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Kontrol kualitas

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Dokumen Induk dan Pengambilan Dokumen Kecil hingga Besar

Kecil-ke-besar menjadi sebuah default dan bukan sebuah trik, dan kerangka kerja besar sudah mengekspos pengambilan hierarki atau berjendela sebagai opsi konfigurasi. Jendela konteks yang lebih besar mengurangi hukuman pengiriman orang tua yang lebih besar, sehingga membuat pola ini lebih murah untuk diadopsi. Pertanyaan terbuka tetap ada tentang memilih batasan induk secara otomatis, misalnya menggunakan analisis tata letak dokumen atau segmentasi yang dipelajari daripada mengandalkan judul. Hal ini semakin banyak dikombinasikan dengan pemeringkatan ulang dan pendekatan penyematan kontekstual yang mencoba memberikan sebagian kecil kesadaran akan lingkungan sekitar mereka pada waktu pengindeksan. Menguji dokumen Anda sendiri, bukan tolok ukur umum, tetap menjadi cara yang dapat diandalkan untuk memilih ukuran anak dan orang tua.

Implementasi Dunia Nyata

Bot bantuan TI internal mengindeks setiap langkah pemecahan masalah sebagai potongan anak terpisah, namun ketika sebuah langkah cocok, bot tersebut akan mengembalikan seluruh prosedur, sehingga model tidak meminta pengguna untuk melakukan langkah 4 tanpa langkah 1 hingga 3.

Alat penelitian hukum mencocokkan satu klausul tentang periode pemberitahuan penghentian, lalu meneruskan model ke bagian kontrak secara keseluruhan, termasuk definisi dan pengecualian yang mengubah arti klausul tersebut.

Seorang asisten mata kuliah di universitas mencari potongan tingkat kalimat dari catatan kuliah dan mengembalikan halaman di sekitarnya, sehingga jawaban tentang rumus juga mencakup kondisi penerapannya.

Asisten klaim asuransi mengambil beberapa kecocokan kecil dari satu dokumen polis, mengelompokkannya berdasarkan induknya, dan mengirimkan bagian polis tersebut satu kali, bukan lima fragmen yang tumpang tindih.

Risiko & Pagar Pembatas

  • Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

  • Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

  • Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

  1. Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

  2. Tolok ukur dalam kondisi beban dan data yang realistis.

  3. Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

  4. Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Parent Document and Small-to-Big Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Pertanyaan yang sering diajukan

Apa itu Dokumen Induk dan Pengambilan Kecil-ke-Besar?

Pengambilan dokumen induk, juga disebut pengambilan kecil-ke-besar, menelusuri potongan teks yang kecil dan tepat, namun tetap memberikan model bahasa pada bagian atau dokumen yang lebih besar dari mana setiap potongan berasal. Hal ini penting karena menghilangkan trade-off pengelompokan yang biasa: potongan kecil mencocokkan kueri secara akurat, dan induk yang lebih besar memberikan konteks yang cukup kepada model untuk menjawab dengan benar.

Pertukaran inti apa yang diatasi oleh pengambilan skala kecil hingga skala besar?

Potongan kecil memberikan penyematan yang terfokus tetapi konteksnya terlalu sedikit; potongan besar memberikan konteks tetapi penyematannya buram. Pencarian kecil hingga besar kecil dan menghasilkan hasil besar untuk mendapatkan keduanya.

Dalam sistem kecil hingga besar, apa yang disematkan dan dicari pada waktu kueri?

Anak-anak diindeks untuk pencocokan yang tepat; orang tua hanya diperhatikan setelah anak bertanding.

Jika tiga potongan anak yang diambil semuanya berasal dari bagian induk yang sama, apa yang harus dilakukan sistem?

Pengelompokan berdasarkan induk berarti bagian tersebut disertakan satu kali, yang menyimpan token dan menghapus fragmen duplikat.

Bagaimana ParentDocumentRetriever LangChain menyimpan dua tingkat teks?

Anak-anak tertanam di penyimpanan vektor untuk pencarian, sementara orang tua penuh berada di penyimpanan dokumen dan diambil berdasarkan ID.

Apa yang dihasilkan dari pengambilan jendela kalimat?

Pengambilan jendela kalimat cocok pada tingkat kalimat dan kemudian diperluas ke jendela kalimat di sekitarnya untuk memberikan konteks.