Strategie dzielenia dokumentów
Dzielenie dokumentu polega na dzieleniu długiego tekstu na fragmenty, które można odzyskać, przed osadzeniem go na potrzeby wyszukiwania lub RAG.
Przegląd
The chunk size and boundaries quietly determine retrieval quality, so getting them right often matters more than picking a fancier model.
Głębokie nurkowanie
Dzielenie na części zamienia duże dokumenty w niewielkie fragmenty, które pasują do modelu osadzania i są zgodne ze sposobem zadawania pytań. Porcje o stałym rozmiarze są dzielone według tokenów lub liczby znaków, często z nakładaniem się, dzięki czemu zdanie wykraczające poza granicę nie zostaje osierocone. Rekurencyjne dzielenie na fragmenty dzieli się wzdłuż hierarchii separatorów (akapity, następnie zdania, a następnie słowa), aby zachować naturalną strukturę. Dzielenie semantyczne grupuje zdania poprzez osadzanie podobieństwa, przerywając tam, gdzie przesuwa się temat. Podział na fragmenty uwzględniający dokument jest zgodny z samym formatem, dzieląc go na nagłówki Markdown, znaczniki HTML lub funkcje kodu. Podstawowym napięciem jest ziarnistość: małe fragmenty zapewniają dokładne dopasowania, ale tracą otaczający kontekst, podczas gdy duże fragmenty niosą kontekst, ale osłabiają znaczenie i mogą przekraczać limity symboli. Wiele potoków przechowuje małe fragmenty do pobrania, a mimo to dostarcza do modelu rozszerzone fragmenty nadrzędne.
Wgląd techniczny
Nakładanie się to najprostsza sztuczka zapewniająca niezawodność: powtarzanie około 10 do 20 procent tokenów pomiędzy sąsiednimi fragmentami gwarantuje, że fakt rozdzielony wzdłuż granicy nadal będzie wyglądał nienaruszony w co najmniej jednym fragmencie. Fragmentacja semantyczna idzie dalej, osadzając każde zdanie i mierząc odległość cosinusową między sąsiadami, a następnie wycinając tam, gdzie odległość przekracza próg. Tworzy to tematycznie spójne fragmenty o zmiennej długości, kosztem dodatkowych obliczeń osadzania podczas indeksowania.
Wpływ strategiczny
Szybkość i skala
Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.
Dostęp i zasięg
Rozszerza dostęp w różnych językach i stylach komunikacji.
Jaśniejsze decyzje
Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.
Przyszłość strategii dzielenia dokumentów
Dzielenie na części oznacza przejście ze stałego etapu przetwarzania wstępnego w stronę czegoś adaptacyjnego i uwzględniającego model. Podejścia takie jak późne fragmentowanie polegają na tym, że najpierw osadza się cały dokument, a następnie łączy wektory fragmentów, tak aby każdy fragment zachował globalny kontekst. Parsery obsługujące układ w coraz większym stopniu zachowują tabele, nagłówki i rysunki, zamiast spłaszczać je w postaci zaszumionego tekstu. W miarę powiększania się okien kontekstowych niektóre potoki pobierają mniej, ale większe fragmenty, jednak inteligentne fragmentowanie pozostaje niezbędne ze względu na koszty, opóźnienia i najwyższą precyzję, a nie znika.
Implementacja w świecie rzeczywistym
Podział 200-stronicowej instrukcji produktu na nagłówki sekcji, tak aby pytanie o „warunki gwarancji” pozwoliło uzyskać tylko tę sekcję, a nie całą książkę.
Używanie nakładania zdań, aby definicja obejmująca koniec jednego akapitu i początek następnego pozostawała całością przynajmniej w jednym fragmencie.
Semantyczne podzielenie artykułu badawczego, tak aby dyskusja na temat metod i dyskusja wyników stały się oddzielnymi, spójnymi tematycznie fragmentami.
Dzielenie bazy kodu według granic funkcji lub klas, aby zapytanie programisty pozyskało kompletną, wykonalną jednostkę, a nie połowę funkcji.
Zagrożenia i poręcze
Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.
Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.
Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.
Plan wdrożenia
Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.
Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.
Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.
Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Document Chunking Strategies quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Hipotetyczne osadzanie dokumentów HyDE
Często zadawane pytania
What is Document Chunking Strategies?
Dzielenie dokumentu polega na dzieleniu długiego tekstu na fragmenty, które można odzyskać, przed osadzeniem go na potrzeby wyszukiwania lub RAG. Rozmiar i granice fragmentów w dyskretny sposób decydują o jakości wyszukiwania, więc prawidłowe ich wykonanie często ma większe znaczenie niż wybranie bardziej wyszukanego modelu.
Dlaczego często dodaje się nakładanie się pomiędzy sąsiednimi fragmentami?
Nakładanie się powtarza fragment tokenów pomiędzy sąsiadami, więc informacje znajdujące się pomiędzy podziałami nie są przecięte na pół i utracone.
Czego używa fragmentacja semantyczna, aby zdecydować, gdzie dokonać podziału?
Semantyczne fragmenty osadzają zdania i przerwy tam, gdzie cosinusowa odległość między sąsiadami wzrasta, tworząc tematycznie spójne fragmenty.
Jaki jest główny kompromis pomiędzy bardzo małymi i bardzo dużymi kawałkami?
Małe fragmenty dokładnie dopasowują się, ale usuwają otaczający kontekst, podczas gdy duże fragmenty zachowują kontekst, ale mogą osłabić trafność i przekroczyć limity tokenów.
W jaki sposób fragmentacja rekurencyjna decyduje, gdzie podzielić tekst?
Fragmentacja rekurencyjna przegląda listę separatorów, aby zachować naturalną strukturę, zachowując jednocześnie docelowy rozmiar.
Jaka jest idea wzorca wyszukiwania „od małego do dużego” lub wzorca wyszukiwania dokumentów nadrzędnych?
Aby uzyskać precyzję, dopasowujesz małe fragmenty, a następnie rozszerzasz je do otaczającego tekstu nadrzędnego, aby model uzyskał pełny kontekst.