Език AI РЪКОВОДСТВО

Стратегии за разделяне на документи

Разделянето на документи е начинът, по който разделяте дълъг текст на части, които могат да бъдат извлечени, преди да го вградите за търсене или RAG.

2 min readПоследна актуализация

Преглед

The chunk size and boundaries quietly determine retrieval quality, so getting them right often matters more than picking a fancier model.

Дълбоко гмуркане

Разкъсването превръща големите документи в малки пасажи, които пасват на модел на вграждане и са в съответствие с начина, по който се задават въпроси. Разделянето на парчета с фиксиран размер се разделя по токен или брой символи, често с припокриване, така че изречение, прекрачващо граница, да не е осиротяло. Рекурсивното групиране се разделя по йерархия от разделители (параграфи, след това изречения, след това думи), за да се съобрази с естествената структура. Семантичното групиране на части изречения чрез вграждане на сходство, прекъсване там, където темата се измества. Разкъсването в съответствие с документа следва самия формат, като се разделя на Markdown заглавия, HTML тагове или кодови функции. Основното напрежение е детайлността: малките парчета дават точни съвпадения, но губят заобикалящия контекст, докато големите парчета носят контекст, но намаляват уместността и могат да надхвърлят ограниченията на символите. Много конвейери съхраняват малки парчета за извличане, но подават разширени родителски пасажи към модела.

Техническа информация

Припокриването е най-простият трик за надеждност: повтарянето на приблизително 10 до 20 процента от токените между съседни парчета гарантира, че факт, разделен през граница, все още изглежда непокътнат в поне една част. Семантичното нарязване отива по-далеч чрез вграждане на всяко изречение и измерване на косинусово разстояние между съседите, след което изрязване там, където разстоянието надвишава прага. Това създава локално кохерентни парчета с променлива дължина, за сметка на допълнително изчисление за вграждане по време на индексирането.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на стратегиите за разделяне на документи

Разкъсването се измества от фиксирана стъпка на предварителна обработка към нещо адаптивно и съобразено с модела. Подходи като късно групиране първо вграждат целия документ, след което обединяват вектори на парчета, така че всяка част запазва глобалния контекст. Съобразените с оформлението парсери все повече запазват таблици, заглавия и фигури, вместо да ги изравняват в шумен текст. С нарастването на контекстните прозорци някои конвейери извличат по-малко, но по-големи парчета, но интелигентното групиране остава от съществено значение за разходите, латентността и точната точност, вместо да изчезне.

Внедряване в реалния свят

Разделяне на ръководство за продукта от 200 страници на заглавията на разделите, така че въпросът относно „гаранционните условия“ извлича само този раздел, а не цялата книга.

Използване на припокриване на изречения, така че определение, което обхваща края на един абзац и началото на следващия, остава цяло в поне една част.

Семантично разделяне на изследователска статия, така че обсъждането на методите и обсъждането на резултатите да станат отделни, тематично съгласувани пасажи.

Разделяне на кодова база по граници на функция или клас, така че заявката на разработчика да извлича пълна, работеща единица, а не половин функция.

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Document Chunking Strategies quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Хипотетични вграждания на документи на HyDE

Frequently asked questions

What is Document Chunking Strategies?

Разделянето на документи е начинът, по който разделяте дълъг текст на части, които могат да бъдат извлечени, преди да го вградите за търсене или RAG. Размерът и границите на парчетата тихомълком определят качеството на извличане, така че правилното им често е по-важно от избора на по-красив модел.

Защо често се добавя припокриване между съседни парчета?

Припокриването повтаря отрязък от токени между съседи, така че информацията, обхващаща разделяне, да не се нарязва наполовина и да се губи.

Какво използва семантичното нарязване, за да реши къде да се раздели?

Семантичното нарязване вгражда изречения и се разделя там, където косинусното разстояние между съседите се увеличава, създавайки локално съгласувани части.

Какъв е основният компромис между много малки и много големи парчета?

Малките парчета съвпадат точно, но премахват заобикалящия контекст, докато големите парчета запазват контекста, но могат да размият уместността и да ударят ограниченията на символите.

Как рекурсивното нарязване решава къде да се прекъсне текстът?

Рекурсивното нарязване върви надолу по списък от разделители, за да се съобрази с естествената структура, като същевременно остава в рамките на целевия размер.

Каква е идеята зад модела за извличане на „малък към голям“ или родителски документ?

Сравнявате малки части за прецизност, след което разширявате до околния родителски текст, така че моделът да получи пълен контекст.