Техническо РЪКОВОДСТВО

Родителски документ и извличане от малки към големи

Извличането на родителски документ, наричано също извличане от малък към голям, търси в малки, точни текстови парчета, но предава на езиковия модел по-големия раздел или документ, от който произхожда всяка част.

  • 4 минути четене
  • Последна актуализация
На тази страница4 минути четене
  1. Преглед
  2. Дълбоко гмуркане
  3. Стратегическо въздействие
  4. Бъдещето на родителския документ и извличането от малък към голям
  5. Внедряване в реалния свят
  6. Рискове и предпазни огради
  7. Пътна карта за изпълнение
  8. Продължете да изследвате
  9. Често задавани въпроси

Преглед

Има значение, защото премахва обичайния компромис с разделянето на парчета: малките парчета отговарят точно на заявките, а по-големият родител дава на модела достатъчно контекст, за да отговори правилно.

Дълбоко гмуркане

Разделянето на парчета с фиксиран размер води до компромис. Малки парчета, да кажем няколко изречения, създават резки вграждания: векторът представлява една идея, така че запитване за тази идея съвпада много с нея. Но част от две изречения рядко съдържа достатъчно контекст, за да може моделът да отговори добре; може да пропусне определението три параграфа по-рано или изключението в следващото изречение. Големите части носят този контекст, но техните вграждания замъгляват няколко идеи заедно, така че извличането става по-малко прецизно и съответният пасаж може да бъде изпреварен от част, която е просто по темата. Извличането от малки към големи разделя двете задачи. Системата индексира малки дъщерни части за търсене и всяко дете пази указател към по-голям родител: раздел, страница или целия документ. По време на заявка той намира най-добрите деца, след което търси и връща родителите им. Ако няколко деца споделят един родител, родителят се изпраща веднъж, което също премахва дубликати. ParentDocumentRetriever на LangChain прилага това с векторно хранилище за деца и отделно хранилище на документи за родители. LlamaIndex предлага свързани модели: извличане на прозорец на изречение, което връща съвпадащо изречение плюс фиксиран брой съседни изречения, и извличане с автоматично сливане, което замества много извлечени парчета листа с техния споделен родителски възел, когато достатъчно от тях съвпадат. Подходът има тенденция да победи групирането с фиксиран размер на структурирани документи като ръководства, договори, политики и учебници, където значението зависи от заобикалящия раздел. Помага по-малко, когато документите вече са кратки или когато родителите са толкова големи, че няколко от тях препълват контекстния прозорец или заравят отговора в неуместен текст. Често срещано погрешно схващане е, че това просто се използват по-големи парчета. Не е: единицата за извличане и единицата за генериране са умишлено с различни размери, така че поддържате прецизно съвпадение, без да изглаждате модела на контекста.

Стратегическо въздействие

Разходи и бюджет

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

По-ясни решения

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Контрол на качеството

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на родителския документ и извличането от малък към голям

От малък към голям се превръща по-скоро в стандарт, отколкото в трик, а основните рамки вече излагат йерархично или прозоречно извличане като опции за конфигуриране. По-големите контекстни прозорци намаляват наказанието за изпращане на по-големи родители, което прави модела по-евтин за възприемане. Остават открити въпроси относно автоматичното избиране на родителски граници, например използване на анализ на оформлението на документа или научено сегментиране вместо разчитане на заглавия. Той все повече се комбинира с прекласатори и с подходи за контекстно вграждане, които се опитват да дадат на малки парчета информация за заобикалящата ги среда по време на индексиране. Тестването на вашите собствени документи, а не общи сравнителни показатели, остава надеждният начин за избор на дъщерни и родителски размери.

Внедряване в реалния свят

Вътрешен ИТ помощен бот индексира всяка стъпка за отстраняване на неизправности като отделно дъщерно парче, но когато стъпка съвпада, връща цялата процедура, така че моделът не казва на потребителите да направят стъпка 4 без стъпки от 1 до 3.

Инструмент за правно проучване съвпада с една клауза относно периодите на предизвестие за прекратяване, след което предава на модела пълния договорен раздел, включително определенията и изключенията, които променят значението на клаузата.

Асистент в университетски курс търси части на ниво изречение от бележки за лекции и връща заобикалящата страница, така че отговорите за формула също включват условията, при които тя се прилага.

Асистент за застрахователни искове извлича няколко малки съвпадения от един документ за полица, групира ги по родител и изпраща този раздел за полица веднъж вместо пет припокриващи се фрагмента.

Рискове и предпазни огради

  • Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

  • Разходите за инфраструктура и поддръжка често се подценяват.

  • Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

  1. Определете целите за латентност, качество и разходи преди внедряването.

  2. Бенчмарк при реалистични условия на натоварване и данни.

  3. Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

  4. Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Parent Document and Small-to-Big Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Стартирай теста

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Често задавани въпроси

Какво е родителски документ и извличане от малък към голям?

Извличането на родителски документ, наричано също извличане от малък към голям, търси в малки, точни текстови парчета, но предава на езиковия модел по-големия раздел или документ, от който произхожда всяка част. Има значение, защото премахва обичайния компромис с разделянето на парчета: малките парчета отговарят точно на заявките, а по-големият родител дава на модела достатъчно контекст, за да отговори правилно.

Какъв основен компромис адресира извличането от малки към големи?

Малките парчета дават фокусирани вграждания, но твърде малко контекст; големите парчета дават контекст, но размазани вграждания. Малко към голямо търси малко и връща голямо, за да получи и двете.

В система от малък към голям, какво се вгражда и търси по време на заявка?

Децата се индексират за точно съвпадение; родителите се търсят само след съвпадение на дете.

Ако три извлечени дъщерни части принадлежат към една и съща родителска секция, какво трябва да направи системата?

Групирането по родител означава, че секцията е включена веднъж, което запазва токени и премахва дублиращи се фрагменти.

Как ParentDocumentRetriever на LangChain съхранява двете нива на текст?

Децата са вградени във векторно хранилище за търсене, докато пълноправните родители седят в хранилище за документи и се извличат чрез ID.

Какво връща извличането на прозорец на изречение?

Извличането на прозорец на изречение съвпада на ниво изречение и след това се разширява до прозорец от околни изречения, за да предостави контекст.