Език AI РЪКОВОДСТВО

Извличане на плътен проход

Dense Passage Retrieval (DPR) намира подходящ текст, като сравнява значението на въпрос и пасажи като цифрови вектори, а не съвпадащи думи.

2 min readПоследна актуализация

Преглед

It matters because it can retrieve correct answers even when the query and the document share zero vocabulary.

Дълбоко гмуркане

DPR, въведен от Facebook AI през 2020 г., използва два отделни BERT енкодера: енкодер за въпроси и енкодер за пасажи. Всеки превръща текста в плътен вектор с фиксирана дължина (често 768 измерения). Уместността е точковият продукт между въпросителен вектор и вектор на пасаж, така че извличането се превръща в бързо търсене на най-близкия съсед върху предварително изчислени вграждания на пасажи. Моделът се обучава с контрастираща цел: издърпайте вектора на правилния пасаж близо до въпроса и избутайте грешните, като използвате групови негативи плюс твърди негативи, извлечени от BM25. При бенчмаркове за QA с отворен домейн като Natural Questions, DPR победи дълго доминиращия BM25 с големи маржове, показвайки, че наученото семантично съвпадение може да надмине търсенето по ключови думи за отговаряне на въпроси.

Техническа информация

DPR е би-енкодер: той кодира заявката и всеки пасаж независимо, така че всички вектори за пасажи се изчисляват веднъж и се съхраняват във векторен индекс (напр. FAISS). По време на заявка само кодирате въпроса, след което стартирате приблизително търсене на най-близкия съсед. Обучението разчита на негативи в партида - други пасажи в същата мини-партида служат като отрицателни примери почти безплатно, което позволява на една положителна двойка да генерира много контрастни сравнения ефективно.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на извличането на плътни проходи

Плътното извличане сега е в основата на повечето тръбопроводи за генериране с разширени извличане, захранващи големи езикови модели. Изследванията се насочват към хибридни системи, които сливат плътни и лексикални резултати, модели за късно взаимодействие като ColBERT, които поддържат вектори за токени за по-фино съвпадение, и настроени с инструкции вграждания, които се адаптират към много задачи. Очаквайте по-евтини, многоезични и по-дълъг контекст енкодери, плюс по-стриктно съвместно обучение на ретривъри с генераторите, които обслужват.

Внедряване в реалния свят

Системи за отговор на въпроси с отворен домейн, които изтеглят поддържащи пасажи от Wikipedia, преди LLM да напише отговора

Търсене на корпоративни документи, при което служителите задават естествени въпроси и получават подходящи абзаци дори без точни ключови думи

Ботове за поддръжка на клиенти, които извличат правилната статия от помощния център от перифразирана жалба

Чатботове с подобрено извличане заземяват отговори в частна база от знания, за да намалят халюцинациите

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dense Passage Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

ColBERT Late Interaction Retrieval

Frequently asked questions

What is Dense Passage Retrieval?

Dense Passage Retrieval (DPR) намира подходящ текст, като сравнява значението на въпрос и пасажи като цифрови вектори, а не съвпадащи думи. Има значение, защото може да извлече верни отговори дори когато заявката и документът не споделят нулев речник.

Каква е основната идея зад Dense Passage Retrieval?

DPR картографира както заявките, така и пасажите в плътни вектори и измерва уместността чрез тяхната прилика (точков продукт), улавяйки значението, а не припокриването на думи.

DPR използва архитектура на „би-енкодер“. какво значи това

Би-енкодерът има независими енкодери за въпроси и пасажи, така че векторите на пасажите могат да бъдат предварително изчислени и индексирани преди време.

Защо векторите за преминаване могат да бъдат изчислени предварително в DPR?

Тъй като енкодерът на пасажи не зависи от заявката, всички вграждания на пасажи могат да бъдат предварително изчислени и съхранени, оставяйки само заявката за кодиране по време на търсене.

Какъв тренировъчен трик позволява на DPR да генерира много отрицателни примери евтино?

Пакетните негативи третират другите пасажи в мини-партида като негативи за даден въпрос, създавайки ефективно много контрастни двойки.

Какъв инструмент обикновено се използва, за да направи търсенето на най-близкия съсед на DPR бързо в мащаб?

Векторни индекси като FAISS извършват бързо приблизително търсене на най-близкия съсед върху милиони предварително изчислени вграждания на пасажи.