Self-RAG a reflexní vyhledávání
Self-RAG je rámec, ve kterém jazykový model rozhoduje, kdy načíst, a poté kritizuje vyhledané pasáže i svůj vlastní výstup pomocí speciálních reflexních žetonů.
Přehled
It matters because it makes retrieval-augmented generation adaptive and self-checking instead of blindly fetching documents for every query.
Hluboký ponor
Standardní RAG načte pevný počet pasáží pro každý vstup, i když žádný není potřeba, a nikdy neověřuje, zda je odpověď skutečně podporována. Self-RAG, který Asai a jeho kolegové představili v roce 2023, trénuje jeden model, aby na požádání dělal tři věci. Nejprve vyšle token „načtení“, který rozhoduje, zda je vůbec potřeba externích znalostí. Za druhé, po načtení vydá kritické žetony „IsRelevant“, které posoudí, zda každá pasáž pomáhá. Za třetí, generuje tokeny „IsSupported“ a „IsUseful“ hodnotící, zda jsou jeho vlastní prohlášení založena na důkazech a jak dobrá je reakce. Tyto reflexní žetony umožňují systému načítat pouze v oprávněných případech, filtrovat irelevantní pasáže a preferovat výstupy, které samotný model hodnotí jako dobře podporované, což snižuje halucinace.
Technický přehled
Self-RAG je trénován prostřednictvím učení pod dohledem na datech označených reflexními tokeny, často destilovanými ze silnějšího modelu, jako je GPT-4. Na závěr model prokládá běžné textové tokeny s těmito speciálními řídicími tokeny. Prohledávání paprskem na úrovni segmentu pak může vyhodnotit kandidátní pokračování pomocí pravděpodobností tokenů kritiky, což vývojářům umožní vyladit chování za běhu – například větší váhu „IsSupported“, aby se maximalizovala faktická základna oproti plynulosti.
Strategický dopad
Rychlost a měřítko
Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.
Přístup a dosah
Rozšiřuje přístup napříč jazyky a komunikačními styly.
Jasnější rozhodnutí
Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.
Budoucnost self-RAG a reflexního vyhledávání
Reflexní vyhledávání se sbližuje s agentním RAG, kde modely plánují vícekrokové vyhledávání, volací nástroje a samočinné opravy napříč iteracemi. Očekávejte těsnější integraci sebekritiky s modely ověřovatelů, vyhledávání v grafech znalostí a posilování učení, které odměňuje věrné a dobře citované odpovědi. Jak modely uvažování dospívají, vyhledávání na vyžádání a samohodnocení se pravděpodobně stane výchozím chováním spíše než samostatným rámcem, přičemž model dynamicky rozhoduje o tom, kolik důkazů vyžaduje každé tvrzení.
Real-World Implementace
Lékařský asistent Q&A vyhledá pokyny pouze pro klinické otázky a vynechá vyhledávání pro pozdravy pomocí svého rozhodovacího tokenu „načíst“.
Výzkumný asistent filtruje výsledky vyhledávání mimo téma tím, že před psaním zkontroluje kritiku každé pasáže „Je relevantní“.
Podnikový chatbot preferuje odpovědi označené 'IsSupported', takže jeho prohlášení zůstávají zakotvena ve firemních dokumentech a omezují halucinace.
Nástroj pro kontrolu faktů používá skóre „IsUseful“ k seřazení více kandidátských odpovědí a k zobrazení té nejlépe doložené.
Rizika a zábradlí
Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.
Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.
Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.
Plán implementace
Před zavedením definujte výstupní formát, tón a standardy kvality.
Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.
Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.
Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-RAG and Reflective Retrieval quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Spekulativní RAG a Retrieval-Augmented Drafting
Často kladené otázky
What is Self-RAG and Reflective Retrieval?
Self-RAG je rámec, ve kterém jazykový model rozhoduje, kdy načíst, a poté kritizuje vyhledané pasáže i svůj vlastní výstup pomocí speciálních reflexních žetonů. Je to důležité, protože díky tomu je generování s rozšířeným načítáním adaptivní a samokontrolované místo slepého načítání dokumentů pro každý dotaz.
Jaké klíčové rozhodnutí dělá Self-RAG a standardní RAG ne?
Self-RAG vydává token „načítání“, aby se na požádání rozhodlo, zda jsou potřeba externí dokumenty, spíše než vždy načítat.
Co jsou to „reflexní žetony“ v Self-RAG?
Reflexní tokeny jako IsRelevant, IsSupported a IsUseful umožňují modelu kritické pasáže a jeho vlastní výstup.
Který žeton reflexe hodnotí, zda je vygenerované prohlášení založeno na získaných důkazech?
Token IsSupported posuzuje, zda je tvrzení modelu skutečně podpořeno získanými pasážemi, což pomáhá snížit halucinace.
Jak je model Self-RAG typicky trénován k výrobě reflexních žetonů?
Self-RAG se učí z tréninkových dat anotovaných reflexními tokeny, často generovanými schopnějším modelem učitele, jako je GPT-4.
Jakou výhodu poskytuje vydání kritiky „Je relevantní“ pro každou pasáž?
Kritizací relevance každé pasáže může Self-RAG ignorovat vyhledávání mimo téma, místo aby je cpal do odpovědi.