РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Самостоятельная ТРЯПКА и рефлексивное извлечение

Self-RAG — это структура, в которой языковая модель решает, когда извлекать информацию, а затем анализирует как извлеченные отрывки, так и собственный вывод, используя специальные токены отражения.

2 минуты чтенияПоследнее обновление

Обзор

It matters because it makes retrieval-augmented generation adaptive and self-checking instead of blindly fetching documents for every query.

Глубокое погружение

Стандартный RAG извлекает фиксированное количество отрывков для каждого ввода, даже если они не нужны, и никогда не проверяет, действительно ли ответ поддерживается. Self-RAG, представленный Асаи и его коллегами в 2023 году, обучает одну модель выполнять три вещи по требованию. Во-первых, он генерирует токен «извлечения», определяющий, нужны ли вообще внешние знания. Во-вторых, после извлечения он выдает жетоны критики «IsRelevant», оценивающие, помогает ли каждый отрывок. В-третьих, он генерирует токены IsSupported и IsUseful, оценивая, основаны ли его собственные утверждения на фактах и ​​насколько хорош ответ. Эти токены отражения позволяют системе извлекать данные только тогда, когда это необходимо, фильтровать нерелевантные отрывки и отдавать предпочтение выводам, которые сама модель оценивает как хорошо поддерживаемые, уменьшая галлюцинации.

Техническая информация

Self-RAG обучается посредством контролируемого обучения на данных, помеченных токенами отражения, которые часто извлекаются из более сильной модели, такой как GPT-4. При выводе модель чередует обычные текстовые токены с этими специальными управляющими токенами. Лучевой поиск на уровне сегмента затем может оценивать продолжения-кандидаты, используя вероятности токенов критики, позволяя разработчикам настраивать поведение во время выполнения — например, придавая больший вес «Поддерживается», чтобы максимизировать фактическое обоснование по сравнению с беглостью.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее самотряпки и рефлексивного поиска

Рефлексивный поиск сходится с агентным RAG, где модели планируют многоэтапный поиск, вызывают инструменты и выполняют самокоррекцию на протяжении итераций. Ожидайте более тесной интеграции самокритики с моделями проверки, извлечения информации из графиков знаний и обучения с подкреплением, которое вознаграждает за точные, хорошо цитируемые ответы. По мере развития моделей рассуждения извлечение данных по требованию и с самооценкой, скорее всего, станет поведением по умолчанию, а не отдельной структурой, при этом модель будет динамически решать, сколько доказательств требуется для каждого утверждения.

Реальная реализация

Медицинский помощник по вопросам и ответам получает инструкции только для клинических вопросов и пропускает поиск приветствий, используя свой жетон решения «получить».

Ассистент-исследователь отфильтровывает результаты поиска, не относящиеся к теме, проверяя критический анализ каждого отрывка перед его написанием.

Корпоративный чат-бот предпочитает ответы с пометкой «Поддерживается», поэтому его утверждения остаются обоснованными в документах компании, что исключает галлюцинации.

Инструмент проверки фактов использует оценку «IsUseful», чтобы ранжировать несколько ответов кандидатов и выявить наиболее обоснованный.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-RAG and Reflective Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Спекулятивная RAG и черчение с расширенным поиском

Часто задаваемые вопросы

What is Self-RAG and Reflective Retrieval?

Self-RAG — это структура, в которой языковая модель решает, когда извлекать информацию, а затем анализирует как извлеченные отрывки, так и собственный вывод, используя специальные токены отражения. Это важно, поскольку делает генерацию с расширенным поиском адаптивной и самопроверяемой, а не слепой выборкой документов для каждого запроса.

Какое ключевое решение принимает Self-RAG, чего не принимает стандартная RAG?

Self-RAG выдает токен «извлечения», чтобы по запросу решить, нужны ли внешние документы, а не всегда получать.

Что такое «токены отражения» в Self-RAG?

Токены отражения, такие как IsRelevant, IsSupported и IsUseful, позволяют модели критически анализировать отрывки и собственные выходные данные.

Какой токен отражения оценивает, основано ли созданное утверждение на полученных доказательствах?

Токен IsSupported определяет, действительно ли утверждение модели подтверждается полученными отрывками, помогая уменьшить галлюцинации.

Как обычно обучается модель Self-RAG для создания токенов отражения?

Self-RAG учится на обучающих данных, аннотированных токенами отражения, часто генерируемых более способной моделью учителя, такой как GPT-4.

Какое преимущество дает критика «IsRelevant» для каждого отрывка?

Критикуя актуальность каждого отрывка, Self-RAG может игнорировать не относящиеся к теме запросы вместо того, чтобы вставлять их в ответ.