ДалееСледующее руководство
Оптимизация второго порядка и методы Ньютона
Технический
Техническое РУКОВОДСТВО
Обнаружение галлюцинаций — это набор методов для пометки результатов модели, которые являются ложными или не подтверждаются доказательствами.
Основными методами являются выборка нескольких ответов и проверка их согласия, проверка того, вытекает ли каждое утверждение из исходных документов, считывание сигналов неопределенности, таких как вероятности токенов, и обращение к второй модели в качестве судьи. Это важно, поскольку галлюцинированный текст часто читается бегло и уверенно, поэтому производственные системы нуждаются в автоматических проверках, прежде чем ошибки дойдут до пользователей.
Обнаружение задает более узкий вопрос, чем вопрос о том, почему модели галлюцинируют: можно ли доверять полученному результату? Надежные системы обычно сочетают в себе несколько методов, описанных ниже. Проверки самосогласованности основаны на простом наблюдении. Когда модель знает факт, повторные выборки имеют тенденцию совпадать, тогда как сфабрикованные детали имеют тенденцию различаться. SelfCheckGPT (Манакул и др., 2023) формализовал это. Он генерирует несколько ответов и измеряет, поддерживается ли каждое предложение основного ответа остальными. Метод не требует внешнего источника. Недостатками являются дополнительные вызовы модели и ошибки, которые она пропускает, когда модель каждый раз повторяет один и тот же неправильный ответ. Проверки на основе источника сравнивают выходные данные со ссылочным текстом, что подходит для систем с расширенным поиском. Ответ разбивается на атомарные утверждения, и каждое утверждение проверяется на предмет соответствия извлеченным отрывкам. Следствие означает, что отрывок логически поддерживает утверждение. В тесте используется либо модель вывода естественного языка, либо LLM. Эти проверки измеряют верность источникам, что не то же самое, что истинность, если источники неверны. Сигналы неопределенности используют собственные вероятности модели. Низкая вероятность токена или высокая энтропия в диапазонах ключей, таких как имена, числа и даты, могут указывать на угадывание. Семантическая энтропия (Фаркуар и др., опубликованная в журнале Nature в 2024 году) группирует ответы по значению перед измерением неопределенности, поэтому разные формулировки одного и того же ответа не считаются разногласиями. Сигналам уровня токена необходим доступ к вероятностям журнала, что ограничивается некоторыми API. Модели-судьи просят сильного магистра права оценить ответ на предмет необоснованных утверждений, обычно с указанием источников и рубрики. Они хорошо масштабируются, но у судей есть свои предубеждения и процент ошибок, поэтому сверяйте их с человеческими ярлыками. Распространенным заблуждением является то, что вопрос модели: «Вы уверены?» надежно ловит ошибки. Модели могут отказываться от правильных ответов или защищать неправильные. Структурированные проверки более надежны.
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Обнаружение становится стандартным уровнем в продуктах искусственного интеллекта, а платформы оценки и облачные провайдеры теперь предлагают проверки обоснованности и достоверности. Продолжаются исследования по распознаванию признаков неопределенности по внутренним активациям модели и по обучению моделей воздержанию или заявлению калиброванной уверенности. Ни один метод не является полным. Проверки заземления не могут выявить неправильные источники, а сигналы неопределенности пропускают достоверные ошибки. Вероятным направлением является многоуровневая защита, а не одиночный детектор. Сначала идут дешевые детерминистические проверки, затем обоснованная проверка с человеческим анализом для получения результатов с высокими ставками.
Инструмент юридического исследования извлекает каждую цитату из проекта ответа и проверяет, существует ли каждая из них в базе данных прецедентного права, прежде чем показывать ответ.
Бот поддержки, использующий поиск, разбивает свой ответ на отдельные претензии и сверяет каждое из полученных справочных статей. Претензии без обоснования заменяются пометкой о том, что их не удалось подтвердить.
Система задает один и тот же фактический вопрос пять раз с включенной случайностью выборки. Если возвращенные даты рождения различаются, ответ помечается как низкий уровень достоверности.
Каждый день модель оценки оценивает выборку сгенерированных резюме по критерию неподтвержденных утверждений, и человек просматривает все, что она отмечает.
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Обнаружение галлюцинаций — это набор методов для пометки результатов модели, которые являются ложными или не подтверждаются доказательствами. Основными методами являются выборка нескольких ответов и проверка их согласия, проверка того, вытекает ли каждое утверждение из исходных документов, считывание сигналов неопределенности, таких как вероятности токенов, и обращение к второй модели в качестве судьи. Это важно, поскольку галлюцинированный текст часто читается бегло и уверенно, поэтому производственные системы нуждаются в автоматических проверках, прежде чем ошибки дойдут до пользователей.
Согласие между образцами является показателем знаний. Детали, которые меняются от образца к образцу, позволяют предположить, что модель угадывает.
Если модель уверенно и последовательно ошибается, ее выборки совпадают и проверка проходит. Генерация нескольких выборок также увеличивает стоимость.
Эти проверки проверяют, поддерживаются ли утверждения ссылочным текстом. Если ссылка неверна, верный ответ все равно может быть ложным.
Группировка по смыслу означает, что разные формулировки одного и того же ответа не считаются несогласием. Только действительно разные ответы повышают оценку неопределенности.
Нужную цитату можно механически сверить с первоисточником, который отлавливает проверяющих, придумывающих их обоснование.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Оптимизация второго порядка и методы Ньютона
Технический