РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Уровень галлюцинаций в легальных инструментах искусственного интеллекта

Независимое тестирование показало, что инструменты правовых исследований ИИ, построенные на технологии дополненной генерации данных (RAG), по-прежнему дают неверные или неподтвержденные ответы значительную часть времени.

  • 4 минуты чтения
  • Последнее обновление
На этой странице4 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее уровня галлюцинаций в легальных инструментах искусственного интеллекта
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Исследование, проведенное в Стэнфорде в 2024 году, выявило галлюцинации более чем в одном из шести запросов даже на самый эффективный коммерческий инструмент. Это важно, потому что производители позиционируют эти инструменты как средства, позволяющие избежать галлюцинаций, а юристы, которые полагаются на них, по-прежнему несут ответственность за каждое обращение, которое они подают.

Глубокое погружение

Два исследования, проведенные в Стэнфорде, сформировали дискуссию. Первая, «Большие юридические фикции» (2024 г.), авторы Мэтью Даля, Варуна Магеша, Мирака Сузгуна и Дэниела Хо, тестировала чат-ботов общего назначения на проверяемые вопросы о делах федерального суда. Было обнаружено, что уровень галлюцинаций на эти вопросы составляет от 69 до 88 процентов. Модели также были склонны принимать ложные предпосылки, заложенные в вопросы. Поставщики коммерческих юридических услуг утверждали, что их инструменты позволяют избежать этой проблемы за счет генерации с расширенным поиском, которая основывает ответы на реальных юридических базах данных. В некоторых маркетинговых целях использовались такие фразы, как «без галлюцинаций». В 2024 году исследователи из Стэнфордской лаборатории RegLab и Института человеко-ориентированного искусственного интеллекта проверили это утверждение в исследовании под названием «Без галлюцинаций?» Они выполнили более 200 юридических запросов через Lexis+ AI, Westlaw AI-Assisted Research и Ask Practice Law AI, используя GPT-4 для сравнения. Они считали галлюцинацией ответ, если он был неправильным или необоснованным. «Ошибочно обосновано» означает, что ссылка на реальный источник не подтверждает это утверждение. Lexis+ AI работал лучше всего, но все же галлюцинировал более чем в 17 процентах запросов. Инструмент Уэстлоу галлюцинировал примерно на треть. Спросите практическое право ИИ часто давал неполные ответы. Ранняя версия статьи подверглась критике, поскольку у исследователей сначала не было доступа к исследовательскому инструменту Вестлоу; позже они протестировали его и исправили статью. Извлечение уменьшает количество ошибок, но не удаляет их по нескольким причинам. Программа поиска может найти документы, в которых слова совпадают с запросом, но не имеют юридической силы. Он может пропустить контролирующий орган, вывести дело из неправильной юрисдикции или заменить версию правила. Затем модель может неправильно прочитать или проигнорировать то, что было получено, смешать источники вместе или принять ложную предпосылку. Распространенным заблуждением является то, что правильно выглядящая цитата означает правильный ответ. Необоснованная категория показывает, что реальная цитата может подтверждать ложное утверждение.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее уровня галлюцинаций в легальных инструментах искусственного интеллекта

Поставщики обновили свои продукты после исследований 2024 года, поэтому конкретные показатели ошибок могут не соответствовать текущим версиям. Вот почему повторное независимое тестирование имеет большее значение, чем какое-либо отдельное число. Усилия по сравнительному анализу со стороны третьих сторон и самих юридических фирм становятся все более распространенными. Лучшие цитаторы, рабочие процессы в стиле агентов, проверяющие собственные цитаты, и более основательное обоснование могут уменьшить количество ошибок. Пока ничто не указывает на то, что извлечение данных полностью удалит их. Суды продолжают рассматривать заявления с сфабрикованными или искаженными полномочиями, а некоторые из них уже наложили санкции. В обозримом будущем проверка человеком каждого цитируемого авторитетного источника останется профессиональной обязанностью, что бы ни заявлял поставщик.

Реальная реализация

Сотрудник спрашивает исследовательский инструмент, почему суд вынес такое решение в деле, которое на самом деле пошло по другому пути. Инструмент принимает ложную предпосылку и объясняет вымышленное решение, ссылаясь на реальное мнение.

Инструмент возвращает реальное апелляционное дело с точной ссылкой на предложение, которое никогда не рассматривалось в деле. Это «необоснованный» ответ, который выглядит заслуживающим доверия, пока кто-нибудь не прочитает мнение.

Инструмент исследования цитирует решение, которое позже было отменено, поскольку оно извлекло старое мнение и не проверило его более позднюю историю.

Юридический отдел тестирует двух поставщиков по собственному набору из 100 вопросов с известными ответами. Он записывает, существует ли каждая цитата, подтверждает ли она утверждение и является ли ответ полным.

Риски и ограничения

  • Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

  • Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

  • Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

  1. Перед развертыванием определите выходной формат, тон и стандарты качества.

  2. Наземные ответы с помощью надежных источников, когда точность имеет значение.

  3. Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

  4. Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Каков уровень галлюцинаций в легальных инструментах искусственного интеллекта?

Независимое тестирование показало, что инструменты правовых исследований ИИ, построенные на технологии дополненной генерации данных (RAG), по-прежнему дают неверные или неподтвержденные ответы значительную часть времени. Исследование, проведенное в Стэнфорде в 2024 году, выявило галлюцинации более чем в одном из шести запросов даже на самый эффективный коммерческий инструмент. Это важно, потому что производители позиционируют эти инструменты как средства, позволяющие избежать галлюцинаций, а юристы, которые полагаются на них, по-прежнему несут ответственность за каждое обращение, которое они подают.

Как Стэнфордский университет «Без галлюцинаций?» исследование определяет галлюцинацию?

В исследовании было учтено два типа ошибок: неверные утверждения и утверждения, подтвержденные цитатой, которая на самом деле их не подтверждает.

Что такое «необоснованный» ответ с точки зрения Стэнфордского исследования?

Неверно обоснованный ответ указывает на подлинный авторитет, но этот авторитет не подтверждает то, что говорится в ответе. Это делает его более надежным, чем он есть на самом деле.

Какой инструмент показал лучшие результаты в Стэнфордском тесте 2024 года, но все же вызывал галлюцинации более чем в 17 процентах запросов?

Lexis+ AI показал лучшие результаты, но все же галлюцинировал более чем в 17 процентах запросов. Инструмент Уэстлоу галлюцинировал примерно на треть.

Какой диапазон галлюцинаций обнаружила «Большая юридическая фикция» для чат-ботов общего назначения по проверяемым вопросам федерального суда?

Исследование показало, что обычные чат-боты галлюцинируют от 69 до 88 процентов времени, отвечая на эти конкретные, поддающиеся проверке вопросы.

Почему на этапе поиска может быть обнаружен неправильный авторитет, даже если в базе данных есть правильный?

Ретриверы оценивают близость в формулировке или значении. Несогласие, краткое изложение аргументов другой стороны или дело из неправильной юрисдикции могут иметь высокий рейтинг, не являясь контролирующим органом.