Что случилось
Препринт arXiv представляет обучение с подкреплением на основе сертификации, или CDRL, метод использования структурированной обратной связи от инструментов символического рассуждения во время поиска научных гипотез. Когда модель-кандидат нарушает ограничения предметной области, инструменты создают сертификаты, идентифицирующие действия, связанные с сбоем. CDRL превращает эти сертификаты в ограничения многократного использования, предназначенные для предотвращения повторного поиска системой одинаковых недействительных кандидатов.
В статье CDRL представлен как ответ на ограничение традиционного обучения с подкреплением для научных открытий. В описании источника стандартные подходы используют скалярное вознаграждение: кандидат либо получает числовой сигнал, отражающий его результат, но этот сигнал предлагает ограниченную информацию о том, почему кандидат потерпел неудачу. В пространстве комбинаторных гипотез это может привести к тому, что агент будет повторно проверять недопустимые области, поскольку он не сохраняет структурированное объяснение ошибки.
CDRL добавляет в цикл поиска инструменты символического рассуждения. Когда предлагаемая модель аромата нейтрино нарушает ограничение предметной области, инструменты генерируют сертификат, который определяет действия, ответственные за нарушение. Платформа преобразует этот сертификат в ограничение многократного использования. Предполагаемый эффект шире, чем отклонение одного кандидата: ограничение может исключить класс связанных недействительных решений и перенаправить последующие исследования на регионы, которые с большей вероятностью будут удовлетворять правилам.
Авторы оценивают подход к открытию модели аромата нейтрино в теоретической физике элементарных частиц. Источник сообщает, что соответствующее пространство гипотез содержит более 10^26 возможных моделей, и сравнивает CDRL с современным методом обучения с подкреплением, ранее использовавшимся для этой задачи. В трех теоретических пространствах в статье сообщается о более высоких показателях достоверных моделей в 1,95 раза, о более высоких показателях нейтринных моделей до 6,33 раз и о меньшем количестве оцененных кандидатов до четырех раз. Это утверждения, сделанные в препринте; предоставленный источник не проверяет их независимо и не предоставляет лежащие в их основе таблицы и подробности эксперимента.
В работу также добавлен второй этап, призванный обеспечить возможность повторного использования поисковых знаний. Авторы извлекают 40 интерпретируемых правил из траекторий поиска с помощью апостериорной структуры дерева решений. Затем они повторно используют эти правила в качестве мягких ограничений, то есть указаний, которые влияют на исследование, но не описываются абстрактно как абсолютный запрет. В статье сообщается о двукратном увеличении скорости открытия действительных моделей и трехкратном увеличении количества открытий нейтринных моделей во всех трех теоретических пространствах при повторном использовании этих правил.
Подробности об источнике: arxiv.org ↗
Почему это важно
В документе сообщается, что CDRL обнаружил действительные модели в 1,95 раза быстрее, чем предыдущий современный подход обучения с подкреплением, а модели нейтрино - в 6,33 раза быстрее, оценивая при этом в четыре раза меньше кандидатов. Если метод выйдет за рамки этого тестового примера, он может сделать поиск с помощью ИИ в больших, ограниченных правилами научных пространствах более эффективным и более интерпретируемым.
Практическое значение сосредоточено в стратегии поиска, а не в новом продукте ИИ, ориентированном на потребителя. Многие задачи научных открытий требуют изучения комбинаций предположений, параметров или структур при соблюдении жестких правил предметной области. Источник утверждает, что объяснения неудач могут быть более полезными, чем одно число наград, поскольку они показывают, какие решения сделали кандидата недействительным, и позволяют системе впоследствии избежать соответствующих ошибок.
Сообщаемое о сокращении числа оцениваемых кандидатов имеет значение, поскольку научные поиски могут стать дорогостоящими по мере увеличения пространства их гипотез. В тестовом примере статьи пространство превышает 10^26 возможных моделей, поэтому даже метод, который выбирает лишь небольшую часть возможностей, должен тщательно распределять свои оценки. Более высокий процент действительных моделей или нейтринных моделей на одного кандидата может помочь исследователям тратить больше вычислений на кандидатов, отвечающих базовым ограничениям, хотя источник не указывает абсолютное количество найденных моделей или общую стоимость вычислений.
Интерпретируемость — еще одно заявленное преимущество. Извлеченные правила дерева решений представлены как способ выявить закономерности в траекториях поиска, а не оставлять стратегию системы полностью неявной. Если эти правила точно описывают полезную структуру, исследователи смогут проверять их, повторно использовать или оспаривать. Это может сделать научный поиск с помощью ИИ более простым для проверки, чем тот, который руководствуется только непрозрачными обновлениями вознаграждений. Источник не устанавливает, что правила представляют собой научно правильные объяснения; он говорит, что это интерпретируемые правила, извлеченные после поиска.
Более широкое утверждение статьи заключается в том, что CDRL может обеспечить общую основу для открытия научных моделей. Эта возможность актуальна для исследований ИИ, поскольку она сочетает в себе обучение с подкреплением, символическое рассуждение и ограничения, специфичные для предметной области. Но представленные здесь доказательства остаются ограниченными. Результаты получены в результате открытия модели аромата нейтрино в трех теоретических пространствах, и источник не сообщает о приложениях к химии, материалам, биологии или экспериментальным данным. Таким образом, это поддерживает демонстрацию потенциально полезного метода, а не вывод о том, что ИИ в значительной степени автоматизировал научные открытия.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Что посмотреть дальше
Главный вопрос заключается в том, распространяются ли сообщаемые достижения за пределы трех теоретических пространств, оцениваемых в статье. Источник не предоставляет в своей абстрактной форме точные пространства, размеры выборки, оценки неопределенности, требования к вычислениям или доказательства того, что обнаруженные правила применимы к другим научным проблемам. Работа представляет собой препринт arXiv, и источник сообщает о результатах вычислений, а не об экспериментальном подтверждении новой теории нейтрино.
Репликация должна быть первым испытанием. Источник сообщает об относительных улучшениях — до 1,95 раза, в 6,33 раза, в два и три раза в зависимости от показателя и процедуры — но в аннотации не указывается количество прогонов, дисперсия между прогонами, статистическая значимость или точная базовая конфигурация. Эти детали необходимы для того, чтобы судить о том, являются ли выгоды устойчивыми или сосредоточены в определенных условиях поиска.
Исследователям также следует изучить, сколько человеческих и вычислительных ресурсов требует этот метод. CDRL зависит от инструментов символического рассуждения, способных создавать сертификаты, привязанные к ограничениям домена. Источник не сообщает, как создаются эти инструменты, какой объем знаний в предметной области необходимо закодировать и дорого ли создание сертификатов. Если каждая новая научная область требует обширной ручной формализации, метод может быть мощным, но трудным для передачи.
Идентичность и структура трех оцениваемых теоретических пространств не указаны в прилагаемом аннотации, поэтому невозможно сказать, представляют ли они существенно разные задачи поиска или близкородственные варианты. В документе также не говорится, передаются ли мягкие ограничения, извлеченные из одного пространства в другое, остаются ли они полезными при изменении пространства или как система обрабатывает неполные или спорные научные правила.
Наконец, результаты поиска не следует путать с экспериментальным подтверждением. В источнике описывается вычислительное открытие потенциальных моделей ароматов нейтрино; он не сообщает об измерениях детектора, лабораторных испытаниях или принятии новой физической теории. Важные неизвестные включают в себя, делают ли какие-либо кандидаты отличительные, поддающиеся проверке прогнозы, выдерживают ли эти прогнозы независимую теоретическую проверку и сохраняется ли заявленный прирост эффективности, когда метод применяется к научным проблемам, ограничения которых менее формальны или менее полны.