Что случилось
В исследовательском документе, опубликованном 5 августа, применяется метод образовательного тестирования для измерения того, что фиксируют тесты безопасности ИИ, выбора небольших наборов полезных подсказок и аудита изменений в поведении модели.
Два независимых исследователя и два исследователя, связанных с Британским институтом безопасности искусственного интеллекта, оценили 192 модели чата по восьми критериям, охватывающим отказ в вредоносных запросах, чрезмерный отказ в безобидных запросах, контекстный вред и правдивость. Полный пакет перед предварительной обработкой содержал 5255 подсказок; анализ сохранил 5067 после удаления неоцененных ответов и элементов, которые не отличались от протестированных моделей.
Команда рассматривала модели как участников тестирования, а контрольные подсказки — как тестовые задания, используя теорию ответа на задания, чтобы оценить, какие подсказки были трудными, а какие лучше всего разделяли модели. В своем основном факторном анализе трехфакторное решение, суммированное как строгость отказа, правдивость и контекстуальный вред, объяснило 77% различий в способностях модели по сравнению с 47% для одного фактора.
В результате 20 отложенных оценок три фиксированных теста с 25 подсказками восстановили эти три фактора, используя менее 2% пакета. Для HarmBench, SORRY-Bench и OR-Bench-Hard примерно 10 адаптивно выбранных подсказок воспроизвели полный рейтинг с корреляцией от 0,92 до 0,94 и сократили количество подсказок на 97–99%; преимущество уменьшалось по мере роста бюджета испытаний.
Сжатие — это не просто случайная выборка. Теория ответов на задания оценивает, насколько сложна каждая подсказка и насколько хорошо она разделяет модели с разными шаблонами ответов, а затем выбирает задания, сохраняющие структуру более крупного теста. Авторы сравнили фиксированные краткие формы с адаптивным отбором и проводили оценки, а не измеряли только данные, используемые для выбора подсказок. Этот подход поддерживает более узкое утверждение о том, что некоторые существующие эталонные рейтинги могут быть эффективно воспроизведены; он не показывает, что тест из 10 или 25 пунктов может обнаружить совершенно новый вид отказа.
Подробности об источнике: Rivera and colleagues' research paper on arXiv ↗
Почему это важно
Исследование предполагает, что более тщательно подобранные подсказки могут удешевить частые проверки безопасности ИИ, не притворяясь, что каждый тест измеряет один универсальный показатель безопасности.
Более дешевые тесты могут позволить разработчикам, небольшим лабораториям и независимым оценщикам проверять больше версий модели во время обучения, точной настройки, квантования и внесения изменений в систему. Результатом является эффективное воспроизведение существующих эталонных измерений, а не расширение того, что эти тесты могут обнаружить.
Факторный анализ также выявляет компромисс между оценками. Показатели, вознаграждающие за отказ, могут пересекаться друг с другом, в то время как ориентир, позволяющий избежать ненужных отказов, вознаграждает противоположное поведение. Усреднение их без объяснения весов может скрыть, стала ли модель более безопасной, просто более ограничительной или менее полезной для мягких запросов.
В документе также проверялись методы аудита «черного ящика» на предмет намеренно спровоцированного поведения «мешков с песком». Проверка шаблона реагирования выявила выборочную низкую производительность, но не выявила наиболее равномерную низкую производительность; добавление проверки исторических способностей повысило комбинированное обнаружение до 94–97% в смоделированных случаях. Это поддерживает многоуровневый аудит, а не полагаться на единую оценку.
Для разработчиков оперативное значение имеет частота. Более короткую оценку можно повторить после системного изменения, прохода квантования, точной настройки, обновления инструмента или пересмотра политики безопасности, не расходуя каждый раз бюджет полного теста. Но результат полезен только в том случае, когда команды проводят периодический аудит исходного пакета, чередуют отложенные запросы и исследуют неожиданные изменения вместо того, чтобы оптимизировать непосредственно для сжатого теста. В противном случае дешевый чек может стать еще одной мишенью для переоснащения.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
Что посмотреть дальше
Следите за независимым репликацией, проверкой будущих семейств моделей и доказательствами того, что сокращенные тесты предсказывают поведение, выходящее за рамки тестов, для воспроизведения которых они были разработаны.
Это новый препринт, а не законченный вердикт рецензента. В анализе скрытой структуры использовалось 134 модели, которые, как отмечают авторы, являются небольшими по общепринятым психометрическим стандартам, а альтернативный метод извлечения сохранил два фактора вместо трех. Названия факторов представляют собой эмпирические обобщения, а не подтвержденные определения безопасности.
Каждая модель давала один ответ на каждое доступное приглашение через OpenRouter, и каждый тест использовал свой предписанный автоматический судья. Полученные в результате короткие тесты могут унаследовать недостатки исходных подсказок, правил оценки, языкового охвата и судей; авторы прямо заявляют, что сжатие не показывает, что эталонный тест предсказывает безопасность развертывания или остается информативным для будущих моделей.
Использованные тесты с мешками с песком предлагали модельные организмы, а не модели, точно настроенные для уклонения от оценки, которые, возможно, легче обнаружить. Проверки API устанавливают непрерывность поведения, а не идентичность скрытых весов модели, и в исследовании не проверялся злоумышленник, специально обученный для борьбы с методами аудита.
Самая важная граница в статье проходит между эффективностью измерений и обеспечением безопасности. Краткая форма может оценить скрытые факторы, присутствующие в исходном тесте, но она наследует язык, оценку, структуру подсказок и слепые зоны этого теста. Будущие оценки должны проверять многоязычные подсказки, агентов с инструментами, долгие разговоры, состязательно настроенные модели и независимые человеческие суждения. Они также должны сообщать, когда сжатая оценка становится нестабильной, потому что четкая корреляция на устаревших данных может скрыть сбой в следующем семействе моделей.
Из этих ограничений вытекает практическое правило принятия: используйте сжатые тесты в качестве контрольных показателей, а не вердиктов. Команды могут запускать их часто, чтобы выявлять регрессии, а затем передавать изменения в полный тест и проверку человеком, когда краткая форма неожиданно перемещается. Собственные данные исследования подтверждают этот многоуровневый рабочий процесс, поскольку факторная структура была получена на основе конкретных подсказок, судей и результатов модели. Публикация выбранных элементов, кода выбора, отложенных результатов и истории версий позволит независимым оценщикам проверить, остаются ли короткие тесты информативными после того, как их увидят разработчики и после того, как новые семейства моделей изменят распределение ответов.
Та же прозрачность имеет значение при обновлении модели. Короткий тест, откалиброванный на одном поколении, может оказаться слишком простым, слишком узким или случайно совпадать с новым системным приглашением. Команды должны сохранять предыдущие версии, сообщать об изменении предмета или судьи и сообщать о доверительных интервалах вместо представления сжатого рейтинга как точного показателя безопасности. Эти методы превращают результаты работы по эффективности в проверяемую программу мониторинга, сохраняя при этом первоначальный эталонный показатель для более глубокого анализа.