ДалееСледующее руководство
Калифорния SB 53 и прозрачность Frontier AI
Общество
РУКОВОДСТВО ПО ОБЩЕСТВУ
Передовая система безопасности ИИ, такая как политика ответственного масштабирования, представляет собой опубликованное обязательство лаборатории ИИ проверять свои модели на наличие опасных возможностей.
Если модель пересекает установленный порог, лаборатория обязуется добавить более сильные меры безопасности или не развертывать или не проводить дальнейшее обучение до тех пор, пока эти меры защиты не будут установлены. Эти структуры важны, потому что в настоящее время они являются основным способом управления наиболее продвинутыми моделями ИИ с учетом катастрофических рисков, хотя большинство из них являются добровольными и написаны самими лабораториями.
Anthropic опубликовала первую политику ответственного масштабирования в сентябре 2023 года. Она ввела уровни безопасности ИИ (ASL), в общих чертах смоделированные на уровнях биобезопасности, где более высокие уровни требуют более строгой безопасности и гарантий развертывания. В более поздней версии, выпущенной в октябре 2024 года, политика была пересмотрена с точки зрения пороговых значений возможностей и необходимых мер безопасности, а также описана роль ответственного специалиста по масштабированию. OpenAI выпустила свою систему готовности в качестве бета-версии в декабре 2023 года. Она оценивала риски в отслеживаемых категориях, первоначально включая угрозы ХБРЯ, кибербезопасность, убеждение и автономию моделей. В редакции 2025 года она была реорганизована вокруг пороговых значений высоких и критических возможностей, а убеждение исключено из отслеживаемой категории. Google DeepMind опубликовал свою концепцию пограничной безопасности в мае 2024 года и с тех пор пересматривал ее. Он определяет уровни критических возможностей (CCL), которые запускают планы реагирования. На саммите AI в Сеуле в мае 2024 года 16 компаний подписали Frontier AI Safety Commitments. Они согласились опубликовать основы безопасности, установить пороговые значения недопустимого риска и не разрабатывать и не внедрять модель, если ее риски не могут быть ниже этих пороговых значений. Многие концепции были опубликованы перед Парижским саммитом по действиям в области искусственного интеллекта в феврале 2025 года. Критики указывают на несколько слабых мест. Лаборатории устанавливают свои собственные пороговые значения и могут самостоятельно их пересматривать. Такая формулировка, как «значимый подъем», оставляет место для интерпретации. Внешняя проверка ограничена, а коммерческая конкуренция дает лабораториям стимул щедро читать результаты. Распространенным заблуждением является то, что эти рамки являются законами. Большинство из них являются добровольными, хотя ситуация меняется. Калифорнийский закон SB 53 требует от крупных передовых разработчиков публиковать такую структуру, а Кодекс практики искусственного интеллекта общего назначения ЕС, добровольный путь к подтверждению соответствия Закону об искусственном интеллекте, требует от подписавших сторон принять его.
Катастрофический и повседневный вред ИИ зависит от того, кто понимает риски и может действовать.
Общественная и профессиональная грамотность определяет, возможна ли с политической точки зрения сильная политика безопасности.
Четкие объяснения уменьшают влияние шумихи, лабораторного пиара и расплывчатого этического театра.
Рамочные программы переходят от добровольных обязательств к нормативным ожиданиям. Калифорния теперь требует, чтобы крупные застройщики публиковали их, Кодекс практики ЕС требует их принятия, и за этим могут последовать другие юрисдикции. Открытые вопросы включают в себя: кто проверяет соответствие требованиям, как стандартизируются пороговые значения в лабораториях и могут ли оценки соответствовать быстро совершенствующимся агентным системам. Независимые органы тестирования, в том числе государственные институты искусственного интеллекта, могут взять на себя более важную роль в проверке заявлений лабораторий. Центральное напряжение, скорее всего, сохранится: лаборатории разрабатывают правила, по которым их оценивают, что делает важными прозрачность и внешний контроль.
Перед выпуском в лаборатории проверяют, дает ли новая модель значимую поддержку тем, кто пытается приобрести биологическое оружие. Если оно превышает пороговое значение, перед развертыванием лаборатория добавляет более строгие фильтры неправомерного использования и меры безопасности.
В мае 2025 года Anthropic заявила, что активировала развертывание ASL-3 и защиту безопасности для Claude Opus 4 в качестве меры предосторожности, поскольку не может исключить, что модель достигла соответствующего порога возможностей.
Структура готовности OpenAI предписывает консультативной группе по безопасности проверять отчеты о возможностях и консультировать руководство о том, адекватны ли меры безопасности перед выпуском.
Лаборатория, отслеживающая автономную репликацию или ускорение исследований ИИ, проводит агентные оценки. Они проверяют, может ли модель выполнять длинные многоэтапные задачи без помощи человека.
Относитесь к экзистенциальному риску как к научной фантастике, в то время как возможности растут.
Сбивает с толку безопасность поверхности продукта и выравнивание при высокой автономности.
Оставляя неанглоязычную и неспециалистскую аудиторию только с некачественными источниками.
Отдельные риски повреждения продукта, неправильного использования и потери контроля/перекоса.
Спросите, какие доказательства могут изменить ваше мнение о сроках и серьезности.
Предпочитайте первоисточники и конкретные оценки маркетинговым заявлениям.
Определите один путь действий: карьера, политика, финансирование или навыки, а не только осведомленность.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Передовая система безопасности ИИ, такая как политика ответственного масштабирования, представляет собой опубликованное обязательство лаборатории ИИ проверять свои модели на наличие опасных возможностей. Если модель пересекает установленный порог, лаборатория обязуется добавить более сильные меры безопасности или не развертывать или не проводить дальнейшее обучение до тех пор, пока эти меры защиты не будут установлены. Эти структуры важны, потому что в настоящее время они являются основным способом управления наиболее продвинутыми моделями ИИ с учетом катастрофических рисков, хотя большинство из них являются добровольными и написаны самими лабораториями.
Эти структуры построены на обязательствах «если-то», которые связывают пороговые значения возможностей с необходимыми гарантиями.
Политика ответственного масштабирования Anthropic, принятая в сентябре 2023 года, ввела ASL, в общих чертах смоделированных на уровнях биобезопасности.
DeepMind использует уровни критических возможностей (CCL), которые запускают планы реагирования при их достижении.
Обязательства по безопасности Frontier AI представляли собой добровольные обязательства опубликовать рамки и не продолжать работу, если риски не удастся удержать ниже пороговых значений.
В новой версии структура была реорганизована вокруг высоких и критических порогов, а убеждение было удалено из отслеживаемой категории.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Калифорния SB 53 и прозрачность Frontier AI
Общество