ДаліНаступний посібник
California SB 53 і Frontier AI Transparency
суспільство
Суспільство GUIDE
Передова структура безпеки штучного інтелекту, як-от політика відповідального масштабування, є опублікованим зобов’язанням лабораторії штучного інтелекту перевірити свої моделі на наявність небезпечних можливостей.
Якщо модель перетинає встановлений поріг, лабораторія бере на себе зобов’язання додати сильніші засоби захисту або не розгортати чи не навчати далі, доки ці заходи не будуть введені. Ці рамки важливі, оскільки наразі вони є основним способом керування найдосконалішими моделями штучного інтелекту для запобігання катастрофічним ризикам, хоча більшість із них є добровільними та написані самими лабораторіями.
Anthropic опублікував першу Політику відповідального масштабування у вересні 2023 року. У ній були представлені рівні безпеки штучного інтелекту (ASL), приблизно змодельовані на рівні біобезпеки, де вищі рівні вимагають більшої безпеки та гарантій розгортання. У пізнішій версії, опублікованій у жовтні 2024 року, політика була переформульована з точки зору порогових значень можливостей і необхідних заходів захисту, а також описана роль відповідального спеціаліста з масштабування. OpenAI випустив свою бета-версію Preparedness Framework у грудні 2023 року. Вона оцінювала ризик у відстежуваних категоріях, спочатку включаючи ХБРЯ загрози, кібербезпеку, переконання та автономію моделі. Редакція 2025 року реорганізувала його навколо високих і критичних порогів можливостей і відмовилася від переконання як відстежуваної категорії. Google DeepMind опублікував свої Frontier Safety Framework у травні 2024 року і з тих пір переглянув їх. Він визначає критичні рівні можливостей (CCL), які запускають плани реагування. На Сеульському саміті з питань штучного інтелекту в травні 2024 року 16 компаній підписали Зобов’язання щодо безпеки ШІ Frontier. Вони погодилися опублікувати рамки безпеки, встановити порогові значення для неприйнятного ризику та не розробляти та не розгортати модель, якщо її ризики не можуть бути нижчими за ці порогові значення. Багато фреймворків було опубліковано до Паризького саміту AI Action Summit у лютому 2025 року. Критики вказують на кілька недоліків. Лабораторії пишуть власні порогові значення та можуть переглядати їх самостійно. Таке формулювання, як «значуще піднесення», залишає простір для тлумачення. Зовнішня перевірка обмежена, а комерційна конкуренція дає лабораторіям стимул щедро читати результати. Поширеною помилкою є те, що ці рамки є законами. Більшість з них добровільні, хоча це змінюється. Каліфорнійський SB 53 вимагає від великих розробників, які працюють на кордоні, опублікувати таку структуру, а Кодекс практики ЄС загального призначення щодо штучного інтелекту, який є добровільним способом підтвердження дотримання Закону про штучний інтелект, просить підписантів прийняти таку структуру.
Катастрофічні та щоденні збитки ШІ залежать від того, хто розуміє ризики та хто може діяти.
Громадська та професійна грамотність визначає, чи політично можлива сильна політика безпеки.
Чіткі пояснення зменшують захоплення ажіотажем, лабораторним піаром і нечітким етичним театром.
Рамки переходять від добровільних зобов’язань до регулятивних очікувань. Каліфорнія тепер вимагає від великих прикордонних розробників публікувати їх, Кодекс практики ЄС просить підписантів прийняти їх, і інші юрисдикції можуть послідувати. Відкритими питаннями є: хто перевіряє відповідність вимогам, як стандартизуються порогові значення в лабораторіях і чи можуть оцінки йти в ногу з агентськими системами, що швидко вдосконалюються. Незалежні органи тестування, включно з державними інститутами ШІ, можуть взяти на себе більшу роль у перевірці заяв лабораторії. Головна напруга, ймовірно, залишиться: лабораторії розробляють правила, за якими їх оцінюють, що робить прозорість і зовнішній контроль важливими.
Перед випуском лабораторія перевіряє, чи дає нова модель суттєвий ефект тим, хто намагається придбати біологічну зброю. Якщо він перевищить порогове значення, лабораторія додає суворіші фільтри зловживання та захист перед розгортанням.
У травні 2025 року Anthropic заявив, що активував розгортання ASL-3 і захист безпеки для Claude Opus 4 як запобіжний захід, оскільки не міг виключити, що модель досягла відповідного порогу можливостей.
Структура готовності OpenAI керує Консультативною групою з безпеки переглядати звіти про можливості та давати поради керівництву щодо того, чи достатні гарантії перед випуском.
Лабораторія, яка відстежує автономну реплікацію або прискорення досліджень штучного інтелекту, виконує агентські оцінки. Вони перевіряють, чи може модель виконувати довгі багатоетапні завдання без допомоги людини.
Розгляд екзистенціального ризику як наукової фантастики, а здібності складені.
Плутання безпеки поверхні продукту з вирівнюванням за високої автономності.
Залишаючи неангломовну та неекспертну аудиторію лише низькоякісними джерелами.
Розділіть ризики шкоди продукту, неправильного використання та втрати контролю/зміщення.
Запитайте, які докази змінили б ваше уявлення про терміни та серйозність.
Віддавайте перевагу першоджерелам і конкретним оцінкам над маркетинговими заявами.
Визначте один шлях дій: кар’єра, політика, фінансування чи навички — не лише обізнаність.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Передова структура безпеки штучного інтелекту, як-от політика відповідального масштабування, є опублікованим зобов’язанням лабораторії штучного інтелекту перевірити свої моделі на наявність небезпечних можливостей. Якщо модель перетинає встановлений поріг, лабораторія бере на себе зобов’язання додати сильніші засоби захисту або не розгортати чи не навчати далі, доки ці заходи не будуть введені. Ці рамки важливі, оскільки наразі вони є основним способом керування найдосконалішими моделями штучного інтелекту для запобігання катастрофічним ризикам, хоча більшість із них є добровільними та написані самими лабораторіями.
Ці структури побудовані на зобов’язаннях якщо-тоді, які прив’язують порогові значення можливостей до необхідних гарантій.
Політика відповідального масштабування Anthropic від вересня 2023 року запровадила ASL, приблизно змодельовані на рівні біобезпеки.
DeepMind використовує критичні рівні можливостей (CCL), які запускають плани реагування, коли вони досягнуті.
Зобов’язання безпеки Frontier AI були добровільними зобов’язаннями публікувати рамки та не продовжувати, якщо ризики не можуть бути нижчими за порогові значення.
Перегляд реорганізував структуру навколо високого та критичного порогів і вилучив переконання як відстежувану категорію.
Продовжуйте вчитися
Інші посібники, вибрані для цієї теми
ДаліНаступний посібник
California SB 53 і Frontier AI Transparency
суспільство