Суспільство GUIDE

Відмова від навчальних наборів даних AI

Творці можуть зменшити використання своєї роботи для навчання штучному інтелекту в майбутньому, заблокувавши сканери штучного інтелекту в robots.txt, вимкнувши дозволи на навчання в налаштуваннях платформи та зареєструвавшись у службах відмови, а також можуть перевірити деякі публічні набори даних за допомогою інструментів пошуку.

  • 4 хвилини читання
  • Останнє оновлення
На цій сторінці4 хвилини читання
  1. Огляд
  2. Глибоке занурення
  3. Стратегічний вплив
  4. Майбутнє відмови від навчальних наборів даних ШІ
  5. Реалізація в реальному світі
  6. Ризики та огорожі
  7. Дорожня карта впровадження
  8. Продовжуйте досліджувати
  9. Часті запитання

Огляд

Ці заходи здебільшого впливають на майбутній збір компаній, які вирішать їх поважати; вони не знімають роботу з уже навчених моделей.

Глибоке занурення

Більшість великих моделей ШІ навчаються на матеріалі, зібраному з Інтернету. Common Crawl публікує величезні сканування загальнодоступного Інтернету, а набори даних зображень, такі як LAION-5B, із приблизно 5,85 мільярдами пар зображень і підписів, були створені шляхом їх фільтрації. LAION розповсюджує посилання та підписи, а не файли зображень, але моделі, які навчалися з ним, завантажували зображення з цих посилань. Щоб перевірити, чи відображається ваша робота, Have I Been Trained від Spawning дозволяє шукати набори даних LAION за текстом або зображенням. Він охоплює лише набори даних, які він індексує; немає способу пошуку приватних даних, якими користуються багато компаній. Основними засобами запобігання є: robots.txt. Багато компаній зі штучним інтелектом публікують назви сканерів, які сайти можуть блокувати, зокрема GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Applebot-Extended (Apple) і Google-Extended, який контролює використання в Google Gemini моделей без видалення сайту з пошуку Google. Деякі хости та CDN, такі як Cloudflare, пропонують блокування сканера штучним інтелектом одним клацанням миші. Налаштування платформи. Сервіси, такі як LinkedIn і X, запропонували налаштування, які контролюють навчання вмісту користувачів, а Meta запропонував форми заперечень у регіонах із суворішим законодавством про захист даних. Художні сайти, такі як DeviantArt і ArtStation, представили теги NoAI. Реєстри та правові застереження. У реєстрі Spawning Do Not Train записані відмови від участі, які деякі компанії, зокрема Stability AI для певних моделей, заявили, що вони будуть дотримуватися. У ЄС Директива про авторське право від 2019 року дозволяє правовласникам зберігати права на текст і інтелектуальний аналіз даних у машинозчитуваній формі, а Закон ЄС про штучний інтелект вимагає від постачальників моделей загального призначення поважати такі застереження. Межі важливі. robots.txt є добровільним, а не примусовим. Відмова не має зворотної сили, і навчені моделі не забувають. Копії ваших робіт, опубліковані в іншому місці, не поширюються на правила вашого сайту. Блокування сканерів також може зменшити видимість у пошуку за допомогою штучного інтелекту. Відмова знижує ризики; це не гарантує виключення.

Стратегічний вплив

Ризики та безпека

Катастрофічні та щоденні збитки ШІ залежать від того, хто розуміє ризики та хто може діяти.

Чіткіші рішення

Громадська та професійна грамотність визначає, чи політично можлива сильна політика безпеки.

Прорізаючи ажіотаж

Чіткі пояснення зменшують захоплення ажіотажем, лабораторним піаром і нечітким етичним театром.

Майбутнє відмови від навчальних наборів даних ШІ

Зростає тиск на сигнали відмови, які є стандартизованими та юридично значущими, а не розкиданими по назвах сканерів і меню платформи. Органи зі стандартизації та галузеві групи працюють над спільними словниками для переваг використання ШІ, а правила ЄС змушують постачальників документувати, як вони поважають застереження. Ліцензійні угоди між компаніями штучного інтелекту та видавцями свідчать про те, що формується ринок дозволених даних, хоча переважно для великих правовласників. Судові позови щодо навчання роботі, захищеній авторським правом, можуть змінити стандартні правила в деяких країнах. Наразі окремим творцям слід розглядати відмову як частковий захист і періодично перевіряти налаштування, оскільки платформи їх змінюють.

Реалізація в реальному світі

Ілюстраторка шукає зображення свого портфоліо на сайті Have I Been Trained, знаходить декілька в LAION-5B і додає їх до реєстру Do Not Train Spawning, знаючи, що це зобов’язує лише компанії, які його шанують.

Фотограф, який керує власним сайтом, додає правила robots.txt, які забороняють GPTBot, CCBot, ClaudeBot і Google-Extended, але залишають Googlebot дозволеним, щоб його сторінки все одно з’являлися в результатах пошуку.

Автор на LinkedIn вимикає параметр, який дозволяє використовувати її дані для навчання генеративних моделей ШІ, і зазначає, що це не скасовує використання в минулому.

Невеликий видавець у ЄС додає машинозчитуване резервування прав на текст і інтелектуальний аналіз даних до свого сайту та умов використання, покладаючись на винятки з авторського права ЄС, які дозволяють власникам прав відмовитися.

Ризики та огорожі

  • Розгляд екзистенціального ризику як наукової фантастики, а здібності складені.

  • Плутання безпеки поверхні продукту з вирівнюванням за високої автономності.

  • Залишаючи неангломовну та неекспертну аудиторію лише низькоякісними джерелами.

Дорожня карта впровадження

  1. Розділіть ризики шкоди продукту, неправильного використання та втрати контролю/зміщення.

  2. Запитайте, які докази змінили б ваше уявлення про терміни та серйозність.

  3. Віддавайте перевагу першоджерелам і конкретним оцінкам над маркетинговими заявами.

  4. Визначте один шлях дій: кар’єра, політика, фінансування чи навички — не лише обізнаність.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Opting Out of AI Training Datasets quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часті запитання

Що таке відмова від навчальних наборів даних AI?

Творці можуть зменшити використання своєї роботи для навчання штучному інтелекту в майбутньому, заблокувавши сканери штучного інтелекту в robots.txt, вимкнувши дозволи на навчання в налаштуваннях платформи та зареєструвавшись у службах відмови, а також можуть перевірити деякі публічні набори даних за допомогою інструментів пошуку. Ці заходи здебільшого впливають на майбутній збір компаній, які вирішать їх поважати; вони не знімають роботу з уже навчених моделей.

Що насправді поширює набір даних LAION-5B?

LAION надає URL-адреси та підписи. Тренери моделей завантажили зображення за цими посиланнями.

Що робить блокування Google-Extended у robots.txt?

Google-Extended — це контрольний маркер для навчання ШІ. Якщо його заблокувати, індексація Пошуку не змінюється.

Яке основне обмеження відмови від участі після навчання моделі?

Відмови впливають на майбутні збори компаніями, які їх шанують. Минулий тренінг не відмінити.

Чому блокування сканерів у файлі robots.txt вашого сайту не повністю захищає вашу роботу?

robots.txt — це запит, якому слідують добре поведені сканери, і він стосується лише сайту, який його публікує.

Що дає вам інструмент Have I Been Trained від Spawning?

Він здійснює пошук у наборах даних, які він індексує. Він не може бачити приватні навчальні дані, які використовуються багатьма компаніями.