ДалееСледующее руководство
Данные о добросовестном использовании и обучении искусственному интеллекту
Общество
РУКОВОДСТВО ПО ОБЩЕСТВУ
Создатели могут сократить использование своей работы для обучения ИИ в будущем, заблокировав сканеры ИИ в файле robots.txt, отключив разрешения на обучение в настройках платформы и зарегистрировавшись в службах отказа, а также могут проверять некоторые общедоступные наборы данных с помощью инструментов поиска.
Эти меры в основном влияют на будущие сборы платежей компаниями, которые решат их соблюдать; они не снимают работу с уже обученных моделей.
Большинство крупных моделей ИИ обучаются на материалах, собранных из Интернета. Common Crawl публикует огромные объемы сканирования общедоступного Интернета, а наборы данных изображений, такие как LAION-5B, содержащие около 5,85 миллиардов пар изображений и подписей, были созданы путем их фильтрации. LAION распространяет ссылки и подписи, а не файлы изображений, но модели, обученные с его помощью, загружали изображения по этим ссылкам. Чтобы проверить, отображается ли ваша работа, инструмент Have I Been Trained компании Spawning позволяет выполнять поиск в наборах данных LAION по тексту или изображению. Он охватывает только те наборы данных, которые он индексирует; нет возможности искать частные данные, которые используют многие компании. Основными инструментами предотвращения являются: robots.txt. Многие компании, занимающиеся искусственным интеллектом, публикуют имена сканеров, которые сайты могут блокировать, в том числе GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Applebot-Extended (Apple) и Google-Extended, который контролирует использование в моделях Google Gemini без удаления сайта из Google Поиск. Некоторые хосты и CDN, такие как Cloudflare, предлагают блокировку ИИ-сканера одним щелчком мыши. Настройки платформы. Такие сервисы, как LinkedIn и X, предлагают настройки, контролирующие обучение пользовательскому контенту, а Meta предлагает формы возражений в регионах с более строгим законодательством о защите данных. Художественные сайты, такие как DeviantArt и ArtStation, представили теги NoAI. Реестры и юридические оговорки. В реестре Spawning Do Not Train есть записи об отказе от участия, который некоторые компании, в том числе Stability AI для определенных моделей, заявили, что будут соблюдать его. В ЕС директива об авторском праве 2019 года позволяет правообладателям сохранять за собой права на интеллектуальный анализ текста и данных в машиночитаемой форме, а Закон ЕС об искусственном интеллекте требует, чтобы поставщики моделей общего назначения уважали такие оговорки. Ограничения важны. Использование файла robots.txt является добровольным, а не принудительным. Отказ не имеет обратной силы, и обученные модели не забывают об этом. Копии вашей работы, размещенные где-либо еще, не подпадают под действие правил вашего сайта. Блокировка сканеров также может снизить видимость при поиске с помощью искусственного интеллекта. Отказ от участия снижает риск; это не гарантирует исключения.
Катастрофический и повседневный вред ИИ зависит от того, кто понимает риски и может действовать.
Общественная и профессиональная грамотность определяет, возможна ли с политической точки зрения сильная политика безопасности.
Четкие объяснения уменьшают влияние шумихи, лабораторного пиара и расплывчатого этического театра.
Растет давление на сигналы отказа, которые должны быть стандартизированы и юридически значимы, а не разбросаны по названиям сканеров и меню платформы. Органы по стандартизации и отраслевые группы работают над общими словарями для предпочтений в использовании ИИ, а правила ЕС требуют от поставщиков документировать, как они соблюдают оговорки. Лицензионные соглашения между компаниями, занимающимися искусственным интеллектом, и издателями позволяют предположить, что формируется рынок согласованных данных, хотя в основном для крупных правообладателей. Судебные иски по поводу обучения работе, защищенной авторским правом, могут изменить правила по умолчанию в некоторых странах. На данный момент отдельные авторы должны рассматривать отказ как частичную защиту и периодически проверять настройки, поскольку платформы их меняют.
Иллюстратор просматривает изображения своего портфолио на сайте Have I Been Trained, находит несколько в LAION-5B и добавляет их в реестр Spawning’s Do Not Train, зная, что это связывает только компании, которые соблюдают это правило.
Фотограф, у которого есть собственный сайт, добавляет правила robots.txt, запрещающие использование GPTBot, CCBot, ClaudeBot и Google-Extended, но оставляя Googlebot разрешенным, чтобы его страницы по-прежнему появлялись в результатах поиска.
Автор LinkedIn отключает настройку, позволяющую использовать ее данные для обучения генеративных моделей ИИ, и отмечает, что это не отменяет предыдущее использование.
Небольшой издатель в ЕС добавляет к своему сайту и условиям использования машиночитаемую резервацию прав на интеллектуальный анализ текста и данных, полагаясь на исключение из авторских прав ЕС, которое позволяет правообладателям отказаться от этого.
Относитесь к экзистенциальному риску как к научной фантастике, в то время как возможности растут.
Сбивает с толку безопасность поверхности продукта и выравнивание при высокой автономности.
Оставляя неанглоязычную и неспециалистскую аудиторию только с некачественными источниками.
Отдельные риски повреждения продукта, неправильного использования и потери контроля/перекоса.
Спросите, какие доказательства могут изменить ваше мнение о сроках и серьезности.
Предпочитайте первоисточники и конкретные оценки маркетинговым заявлениям.
Определите один путь действий: карьера, политика, финансирование или навыки, а не только осведомленность.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Создатели могут сократить использование своей работы для обучения ИИ в будущем, заблокировав сканеры ИИ в файле robots.txt, отключив разрешения на обучение в настройках платформы и зарегистрировавшись в службах отказа, а также могут проверять некоторые общедоступные наборы данных с помощью инструментов поиска. Эти меры в основном влияют на будущие сборы платежей компаниями, которые решат их соблюдать; они не снимают работу с уже обученных моделей.
LAION предоставляет URL-адреса и подписи. Тренеры моделей загрузили изображения по этим ссылкам.
Google-Extended — это управляющий токен для использования в обучении ИИ. Блокировка оставляет индексацию поиска нетронутой.
Отказ от участия повлияет на будущие сборы компаниями, которые его соблюдают. Прошлое обучение не отменяется.
robots.txt — это запрос, которому следуют добросовестные сканеры, и он применяется только к сайту, который его публикует.
Он ищет наборы данных, которые индексирует. Он не может видеть данные частного обучения, используемые многими компаниями.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Данные о добросовестном использовании и обучении искусственному интеллекту
Общество