Какво стана
В пояснение от 14 август 2026 г. Anthropic каза, че бъдещите модели Claude ще генерират текст, носещ статистически воден знак, внедрен като версия на SynthID-Text на Google DeepMind, за да отговарят на правилата за прозрачност на Закона за изкуствен интелект на ЕС. Публикацията описва метода и неговите ограничения, но не назовава моделите, не дава начална дата или стартира детектор.
Anthropic публикува обяснение на 14 август 2026 г., описващо как текстовият воден знак ще работи в бъдещите модели Claude. Компанията определя промяната като съответствие със Закона за изкуствен интелект на ЕС: в него се казва, че от 2 август 2026 г. доставчиците, обслужващи пазара на ЕС, трябва да маркират съдържание, генерирано от изкуствен интелект, и че Anthropic е сред приблизително 190 подписали Кодекса на ЕС за прозрачност на съдържание, генерирано от изкуствен интелект през юли 2026 г. Публикацията е документация на подход, а не на съобщение за стартиране. Не се посочва кои модели ще носят водния знак, не се посочва дата, когато започва маркирането, нито се казва дали е на живо в някой продукт днес.
Методът е описан като версия на SynthID-Text, схемата Google DeepMind, публикувана в Nature през 2024 г., която публикацията поставя в семейство от дизайни, връщайки се към предложение от 2022 г. на Скот Арънсън. Езиковите модели избират всяка следваща лексема частично на случаен принцип сред кандидати, които са приблизително еднакво добри. Водният знак заменя този произволен произволен източник с псевдослучаен, получен от таен ключ и предходните думи, така че поредица от избори може по-късно да бъде тествана за съответствие с ключа. Anthropic казва, че нищо не се вмъква в текста, няма скрити знаци, не се произвеждат допълнителни жетони и цената и скоростта са непроменени. Той също така казва, че водният знак не носи идентифицираща информация и не може да бъде проследен до човек, организация или разговор.
Anthropic е ясен относно ограниченията. Резултатът от откриването оценява само вероятността Claude да е участвал в създаването на пасаж. Не може да покаже, че текстът е написан от хора, и не може да идентифицира други AI системи, които биха използвали различни ключове или различни методи изцяло. Откриването работи зле на кратки извадки и знакът е по-рядък навсякъде, където формулировката е ограничена – фактически изявления с едно правилно завършване, аритметика и код, където публикацията казва, че ефектът върху самия код е незначителен и водният знак остава предимно в коментарите. Леката корекция на човешки текст може да остави твърде малко Claude-избрани думи за регистриране. Пълното пренаписване премахва марката; лекото редактиране, според компанията, вероятно няма да го направи. Публикацията също така посочва, че водният знак не казва нищо за собственост, авторство или правна отговорност за резултат.
Заедно с текста Anthropic казва, че файловете, които Claude създава в поддържани формати като .png, .jpg и .svg, ще носят идентификационни данни за съдържание C2PA — криптографски подписана бележка в метаданните на файла, част от отворен индустриален стандарт, записваща, че Claude е участвал, без да променя самия файл. Компанията казва, че идва API за откриване на воден знак, но подробностите за внедряването все още се разработват и че ще предостави собствен инструмент за проверка на идентификационните данни на C2PA. Водният знак ще бъде приложен глобално при стартирането, тъй като, казва Anthropic, няма траен начин за обхват по региони. Claude моделите, пуснати преди 2 август 2026 г., попадат в преходен период в законодателството на ЕС и трябва да бъдат обхванати през следващите месеци.
Детайли за източника: anthropic.com ↗
Защо има значение
Базираният на ключовете воден знак е по-силно доказателство от базираните на стил AI детектори, но отговаря само на тесен въпрос: дали моделите на един доставчик вероятно са докоснали достатъчно дълъг пасаж. Отрицателният резултат не доказва нищо и техниката е най-слаба точно там, където споровете са често срещани - код, кратък текст и леко редактирано човешко писане.
Произходът се е превърнал в практически проблем за училища, съдилища, издатели, наемане и модериране на платформи, а повечето инструменти, които се използват днес, са статистически детектори, които извеждат авторството от стилистични разкази - подход с добре документирани фалшиво положителни проблеми. Базираният на ключ воден знак е различен клас доказателства: страната, която държи ключовите тестове за шаблон, който е поставила умишлено, вместо да гадае от стила. Това е истинско подобрение по принцип, но само за тесния въпрос, на който отговаря.
Асиметрията има значение за всеки, изкушен да използва това в дисциплинарна или правна обстановка. Положителен резултат предполага участие на Claude; отрицателен резултат не установява нищо, тъй като текстът може да идва от друг модел, от по-стар модел Claude, който все още е в преходен период, от силно редактирана чернова или от пасаж, който е твърде кратък или твърде ограничен, за да задържи знак. Anthropic казва, че водният знак не може да раздели „Claude написа това“ от „Claude силно редактира това“. Институции, които третират изхода на детектора като доказателство за неправомерно поведение, биха се основали на сигнал, който собственият им производител описва като вероятностен.
Доказателствата зад твърдението „липса на влияние върху качеството“ са неравномерни по начин, който си заслужава да бъде назован. Anthropic цитира вътрешно тестване, което не е публикувано, плюс документа SynthID-Text, в който DeepMind не съобщава за статистически значима разлика в оценките с палец нагоре и с палец надолу, когато модел с воден знак е обслужвал част от трафика Gemini, както и никаква забелязана разлика в контролирано успоредно проучване за оценка от хора. Това е истинско външно доказателство, но се отнася до модел и трафик на друга компания. Не е публикувано измерване на силата на водния знак, честотата на фалшивите положителни резултати или минималната дължина на пасажа конкретно за Claude.
Регулаторната механика достига и извън Европа. Тъй като Anthropic казва, че все още не може да обхване водния знак по региони, задължението за прозрачност на ЕС се изпълнява чрез промяна на изходите за потребителите по целия свят. Кодексът на практиката обвързва много доставчици, така че се очакват сравними оценки от други разработчици, всеки със собствен ключ и евентуално свой собствен метод. Това сочи към фрагментирана среда за проверка: няма един детектор, покриващ всички модели, проверки, протичащи през контролирани от доставчика крайни точки, и модели с отворено тегло — където вземането на проби се контролира от всеки, който управлява модела — до голяма степен извън схемата.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
Which of these is a common misconception about AI Ethics?
Какво да гледате след това
Непубликуваният API за откриване ще реши дали това може да се използва на практика: условията за достъп, оценките на доверието, фалшиво-положителната настройка и минималната дължина на текста не са посочени. Също отворено: кои модели се доставят с него, колко бързо се преоборудват моделите преди август 2026 г. и дали глобалното приложение по-късно ще бъде стеснено до ЕС.
API за откриване е частта, която определя дали нещо от това е използваемо. Неразрешено: кой получава достъп, дали е безплатен или с измерване, какви резултати за доверие връща, за какъв процент на фалшиви положителни резултати е настроен и каква минимална дължина на текста изисква. Тези избори решават дали водният знак ще се превърне в внимателна съдебномедицинска помощ или тъп инструмент в класните стаи и разследванията на човешките ресурси. Anthropic не е посочил дата на пускане.
Второ, покритие. В публикацията не се посочва кои предстоящи модели носят водния знак или кога се доставят, а моделите за преоборудване, пуснати преди 2 август 2026 г., се описват само като пуснати през следващите месеци. Докато това не приключи, голям обем от съществуващия Claude изход остава немаркиран и всеки детектор ще има слепи петна, за които потребителите надолу по веригата не могат лесно да разсъждават.
Трето, здравина. Изследователите многократно са изследвали схеми за поставяне на водни знаци с перифразиране, превод на различни модели и редакции на ниво токен, а собственият акаунт на Anthropic признава, че пълното пренаписване побеждава марката. Очаквайте публикувани атаки — и след като съществува API за откриване, независими фалшиво-положителни анализи. Тези резултати, а не документацията на доставчика, ще установят колко тегло може да понесе сигналът.
И накрая, вижте дали глобалното приложение се стеснява. Anthropic казва, че ще продължи да оценява регионалния обхват и ще споделя актуализации. Също така си струва да се проследи: как другите подписали Кодекса на практика прилагат собствените си маркировки, дали се появява някакъв споделен слой за проверка и дали регулаторите на ЕС издават насоки за това какво се счита за адекватно маркиране за код, кратки резултати и леко редактиран човешки текст – случаите, в които тази техника е най-слаба по дизайн.