Vad hände
I en förklaring den 14 augusti 2026 sa Anthropic att framtida Claude-modeller kommer att generera text som bär en statistisk vattenstämpel, implementerad som en version av Google DeepMinds SynthID-Text, för att uppfylla EU:s AI Acts regler för insyn. Inlägget beskriver metoden och dess gränser men nämner inte modellerna, anger ett startdatum eller startar en detektor.
Anthropic publicerade en förklarande den 14 augusti 2026 som beskrev hur en textvattenstämpel kommer att fungera i framtida Claude-modeller. Företaget formulerar förändringen som överensstämmelse med EU:s AI-lag: den säger att från och med den 2 augusti 2026 måste leverantörer som betjänar EU-marknaden märka AI-genererat innehåll, och att Anthropic var bland ungefär 190 undertecknare av EU:s uppförandekod för transparens av AI-genererat innehåll i juli, snarare än lanseringen av post20-dokumentation26. tillkännagivande. Den anger inte vilka modeller som kommer att bära vattenstämpeln, anger ett datum när märkningen börjar, eller säger om det är live i någon produkt idag.
Metoden beskrivs som en version av SynthID-Text, schemat Google DeepMind publicerat i Nature 2024, som inlägget placerar i en familj av design som går tillbaka till ett förslag från 2022 av Scott Aaronson. Språkmodeller väljer varje nästa token delvis slumpmässigt bland kandidater som är ungefär lika bra. Vattenmärkning ersätter den godtyckliga slumpmässiga källan med en pseudoslumpmässig källa som härrör från en hemlig nyckel och de föregående orden, så en sekvens av val kan senare testas för överensstämmelse med nyckeln. Anthropic säger att ingenting har infogats i texten, det finns inga dolda tecken, inga extra tokens produceras och pris och hastighet är oförändrade. Det står också att vattenstämpeln inte innehåller någon identifierande information och att den inte kan spåras till en person, organisation eller konversation.
Anthropic är explicit om gränser. Ett detekteringsresultat uppskattar bara sannolikheten att Claude var inblandad i att producera en passage. Den kan inte visa att texten var mänsklig skriven, och den kan inte identifiera andra AI-system, som skulle använda olika nycklar eller helt olika metoder. Detektering fungerar dåligt på korta prover, och märket är glesare varhelst ordalydelsen är begränsad - faktapåståenden med en korrekt komplettering, aritmetik och kod, där inlägget säger att effekten på själva koden är försumbar och vattenstämpeln oftast lever i kommentarer. Lätt korrekturläsning av mänsklig text kan lämna för få Claude-valda ord att registrera. En fullständig omskrivning tar bort märket; lätt redigering, säger företaget, förmodligen inte. I inlägget står det också att en vattenstämpel inte säger något om ägande, författarskap eller juridiskt ansvar för en produktion.
Vid sidan av text säger Anthropic att filer Claude producerar i format som stöds som .png, .jpg och .svg kommer att ha C2PA-innehållsreferenser - en kryptografiskt signerad anteckning i filmetadata, en del av en öppen branschstandard, som registrerar att PROTECT-filen själv var inblandad utan __ED_AI_9. Företaget säger att ett API för vattenstämpeldetektering kommer men att implementeringsdetaljerna fortfarande håller på att utarbetas och att det kommer att tillhandahålla ett eget verktyg för att kontrollera C2PA-uppgifter. Vattenmärkning kommer att tillämpas globalt vid lanseringen eftersom, Anthropic säger, det inte har något hållbart sätt att omfånga det efter region. Claude modeller som släppts före den 2 augusti 2026 faller under en övergångsperiod i EU-lagstiftningen och kommer att täckas under de kommande månaderna.
Källinformation: anthropic.com ↗
Varför det spelar roll
Nyckelbaserad vattenmärkning är starkare bevis än stilbaserade AI-detektorer, men det svarar bara på en snäv fråga: om en leverantörs modeller sannolikt rörde en tillräckligt lång passage. Ett negativt resultat bevisar ingenting, och tekniken är svagast just där dispyter är vanliga - kod, kort text och lätt redigerad mänsklig skrift.
Härkomst har blivit ett praktiskt problem för skolor, domstolar, förlag, anställning och moderering av plattformar, och de flesta verktyg som används idag är statistiska detektorer som härleder författarskap från stilistiska berättar - ett tillvägagångssätt med väldokumenterade falskt positiva problem. Ett nyckelbaserat vattenstämpel är en annan klass av bevis: den part som håller nyckeltesterna för ett mönster som den medvetet placerade i stället för att gissa utifrån stil. Det är en verklig förbättring i princip, men bara för den snäva fråga den besvarar.
Asymmetrin har betydelse för alla som frestas att använda detta i en disciplinär eller juridisk miljö. Ett positivt resultat tyder på Claude engagemang; ett negativt resultat fastställer ingenting, eftersom texten kan ha kommit från en annan modell, från en äldre Claude-modell som fortfarande befinner sig i övergångsperioden, från ett hårt redigerat utkast eller från en passage som är för kort eller för begränsad för att hålla ett märke. Anthropic säger att vattenstämpeln inte kan skilja "Claude skrev detta" från "Claude redigerade detta kraftigt." Institutioner som behandlar en detektorutgång som bevis på oredlighet skulle bygga på en signal som den egna tillverkaren beskriver som sannolikhet.
Bevisen bakom påståendet "ingen kvalitetspåverkan" är ojämn på ett sätt värt att nämna. Anthropic citerar interna tester som inte har publicerats, plus SynthID-Text-artikeln, där DeepMind inte rapporterade någon statistiskt signifikant skillnad i tummen upp och tummen ned när en vattenstämplad modell betjänade en del av Gemini trafiken, och ingen upplevd bedömningsskillnad från en sida av människan. Det är äkta externa bevis, men det handlar om ett annat företags modell och trafik. Ingen mätning av vattenstämpelstyrka, falsk-positiv frekvens eller minsta passagelängd har publicerats specifikt för Claude.
Regleringsmekaniken når även utanför Europa. Eftersom Anthropic säger att det ännu inte kan omfånga vattenstämpeln per region, uppfylls en EU-transparensskyldighet genom att ändra utdata för användare över hela världen. Uppförandekoden binder många leverantörer, så jämförbara märken förväntas från andra utvecklare, var och en med sin egen nyckel och eventuellt sin egen metod. Det pekar mot ett fragmenterat verifieringslandskap: ingen enskild detektor som täcker alla modeller, kontroller som går genom leverantörskontrollerade slutpunkter och modeller med öppen vikt – där provtagningen kontrolleras av den som kör modellen – som till stor del sitter utanför systemet.
Interaktiv mekanism: hur det faktiskt fungerar
Utforska den underliggande tekniken bakom denna utveckling interaktivt.
Which of these is a common misconception about AI Ethics?
Vad du ska titta på härnäst
Det osläppta identifierings-API:et kommer att avgöra om detta är användbart i praktiken: åtkomsttermer, konfidenspoäng, falskt positiv justering och minsta textlängd är alla ospecificerade. Också öppet: vilka modeller levereras med den, hur snabbt modellerna före augusti 2026 eftermonteras och om den globala tillämpningen senare begränsas till EU.
Detektions-API:n är den del som avgör om något av detta är användbart. Olöst: vem får åtkomst, oavsett om det är gratis eller uppmätt, vilka konfidenspoäng den ger, vilken falsk-positiv frekvens den är inställd på och vilken minsta textlängd den kräver. De valen avgör om vattenstämpeln blir ett noggrant rättsmedicinskt hjälpmedel eller ett trubbigt instrument i klassrum och HR-utredningar. Anthropic har inte angett något releasedatum.
För det andra, täckning. Inlägget identifierar inte vilka kommande modeller som bär vattenstämpeln eller när de skickas, och eftermonteringsmodeller som släpptes före den 2 augusti 2026 beskrivs endast som att de kommer att rullas ut under de kommande månaderna. Tills det är klart förblir en stor volym av befintlig Claude-utgång omarkerad, och alla detektorer kommer att ha blinda fläckar som nedströmsanvändare inte enkelt kan resonera kring.
För det tredje, robusthet. Forskare har upprepade gånger undersökt vattenmärkningsscheman med parafrasering, översättning av olika modeller och redigeringar på tokennivå, och Anthropics eget konto medger att en fullständig omskrivning besegrar märket. Förvänta dig publicerade attacker – och, när detektions-API:et finns, oberoende falsk-positiva analyser. Dessa resultat, snarare än leverantörsdokumentation, kommer att fastställa hur mycket vikt signalen kan bära.
Slutligen, se om den globala applikationen minskar. Anthropic säger att den kommer att fortsätta att utvärdera regional omfattning och dela uppdateringar. Också värt att spåra: hur andra undertecknare av uppförandekoden implementerar sina egna märken, om något delat verifieringslager uppstår och om EU:s tillsynsmyndigheter utfärdar vägledning om vad som räknas som adekvat märkning för kod, korta utdata och lätt redigerad mänsklig text – de fall där denna teknik är svagast till sin design.