Ne oldu?
14 Ağustos 2026 tarihli bir açıklayıcıda, Anthropic gelecekteki Claude modellerinin, AB AI Yasası şeffaflık kurallarını karşılamak için Google DeepMind'in SynthID-Text'inin bir sürümü olarak uygulanan istatistiksel bir filigran taşıyan metin oluşturacağını söyledi. Gönderi, yöntemi ve sınırlarını açıklıyor ancak modellerin adını vermiyor, bir başlangıç tarihi vermiyor veya bir dedektörün lansmanını yapmıyor.
Anthropic, 14 Ağustos 2026'da metin filigranının gelecekteki Claude modellerinde nasıl çalışacağını açıklayan bir açıklayıcı yayınladı. Şirket, değişikliği AB Yapay Zeka Yasası'na uygunluk olarak çerçeveliyor: 2 Ağustos 2026 itibarıyla AB pazarına hizmet veren sağlayıcıların yapay zeka tarafından oluşturulan içeriği işaretlemesi gerektiğini ve Anthropic'nin Temmuz 2026'da Yapay Zeka Tarafından Oluşturulan İçeriğin Şeffaflığına İlişkin AB Uygulama Kurallarını imzalayan yaklaşık 190 taraf arasında yer aldığını söylüyor. Gönderi, bir lansman duyurusundan ziyade bir yaklaşımın belgelenmesidir. Filigranı hangi modellerin taşıyacağı belirtilmez, işaretlemenin ne zaman başlayacağına dair bir tarih verilmez veya bugün herhangi bir üründe yayınlanıp yayınlanmadığı belirtilmez.
Yöntem, 2024'te Nature'da yayınlanan Google DeepMind şeması olan SynthID-Text'in bir versiyonu olarak tanımlanıyor ve gönderi, Scott Aaronson'un 2022 tarihli bir teklifine dayanan bir tasarım ailesi içine yerleştiriyor. Dil modelleri, bir sonraki jetonları kabaca eşit derecede iyi olan adaylar arasından kısmen rastgele seçer. Filigranlama, bu rastgele rastgele kaynağı, gizli bir anahtardan ve önceki sözcüklerden türetilen sözde rastgele bir kaynakla değiştirir, böylece bir dizi seçenek daha sonra anahtarla tutarlılık açısından test edilebilir. Anthropic, metne hiçbir şey eklenmediğini, gizli karakterlerin bulunmadığını, fazladan jeton üretilmediğini ve fiyat ve hızın değişmediğini söylüyor. Ayrıca filigranın hiçbir tanımlayıcı bilgi taşımadığını ve bir kişi, kuruluş veya konuşmaya kadar takip edilemeyeceğini de belirtiyor.
Anthropic sınırlar konusunda açıktır. Tespit sonucu yalnızca Claude'un bir pasajın oluşturulmasına dahil olma olasılığını tahmin eder. Metnin insan tarafından yazıldığını gösteremez ve tamamen farklı anahtarlar veya farklı yöntemler kullanan diğer yapay zeka sistemlerini tanımlayamaz. Tespit, kısa örneklerde zayıf çalışıyor ve ifadelerin kısıtlandığı yerlerde işaret daha seyrek oluyor - tek bir doğru tamamlama, aritmetik ve kod içeren gerçek ifadeler; burada gönderi, kodun kendisi üzerindeki etkinin ihmal edilebilir olduğunu ve filigranın çoğunlukla yorumlarda bulunduğunu söylüyor. İnsan metninin hafif düzeltmeleri, kaydedilecek çok az sayıda Claude seçilmiş kelime bırakabilir. Tam bir yeniden yazma işareti kaldırır; Şirket, hafif düzenlemenin muhtemelen yapılmayacağını söylüyor. Gönderide ayrıca filigranın bir çıktının mülkiyeti, yazarlığı veya yasal sorumluluğu hakkında hiçbir şey söylemediği belirtiliyor.
Anthropic, metnin yanı sıra, Claude'nin .png, .jpg ve .svg gibi desteklenen formatlarda ürettiği dosyaların C2PA içerik kimlik bilgilerini taşıyacağını söylüyor; bu, dosya meta verilerinde, açık endüstri standardının bir parçası olan, dosyanın kendisini değiştirmeden Claude'nin dahil olduğunu kaydeden kriptografik olarak imzalanmış bir nottur. Şirket, filigran algılama API'sinin geleceğini ancak uygulama ayrıntılarının hala üzerinde çalışıldığını ve C2PA kimlik bilgilerini kontrol etmek için kendi aracını sağlayacağını söylüyor. Anthropic, filigranlamanın lansman sırasında küresel olarak uygulanacağını söylüyor, bunun kapsamını bölgeye göre belirlemenin kalıcı bir yolu yok. 2 Ağustos 2026'dan önce piyasaya sürülen Claude modelleri, AB hukukunda bir geçiş dönemi kapsamındadır ve önümüzdeki aylarda ele alınacaktır.
Kaynak ayrıntıları: anthropic.com ↗
Neden önemli?
Anahtar tabanlı filigranlama, stil tabanlı AI dedektörlerinden daha güçlü bir kanıttır, ancak yalnızca dar bir soruyu yanıtlar: Bir satıcının modellerinin muhtemelen yeterince uzun bir pasaja dokunup dokunmadığı. Negatif bir sonuç hiçbir şeyi kanıtlamaz ve teknik, tam olarak anlaşmazlıkların yaygın olduğu yerlerde (kod, kısa metin ve hafifçe düzenlenmiş insan yazısı) en zayıftır.
Kaynak, okullar, mahkemeler, yayıncılar, işe alma ve platform denetimi için pratik bir sorun haline geldi ve günümüzde kullanılan çoğu araç, yazarlığı stilistik anlatımlardan çıkaran istatistiksel algılayıcılardır; bu, iyi belgelenmiş yanlış pozitif sorunlara sahip bir yaklaşımdır. Anahtar tabanlı filigran farklı bir kanıt sınıfıdır: Tarafın, tarzdan tahmin etmek yerine kasıtlı olarak yerleştirdiği bir model için anahtar testleri yapması. Bu, prensipte gerçek bir gelişmedir, ancak yalnızca yanıtladığı dar soru açısından.
Asimetri, bunu disiplin veya yasal bir ortamda kullanmak isteyen herkes için önemlidir. Olumlu bir sonuç Claude katılımını gösterir; olumsuz bir sonuç hiçbir şey ifade etmez, çünkü metin başka bir modelden, hala geçiş döneminde olan eski bir Claude modelinden, yoğun biçimde düzenlenmiş bir taslaktan veya işaretlenemeyecek kadar kısa veya çok kısıtlı bir pasajdan gelmiş olabilir. Anthropic, filigranın "Claude bunu yazdı" ifadesini "Claude bunu yoğun şekilde düzenledi" ifadesinden ayıramayacağını söylüyor. Bir dedektör çıktısını suiistimalin kanıtı olarak ele alan kurumlar, kendi üreticisinin olasılıksal olarak tanımladığı bir sinyal üzerine inşa ediyor olacaktır.
"Kalite etkisi yok" iddiasının ardındaki kanıtlar, adlandırılmaya değer bir şekilde dengesizdir. Anthropic, yayınlanmamış dahili testlere ek olarak, DeepMind'ın filigranlı bir model Gemini trafiğinin bir kısmına hizmet ettiğinde beğenilenler ve beğenilmeyenler derecelendirmelerinde istatistiksel olarak anlamlı bir fark olmadığını ve kontrollü bir yan yana insan derecelendirme çalışmasında algılanan bir fark olmadığını bildirdiği SynthID-Text makalesine atıfta bulunuyor. Bu gerçek bir dış kanıttır ancak farklı bir şirketin modeli ve trafiğiyle ilgilidir. Özellikle Claude için filigran gücü, yanlış pozitiflik oranı veya minimum geçiş uzunluğuna ilişkin herhangi bir ölçüm yayınlanmamıştır.
Düzenleme mekanizmaları Avrupa'nın ötesine de uzanıyor. Anthropic henüz filigranı bölgeye göre kapsayamayacağını söylediğinden, dünya çapındaki kullanıcılar için çıktılar değiştirilerek AB şeffaflık yükümlülüğü yerine getiriliyor. Uygulama Kuralları birçok sağlayıcıyı bağlar, dolayısıyla her birinin kendi anahtarı ve muhtemelen kendi yöntemi olan diğer geliştiricilerden de benzer puanlar beklenir. Bu, parçalanmış bir doğrulama ortamına işaret ediyor: tüm modelleri kapsayan tek bir dedektör yok, satıcı tarafından kontrol edilen uç noktalar üzerinden çalışan kontroller ve örneklemenin modeli çalıştıran kişi tarafından kontrol edildiği açık ağırlıklı modeller büyük ölçüde planın dışında kalıyor.
Interactive Mechanism: How It Actually Works
Explore the underlying technology behind this development interactively.
Which of these is a common misconception about AI Ethics?
Bundan sonra ne izlenecek?
Yayınlanmamış algılama API'si bunun pratikte kullanılabilir olup olmadığına karar verecektir: erişim koşulları, güven puanları, yanlış pozitif ayarlama ve minimum metin uzunluğu belirtilmemiştir. Ayrıca açık: hangi modellerin onunla birlikte gönderildiği, Ağustos 2026 öncesi modellerin ne kadar hızlı yenilendiği ve küresel uygulamanın daha sonra AB'yi kapsayacak şekilde daraltılıp daraltılmayacağı da açık.
Tespit API'si bunlardan herhangi birinin kullanılabilir olup olmadığını belirleyen parçadır. Çözülmemiş: Kimin erişimi var, ücretsiz mi yoksa ölçülü mü, hangi güven puanlarını döndürüyor, hangi yanlış pozitif oranına göre ayarlanıyor ve ne kadar minimum metin uzunluğu gerektiriyor? Bu seçimler, filigranın dikkatli bir adli tıp yardımına mı yoksa sınıflarda ve İK araştırmalarında kör bir araca mı dönüşeceğine karar verir. Anthropic yayın tarihi belirtmedi.
İkincisi, kapsama alanı. Gönderi, gelecek modellerden hangilerinin filigranı taşıdığını veya ne zaman gönderileceğini belirtmiyor ve 2 Ağustos 2026'dan önce piyasaya sürülen yenilenen modellerin yalnızca önümüzdeki aylarda kullanıma sunulacağı açıklanıyor. Bu tamamlanana kadar, mevcut Claude çıkışının büyük bir kısmı işaretlenmemiş olarak kalacaktır ve herhangi bir dedektör, alt kullanıcıların kolaylıkla akıl yürütemeyeceği kör noktalara sahip olacaktır.
Üçüncüsü sağlamlık. Araştırmacılar, filigranlama şemalarını başka kelimelerle ifade etme, modeller arası çeviri ve belirteç düzeyinde düzenlemelerle defalarca araştırdı ve Anthropic'in kendi hesabı, tam bir yeniden yazmanın işareti boşa çıkardığını kabul ediyor. Yayınlanan saldırıları ve algılama API'si mevcut olduğunda bağımsız hatalı pozitif analizleri bekleyin. Satıcı belgelerinden ziyade bu sonuçlar, sinyalin ne kadar ağırlığa dayanabileceğini belirleyecektir.
Son olarak global uygulamanın daralıp daralmadığını izleyin. Anthropic bölgesel kapsamı değerlendirmeye ve güncellemeleri paylaşmaya devam edeceğini söylüyor. Ayrıca takip etmeye değer: diğer Uygulama Kurallarını imzalayanların kendi işaretlerini nasıl uyguladığı, herhangi bir ortak doğrulama katmanının ortaya çıkıp çıkmadığı ve AB düzenleyicilerinin kod, kısa çıktılar ve hafifçe düzenlenmiş insan metni için neyin yeterli işaretleme sayıldığına dair kılavuz yayınlayıp yayınlamadığı (bu tekniğin tasarım açısından en zayıf olduğu durumlar).