Chuyện gì đã xảy ra
Trong phần giải thích ngày 14 tháng 8 năm 2026, Anthropic cho biết các mô hình Claude trong tương lai sẽ tạo ra văn bản mang hình mờ thống kê, được triển khai dưới dạng phiên bản của Google SynthID-Text của DeepMind, để đáp ứng các quy tắc minh bạch trong Đạo luật AI của EU. Bài đăng mô tả phương pháp và các giới hạn của nó nhưng không nêu tên các mô hình, đưa ra ngày bắt đầu hoặc khởi chạy máy dò.
Anthropic đã xuất bản phần giải thích vào ngày 14 tháng 8 năm 2026 mô tả cách hình mờ văn bản sẽ hoạt động trong các mô hình Claude trong tương lai. Công ty coi sự thay đổi này là tuân thủ Đạo luật AI của EU: công ty nói rằng kể từ ngày 2 tháng 8 năm 2026, các nhà cung cấp phục vụ thị trường EU phải đánh dấu nội dung do AI tạo ra và Anthropic nằm trong số khoảng 190 bên ký kết Quy tắc thực hành của EU về tính minh bạch của nội dung do AI tạo ra vào tháng 7 năm 2026. Bài đăng này là tài liệu về một cách tiếp cận chứ không phải là một thông báo ra mắt. Nó không nêu tên mẫu nào sẽ mang hình mờ, ngày bắt đầu đánh dấu hoặc cho biết liệu nó có còn tồn tại trong bất kỳ sản phẩm nào hiện nay hay không.
Phương pháp này được mô tả là một phiên bản của SynthID-Text, sơ đồ Google DeepMind được xuất bản trên tạp chí Nature vào năm 2024, mà bài đăng đặt vào một nhóm thiết kế dựa trên đề xuất năm 2022 của Scott Aaronson. Các mô hình ngôn ngữ chọn từng mã thông báo tiếp theo một cách ngẫu nhiên trong số các ứng cử viên có mức độ tốt gần như nhau. Hình mờ thay thế nguồn ngẫu nhiên tùy ý đó bằng nguồn giả ngẫu nhiên bắt nguồn từ khóa bí mật và các từ trước đó, do đó, sau đó một chuỗi các lựa chọn có thể được kiểm tra tính nhất quán với khóa. Anthropic cho biết không có gì được chèn vào văn bản, không có ký tự ẩn, không có mã thông báo bổ sung nào được tạo ra và giá cũng như tốc độ không thay đổi. Nó cũng cho biết hình mờ không mang thông tin nhận dạng và không thể truy tìm một cá nhân, tổ chức hoặc cuộc trò chuyện.
Anthropic nêu rõ ràng về các giới hạn. Kết quả phát hiện chỉ ước tính khả năng Claude có liên quan đến việc tạo ra một đoạn văn. Nó không thể chứng minh rằng văn bản đó là do con người viết và nó không thể xác định các hệ thống AI khác sẽ sử dụng các khóa khác hoặc các phương pháp khác hoàn toàn. Khả năng phát hiện hoạt động kém trên các mẫu ngắn và dấu hiệu thưa thớt hơn ở những nơi từ ngữ bị hạn chế - các tuyên bố thực tế với một phần hoàn thành, số học và mã chính xác, trong đó bài đăng cho biết tác động lên bản thân mã là không đáng kể và hình mờ chủ yếu tồn tại trong các nhận xét. Việc hiệu đính nhẹ văn bản do con người thực hiện có thể để lại quá ít Claude từ được chọn để đăng ký. Việc viết lại hoàn toàn sẽ xóa dấu vết; công ty cho biết có thể sẽ không chỉnh sửa ánh sáng. Bài đăng cũng nói rằng hình mờ không nói gì về quyền sở hữu, quyền tác giả hoặc trách nhiệm pháp lý đối với đầu ra.
Bên cạnh văn bản, Anthropic cho biết các tệp Claude tạo ra ở các định dạng được hỗ trợ như .png, .jpg và .svg sẽ mang thông tin xác thực nội dung C2PA — một ghi chú được ký bằng mật mã trong siêu dữ liệu tệp, một phần của tiêu chuẩn ngành mở, ghi lại rằng Claude có liên quan mà không làm thay đổi chính tệp đó. Công ty cho biết API phát hiện hình mờ sắp ra mắt nhưng các chi tiết triển khai vẫn đang được hoàn thiện và nó sẽ cung cấp công cụ riêng để kiểm tra thông tin xác thực C2PA. Hình mờ sẽ được áp dụng trên toàn cầu khi ra mắt vì, Anthropic cho biết, nó không có cách nào bền vững để phạm vi theo khu vực. Các mẫu Claude được phát hành trước ngày 2 tháng 8 năm 2026 sẽ nằm trong giai đoạn chuyển tiếp theo luật của Liên minh Châu Âu và sẽ được áp dụng trong những tháng tới.
Chi tiết nguồn: anthropic.com ↗
Tại sao nó quan trọng
Hình mờ dựa trên khóa là bằng chứng mạnh mẽ hơn so với máy dò AI dựa trên kiểu dáng, nhưng nó chỉ trả lời một câu hỏi hẹp: liệu mô hình của một nhà cung cấp có thể chạm vào một lối đi đủ dài hay không. Một kết quả tiêu cực không chứng minh được điều gì và kỹ thuật này yếu nhất chính xác ở những nơi thường xuyên xảy ra tranh chấp - mã, văn bản ngắn và chữ viết của con người được chỉnh sửa nhẹ.
Nguồn gốc đã trở thành một vấn đề thực tế đối với các trường học, tòa án, nhà xuất bản, tuyển dụng và kiểm duyệt nền tảng, đồng thời hầu hết các công cụ được sử dụng ngày nay đều là công cụ phát hiện thống kê suy ra quyền tác giả từ các thông tin về phong cách - một cách tiếp cận với các vấn đề dương tính giả được ghi chép rõ ràng. Hình mờ dựa trên khóa là một loại bằng chứng khác: bên tiến hành các bài kiểm tra chính cho một mẫu mà họ cố tình đặt thay vì đoán theo phong cách. Về nguyên tắc, đó là một cải tiến thực sự, nhưng nó chỉ trả lời cho câu hỏi hẹp.
Sự bất đối xứng quan trọng đối với bất kỳ ai muốn sử dụng điều này trong môi trường kỷ luật hoặc pháp lý. Kết quả tích cực cho thấy sự tham gia của Claude; một kết quả phủ định không chứng minh được điều gì vì văn bản có thể đến từ một mô hình khác, từ một mô hình Claude cũ hơn vẫn đang trong giai đoạn chuyển tiếp, từ một bản nháp được chỉnh sửa nhiều hoặc từ một đoạn văn quá ngắn hoặc quá chật hẹp để giữ dấu. Anthropic cho biết hình mờ không thể tách rời "Claude đã viết nội dung này" khỏi "Claude đã chỉnh sửa nội dung này nhiều". Các tổ chức coi đầu ra của máy dò là bằng chứng về hành vi sai trái sẽ xây dựng dựa trên tín hiệu mà chính nhà sản xuất của nó mô tả là có tính xác suất.
Bằng chứng đằng sau tuyên bố "không có tác động đến chất lượng" không đồng đều theo cách đáng được đặt tên. Anthropic trích dẫn thử nghiệm nội bộ chưa được công bố, cùng với tài liệu SynthID-Text, trong đó DeepMind báo cáo không có sự khác biệt có ý nghĩa thống kê về xếp hạng không thích và không thích khi mô hình có hình mờ phục vụ một phần lưu lượng truy cập Gemini và không có sự khác biệt nào được nhận thấy trong nghiên cứu xếp hạng con người song song có kiểm soát. Đó là bằng chứng xác thực bên ngoài, nhưng nó liên quan đến mô hình và lưu lượng truy cập của một công ty khác. Không có thước đo nào về cường độ hình mờ, tỷ lệ dương tính giả hoặc độ dài đoạn văn tối thiểu được công bố cụ thể cho Claude.
Cơ chế quản lý cũng vươn ra ngoài châu Âu. Vì Anthropic cho biết họ chưa thể xác định phạm vi hình mờ theo khu vực nên nghĩa vụ minh bạch của EU đang được đáp ứng bằng cách thay đổi kết quả đầu ra cho người dùng trên toàn thế giới. Quy tắc thực hành ràng buộc nhiều nhà cung cấp, do đó, các nhà phát triển khác được mong đợi có điểm tương đương, mỗi nhà phát triển có khóa riêng và có thể có phương pháp riêng. Điều đó chỉ ra bối cảnh xác minh bị phân mảnh: không có trình phát hiện duy nhất nào bao gồm tất cả các mô hình, kiểm tra chạy qua các điểm cuối do nhà cung cấp kiểm soát và các mô hình trọng lượng mở - trong đó việc lấy mẫu được kiểm soát bởi bất kỳ ai chạy mô hình - phần lớn nằm ngoài kế hoạch.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?
Xem gì tiếp theo
API phát hiện chưa được phát hành sẽ quyết định xem điều này có thể sử dụng được trong thực tế hay không: các thuật ngữ truy cập, điểm tin cậy, điều chỉnh dương tính giả và độ dài văn bản tối thiểu đều không được chỉ định. Cũng mở: những mẫu nào được vận chuyển cùng với nó, các mẫu trước tháng 8 năm 2026 được trang bị thêm nhanh như thế nào và liệu ứng dụng toàn cầu sau đó có bị thu hẹp ở EU hay không.
API phát hiện là phần xác định xem liệu bất kỳ thứ nào trong số này có thể sử dụng được hay không. Chưa được giải quyết: ai có quyền truy cập, dù là miễn phí hay theo đồng hồ, nó trả về điểm tin cậy nào, tỷ lệ dương tính giả nào được điều chỉnh và độ dài văn bản tối thiểu mà nó yêu cầu. Những lựa chọn đó quyết định liệu hình mờ có trở thành một công cụ hỗ trợ pháp lý cẩn thận hay một công cụ cùn trong lớp học và điều tra nhân sự hay không. Anthropic chưa đưa ra ngày phát hành.
Thứ hai, độ che phủ. Bài đăng không xác định những mẫu sắp ra mắt nào mang hình mờ hoặc thời điểm chúng xuất xưởng và các mẫu trang bị thêm được phát hành trước ngày 2 tháng 8 năm 2026 chỉ được mô tả là sẽ ra mắt trong những tháng tới. Cho đến khi hoàn tất, một lượng lớn đầu ra Claude hiện có vẫn chưa được đánh dấu và bất kỳ máy dò nào cũng sẽ có những điểm mù mà người dùng xuôi dòng không thể dễ dàng nhận ra.
Thứ ba, độ bền. Các nhà nghiên cứu đã nhiều lần thăm dò các kế hoạch tạo hình chìm mờ bằng cách diễn giải, dịch mô hình chéo và chỉnh sửa ở cấp độ mã thông báo, và tài khoản riêng của Anthropic thừa nhận rằng việc viết lại hoàn toàn sẽ đánh bại nhãn hiệu đó. Dự kiến các cuộc tấn công đã được công bố — và khi API phát hiện tồn tại, sẽ có các phân tích dương tính giả độc lập. Những kết quả đó, thay vì tài liệu của nhà cung cấp, sẽ xác định mức độ tín hiệu có thể chịu được.
Cuối cùng, hãy xem liệu ứng dụng toàn cầu có thu hẹp hay không. Anthropic cho biết họ sẽ tiếp tục đánh giá các cập nhật về phạm vi khu vực và chia sẻ. Cũng đáng theo dõi: cách những người ký Quy tắc thực hành khác triển khai nhãn hiệu của riêng họ, liệu có lớp xác minh chung nào xuất hiện hay không và liệu các cơ quan quản lý của EU có đưa ra hướng dẫn về những gì được coi là đánh dấu đầy đủ cho mã, đầu ra ngắn và văn bản con người được chỉnh sửa nhẹ hay không - những trường hợp kỹ thuật này được thiết kế yếu nhất.