Tấn công suy luận thành viên
Một cuộc tấn công suy luận thành viên cố gắng xác định xem dữ liệu của một người cụ thể có được sử dụng để huấn luyện một mô hình hay không chỉ bằng cách thăm dò mô hình.
Tổng quan
It matters because confirming someone was in a medical or financial training set can itself be a serious privacy breach.
Lặn sâu
Suy luận thành viên khai thác một trực giác đơn giản: các mô hình có xu hướng hành xử khác nhau trên dữ liệu mà chúng ghi nhớ trong quá trình đào tạo so với dữ liệu chúng chưa từng thấy. Cuộc tấn công tinh vi năm 2017 của Shokri và các đồng nghiệp đã đào tạo 'mô hình bóng' bắt chước mục tiêu, sau đó đào tạo một bộ phân loại để nhận ra mô hình độ tin cậy của các thành viên so với những người không phải thành viên. Nhiều cuộc tấn công sau này đơn giản hơn: một ví dụ thành viên thường tạo ra tổn thất thấp hơn hoặc độ tin cậy cao hơn so với một ví dụ không phải thành viên tương đương. Trang bị quá mức sẽ khuếch đại khoảng cách này, vì vậy các bản ghi hiếm hoặc được ghi nhớ nhiều sẽ bị lộ nhiều nhất. Sự nguy hiểm là theo ngữ cảnh. Nếu một mô hình chỉ được đào tạo trên những bệnh nhân có chẩn đoán cụ thể, việc chứng minh tư cách thành viên sẽ tiết lộ chẩn đoán. Những cuộc tấn công này là thử nghiệm thực nghiệm tiêu chuẩn về việc liệu một mô hình có rò rỉ dữ liệu huấn luyện hay không.
Hiểu biết kỹ thuật
Các cuộc tấn công hiện đại mạnh nhất, như Tấn công tỷ lệ khả năng (LiRA), hiệu chỉnh độ khó trên từng ví dụ bằng cách so sánh tổn thất của mô hình mục tiêu trên một bản ghi với phân bổ tổn thất từ nhiều mô hình được đào tạo có và không có bản ghi đó. Việc hiệu chuẩn này loại bỏ nhiễu khỏi các ví dụ đơn giản là dễ hoặc khó, làm sắc nét tín hiệu giữa thành viên và không phải thành viên và tăng đáng kể tỷ lệ dương tính thật ở tỷ lệ dương tính giả thấp.
Tác động chiến lược
Rủi ro và an toàn
Những tác hại thảm khốc và thường ngày của AI đều phụ thuộc vào việc ai hiểu được rủi ro và ai có thể hành động.
Quyết định rõ ràng hơn
Kiến thức công cộng và chuyên môn định hình liệu chính sách an toàn mạnh mẽ có khả thi về mặt chính trị hay không.
Phá vỡ sự thổi phồng
Những lời giải thích rõ ràng làm giảm sự thu hút bởi sự cường điệu, PR trong phòng thí nghiệm và sân khấu đạo đức mơ hồ.
Tương lai của các cuộc tấn công suy luận thành viên
Khi các mô hình đào tạo dựa trên dữ liệu cá nhân ngày càng nhiều, việc suy luận của thành viên đang trở thành một hoạt động kiểm tra bắt buộc chứ không phải là sự tò mò mang tính học thuật. Các cơ quan quản lý giải thích GDPR và các luật tương tự ngày càng coi dữ liệu đào tạo được ghi nhớ là dữ liệu cá nhân, do đó, các cuộc tấn công sẽ tăng gấp đôi như các bài kiểm tra tuân thủ. Biện pháp bảo vệ chính, quyền riêng tư khác biệt, đưa ra các giới hạn có thể chứng minh được nhưng lại tốn kém độ chính xác, thúc đẩy nghiên cứu theo hướng tính toán quyền riêng tư chặt chẽ hơn, bảo vệ có chọn lọc các hồ sơ hiếm và loại bỏ khả năng học hỏi của máy để loại bỏ các cá nhân theo yêu cầu.
Triển khai trong thế giới thực
Kiểm tra mô hình chẩn đoán của bệnh viện để kiểm tra xem hồ sơ bệnh nhân riêng lẻ có thể được xác định là dữ liệu đào tạo hay không
Chứng minh sự rò rỉ liên quan đến GDPR bằng cách hiển thị một bản ghi người dùng cụ thể được ghi nhớ theo mô hình
Nhóm lại một mô hình ngôn ngữ để kiểm tra xem email hoặc tài liệu riêng tư có nằm trong kho dữ liệu đào tạo của nó không
Đánh giá xem liệu đào tạo về quyền riêng tư khác biệt có thực sự thu hẹp khoảng cách giữa thành viên và không phải thành viên hay không
Rủi ro & lan can
Xử lý rủi ro hiện hữu như khoa học viễn tưởng trong khi khả năng lại phức tạp.
Nhầm lẫn giữa an toàn sản phẩm bề mặt với sự liên kết dưới quyền tự chủ cao.
Chỉ để lại những khán giả không phải người Anh và không có chuyên môn với những nguồn chất lượng thấp.
Lộ trình thực hiện
Tách biệt các tác hại của sản phẩm, sử dụng sai và rủi ro mất kiểm soát/sai lệch.
Hỏi bằng chứng nào sẽ thay đổi quan điểm của bạn về thời gian và mức độ nghiêm trọng.
Ưu tiên các nguồn chính và đánh giá cụ thể hơn các tuyên bố tiếp thị.
Xác định một lộ trình hành động: sự nghiệp, chính sách, nguồn tài trợ hoặc kỹ năng - không chỉ là nhận thức.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Membership Inference Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Tấn công tiêm nhắc
Câu hỏi thường gặp
What is Membership Inference Attacks?
Một cuộc tấn công suy luận thành viên cố gắng xác định xem dữ liệu của một người cụ thể có được sử dụng để huấn luyện một mô hình hay không chỉ bằng cách thăm dò mô hình. Điều này quan trọng vì việc xác nhận ai đó đang tham gia chương trình đào tạo y tế hoặc tài chính có thể là hành vi vi phạm quyền riêng tư nghiêm trọng.
Một cuộc tấn công suy luận thành viên đang cố gắng xác định là gì?
Cuộc tấn công suy ra tư cách thành viên: liệu một điểm dữ liệu nhất định có được sử dụng để huấn luyện mô hình hay không, bản thân nó có thể làm rò rỉ thông tin nhạy cảm.
Thuộc tính mô hình nào làm tăng khả năng dễ bị tổn thương nhất đối với các cuộc tấn công này?
Trang bị quá mức sẽ mở rộng khoảng cách hành vi giữa các thành viên đào tạo và dữ liệu không nhìn thấy, giúp phát hiện tư cách thành viên dễ dàng hơn.
Shokri et al. 2017 ban đầu đã thực hiện kỹ thuật gì. dựa vào tấn công?
Họ đã huấn luyện các mô hình bóng bắt chước mục tiêu để tạo ra hành vi được gắn nhãn thành viên/không phải thành viên cho bộ phân loại tấn công.
Tại sao suy luận của thành viên có thể có hại ngay cả khi không tiết lộ nội dung của hồ sơ?
Nếu một tập dữ liệu được xác định bởi một thuộc tính nhạy cảm thì chỉ cần xác nhận sự hiện diện của ai đó sẽ tiết lộ thuộc tính đó.
Điều gì làm cho Tỷ lệ tấn công khả năng xảy ra (LiRA) mạnh hơn ngưỡng tổn thất ngây thơ?
LiRA so sánh tổn thất mục tiêu với các phân phối từ các mô hình được đào tạo có và không có mỗi bản ghi, loại bỏ nhiễu độ khó trên mỗi ví dụ.