Tấn công khai thác và đánh cắp mô hình
Các cuộc tấn công trích xuất mô hình cho phép kẻ thù sao chép một mô hình AI độc quyền chỉ bằng cách truy vấn API công khai của nó và huấn luyện kẻ bắt chước các câu trả lời.
Tổng quan
It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.
Lặn sâu
Một cuộc tấn công trích xuất mô hình (hoặc đánh cắp mô hình) coi mô hình được triển khai như một lời tiên tri. Kẻ tấn công gửi đầu vào, ghi lại đầu ra và huấn luyện một mô hình thay thế để bắt chước hành vi. Bởi vì bản thân mô hình đích là một hàm đã học ánh xạ đầu vào thành đầu ra, nên việc sao chép đủ các cặp đầu vào-đầu ra có thể tái tạo lại giá trị gần đúng mà không cần nhìn thấy trọng số hoặc dữ liệu huấn luyện ban đầu. Các nhà nghiên cứu đã đánh cắp ranh giới quyết định của bộ phân loại hình ảnh và thậm chí còn khôi phục được trọng số chính xác của các lớp nhỏ. Vào năm 2024, một nhóm đã cho thấy các phần của lớp nhúng mô hình sản xuất OpenAI và Google có thể được trích xuất với chi phí dưới vài trăm đô la. Các bản sao bị đánh cắp đã cắt giảm các dịch vụ phải trả phí, bỏ qua các bộ lọc an toàn và cho phép các cuộc tấn công hộp trắng tiếp theo như tạo ra các ví dụ đối nghịch.
Hiểu biết kỹ thuật
Phản hồi API càng phong phú thì hành vi trộm cắp càng rẻ. Việc trả về các vectơ hoặc nhật ký xác suất đầy đủ sẽ làm rò rỉ nhiều thông tin cho mỗi truy vấn hơn so với một nhãn top 1 duy nhất, vì vậy những kẻ tấn công sẽ xây dựng lại ranh giới với ít truy vấn hơn. Chiến lược học tập tích cực chọn các truy vấn có nhiều thông tin nhất gần ranh giới quyết định. Một kết quả mang tính bước ngoặt cho thấy rằng việc truy vấn chỉ qua số thứ nguyên đầu ra có thể khôi phục lớp chiếu tuyến tính cuối cùng một cách chính xác thông qua đại số tuyến tính, vì lớp đó thực sự là một ma trận có phạm vi phản hồi.
Tác động chiến lược
Rủi ro và an toàn
Những tác hại thảm khốc và thường ngày của AI đều phụ thuộc vào việc ai hiểu được rủi ro và ai có thể hành động.
Quyết định rõ ràng hơn
Kiến thức công cộng và chuyên môn định hình liệu chính sách an toàn mạnh mẽ có khả thi về mặt chính trị hay không.
Phá vỡ sự thổi phồng
Những lời giải thích rõ ràng làm giảm sự thu hút bởi sự cường điệu, PR trong phòng thí nghiệm và sân khấu đạo đức mơ hồ.
Tương lai của các cuộc tấn công khai thác và đánh cắp mô hình
Các biện pháp phòng vệ đang chuyển từ chặn sang phát hiện và suy giảm: giới hạn tốc độ, trả về kết quả đầu ra được làm tròn hoặc chỉ trên 1, thêm nhiễu đã hiệu chỉnh, hoạt động của mô hình hình chìm mờ để các bản sao bị đánh cắp có thể được lấy dấu vân tay và giám sát các mẫu truy vấn để tìm chữ ký trích xuất. Mong đợi các điều khoản về quy định và cấp phép coi việc trích xuất là hành vi trộm cắp, cộng với nghiên cứu tích cực về các kiến trúc được chứng minh là khó trích xuất. Khi các mô hình ngày càng lớn hơn, việc chiết xuất toàn bộ vẫn tốn kém, nhưng việc chiết xuất một phần các thành phần có giá trị và nhân bản theo kiểu chưng cất sẽ vẫn là mối đe dọa an ninh và thương mại dai dẳng.
Triển khai trong thế giới thực
Một công ty khởi nghiệp truy vấn API nhận dạng hình ảnh phải trả phí của đối thủ cạnh tranh hàng nghìn lần và đào tạo một bản sao miễn phí sao chép độ chính xác của nó.
Các nhà nghiên cứu bảo mật trích xuất lớp nhúng-chiếu cuối cùng của mô hình ngôn ngữ sản xuất bằng cách sử dụng các truy vấn API được chế tạo cẩn thận với chi phí chỉ vài trăm đô la.
Kẻ tấn công sao chép cục bộ bộ phân loại thư rác hoặc gian lận để chúng có thể thăm dò nó ngoại tuyến và tạo ra các dữ liệu đầu vào có khả năng tránh bị phát hiện một cách đáng tin cậy.
Nhà cung cấp đám mây bổ sung tính năng giám sát tốc độ truy vấn để gắn cờ tài khoản có mẫu truy cập phù hợp với quá trình trích xuất học tập tích cực và điều chỉnh phản hồi của tài khoản đó.
Rủi ro & lan can
Xử lý rủi ro hiện hữu như khoa học viễn tưởng trong khi khả năng lại phức tạp.
Nhầm lẫn giữa an toàn sản phẩm bề mặt với sự liên kết dưới quyền tự chủ cao.
Chỉ để lại những khán giả không phải người Anh và không có chuyên môn với những nguồn chất lượng thấp.
Lộ trình thực hiện
Tách biệt các tác hại của sản phẩm, sử dụng sai và rủi ro mất kiểm soát/sai lệch.
Hỏi bằng chứng nào sẽ thay đổi quan điểm của bạn về thời gian và mức độ nghiêm trọng.
Ưu tiên các nguồn chính và đánh giá cụ thể hơn các tuyên bố tiếp thị.
Xác định một lộ trình hành động: sự nghiệp, chính sách, nguồn tài trợ hoặc kỹ năng - không chỉ là nhận thức.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Extraction and Stealing Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Tấn công suy luận thành viên
Câu hỏi thường gặp
What is Model Extraction and Stealing Attacks?
Các cuộc tấn công trích xuất mô hình cho phép kẻ thù sao chép một mô hình AI độc quyền chỉ bằng cách truy vấn API công khai của nó và huấn luyện kẻ bắt chước các câu trả lời. Điều này quan trọng vì các công ty chi hàng triệu mô hình đào tạo có thể xấp xỉ với mức giá vài nghìn lệnh gọi API.
Ý tưởng cốt lõi đằng sau cuộc tấn công trích xuất mô hình là gì?
Quá trình trích xuất coi mô hình đã triển khai như một lời tiên tri: kẻ tấn công thu thập các cặp đầu vào-đầu ra và huấn luyện một mô hình sao chép để bắt chước hành vi mà không cần truy cập vào trọng số ban đầu.
Tại sao việc trả về các vectơ xác suất đầy đủ lại giúp việc trích xuất dễ dàng hơn việc chỉ trả về nhãn top 1?
Mỗi vectơ xác suất đầy đủ tiết lộ nhiều thông tin hơn về bề mặt quyết định bên trong của mô hình so với một nhãn duy nhất, cho phép kẻ tấn công tái tạo lại ranh giới với ít truy vấn hơn.
Kỹ thuật phòng thủ nào trực tiếp làm giảm thông tin bị rò rỉ trên mỗi truy vấn?
Kết quả đầu ra thô hơn, chẳng hạn như chỉ trả về nhãn trên cùng hoặc xác suất được làm tròn, sẽ làm giảm tín hiệu mà mỗi phản hồi cung cấp cho kẻ tấn công, làm tăng chi phí trích xuất.
Kết quả năm 2024 cho thấy những kẻ tấn công có thể khôi phục chính xác phần nào của mô hình ngôn ngữ sản xuất với giá rẻ?
Các nhà nghiên cứu đã chứng minh rằng lớp chiếu tuyến tính cuối cùng có thể được phục hồi với giá chính xác là vài trăm đô la, vì phản hồi của nó trải rộng trên một ma trận có thể phục hồi.
Tại sao một mô hình thay thế bị đánh cắp lại nguy hiểm ngoài việc mất doanh thu?
Sau khi kẻ tấn công có bản sao cục bộ, chúng có thể tự do thăm dò nó để thiết kế các đầu vào đối nghịch hoặc các cuộc tấn công trốn tránh nhằm đánh lừa hệ thống được triển khai ban đầu.