HƯỚNG DẪN xã hội

Ngộ độc dữ liệu và tấn công cửa sau

Việc đầu độc dữ liệu làm hỏng một mô hình bằng cách giả mạo dữ liệu huấn luyện của nó và các cuộc tấn công cửa sau che giấu một yếu tố kích hoạt bí mật khiến mô hình hoạt động sai lệnh.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.

Lặn sâu

Các cuộc tấn công đầu độc được chia thành hai mục tiêu lớn. Các cuộc tấn công vào tính khả dụng nhằm mục đích làm giảm độ chính xác tổng thể bằng cách đưa vào các ví dụ bị gắn nhãn sai hoặc bị hỏng. Các cuộc tấn công có mục tiêu và cửa sau lén lút hơn: mô hình hoạt động hoàn hảo trên các đầu vào thông thường nhưng tạo ra đầu ra do kẻ tấn công chọn bất cứ khi nào một trình kích hoạt ẩn xuất hiện, chẳng hạn như một bản vá pixel nhỏ, một cụm từ cụ thể hoặc hình mờ vô hình. Tác phẩm của BadNets hiển thị một bộ phân loại biển báo dừng đọc biển báo được đánh dấu bằng nhãn dán là 'giới hạn tốc độ'. Các hệ thống hiện đại bị lộ vì chúng đào tạo trên dữ liệu quy mô web. Các nhà nghiên cứu đã chứng minh rằng việc mua các tên miền hết hạn đằng sau một phần nhỏ URL của tập dữ liệu có thể đầu độc các tập dữ liệu hình ảnh phổ biến với giá vài trăm đô la. Các mô hình ngôn ngữ cũng có thể bị cài cửa sau thông qua các ví dụ hướng dẫn hoặc dữ liệu tinh chỉnh bị nhiễm độc.

Hiểu biết kỹ thuật

Cửa sau có nhãn sạch đặc biệt nguy hiểm: các mẫu bị nhiễm độc giữ nhãn chính xác và trông bình thường đối với người đánh giá, tuy nhiên chúng lại nhúng một tính năng kích hoạt mà mô hình học cách liên kết với lớp mục tiêu. Khi suy luận, việc đưa ra trình kích hoạt sẽ đảo ngược dự đoán trong khi độ chính xác rõ ràng vẫn ở mức cao, do đó việc xác thực tiêu chuẩn không bao giờ nắm bắt được nó. Các biện pháp bảo vệ bao gồm phân cụm kích hoạt, chữ ký quang phổ, tái thiết kích hoạt và kiểm tra nguồn gốc dữ liệu.

Tác động chiến lược

Rủi ro và an toàn

Những tác hại thảm khốc và thường ngày của AI đều phụ thuộc vào việc ai hiểu được rủi ro và ai có thể hành động.

Quyết định rõ ràng hơn

Kiến thức công cộng và chuyên môn định hình liệu chính sách an toàn mạnh mẽ có khả thi về mặt chính trị hay không.

Phá vỡ sự thổi phồng

Những lời giải thích rõ ràng làm giảm sự thu hút bởi sự cường điệu, PR trong phòng thí nghiệm và sân khấu đạo đức mơ hồ.

Tương lai của ngộ độc dữ liệu và tấn công cửa sau

Do chuỗi cung ứng dựa vào dữ liệu đã được thu thập, trọng lượng đã được sàng lọc trước và sự tinh chỉnh của bên thứ ba, nên việc đầu độc đang chuyển từ lý thuyết sang mối đe dọa thực sự đối với chuỗi cung ứng. Yêu cầu các tiêu chuẩn về ký và xuất xứ dữ liệu, đào tạo về độ mạnh được chứng nhận nhằm hạn chế thiệt hại từ một số điểm bị nhiễm độc cố định và quét cửa sau liên tục các mô hình trước khi triển khai. Các cơ quan quản lý và khuôn khổ bảo mật như MITER ATLAS đang bắt đầu coi ngộ độc là rủi ro học máy hạng nhất.

Triển khai trong thế giới thực

Mô hình trực quan dành cho ô tô tự lái đọc nhầm biển báo dừng là biển báo giới hạn tốc độ khi có một nhãn dán kích hoạt nhỏ

Đầu độc một tập dữ liệu hình ảnh công khai với giá rẻ bằng cách chiếm đoạt các miền đã hết hạn lưu trữ một phần URL hình ảnh của nó

Tạo cửa sau cho mô hình hoàn thiện mã để cụm từ nhắc nhở ẩn khiến mô hình này chèn mã không an toàn

Làm hỏng phản hồi đào tạo có nguồn lực từ cộng đồng của bộ lọc thư rác để các email độc hại cụ thể lọt qua

Rủi ro & lan can

Xử lý rủi ro hiện hữu như khoa học viễn tưởng trong khi khả năng lại phức tạp.

Nhầm lẫn giữa an toàn sản phẩm bề mặt với sự liên kết dưới quyền tự chủ cao.

Chỉ để lại những khán giả không phải người Anh và không có chuyên môn với những nguồn chất lượng thấp.

Lộ trình thực hiện

1

Tách biệt các tác hại của sản phẩm, sử dụng sai và rủi ro mất kiểm soát/sai lệch.

2

Hỏi bằng chứng nào sẽ thay đổi quan điểm của bạn về thời gian và mức độ nghiêm trọng.

3

Ưu tiên các nguồn chính và đánh giá cụ thể hơn các tuyên bố tiếp thị.

4

Xác định một lộ trình hành động: sự nghiệp, chính sách, nguồn tài trợ hoặc kỹ năng - không chỉ là nhận thức.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Poisoning and Backdoor Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

What is Data Poisoning and Backdoor Attacks?

Việc đầu độc dữ liệu làm hỏng một mô hình bằng cách giả mạo dữ liệu huấn luyện của nó và các cuộc tấn công cửa sau che giấu một yếu tố kích hoạt bí mật khiến mô hình hoạt động sai lệnh. Chúng quan trọng vì các mô hình ngày càng học hỏi từ dữ liệu được thu thập từ cộng đồng mà những kẻ tấn công có thể âm thầm lây nhiễm.

Điều gì phân biệt một cuộc tấn công cửa sau với một cuộc tấn công đầu độc tính khả dụng chung?

Các mô hình có cửa sau hoạt động bình thường trên các đầu vào sạch và chỉ tạo ra đầu ra mục tiêu của kẻ tấn công khi trình kích hoạt ẩn xuất hiện.

Tại sao các cuộc tấn công cửa sau nhãn sạch khó bị phát hiện?

Vì các mẫu bị nhiễm độc có nhãn chính xác và có vẻ bình thường nên việc đánh giá của con người và độ chính xác xác thực theo tiêu chuẩn không gắn cờ chúng.

Nghiên cứu của BadNets đã chứng minh điều gì nổi tiếng?

BadNets đã hiển thị một trình phân loại biển báo giao thông có cửa sau giúp đọc sai các biển báo dừng được đánh dấu bằng một nhãn dán nhỏ.

Làm thế nào các nhà nghiên cứu cho thấy các bộ dữ liệu quy mô web có thể bị đầu độc với giá rẻ?

Vì bộ dữ liệu tham chiếu hình ảnh theo URL nên việc mua các miền hết hạn cho phép kẻ tấn công kiểm soát những hình ảnh đó với một khoản chi phí nhỏ.

Biện pháp nào sau đây được công nhận là biện pháp phòng vệ chống lại các cuộc tấn công cửa sau?

Phòng thủ phân tích các kích hoạt bên trong để tách các mẫu bị nhiễm độc khỏi các mẫu sạch, trong số các phương pháp phát hiện khác.