HƯỚNG DẪN xã hội

Bảo mật AI

Bảo mật AI bảo vệ mô hình, dữ liệu, công cụ và các dịch vụ xung quanh khỏi truy cập trái phép hoặc thao túng.

Đọc trong 2 phútCập nhật lần cuối Một phần trong lộ trình học Chính sách & Xã hội AI

Tổng quan

Nó bao gồm bảo mật phần mềm thông thường và các mối đe dọa nhắm vào việc học hoặc hành vi mô hình. Một thiết kế bảo mật bắt đầu từ tài sản, đối thủ và ranh giới tin cậy của ứng dụng thực tế.

Những điểm chính rút ra

  • Mô hình hóa toàn bộ ứng dụng theo mối đe dọa.
  • Thực thi quyền bên ngoài mô hình.
  • Kiểm tra lại các điều khiển giữa các thay đổi hệ thống.

Lặn sâu

Xác định những gì cần bảo vệ: đầu vào riêng tư, dữ liệu huấn luyện, hiện vật mô hình, thông tin xác thực, tài khoản kết nối và các hành động bên ngoài. Ghi lại ai có thể ảnh hưởng đến từng đầu vào và những gì kẻ tấn công có thể thu được từ thất bại. Chatbot công khai và một agent nội bộ có quyền ghi có các mô hình mối đe dọa khác nhau. Mối đe dọa có thể ảnh hưởng đến các giai đoạn khác nhau. Tài liệu huấn luyện bị nhiễm độc có thể thay đổi hành vi đã học; đầu vào đối kháng có thể thao túng dự đoán; Nội dung truy xuất không đáng tin cậy có thể chuyển hướng ứng dụng sử dụng công cụ. Đầu ra mô hình cũng có thể nguy hiểm khi được chèn vào truy vấn cơ sở dữ liệu, trang web hoặc lệnh mà không được xử lý phù hợp. Áp dụng các điều khiển tại ranh giới phần mềm. Thực thi quyền trong mã, giữ bí mật ngoài bối cảnh hiển thị của mô hình khi có thể, giới hạn phạm vi công cụ và xác thực đầu ra trước khi sử dụng. Một lời nhắc yêu cầu mô hình hoạt động an toàn không thể thay thế việc cô lập tài khoản hoặc kiểm tra quyền. Kiểm tra các đường dẫn lỗi đại diện trong môi trường được ủy quyền và duy trì quy trình sự cố. Ghi lại đủ thông tin để điều tra mà không thu thập nội dung nhạy cảm không cần thiết. Đánh giá các biện pháp kiểm soát sau khi thay đổi mô hình, nguồn truy xuất, công cụ và các phụ thuộc. Mô tả rủi ro còn lại một cách trung thực; không có bộ lọc duy nhất nào thiết lập được sự bảo vệ hoàn toàn.

Hiểu biết kỹ thuật

Một mô hình từ chối một nhắc nhở độc hại không chứng minh hệ thống an toàn. Các đầu vào, công cụ, phương thức và ranh giới thành phần khác nhau có thể tạo ra các đường lỗi riêng biệt.

Xác định ranh giới bảo mật

  1. Hãy tưởng tượng một trợ lý đang tìm kiếm một người dùng đã đăng nhập trong kho tài liệu riêng tư.
  2. Áp dụng bộ lọc truy cập của người dùng trong dịch vụ truy xuất trước khi tài liệu vào ngữ cảnh mô hình.
  3. Kiểm tra với tài liệu thuộc tài khoản khác và xác minh rằng cả nội dung lẫn siêu dữ liệu nhận dạng đều không xuất hiện trong kết quả.

Bài kiểm tra phòng thủ, giả định này kiểm tra sự cấp phép độc lập với mức độ sẵn lòng tuân theo chỉ dẫn của mô hình.

Tác động chiến lược

Rủi ro và an toàn

Những tác hại thảm khốc và thường ngày của AI đều phụ thuộc vào việc ai hiểu được rủi ro và ai có thể hành động.

Quyết định rõ ràng hơn

Kiến thức công cộng và chuyên môn định hình liệu chính sách an toàn mạnh mẽ có khả thi về mặt chính trị hay không.

Phá vỡ sự thổi phồng

Những lời giải thích rõ ràng làm giảm sự thu hút bởi sự cường điệu, PR trong phòng thí nghiệm và sân khấu đạo đức mơ hồ.

Triển khai trong thế giới thực

Kiểm tra xem một tài khoản không thể lấy tài liệu của tài khoản khác.

Xác thực các trường đã tạo trước khi sử dụng chúng trong thao tác cơ sở dữ liệu.

Rủi ro & lan can

Xử lý rủi ro hiện hữu như khoa học viễn tưởng trong khi khả năng lại phức tạp.

Nhầm lẫn giữa an toàn sản phẩm bề mặt với sự liên kết dưới quyền tự chủ cao.

Chỉ để lại những khán giả không phải người Anh và không có chuyên môn với những nguồn chất lượng thấp.

Lộ trình thực hiện

1

Tách biệt các tác hại của sản phẩm, sử dụng sai và rủi ro mất kiểm soát/sai lệch.

2

Hỏi bằng chứng nào sẽ thay đổi quan điểm của bạn về thời gian và mức độ nghiêm trọng.

3

Ưu tiên các nguồn chính và đánh giá cụ thể hơn các tuyên bố tiếp thị.

4

Xác định một lộ trình hành động: sự nghiệp, chính sách, nguồn tài trợ hoặc kỹ năng - không chỉ là nhận thức.

Nguồn tham khảo và đọc thêm

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI Security quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Tiếp theo trong Chính sách & Xã hội AI

An toàn AI

Câu hỏi thường gặp

Liệu một hệ thống nhắc nhở mạnh có đủ để có được trợ lý không?

Không. Xác thực, ủy quyền, xử lý đầu vào và đầu ra, giới hạn công cụ và phản ứng sự cố vẫn là những phần cần thiết của ứng dụng.