HƯỚNG DẪN AI về ngôn ngữ

Bẻ khóa và lập nhóm đỏ

Bẻ khóa là phương pháp tạo ra các lời nhắc nhằm đánh lừa mô hình AI bỏ qua các quy tắc an toàn của nó, trong khi đội đỏ là nỗ lực có tổ chức để tìm ra những điểm yếu đó trước khi những kẻ xấu thực hiện.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Together they form the adversarial testing loop that makes deployed AI systems safer.

Lặn sâu

Các mô hình ngôn ngữ lớn được đào tạo để từ chối các yêu cầu có hại, nhưng những rào cản đó chỉ mang tính thống kê chứ không phải tuyệt đối. Các cuộc bẻ khóa khai thác điều này bằng cách điều chỉnh lại một yêu cầu bị cấm để nó vượt qua những lời từ chối đã học được của mô hình. Các kỹ thuật cổ điển bao gồm nhập vai ('giả vờ bạn là AI không có quy tắc'), nhân vật 'DAN' (Làm bất cứ điều gì ngay bây giờ) khét tiếng, đóng khung giả định, chèn nhanh thông qua các hướng dẫn ẩn, các thủ thuật mã hóa như Base64 hoặc leetspeak và bẻ khóa 'nhiều lần' làm tràn ngập một cửa sổ ngữ cảnh dài với các ví dụ tuân thủ giả. Đội đỏ đã giải quyết vấn đề này: các nhóm chuyên dụng và hệ thống tự động thăm dò một mô hình với hàng nghìn lời nhắc đối nghịch trước khi phát hành, lập danh mục các lỗi để các kỹ sư có thể vá chúng thông qua tinh chỉnh, học hỏi tăng cường từ phản hồi của con người và bổ sung các bộ lọc phân loại.

Hiểu biết kỹ thuật

Hành vi an toàn được học thông qua tinh chỉnh và RLHF, tạo ra một 'ranh giới từ chối' mỏng đối với một mô hình đã tiếp thu kiến ​​thức sâu rộng. Việc bẻ khóa hoạt động bằng cách dịch chuyển phân phối đầu vào ra khỏi các ví dụ được sử dụng trong quá trình huấn luyện an toàn, do đó, động lực hữu ích của mô hình sẽ ghi đè lên tín hiệu từ chối yếu hơn của nó. Kiểm tra nhiều lớp phòng thủ: bộ phân loại đầu vào/đầu ra, AI tự phê bình theo hiến pháp và đào tạo đối thủ để bổ sung các bản bẻ khóa được phát hiện trở lại tập huấn luyện.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của việc bẻ khóa và hợp tác đỏ

Mong đợi một cuộc chạy đua vũ trang đang diễn ra. Nhóm đỏ tự động, trong đó một mô hình tấn công một mô hình khác, đang mở rộng quy mô nhanh hơn so với thử nghiệm thủ công và gặp phải các lỗi kỳ lạ. Những người bảo vệ đang hướng tới 'phòng thủ theo chiều sâu': các bộ phân loại hiến pháp, giám sát thời gian thực và đào tạo chống giả mạo giúp đưa những lời từ chối trở nên sâu sắc hơn. Các cơ quan quản lý và tiêu chuẩn ngày càng yêu cầu các kết quả của nhóm đỏ được ghi lại trước khi xuất xưởng các mô hình có khả năng cao, khiến việc thử nghiệm đối thủ trở thành một phần thường xuyên, có thể kiểm tra được trong quy trình phát hành AI thay vì phải suy nghĩ lại.

Triển khai trong thế giới thực

Anthropic đã thực hiện một 'tiền thưởng bẻ khóa' công khai, mời hàng nghìn người thử nghiệm phá vỡ Bộ phân loại Hiến pháp của nó và khen thưởng bất kỳ ai tìm thấy một bản bẻ khóa phổ quát.

Các nhà nghiên cứu đã chứng minh tính năng 'bẻ khóa nhiều lần', cho thấy rằng việc lấp đầy một cửa sổ ngữ cảnh dài với hàng trăm cặp Hỏi & Đáp giả mạo có hại có thể làm giảm khả năng từ chối của người mẫu.

OpenAI, Google và Anthropic duy trì các đội đỏ nội bộ cùng với mạng lưới chuyên gia bên ngoài nhằm thăm dò các mô hình về rủi ro vũ khí sinh học, mạng và an toàn trẻ em trước khi ra mắt.

Các công ty bảo mật hiện cung cấp thử nghiệm thâm nhập LLM, quét chatbot để tìm lỗ hổng kịp thời trong các ứng dụng hướng tới khách hàng như trợ lý ngân hàng và chăm sóc sức khỏe.

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jailbreaking and Red-Teaming quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Điều phối công cụ đại lý

Câu hỏi thường gặp

What is Jailbreaking and Red-Teaming?

Bẻ khóa là phương pháp tạo ra các lời nhắc nhằm đánh lừa mô hình AI bỏ qua các quy tắc an toàn của nó, trong khi đội đỏ là nỗ lực có tổ chức để tìm ra những điểm yếu đó trước khi những kẻ xấu thực hiện. Chúng cùng nhau tạo thành vòng thử nghiệm đối nghịch giúp các hệ thống AI được triển khai an toàn hơn.

Mục tiêu chính của lời nhắc bẻ khóa là gì?

Một bản bẻ khóa được tạo ra đặc biệt để khiến một mô hình bỏ qua hoặc phá vỡ các rào cản an toàn mà nó đã được đào tạo để tuân theo.

'Đội đỏ' ám chỉ điều gì về an toàn AI?

Đội đỏ mượn thuật ngữ bảo mật để chỉ những kẻ tấn công thân thiện, những người thăm dò hệ thống để vạch ra những điểm yếu để có thể khắc phục chúng.

Tại sao việc bẻ khóa nhiều lần hoạt động tốt hơn khi cửa sổ ngữ cảnh dài hơn?

Việc bẻ khóa nhiều lần đưa hàng trăm ví dụ Hỏi & Đáp có hại bịa đặt vào một bối cảnh dài, khiến mô hình thiên về việc tuân thủ thông qua học tập trong ngữ cảnh.

Cái nào trong số này là biện pháp bảo vệ được công nhận chống lại việc bẻ khóa?

Các trình phân loại theo lớp kiểm tra cả lời nhắc đến và phản hồi gửi đi là kỹ thuật 'phòng thủ chuyên sâu' cốt lõi chống lại các cuộc bẻ khóa.

Tại sao các rào cản an toàn của một mẫu xe được mô tả là 'có tính thống kê, không phải tuyệt đối'?

An toàn được giảng dạy thông qua việc tinh chỉnh và RLHF, do đó, có một xu hướng đã học được là các yếu tố đầu vào đối nghịch bên ngoài quá trình phân bổ đào tạo đôi khi có thể đánh bại.