Chuyện gì đã xảy ra
Một bài nghiên cứu được đăng vào ngày 5 tháng 8 áp dụng một phương pháp từ thử nghiệm giáo dục để đo lường những gì mà tiêu chuẩn an toàn AI nắm bắt được, chọn các nhóm lời nhắc hữu ích nhỏ hơn và kiểm tra những thay đổi trong hành vi của mô hình.
Hai nhà nghiên cứu độc lập và hai nhà nghiên cứu liên kết với Viện An ninh AI của Vương quốc Anh đã đánh giá 192 mô hình trò chuyện theo 8 tiêu chuẩn bao gồm từ chối yêu cầu có hại, từ chối quá mức các yêu cầu vô hại, gây tổn hại theo ngữ cảnh và tính trung thực. Bộ đầy đủ chứa 5.255 lời nhắc trước khi xử lý trước; phân tích giữ lại 5.067 sau khi loại bỏ các câu trả lời không được tính điểm và các mục không phân biệt giữa các mô hình được thử nghiệm.
Nhóm coi các mô hình là người làm bài kiểm tra và các lời nhắc điểm chuẩn như các mục kiểm tra, sử dụng lý thuyết phản hồi mục để ước tính lời nhắc nào khó và mô hình nào được phân tách tốt nhất. Trong phân tích nhân tố chính, giải pháp ba yếu tố—được tóm tắt là sự nghiêm khắc từ chối, tính trung thực và tác hại theo ngữ cảnh—đã giải thích được 77% sự khác biệt trong khả năng của mô hình, so với 47% của một yếu tố duy nhất.
Trên 20 bài đánh giá được tổ chức, ba bài kiểm tra cố định 25 lần nhắc đã phục hồi ba yếu tố đó bằng cách sử dụng ít hơn 2% bộ dữ liệu. Đối với HarmBench, SORRY-Bench và OR-Bench-Hard, khoảng 10 lời nhắc được lựa chọn thích ứng đã tái tạo thứ hạng điểm chuẩn đầy đủ với hệ số tương quan từ 0,92 đến 0,94 và cắt giảm số lượng lời nhắc từ 97–99%; lợi thế bị thu hẹp khi ngân sách thử nghiệm tăng lên.
Việc nén không chỉ đơn giản là lấy mẫu ngẫu nhiên. Lý thuyết phản hồi mục ước tính mức độ khó của mỗi lời nhắc và mức độ phân tách các mô hình với các mẫu phản hồi khác nhau, sau đó chọn các mục duy trì cấu trúc của bài kiểm tra lớn hơn. Các tác giả đã so sánh các dạng ngắn cố định với lựa chọn thích ứng và đưa ra các đánh giá thay vì chỉ đo lường dữ liệu được sử dụng để chọn lời nhắc. Thiết kế đó hỗ trợ cho tuyên bố hẹp hơn rằng một số bảng xếp hạng chuẩn hiện có có thể được sao chép một cách hiệu quả; nó không cho thấy rằng bài kiểm tra 10 hoặc 25 mục có thể phát hiện ra một dạng lỗi hoàn toàn mới.
Chi tiết nguồn: Rivera and colleagues' research paper on arXiv ↗
Tại sao nó quan trọng
Nghiên cứu gợi ý rằng những lời nhắc được lựa chọn tốt hơn có thể giúp việc kiểm tra an toàn AI thường xuyên rẻ hơn mà không cần giả vờ rằng mọi điểm chuẩn đều đo lường một điểm an toàn chung.
Các thử nghiệm rẻ hơn có thể cho phép các nhà phát triển, phòng thí nghiệm nhỏ và người đánh giá độc lập kiểm tra nhiều phiên bản mô hình hơn trong quá trình đào tạo, tinh chỉnh, lượng tử hóa và thay đổi theo lời nhắc của hệ thống. Kết quả là tái tạo các phép đo điểm chuẩn hiện có một cách hiệu quả chứ không phải mở rộng những gì các điểm chuẩn đó có thể phát hiện.
Phân tích nhân tố cũng cho thấy sự đánh đổi về điểm số. Các tiêu chuẩn khen thưởng cho việc từ chối có thể trùng lặp với nhau, trong khi tiêu chuẩn để tránh những lời từ chối không cần thiết sẽ khen thưởng hành vi ngược lại. Việc tính trung bình chúng mà không giải thích các trọng số có thể che giấu liệu một mô hình có trở nên an toàn hơn hay không, chỉ hạn chế hơn hoặc ít hữu ích hơn đối với các yêu cầu lành tính.
Bài viết cũng đã thử nghiệm các phương pháp kiểm tra hộp đen đối với hành vi bao cát được thúc đẩy có chủ ý. Việc kiểm tra mẫu phản hồi đã phát hiện được hiệu quả hoạt động kém có chọn lọc nhưng bỏ sót hầu hết hoạt động kém hiệu quả đồng đều; việc thêm kiểm tra khả năng lịch sử đã nâng khả năng phát hiện kết hợp lên 94–97% trong các trường hợp mô phỏng. Điều đó hỗ trợ kiểm tra theo lớp thay vì dựa vào một điểm duy nhất.
Đối với các nhà phát triển, giá trị hoạt động là tần số. Một đánh giá ngắn hơn có thể được chạy lại sau khi thay đổi lời nhắc hệ thống, vượt qua lượng tử hóa, tinh chỉnh, cập nhật công cụ hoặc sửa đổi chính sách an toàn mà không tốn ngân sách cho một tiêu chuẩn đầy đủ mỗi lần. Tuy nhiên, kết quả chỉ hữu ích khi các nhóm giữ bộ phần mềm ban đầu dưới dạng kiểm tra định kỳ, luân phiên các lời nhắc được đưa ra và điều tra những thay đổi đáng ngạc nhiên thay vì tối ưu hóa trực tiếp cho thử nghiệm nén. Nếu không, séc giá rẻ có thể trở thành một mục tiêu khác cho việc trang bị quá mức.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
Xem gì tiếp theo
Theo dõi sự sao chép độc lập, xác nhận trên các dòng mô hình trong tương lai và bằng chứng cho thấy các thử nghiệm rút ngắn dự đoán hành vi nằm ngoài tiêu chuẩn mà chúng được thiết kế để tái tạo.
Đây là bản in trước mới, không phải là bản đánh giá ngang hàng đã hoàn chỉnh. Phân tích cấu trúc tiềm ẩn đã sử dụng 134 mô hình mà các tác giả lưu ý là nhỏ so với các tiêu chuẩn tâm lý thông thường và một phương pháp trích xuất thay thế giữ lại hai yếu tố thay vì ba. Tên các yếu tố là tóm tắt theo kinh nghiệm, không phải là định nghĩa đã được xác nhận về độ an toàn.
Mỗi mô hình tạo ra một phản hồi cho mỗi lời nhắc có sẵn thông qua OpenRouter và mỗi điểm chuẩn sử dụng đánh giá tự động theo quy định của nó. Kết quả của các bài kiểm tra ngắn có thể kế thừa những sai sót trong lời nhắc ban đầu, quy tắc tính điểm, phạm vi ngôn ngữ và giám khảo; các tác giả nói rõ ràng rằng việc nén không cho thấy rằng điểm chuẩn dự đoán sự an toàn khi triển khai hoặc cung cấp thông tin cho các mô hình trong tương lai.
Các thử nghiệm đóng bao cát sử dụng các sinh vật mô hình gợi ý thay vì các mô hình được tinh chỉnh để trốn tránh việc đánh giá, điều này có thể dễ phát hiện hơn. Kiểm tra API thiết lập tính liên tục của hành vi chứ không phải danh tính của trọng số mô hình ẩn và nghiên cứu không kiểm tra đối thủ được đào tạo đặc biệt để đánh bại các phương pháp kiểm tra.
Ranh giới quan trọng nhất của bài viết là giữa hiệu quả đo lường và đảm bảo an toàn. Một biểu mẫu ngắn có thể ước tính các yếu tố tiềm ẩn có trong điểm chuẩn ban đầu, nhưng nó kế thừa ngôn ngữ, đánh giá, khung nhắc nhở và các điểm mù của điểm chuẩn đó. Các đánh giá trong tương lai nên kiểm tra các lời nhắc đa ngôn ngữ, các tác nhân hỗ trợ công cụ, các cuộc hội thoại dài, các mô hình được điều chỉnh theo hướng đối nghịch và các phán đoán độc lập của con người. Họ cũng nên báo cáo khi điểm nén trở nên không ổn định, bởi vì mối tương quan rõ ràng trên dữ liệu được giữ lại có thể che giấu lỗi trên dòng mô hình tiếp theo.
Một quy tắc áp dụng thực tế tuân theo những hạn chế đó: sử dụng các bài kiểm tra nén làm trọng điểm chứ không phải phán quyết. Các nhóm có thể chạy chúng thường xuyên để nắm bắt các hồi quy, sau đó chuyển sang thay đổi đối với điểm chuẩn đầy đủ và đánh giá của con người khi biểu mẫu ngắn di chuyển bất ngờ. Bằng chứng riêng của nghiên cứu ủng hộ quy trình làm việc theo lớp đó vì cấu trúc nhân tố được lấy từ các gợi ý, đánh giá và kết quả đầu ra của mô hình cụ thể. Việc xuất bản các mục đã chọn, mã lựa chọn, kết quả được giữ lại và lịch sử phiên bản sẽ cho phép những người đánh giá độc lập kiểm tra xem các bài kiểm tra ngắn có còn cung cấp thông tin hay không sau khi các nhà phát triển xem chúng và sau khi các dòng mô hình mới thay đổi cách phân phối phản hồi.
Tính minh bạch tương tự cũng quan trọng khi mô hình được cập nhật. Một bài kiểm tra ngắn được hiệu chỉnh trên một thế hệ có thể trở nên quá dễ, quá hẹp hoặc vô tình bị căn chỉnh với lời nhắc hệ thống mới. Các nhóm nên giữ nguyên các phiên bản trước, tiết lộ khi một mục hoặc đánh giá thay đổi và báo cáo khoảng tin cậy thay vì trình bày thứ hạng nén dưới dạng điểm an toàn chính xác. Những phương pháp thực hành đó biến kết quả hiệu quả của bài báo thành một chương trình giám sát có thể kiểm tra được trong khi vẫn giữ nguyên điểm chuẩn ban đầu để xem xét sâu hơn.