Căn chỉnh AI
Liên kết AI là dự án thể chế và kỹ thuật nhằm làm cho các hệ thống AI tiên tiến thực hiện những gì con người dự định một cách đáng tin cậy — bao gồm cả trong các tình huống mới, có tính rủi ro cao trong đó hệ thống thông minh hơn, nhanh hơn hoặc tự chủ hơn so với người vận hành.
Lặn sâu
Sự liên kết không giống như 'đạo đức AI' theo nghĩa rộng. Đạo đức hỏi xã hội nên theo đuổi những giá trị nào; sự liên kết hỏi liệu một hệ thống AI mạnh mẽ có thực sự theo đuổi các mục tiêu mà chúng tôi chỉ định hay không và liệu các mục tiêu đó có ổn định khi năng lực tăng lên hay không. Các chế độ thất bại cổ điển bao gồm chơi trò chơi thông số kỹ thuật (tối ưu hóa số liệu proxy), xác định sai mục tiêu (chúng tôi đã viết sai mục tiêu) và hội tụ công cụ (hệ thống tìm kiếm sức mạnh, tài nguyên hoặc khả năng tự bảo tồn vì những điều đó giúp ích cho hầu hết mọi mục tiêu cuối cùng). Các phòng thí nghiệm hiện đại đã gặp phải những phiên bản nhẹ nhàng hơn của những thất bại này: các chatbot hoàn toàn đồng ý với người dùng, các tác nhân khai thác các lỗ hổng trong chức năng tính điểm và các mô hình đánh giá điểm chuẩn. Câu hỏi mở là liệu các phương pháp điều chỉnh ngày nay (RLHF, AI hiến pháp, tranh luận, khả năng diễn giải, kỹ thuật kiểm soát) có mở rộng sang các hệ thống có thể lập kế hoạch, đánh lừa hoặc hành động mà ít có sự giám sát của con người hơn hay không. Đó là lý do tại sao nghiên cứu liên kết nằm ở trung tâm của các cuộc tranh luận về rủi ro AI hiện hữu: nếu các hệ thống có năng lực cao bị sai lệch thì các quy trình an toàn sản phẩm thông thường có thể không đủ.
Hiểu biết kỹ thuật
'Điều chỉnh' được triển khai nhiều nhất hiện nay là tối ưu hóa tùy chọn trên mô hình cơ sở được đào tạo trước: thu thập thứ hạng đầu ra của con người (hoặc AI), đào tạo mô hình phần thưởng hoặc sử dụng các phương pháp ưu tiên trực tiếp (DPO và các biến thể), sau đó cập nhật chính sách. Điều đó cải thiện mức độ hữu ích trung bình và giảm một số tác hại, nhưng nó không chứng minh rằng mô hình có mục tiêu nội bộ phù hợp với ý định của con người, cũng như không chứng minh rằng mô hình sẽ hoạt động tốt dưới sự thay đổi phân phối, tác nhân lâu dài hoặc áp lực đối nghịch. Khả năng giải thích, giám sát có thể mở rộng và đánh giá hành vi lừa dối là những nỗ lực vượt ra ngoài sự tuân thủ bề ngoài.
Tác động chiến lược
Rủi ro và an toàn
Những tác hại thảm khốc và thường ngày của AI đều phụ thuộc vào việc ai hiểu được rủi ro và ai có thể hành động.
Quyết định rõ ràng hơn
Kiến thức công cộng và chuyên môn định hình liệu chính sách an toàn mạnh mẽ có khả thi về mặt chính trị hay không.
Phá vỡ sự thổi phồng
Những lời giải thích rõ ràng làm giảm sự thu hút bởi sự cường điệu, PR trong phòng thí nghiệm và sân khấu đạo đức mơ hồ.
Tương lai của sự liên kết AI
Mong đợi nhiều công việc hơn trong việc đo lường tính trung thực của chuỗi suy nghĩ, phát hiện âm mưu hoặc đóng bao cát, lập nhóm đỏ tự động và các phương pháp kiểm soát giả định sự liên kết không hoàn hảo. Vấn đề về trình độ hiểu biết của công chúng ở đây: những người chỉ nghe thấy 'sự liên kết = làm cho chatbot trở nên lịch sự' sẽ đánh giá thấp các phương thức thất bại thảm hại và quá tin tưởng vào các tuyên bố tiếp thị từ các phòng thí nghiệm.
Triển khai trong thế giới thực
Đào tạo trợ lý bằng dữ liệu ưu tiên của con người (RLHF) để họ từ chối tác hại rõ ràng và làm theo hướng dẫn tốt hơn.
Các đặc vụ nhóm đỏ để hack phần thưởng: tuân theo từng chữ cái của mục tiêu trong khi vi phạm mục đích của nó.
Đánh giá xem một mô hình có thay đổi hành vi hay không khi nó có thể cho biết nó đang được kiểm tra (đánh giá nhận thức).
Xây dựng các công cụ giám sát để những người yếu hơn vẫn có thể giám sát các mô hình mạnh hơn khi thực hiện các nhiệm vụ khó khăn.
Rủi ro & lan can
Xử lý rủi ro hiện hữu như khoa học viễn tưởng trong khi khả năng lại phức tạp.
Nhầm lẫn giữa an toàn sản phẩm bề mặt với sự liên kết dưới quyền tự chủ cao.
Chỉ để lại những khán giả không phải người Anh và không có chuyên môn với những nguồn chất lượng thấp.
Lộ trình thực hiện
Tách biệt các tác hại của sản phẩm, sử dụng sai và rủi ro mất kiểm soát/sai lệch.
Hỏi bằng chứng nào sẽ thay đổi quan điểm của bạn về thời gian và mức độ nghiêm trọng.
Ưu tiên các nguồn chính và đánh giá cụ thể hơn các tuyên bố tiếp thị.
Xác định một lộ trình hành động: sự nghiệp, chính sách, nguồn tài trợ hoặc kỹ năng - không chỉ là nhận thức.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AI Alignment quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Căn chỉnh đơn điệu Glow-TTS
Câu hỏi thường gặp
What is AI Alignment?
Liên kết AI là dự án thể chế và kỹ thuật nhằm làm cho các hệ thống AI tiên tiến thực hiện những gì con người dự định một cách đáng tin cậy — bao gồm cả trong các tình huống mới, có tính rủi ro cao trong đó hệ thống thông minh hơn, nhanh hơn hoặc tự chủ hơn so với người vận hành.
Quyền riêng tư và bảo mật nên được xử lý như thế nào khi triển khai AI Alignment?
Quyền riêng tư và bảo mật cần phải được tích hợp vào bất kỳ hoạt động triển khai AI Alignment nào ngay từ đầu.
Cách có trách nhiệm để xử lý sự không chắc chắn về kết quả từ AI Alignment là gì?
Chuyển các kết quả đầu ra không chắc chắn từ AI Alignment sang đánh giá của con người sẽ ngăn ngừa những sai sót có thể tránh được.
Trước khi dựa vào AI Alignment cho một quyết định quan trọng, bạn nên xác nhận điều gì trước tiên?
Tốc độ và sự đánh bóng không đảm bảo độ chính xác. Căn chỉnh AI căn cứ bằng bằng chứng có thể kiểm chứng là điều khiến nó an toàn để dựa vào.
Dấu hiệu nào cho thấy một nhóm hiểu về AI Alignment một cách chín chắn hơn là hời hợt?
Biết được ranh giới của Sự liên kết AI - nơi nó không phù hợp - là một dấu hiệu của sự hiểu biết thực sự.
Khả năng phán đoán của con người nên đóng vai trò gì khi sử dụng AI Alignment?
Luôn cập nhật cho mọi người về các trường hợp quan trọng hoặc có độ tin cậy thấp là biện pháp bảo vệ cốt lõi với AI Alignment.