Độ lệch logit
Độ lệch logit là một nút điều khiển đẩy mô hình ngôn ngữ tiến tới hoặc tránh xa các mã thông báo cụ thể bằng cách thêm một số cố định vào điểm của chúng trước khi mô hình chọn từ tiếp theo.
Tổng quan
It is a lightweight way to ban words, force choices, or shape style without retraining anything.
Lặn sâu
Trước khi một mô hình chọn mã thông báo tiếp theo, nó sẽ tạo ra logit (điểm không chuẩn hóa) cho mỗi mã thông báo trong từ vựng của nó. Độ lệch nhật ký cho phép bạn thêm giá trị không đổi vào nhật ký của mã thông báo đã chọn theo ID mã thông báo dạng số của chúng. Xu hướng tích cực lớn làm cho mã thông báo có nhiều khả năng được lấy mẫu hơn; độ lệch âm lớn (thường là -100 trong API) ngăn cản điều đó một cách hiệu quả. Bởi vì sự điều chỉnh xảy ra trước softmax biến điểm số thành xác suất, ngay cả những sai lệch khiêm tốn nhất cũng có thể làm thay đổi sự phân bổ một cách có ý nghĩa. Điều quan trọng là xu hướng được khóa theo ID mã thông báo chứ không phải toàn bộ từ - vì vậy, một từ có nhiều mã thông báo có thể cần mỗi phần của nó được định vị để ngăn chặn hoặc quảng bá hoàn toàn nó. Đây là một biện pháp kiểm soát phẫu thuật nhanh chóng, không cần tinh chỉnh và áp dụng theo yêu cầu.
Hiểu biết kỹ thuật
Nhật ký là điểm có giá trị thực; softmax lũy thừa chúng, do đó, việc thêm +5 vào mã thông báo sẽ nhân trọng số không chuẩn hóa của nó với e^5 (~148x) trước khi chuẩn hóa. Việc thêm -100 sẽ đẩy xác suất hậu softmax của nó về cơ bản bằng 0. Bởi vì các mã thông báo sử dụng các đơn vị từ phụ nên từ 'không vui' có thể là hai mã thông báo; chỉ thiên vị phần đầu tiên sẽ không kiểm soát hoàn toàn nó. Mức độ chi tiết của từ phụ đó là vấn đề chính khi mọi người cố gắng cấm một từ cụ thể và nó vẫn rò rỉ một phần.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của sai lệch Logit
Độ lệch logit vẫn là yếu tố chính để điều khiển nhanh, nhưng các lựa chọn thay thế phong phú hơn đang phát triển: giải mã có cấu trúc/ràng buộc cho các đảm bảo cứng và kỹ thuật biểu diễn hoặc điều khiển kích hoạt thúc đẩy các vectơ bên trong của mô hình thay vì chỉ điểm đầu ra. Mong đợi các API duy trì xu hướng logit như một lối thoát đơn giản trong khi cung cấp các biện pháp kiểm soát cấp cao hơn — cụm từ bị cấm, chỉ thị kiểu, bộ lọc an toàn — tự động xử lý mã thông báo để nhà phát triển không phải suy luận về ID mã thông báo thô.
Triển khai trong thế giới thực
Đặt độ lệch -100 cho các mã thông báo tục tĩu để ngăn chatbot tạo ra một số từ nhất định.
Buộc phân loại có/không bằng cách đưa ra xu hướng tích cực mạnh mẽ cho mã thông báo 'Có' và 'Không' và loại bỏ mọi thứ khác.
Không khuyến khích một cụm từ hoặc từ đệm được sử dụng quá mức bằng cách áp dụng thành kiến tiêu cực vừa phải cho các mã thông báo của nó.
Tăng cường các thuật ngữ dành riêng cho tên miền (như tên sản phẩm) để người tóm tắt đề cập đến chúng một cách đáng tin cậy.
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Logit Bias quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Xu hướng vị trí ALiBi
Câu hỏi thường gặp
What is Logit Bias?
Độ lệch logit là một nút điều khiển đẩy mô hình ngôn ngữ tiến tới hoặc tránh xa các mã thông báo cụ thể bằng cách thêm một số cố định vào điểm của chúng trước khi mô hình chọn từ tiếp theo. Đó là một cách nhẹ nhàng để cấm từ, ép buộc lựa chọn hoặc định hình phong cách mà không cần đào tạo lại bất cứ điều gì.
Sự thiên vị logit sửa đổi điều gì?
Độ lệch logit thêm một hằng số vào nhật ký của các ID mã thông báo đã chọn, thay đổi khả năng chúng được chọn mà không thay đổi chính mô hình.
Trong nhiều API, độ lệch logit -100 trên mã thông báo có tác dụng gì?
Độ lệch âm lớn như -100 khiến xác suất hậu softmax của mã thông báo về cơ bản bằng 0, do đó nó hầu như không bao giờ được tạo ra.
Tại sao việc cấm một từ có sai lệch logit đôi khi có thể làm rò rỉ một phần đầu ra?
Trình tạo mã thông báo chia nhiều từ thành nhiều mã thông báo từ phụ, do đó, chỉ thiên vị phần đầu tiên sẽ không loại bỏ được toàn bộ từ.
Độ lệch logit được khóa theo mã định danh nào?
Các giá trị thiên vị được áp dụng cho các ID mã thông báo cụ thể từ vốn từ vựng của mã thông báo, đó là lý do tại sao bạn phải biết ID cho các phần của một từ.
Bởi vì nhật ký được chuyển qua softmax, tác dụng của việc thêm độ lệch dương là gì?
Softmax lũy thừa số log, do đó, ngay cả một độ lệch dương khiêm tốn cũng sẽ nhân đáng kể trọng số không chuẩn hóa của mã thông báo, làm tăng mạnh tỷ lệ cược của nó.