HƯỚNG DẪN AI về ngôn ngữ

Mô hình dự thảo giải mã suy đoán

Giải mã suy đoán sử dụng mô hình 'bản nháp' nhỏ, nhanh để đoán một số mã thông báo sắp ra mắt mà mô hình lớn sẽ xác minh trong một lần.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It speeds up text generation 2-3x with no change to the output.

Lặn sâu

Các mô hình ngôn ngữ lớn tạo văn bản theo từng mã thông báo một lần và mỗi bước yêu cầu chuyển tiếp hoàn toàn qua hàng tỷ tham số — chậm và bị giới hạn bộ nhớ. Giải mã suy đoán tấn công điều này bằng cách ghép mô hình 'mục tiêu' lớn với mô hình 'bản nháp' rẻ tiền. Mô hình dự thảo nhanh chóng đề xuất một nhóm gồm 4-8 mã thông báo ứng cử viên. Sau đó, mô hình lớn xử lý tất cả chúng trong một lần chuyển tiếp song song duy nhất và kiểm tra từng cái. Các mã thông báo phù hợp với những gì mô hình lớn tạo ra sẽ được chấp nhận; sự không phù hợp đầu tiên được sửa chữa và phần còn lại bị loại bỏ. Bởi vì việc xác minh nhiều mã thông báo cùng một lúc có chi phí gần bằng chi phí tạo một mã thông báo nên các lần chạy được chấp nhận gần như miễn phí. Điều quan trọng là bước lấy mẫu từ chối đảm bảo phân phối cuối cùng giống hệt như chỉ chạy mô hình lớn — tốc độ mà không làm giảm chất lượng.

Hiểu biết kỹ thuật

Bí quyết chính là thử nghiệm lấy mẫu từ chối đã được sửa đổi. Đối với mỗi mã thông báo được soạn thảo, xác suất của mô hình mục tiêu được so sánh với mô hình dự thảo. Nếu mục tiêu chỉ định xác suất bằng hoặc cao hơn thì mã thông báo sẽ được chấp nhận; mặt khác, nó được chấp nhận với xác suất bằng tỷ lệ và khi bị từ chối, mã thông báo đã sửa sẽ được lấy mẫu từ phân phối dư đã điều chỉnh. Phép toán này làm cho kết quả đầu ra có thể chứng minh được là tương đương với việc lấy mẫu trực tiếp từ mô hình lớn.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của các mô hình dự thảo giải mã suy đoán

Dự kiến ​​các mô hình dự thảo sẽ trở thành cơ sở hạ tầng tiêu chuẩn trong các máy chủ suy luận như vLLM và TensorRT-LLM. Các biến thể tự suy đoán (Medusa, EAGLE) loại bỏ hoàn toàn mô hình dự thảo riêng biệt bằng cách thêm các đầu dự đoán nhẹ và việc soạn thảo dựa trên cây xác minh nhiều phần tiếp theo của ứng cử viên cùng một lúc. Khi các cửa sổ ngữ cảnh phát triển và chi phí phục vụ chiếm ưu thế, những người soạn thảo thông minh hơn, phù hợp với mô hình và xác minh nhận biết phần cứng sẽ đẩy tỷ lệ chấp nhận và thông lượng cao hơn.

Triển khai trong thế giới thực

Anthropic, OpenAI và Google sử dụng giải mã suy đoán để giảm độ trễ và chi phí phân phát trên trợ lý trò chuyện phục vụ hàng triệu người dùng.

vLLM và NVIDIA TensorRT-LLM cung cấp giải mã suy đoán tích hợp sẵn để những người tự lưu trữ có thể tăng tốc độ triển khai Llama hoặc Mistral.

Ghép nối mô hình dự thảo 7B với mục tiêu 70B (ví dụ: dòng Llama-3) để tăng gần gấp đôi số mã thông báo mỗi giây trên một GPU.

Các công cụ hoàn thiện mã sử dụng một mô hình nháp nhỏ để đề xuất bản soạn sẵn mà mô hình lớn hơn sẽ xác minh, giữ cho các đề xuất luôn linh hoạt trong trình chỉnh sửa.

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Chỉnh sửa suy đoán cho các mô hình mã

Câu hỏi thường gặp

What is Speculative Decoding Draft Models?

Giải mã suy đoán sử dụng mô hình 'bản nháp' nhỏ, nhanh để đoán một số mã thông báo sắp ra mắt mà mô hình lớn sẽ xác minh trong một lần. Nó tăng tốc độ tạo văn bản lên 2-3 lần mà không thay đổi đầu ra.

Vai trò chính của mô hình 'bản nháp' trong việc giải mã suy đoán là gì?

Mô hình dự thảo nhỏ dự đoán một cách rẻ tiền các mã thông báo sắp ra mắt, sau đó mô hình mục tiêu lớn sẽ kiểm tra trong một lần chuyển song song duy nhất.

Tại sao việc xác minh nhiều mã thông báo được soạn thảo cùng một lúc lại tiết kiệm thời gian?

Thế hệ bị ràng buộc bởi bộ nhớ; việc kiểm tra nhiều mã thông báo trong một lượt theo đợt gần như rẻ bằng một bước, vì vậy các lần chạy được chấp nhận gần như miễn phí.

Điều gì xảy ra với mã thông báo được soạn thảo sau mã thông báo đầu tiên mà mô hình mục tiêu từ chối?

Việc chấp nhận tiếp tục cho đến khi có sự bất đồng đầu tiên; mã thông báo đó được sửa và tất cả các mã thông báo được soạn thảo tiếp theo sẽ bị loại bỏ.

Giải mã suy đoán làm thế nào để đảm bảo chất lượng đầu ra không bị suy giảm?

Thử nghiệm lấy mẫu từ chối đã sửa đổi đảm bảo phân phối mã thông báo cuối cùng khớp với mẫu trực tiếp từ mô hình đích.

Cách nào sau đây là cách tiếp cận 'tự suy đoán' nhằm tránh mô hình dự thảo riêng biệt?

Medusa và EAGLE thêm các đầu dự đoán bổ sung nhẹ vào mô hình chính để nó có thể soạn thảo các mã thông báo trong tương lai của riêng mình.