HƯỚNG DẪN KỸ THUẬT

Giải mã suy đoán

Giải mã suy đoán giúp các mô hình ngôn ngữ lớn tạo ra văn bản nhanh hơn bằng cách sử dụng mô hình 'bản nháp' nhỏ, nhanh để đoán trước một số mã thông báo, sau đó yêu cầu mô hình lớn xác minh tất cả chúng cùng một lúc.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Nó tăng tốc độ suy luận lên 2-3 lần với chất lượng đầu ra giống hệt nhau.

Lặn sâu

Thông thường, LLM tạo văn bản mỗi lần một mã thông báo: mỗi mã thông báo yêu cầu chuyển tiếp hoàn toàn qua mô hình khổng lồ và bạn không thể bắt đầu mã tiếp theo cho đến khi mã hiện tại kết thúc. Tốc độ này chậm vì nó phụ thuộc vào bộ nhớ chứ không phải tính toán — GPU dành phần lớn thời gian để tải các trọng số chứ không phải làm toán. Giải mã suy đoán phá vỡ nút cổ chai. Một mô hình dự thảo nhỏ, rẻ tiền đề xuất một lượng lớn năm mã thông báo ứng cử viên. Sau đó, mô hình 'đích' lớn sẽ xử lý cả năm trong một lần chuyển tiếp song song và kiểm tra chúng. Các mã thông báo phù hợp với những gì nó tạo ra sẽ được chấp nhận; ở sự bất đồng đầu tiên, nó sẽ sửa và loại bỏ phần còn lại. Vì việc xác minh nhiều mã thông báo có chi phí tương đương với việc tạo một mã thông báo nên các dự đoán được chấp nhận gần như miễn phí.

Hiểu biết kỹ thuật

Phần thông minh là quy tắc lấy mẫu từ chối đảm bảo phân phối đầu ra giống hệt về mặt toán học với việc chỉ chạy mô hình mục tiêu - vì vậy chất lượng không phải là gần đúng mà là chính xác. Tỷ lệ chấp nhận thúc đẩy tốc độ tăng tốc: mô hình nhỏ dự đoán mô hình lớn càng tốt thì càng có nhiều mã thông báo được gắn vào mỗi bước xác minh. Các biến thể như Medusa bổ sung thêm các đầu dự đoán vào chính mô hình mục tiêu và các bản nháp EAGLE trong không gian đối tượng, loại bỏ nhu cầu về một mô hình nháp riêng biệt.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của giải mã suy đoán

Giải mã suy đoán đang trở thành mặc định trong các ngăn xếp phân phát như vLLM và TensorRT-LLM. Dự kiến ​​các phương pháp tự soạn thảo (Medusa, EAGLE, Lookahead) sẽ chiếm ưu thế vì chúng tránh duy trì mô hình thứ hai, cộng với việc suy đoán dựa trên cây để xác minh nhiều nhánh ứng cử viên mỗi bước. Khi các mô hình phát triển, nút cổ chai liên quan đến bộ nhớ trở nên trầm trọng hơn, khiến cho việc suy đoán thậm chí còn có giá trị hơn và những người soạn thảo nhận thức được phần cứng sẽ đẩy tốc độ tăng tốc trong thế giới thực lên cao hơn.

Triển khai trong thế giới thực

Mô hình dự thảo 7B đề xuất mã thông báo cho mô hình trò chuyện 70B để giảm độ trễ phản hồi trong trợ lý sản xuất

Đầu Medusa được gắn vào LLM để nó dự đoán một số mã thông báo trong tương lai cùng một lúc mà không cần mô hình dự thảo riêng

vLLM cho phép giải mã suy đoán để tăng thông lượng mã thông báo mỗi giây trên cụm phân phát

Soạn thảo EAGLE trong không gian tính năng ẩn của mô hình để tăng tỷ lệ chấp nhận và tốc độ tổng thể

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Giải mã suy đoán với EAGLE

Câu hỏi thường gặp

Giải mã suy đoán là gì?

Giải mã suy đoán giúp các mô hình ngôn ngữ lớn tạo ra văn bản nhanh hơn bằng cách sử dụng mô hình 'bản nháp' nhỏ, nhanh để đoán trước một số mã thông báo, sau đó yêu cầu mô hình lớn xác minh tất cả chúng cùng một lúc. Nó tăng tốc độ suy luận lên 2-3 lần với chất lượng đầu ra giống hệt nhau.

Ý tưởng cốt lõi của giải mã suy đoán là gì?

Mô hình dự thảo nhanh đề xuất nhiều mã thông báo và mô hình mục tiêu lớn sẽ kiểm tra tất cả chúng trong một lần chuyển song song.

Tại sao việc tạo LLM một mã thông báo thông thường lại chậm?

Mỗi bước chủ yếu tải các ma trận có trọng số khổng lồ từ bộ nhớ thay vì thực hiện các phép tính nặng, do đó GPU không được sử dụng đúng mức.

Điều gì xảy ra ở mã thông báo đầu tiên mà mô hình dự thảo và mô hình mục tiêu không đồng ý?

Các thẻ không đồng ý sẽ được chấp nhận; kể từ khi không khớp trở đi, chúng sẽ bị từ chối và mã thông báo chính xác của mô hình mục tiêu được giữ lại.

Giải mã suy đoán ảnh hưởng đến chất lượng đầu ra như thế nào?

Quy tắc lấy mẫu từ chối đảm bảo phân phối cuối cùng khớp chính xác với mô hình mục tiêu, do đó chất lượng không thay đổi.

Điều gì quyết định trực tiếp nhất đến việc tăng tốc độ giải mã suy đoán?

Mô hình mục tiêu chấp nhận càng nhiều mã thông báo được soạn thảo cho mỗi bước xác minh thì tốc độ càng nhanh.