Giải mã suy đoán với EAGLE
Giải mã suy đoán tăng tốc độ suy luận mô hình ngôn ngữ lớn bằng cách cho phép một mô hình dự thảo nhỏ đoán trước một số mã thông báo, sau đó mô hình lớn sẽ xác minh trong một lần.
Tổng quan
EAGLE is a state-of-the-art version that drafts at the feature level rather than the token level, delivering 2-4x speedups with zero loss in output quality.
Lặn sâu
Việc tạo LLM thông thường có tính tự hồi quy: mô hình tạo ra một mã thông báo, cung cấp lại mã thông báo đó và lặp lại, do đó, mỗi mã thông báo yêu cầu chuyển tiếp đầy đủ thông qua hàng tỷ tham số. Giải mã suy đoán phá vỡ nút thắt cổ chai này. Một người soạn thảo giá rẻ đề xuất một đoạn mã thông báo ứng cử viên và mô hình mục tiêu đắt tiền sẽ xác minh tất cả chúng trong một lần chuyển song song duy nhất, chấp nhận tiền tố chính xác dài nhất. EAGLE (Thuật toán ngoại suy để đạt hiệu quả mô hình ngôn ngữ cao hơn) cải thiện các phương pháp trước đó bằng cách phác thảo trong không gian tính năng ẩn của mô hình và phản hồi lại khả năng nhúng thực sự của mã thông báo trước đó để giảm độ không chắc chắn. EAGLE-2 thêm cây phác thảo động và EAGLE-3 loại bỏ ràng buộc dự đoán tính năng để mở rộng quy mô tốt hơn. Điều quan trọng là việc xác minh đảm bảo đầu ra giống hệt với những gì mà mô hình mục tiêu sẽ tạo ra.
Hiểu biết kỹ thuật
EAGLE đào tạo một phần đầu tự hồi quy nhỏ để dự đoán tính năng trạng thái ẩn tiếp theo của mô hình mục tiêu, sau đó sử dụng lại phần đầu LM của chính mục tiêu để biến các tính năng thành các ứng cử viên mã thông báo. Bằng cách điều chỉnh trình tự mã thông báo đã dịch chuyển cộng với các tính năng trước đó, nó sẽ loại bỏ sự mơ hồ gây cản trở cho việc soạn thảo chỉ có tính năng. Một cây ứng viên được xác minh ngay lập tức; phân phối của mô hình mục tiêu được bảo toàn chính xác vì các mã thông báo được chấp nhận phải khớp với lựa chọn được lấy mẫu hoặc argmax của nó, giúp cho việc tăng tốc không bị mất mát.
Tác động chiến lược
Chi phí và ngân sách
Các quyết định về kiến trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.
Quyết định rõ ràng hơn
Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.
Kiểm soát chất lượng
Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.
Tương lai của giải mã suy đoán với EAGLE
Giải mã suy đoán đang trở thành cơ sở hạ tầng mặc định trong các ngăn xếp phục vụ như vLLM và TensorRT-LLM. Mong đợi sự tích hợp chặt chẽ hơn với tính năng chia nhóm và chia sẻ bộ đệm KV, các mô hình tự soạn thảo không cần trình soạn thảo riêng và đồng thiết kế phần cứng giả định xác minh song song. Việc soạn thảo tính năng theo phong cách EAGLE đang được mở rộng sang các mô hình lý luận và đa phương thức, trong đó chuỗi suy nghĩ dài khiến chi phí trên mỗi mã thông báo trở nên đặc biệt khó khăn và suy luận trên thiết bị nơi độ trễ quan trọng nhất.
Triển khai trong thế giới thực
Giảm độ trễ trong trợ lý trò chuyện để phản hồi truyền nhanh hơn 2-3 lần mà không làm thay đổi câu trả lời của mô hình
Giảm chi phí phân phối GPU cho các nhà cung cấp API khối lượng lớn bằng cách tạo ra nhiều mã thông báo hơn cho mỗi lượt chuyển tiếp
Tăng tốc các mô hình suy luận chuỗi suy nghĩ dài trong đó hàng nghìn mã thông báo được tạo ra cho mỗi truy vấn
Tăng tốc các công cụ hoàn thiện mã trong đó các chuỗi mã thông báo lặp đi lặp lại, có thể dự đoán được mang lại tỷ lệ chấp nhận bản nháp cao
Rủi ro & lan can
Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.
Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.
Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.
Lộ trình thực hiện
Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.
Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.
Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.
Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding with EAGLE quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Giải mã suy đoán
Câu hỏi thường gặp
What is Speculative Decoding with EAGLE?
Giải mã suy đoán tăng tốc độ suy luận mô hình ngôn ngữ lớn bằng cách cho phép một mô hình dự thảo nhỏ đoán trước một số mã thông báo, sau đó mô hình lớn sẽ xác minh trong một lần. EAGLE là phiên bản tiên tiến, soạn thảo ở cấp tính năng thay vì cấp mã thông báo, mang lại tốc độ tăng gấp 2-4 lần mà không làm giảm chất lượng đầu ra.
Ý tưởng cốt lõi đằng sau việc giải mã suy đoán là gì?
Một người soạn thảo nhỏ đoán trước một số mã thông báo và mô hình mục tiêu lớn sẽ xác minh chúng cùng nhau, chấp nhận tiền tố chính xác dài nhất.
EAGLE khác với các phương pháp giải mã suy đoán trước đây như thế nào?
EAGLE dự đoán các tính năng ẩn của mô hình mục tiêu và sử dụng lại đầu LM của nó, tạo ra các bản nháp chính xác hơn các phương pháp chỉ sử dụng mã thông báo.
Tại sao giải mã suy đoán được coi là 'không mất dữ liệu'?
Bởi vì mô hình mục tiêu kiểm tra từng mã thông báo được soạn thảo dựa trên phân phối riêng của nó nên đầu ra được chấp nhận chính xác là những gì mục tiêu sẽ tạo ra một mình.
Vấn đề gì trong quá trình soạn thảo tính năng của EAGLE có giúp giải quyết việc phản hồi lại quá trình nhúng của mã thông báo trước đó không?
Việc điều chỉnh mã thông báo thực tế trước đó giúp giảm sự mơ hồ khi dự đoán tính năng ẩn tiếp theo, cải thiện độ chính xác của bản nháp.
EAGLE-2 đã thêm gì vào EAGLE ban đầu?
EAGLE-2 đã giới thiệu cây dự thảo động nhận biết ngữ cảnh, mở rộng các nhánh có triển vọng để nâng cao tỷ lệ chấp nhận.