HƯỚNG DẪN AI về ngôn ngữ

Giải mã Lookahead

Giải mã Lookahead tăng tốc độ tạo LLM mà không cần bất kỳ mô hình dự thảo bổ sung nào bằng cách đoán và xác minh song song nhiều mã thông báo trong tương lai bằng cách sử dụng n-gram mà mô hình tạo ra một cách nhanh chóng.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It breaks the strict one-token-at-a-time bottleneck.

Lặn sâu

Được các nhà nghiên cứu tại UC Berkeley giới thiệu vào năm 2023, giải mã nhìn trước giúp tăng tốc suy luận chỉ bằng cách sử dụng chính mô hình đích — không có mô hình thứ hai và không cần đào tạo bổ trợ. Nó định hình lại việc tạo như việc giải một hệ phương trình phi tuyến bằng phương pháp song song gọi là phép lặp Jacobi. Ở mỗi bước, mô hình chạy hai nhánh cùng một lúc: nhánh 'nhìn trước' tinh chỉnh song song các dự đoán cho một số vị trí mã thông báo trong tương lai và nhánh 'xác minh' kiểm tra các n-gram nhiều mã thông báo đầy hứa hẹn được thu thập trong một nhóm. Các n-gram đã được xác minh mà mô hình đồng ý đều được cam kết cùng một lúc, do đó, nhiều mã thông báo có thể được chấp nhận trong mỗi bước. Bởi vì nó chỉ dựa vào các bước chuyển tiếp của chính mô hình nên đầu ra vẫn giữ nguyên chính xác những gì mà quá trình giải mã tham lam hoặc lấy mẫu sẽ tạo ra, đồng thời giảm số bước tuần tự cần thiết.

Hiểu biết kỹ thuật

Ý tưởng cốt lõi mượn sự lặp lại điểm cố định của Jacobi/Gauss-Seidel: giải mã tự hồi quy được coi là tìm một điểm cố định của ánh xạ mô hình qua một cửa sổ các mã thông báo trong tương lai. Các dự đoán song song được tinh chỉnh lặp đi lặp lại và nhóm n-gram lưu trữ các chuỗi mã thông báo hợp lý được thấy trong các lần lặp này. Quá trình xác minh xác nhận xem có bất kỳ n-gram được lưu trong bộ nhớ đệm nào khớp với đầu ra thực sự tiếp theo của mô hình hay không, cho phép một số mã thông báo tiến lên trong một lần mà không cần mạng dự thảo riêng.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của việc giải mã Lookahead

Giải mã Lookahead rất hấp dẫn vì nó không cần mô hình bổ sung để đào tạo, triển khai hoặc lưu trữ trong bộ nhớ — tạo điều kiện thuận lợi cho việc áp dụng cho những người tự lưu trữ. Mong đợi sự tích hợp vào nhiều khung phân phối hơn và các kết hợp với giải mã suy đoán và tối ưu hóa bộ nhớ đệm KV. Nghiên cứu đang điều chỉnh kích thước cửa sổ và quản lý nhóm n-gram cho các khối lượng công việc khác nhau, đồng thời khám phá cách kỹ thuật này mở rộng quy mô với các bối cảnh dài hơn và phân phát theo đợt trong đó tính toán GPU không được sử dụng đúng mức.

Triển khai trong thế giới thực

Tự lưu trữ mô hình mở như Llama hay Vicuna với độ trễ nhanh hơn mà không cần đào tạo hay tải bất kỳ mô hình dự thảo phụ trợ nào.

Giảm số lượng các bước giải mã tuần tự cho việc tạo dạng dài chẳng hạn như bài tiểu luận hoặc mã, trong đó có rất nhiều lỗi nhưng các bước lại là nút thắt cổ chai.

Tích hợp vào các thư viện suy luận (bản phát hành ban đầu đã triển khai triển khai tương thích với FlashAttention) để tăng thông lượng trên các GPU hiện có.

Tăng tốc độ phân phát theo đợt trên phần cứng không được sử dụng đúng mức bằng cách trao đổi tính toán song song bổ sung để có ít lượt chuyển mô hình tuần tự hơn.

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Lookahead Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Giải mã song song bộ xương suy nghĩ

Câu hỏi thường gặp

What is Lookahead Decoding?

Giải mã Lookahead tăng tốc độ tạo LLM mà không cần bất kỳ mô hình dự thảo bổ sung nào bằng cách đoán và xác minh song song nhiều mã thông báo trong tương lai bằng cách sử dụng n-gram mà mô hình tạo ra một cách nhanh chóng. Nó phá vỡ nút thắt cổ chai nghiêm ngặt một mã thông báo tại một thời điểm.

Điều gì phân biệt giải mã nhìn trước với giải mã suy đoán tiêu chuẩn?

Giải mã Lookahead tăng tốc quá trình tạo chỉ bằng cách sử dụng các bước chuyển tiếp của chính mô hình mục tiêu mà không cần mạng dự thảo phụ trợ.

Phương pháp số nào làm cơ sở cho việc giải mã lookahead?

Nó điều chỉnh lại quá trình giải mã tự hồi quy như một hệ thống phi tuyến được giải quyết bằng phép lặp điểm cố định song song kiểu Jacobi trên các mã thông báo trong tương lai.

Hai nhánh song song chạy ở mỗi bước là gì?

Nhánh nhìn trước tinh chỉnh các dự đoán cho các vị trí trong tương lai trong khi nhánh xác minh kiểm tra n-gram ứng viên từ nhóm.

Những gì được lưu trữ trong 'nhóm n-gram'?

Nhóm lưu trữ các n-gram ứng cử viên được tạo trong quá trình lặp lại để chúng có thể được xác minh và có khả năng được cam kết trong bước tương lai.

Giải mã lookahead ảnh hưởng như thế nào đến chất lượng đầu ra so với giải mã thông thường?

Bởi vì chỉ các thẻ riêng của mô hình mục tiêu mới được sử dụng và xác minh nên kết quả khớp với những gì giải mã tiêu chuẩn sẽ tạo ra.