HƯỚNG DẪN AI về ngôn ngữ

Nội suy vị trí cho phần mở rộng ngữ cảnh

Nội suy vị trí (PI) là một kỹ thuật kéo dài cửa sổ ngữ cảnh có thể sử dụng của mô hình ngôn ngữ vượt xa thời lượng đào tạo của nó bằng cách thay đổi tỷ lệ các chỉ số vị trí thay vì ngoại suy chúng.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It lets a model trained on, say, 2K or 4K tokens handle 32K or more with only light fine-tuning.

Lặn sâu

Hầu hết các LLM hiện đại đều sử dụng các phần nhúng vị trí quay (RoPE), mã hóa vị trí dưới dạng các góc xoay được áp dụng cho vectơ truy vấn và vectơ khóa. Nếu bạn chỉ cung cấp các chuỗi dài hơn, mô hình sẽ nhìn thấy các vị trí và góc quay mà nó chưa từng được huấn luyện và hiệu suất sẽ giảm do khả năng ngoại suy kém đối với các tần số ngoài phạm vi. Nội suy vị trí tránh ngoại suy: để mở rộng từ độ dài L đến độ dài L', nó chia mọi chỉ số vị trí cho hệ số L'/L, ép phạm vi mới trở lại khoảng đã huấn luyện. Mô hình bây giờ chỉ nhìn thấy các góc trong phân phối, chỉ cách nhau dày đặc hơn. Một lần tinh chỉnh ngắn (thường là vài trăm đến một nghìn bước) cho phép nó thích ứng với khoảng cách nhỏ hơn, mang lại hành vi ngữ cảnh dài ổn định với một phần rất nhỏ chi phí huấn luyện trước.

Hiểu biết kỹ thuật

RoPE xoay các cặp kích thước ở các tần số từ mịn đến thô. PI thay đổi tỷ lệ vị trí m thành m/s trong đó s = L'/L, do đó góc quay nằm trong phạm vi đã huấn luyện thay vì ngoại suy. Các biến thể nhận biết tần số như chia tỷ lệ nhận biết NTK và YaRN còn tiến xa hơn: chúng chia tỷ lệ tần số thấp ít hơn và tần số cao nhiều hơn (hoặc nội suy theo bước sóng), bảo toàn chi tiết cục bộ tần số cao trong khi mở rộng phạm vi tiếp cận tầm xa tần số thấp.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của nội suy vị trí cho việc mở rộng ngữ cảnh

Phần mở rộng ngữ cảnh đang phát triển nhanh chóng. Các phương pháp như chia tỷ lệ RoPE nhận biết NTK, YaRN và RoPE động/dài hiện đẩy các cửa sổ lên tới hàng trăm nghìn hoặc thậm chí hàng triệu mã thông báo, đôi khi có rất ít hoặc không cần tinh chỉnh. Mong đợi các thủ thuật mở rộng quy mô này sẽ được kết hợp với tính năng chú ý và nén bộ đệm KV hiệu quả, đồng thời trở thành các nút xoay tiêu chuẩn trong cấu hình mô hình. Nghiên cứu tiếp tục duy trì độ chính xác cao trên toàn bộ cửa sổ để các ngữ cảnh dài thực sự có thể sử dụng được chứ không chỉ được hỗ trợ trên danh nghĩa.

Triển khai trong thế giới thực

Mở rộng mô hình LLaMA được đào tạo 4K sang ngữ cảnh 32K để tóm tắt các tài liệu dài sau khi tinh chỉnh ngắn gọn.

Tải toàn bộ cơ sở mã hoặc hợp đồng pháp lý lớn vào một lời nhắc để trả lời câu hỏi trên nhiều tệp.

Sử dụng NTK-aware hoặc chia tỷ lệ YaRN để kéo dài bối cảnh mà không cần đào tạo thêm hoặc tối thiểu.

Phục vụ lịch sử trò chuyện dài mà không bị cắt bớt bằng cách thay đổi tỷ lệ vị trí RoPE tại thời điểm suy luận.

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Position Interpolation for Context Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

YaRN và phần mở rộng độ dài ngữ cảnh

Câu hỏi thường gặp

What is Position Interpolation for Context Extension?

Nội suy vị trí (PI) là một kỹ thuật kéo dài cửa sổ ngữ cảnh có thể sử dụng của mô hình ngôn ngữ vượt xa thời lượng đào tạo của nó bằng cách thay đổi tỷ lệ các chỉ số vị trí thay vì ngoại suy chúng. Nó cho phép một mô hình được đào tạo trên mã thông báo 2K hoặc 4K xử lý 32K trở lên chỉ với tinh chỉnh nhẹ.

Ý tưởng cốt lõi của Nội suy vị trí là gì?

PI chia chỉ số vị trí cho hệ số mở rộng, ánh xạ chuỗi dài hơn trở lại phạm vi phân phối mà mô hình đã học.

Sơ đồ mã hóa vị trí nào được Nội suy vị trí liên quan nhiều nhất?

PI được phổ biến cho các mô hình dựa trên RoPE, thay đổi tỷ lệ các góc quay để chúng vẫn nằm trong tần số đã được huấn luyện.

Tại sao phép ngoại suy ngây thơ sang bối cảnh dài hơn có xu hướng thất bại?

Việc cung cấp các chuỗi dài hơn sẽ khiến mô hình tiếp cận các góc ngoài phạm vi mà nó chưa từng được huấn luyện, khiến sự chú ý và hiệu suất giảm sút nghiêm trọng.

Nếu mở rộng độ dài ngữ cảnh từ L đến L', PI cơ bản áp dụng hệ số thay đổi tỷ lệ nào cho vị trí m?

PI ánh xạ m đến m chia cho hệ số s = L'/L, nén phạm vi dài hơn vào khoảng thời gian được huấn luyện ban đầu.

Làm cách nào để chia tỷ lệ nhận biết NTK và YaRN cải thiện Nội suy vị trí đơn giản?

Các phương pháp này chia tỷ lệ tần số thấp và tần số cao khác nhau, giữ lại chi tiết vị trí cục bộ chi tiết trong khi vẫn đạt được bối cảnh dài hơn.