Chia tỷ lệ cửa sổ ngữ cảnh YaRN
YaRN (Yet another RoPE extensioN) là một kỹ thuật kéo dài cửa sổ ngữ cảnh có thể sử dụng của máy biến áp vượt xa những gì nó được đào tạo với sự tinh chỉnh tối thiểu.
Tổng quan
It matters because it lets existing models handle much longer documents without retraining from scratch.
Lặn sâu
Hầu hết các LLM hiện đại đều mã hóa các vị trí từ bằng cách sử dụng Nhúng vị trí quay (RoPE), chỉ hoạt động tốt trong phạm vi độ dài mà mô hình đã nhìn thấy trong quá trình đào tạo. Nạp theo trình tự dài hơn và mô hình xuống cấp trầm trọng. YaRN giải quyết vấn đề này bằng cách thay đổi tỷ lệ tần số quay của RoPE theo cách nhận biết tần số: các kích thước tần số cao (nắm bắt các mối quan hệ cục bộ, lân cận) hầu như không bị ảnh hưởng, trong khi các kích thước tần số thấp (ghi lại vị trí tầm xa) được nội suy. Nó cũng bổ sung thêm tính năng điều chỉnh nhiệt độ để giữ cho các bản ghi hoạt động tốt ở tầm xa. Kết quả, được thể hiện trên các mô hình LLaMA, mở rộng ngữ cảnh từ mã thông báo 4K lên 64K-128K chỉ bằng cách sử dụng khoảng 0,1% dữ liệu đào tạo ban đầu và vài trăm bước tinh chỉnh.
Hiểu biết kỹ thuật
RoPE xoay vectơ truy vấn và khóa theo một góc tỷ lệ với vị trí và tần số theo chiều. Nội suy tuyến tính ngây thơ (Nội suy vị trí) nén tất cả các tần số như nhau, gây tổn hại đến chi tiết cục bộ. Thay vào đó, YaRN áp dụng 'NTK theo từng phần': nó chỉ nội suy các chiều tần số thấp (bước sóng dài), chỉ để lại các chiều tần số cao và tăng dần giữa chúng. Việc tăng nhiệt độ chú ý sẽ bù đắp cho sự dịch chuyển entropy, duy trì độ chính xác ở độ dài mở rộng.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của việc mở rộng cửa sổ ngữ cảnh YaRN
Tiện ích mở rộng nhận biết tần số kiểu YaRN đã trở thành thành phần mặc định để vận chuyển các mô hình ngữ cảnh dài; các biến thể và phiên bản kế tiếp tiếp tục xuất hiện khi các phòng thí nghiệm hướng tới các cửa sổ triệu token. Mong đợi sự tích hợp chặt chẽ hơn với sự chú ý hiệu quả, nén bộ đệm KV và chia tỷ lệ động có thể điều chỉnh nhanh chóng theo yêu cầu. Xu hướng rộng hơn là tách biệt 'một mô hình được đào tạo trong bao lâu' khỏi 'nó có thể đọc hữu ích trong bao lâu', khiến bối cảnh dài trở thành một tính năng sau đào tạo rẻ tiền thay vì một cam kết kiến trúc đắt tiền.
Triển khai trong thế giới thực
Mở rộng mô hình LLaMA mở từ mã thông báo 4K lên 128K để nó có thể sử dụng toàn bộ cơ sở mã hoặc hợp đồng dài trong một lần
Để chatbot giữ lại lịch sử trò chuyện rất dài mà không cần cắt bớt các lượt trước đó
Tóm tắt các tài liệu có độ dài sách hoặc bản ghi nhiều giờ vượt quá cửa sổ gốc của mô hình cơ sở
Điều chỉnh một cách rẻ tiền một mô hình được đào tạo trước cho các tác vụ truy xuất ngữ cảnh dài chỉ bằng một lần tinh chỉnh nhỏ
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Cửa sổ ngữ cảnh
Câu hỏi thường gặp
What is YaRN Context Window Scaling?
YaRN (Yet another RoPE extensioN) là một kỹ thuật kéo dài cửa sổ ngữ cảnh có thể sử dụng của máy biến áp vượt xa những gì nó được đào tạo với sự tinh chỉnh tối thiểu. Điều này quan trọng vì nó cho phép các mô hình hiện có xử lý các tài liệu dài hơn nhiều mà không cần đào tạo lại từ đầu.
YaRN sửa đổi sơ đồ mã hóa vị trí nào để kéo dài độ dài ngữ cảnh?
YaRN là viết tắt của 'Yet another RoPE extensioN' và hoạt động bằng cách thay đổi tỷ lệ tần số quay được sử dụng trong Nhúng Vị trí Quay.
YaRN xử lý các kích thước RoPE tần số cao và tần số thấp như thế nào?
Phương pháp 'NTK theo từng bộ phận' của YaRN duy trì các kích thước tần số cao (cục bộ) trong khi nội suy các kích thước tần số thấp (tầm xa) để tránh làm tổn hại đến chi tiết cục bộ.
Lợi thế hiệu quả chính của YaRN so với việc đào tạo mô hình ngữ cảnh dài từ đầu là gì?
YaRN có thể mở rộng ngữ cảnh bằng cách sử dụng khoảng 0,1% dữ liệu đào tạo ban đầu và một số bước tinh chỉnh nhỏ, rẻ hơn nhiều so với đào tạo lại.
Bên cạnh việc thay đổi tỷ lệ tần số, YaRN còn áp dụng điều chỉnh bổ sung nào để giữ sự chú ý ở tầm xa ổn định?
YaRN điều chỉnh nhiệt độ chú ý để bù đắp cho sự dịch chuyển entropy/logit xảy ra khi các chuỗi dài hơn nhiều.
Vấn đề gì xảy ra nếu bạn cung cấp các chuỗi mô hình RoPE lâu hơn nhiều so với thời gian được đào tạo mà không có bất kỳ tỷ lệ nào?
RoPE tổng quát hóa kém ở các vị trí dài không thể nhìn thấy, do đó chất lượng sẽ giảm trừ khi tần số được thay đổi tỷ lệ.