HƯỚNG DẪN KỸ THUẬT

RMSNorm và chuẩn hóa lớp trước

RMSNorm là một lớp chuẩn hóa nhẹ giúp định lại tỷ lệ kích hoạt theo bình phương trung bình gốc của chúng và chuẩn hóa lớp trước đặt bước trước mỗi lớp con thay vì sau.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Họ cùng nhau làm cho máy biến áp sâu hoạt động ổn định mà không cần thủ thuật khởi động.

Lặn sâu

Standard LayerNorm trừ giá trị trung bình và chia cho độ lệch chuẩn trên một vectơ đặc trưng, ​​sau đó áp dụng thang đo và dịch chuyển đã học. RMSNorm, được Zhang và Sennrich giới thiệu vào năm 2019, loại bỏ hoàn toàn định tâm trung bình và độ lệch: nó chỉ đơn giản chia mỗi vectơ cho bình phương trung bình gốc của các phần tử của nó và nhân với mức tăng đã học trên mỗi đặc tính. Điều này loại bỏ một thống kê và một số thao tác, cắt giảm khoảng 10-50% tính toán trong lớp định mức trong khi vẫn khớp độ chính xác. Riêng biệt, vị trí 'Pre-LN' (chuẩn mực trước sự chú ý/MLP, với đường dư rõ ràng xung quanh nó) giữ cho cường độ gradient bị giới hạn khi khởi tạo, do đó các mô hình như GPT-3, LLaMA và PaLM huấn luyện mà không cần hack khởi động tốc độ học tập mà máy biến áp Post-LN ban đầu yêu cầu.

Hiểu biết kỹ thuật

Đối với vectơ x có kích thước d, RMSNorm tính x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon), trong đó g là vectơ khuếch đại đã học. Không có phép trừ trung bình và không có sai lệch. Do luồng dư trong khối Pre-LN bỏ qua quá trình chuẩn hóa nên đường dẫn nhận dạng không bị ảnh hưởng và độ dốc chuyển trực tiếp từ đầu ra sang đầu vào, đó là lý do tại sao các ngăn xếp rất sâu hội tụ.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của RMSNorm và Chuẩn hóa tiền lớp

RMSNorm hiện là mặc định trong hầu hết các LLM có trọng lượng mở (LLaMA, Mistral, Qwen, Gemma), vì vậy, mong đợi nó sẽ duy trì tiêu chuẩn. Nghiên cứu đang cải tiến công thức: QK-norm áp dụng RMSNorm cho các truy vấn chú ý và khóa để chế ngự sự tăng trưởng logit, đồng thời một số phòng thí nghiệm kết hợp trước và sau định mức ('sandwich' hoặc 'peri-LN') để tăng độ ổn định ở quy mô nghìn tỷ tham số. Các hạt nhân phần cứng tiếp tục hợp nhất hoạt động để đạt được tốc độ.

Triển khai trong thế giới thực

LLaMA, Mistral và Qwen đều thay thế LayerNorm bằng RMSNorm để loại bỏ độ trễ suy luận trên mỗi mã thông báo

Pre-LN cho phép các mô hình kiểu GPT huấn luyện mà không cần khởi động tốc độ học tập mà máy biến áp Post-LN 2017 cần có

Chuẩn hóa QK sử dụng RMSNorm trên các truy vấn và khóa chú ý để ngăn chặn các bản ghi bùng nổ trong các mô hình lớn

Máy biến áp di động và biên áp dụng RMSNorm vì việc giảm giá trị trung bình và độ lệch làm giảm lưu lượng bộ nhớ

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RMSNorm and Pre-Layer Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

RMSNorm và Chuẩn hóa lớp trước là gì?

RMSNorm là một lớp chuẩn hóa nhẹ giúp định lại tỷ lệ kích hoạt theo bình phương trung bình gốc của chúng và chuẩn hóa lớp trước đặt bước trước mỗi lớp con thay vì sau. Họ cùng nhau làm cho máy biến áp sâu hoạt động ổn định mà không cần thủ thuật khởi động.

RMSNorm bỏ qua điều gì so với LayerNorm tiêu chuẩn?

RMSNorm bỏ qua việc tính toán và trừ giá trị trung bình, chỉ chuẩn hóa theo bình phương trung bình gốc của các lần kích hoạt.

RMSNorm chia mỗi vectơ kích hoạt với số lượng bao nhiêu?

RMSNorm chia cho sqrt giá trị trung bình của các phần tử bình phương, tức là bình phương trung bình gốc, sau đó áp dụng mức tăng đã học.

Lợi ích chính của việc chuẩn hóa lớp trước so với chuẩn hóa lớp sau là gì?

Việc đặt định mức trước mỗi lớp con với một đường dư rõ ràng sẽ giới hạn độ lớn độ dốc, loại bỏ nhu cầu khởi động tốc độ học tập.

Trong khối Pre-LN, lớp chuẩn hóa cố tình giữ nguyên đường dẫn nào?

Pre-LN chuẩn hóa đầu vào thành lớp con nhưng phím tắt còn lại sẽ bỏ qua nó, duy trì đường cao tốc có độ dốc rõ ràng.

Theo mặc định, dòng mô hình trọng lượng mở hiện đại nào sử dụng RMSNorm?

RMSNorm đã trở thành chuẩn hóa tiêu chuẩn trong LLaMA, Mistral, Qwen, Gemma và các LLM gần đây nhất.