HƯỚNG DẪN AI về ngôn ngữ

Máy biến áp lai Jamba-Mamba Models

Jamba là một mô hình ngôn ngữ lớn của Phòng thí nghiệm AI21 xen kẽ các lớp chú ý của Transformer với các lớp không gian trạng thái Mamba (cộng với sự kết hợp của các chuyên gia) để đạt được hiệu quả ngữ cảnh lâu dài mà không làm giảm chất lượng của Transformer.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Điều này quan trọng vì nó cho thấy kiến trúc lai có thể đánh bại Transformer thuần túy về bộ nhớ và tốc độ truyền thông ở độ dài chuỗi dài.

Lặn sâu

Máy biến áp thuần túy chú ý đến chi phí bậc hai khi bối cảnh phát triển và các bong bóng bộ nhớ đệm giá trị khóa của chúng có độ dài chuỗi. Các mô hình không gian trạng thái thuần túy như Mamba có quy mô tuyến tính và giữ trạng thái lặp lại có kích thước cố định, nhưng về mặt lịch sử lại gây chú ý cho một số nhiệm vụ. Jamba kết hợp cả hai: nó xếp chồng các khối trong đó hầu hết các lớp là Mamba (rẻ, tuyến tính, tuyệt vời cho các chuỗi dài) và một số lượng nhỏ hơn là sự chú ý tiêu chuẩn (mạnh về khả năng thu hồi chính xác và lý luận trong ngữ cảnh). Nó cũng bổ sung thêm các lớp hỗn hợp chuyên gia (MoE) để tăng công suất trong khi vẫn giữ các thông số hoạt động ở mức khiêm tốn. Jamba đầu tiên được phát hành với cửa sổ ngữ cảnh 256K mã thông báo và có thể phù hợp với nhiều ngữ cảnh hơn trên một GPU so với các Transformers tương đương, nhờ bộ đệm KV nhỏ hơn đáng kể.

Hiểu biết kỹ thuật

Mamba là một mô hình không gian trạng thái có chọn lọc: thay vì tham gia vào mọi mã thông báo trong quá khứ, nó duy trì trạng thái lặp lại nén được cập nhật tuyến tính theo trình tự, với việc đo phụ thuộc vào đầu vào sẽ quyết định những gì cần giữ hoặc quên. Jamba xen kẽ một vài lớp chú ý đầy đủ trong số nhiều lớp Mamba để mô hình duy trì việc tra cứu tầm xa chính xác của sự chú ý trong khi hầu hết hoạt động điện toán và bộ nhớ vẫn tuyến tính và định tuyến MoE chỉ kích hoạt một tập hợp con các chuyên gia trên mỗi mã thông báo.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của các mẫu máy biến áp lai-Mamba Jamba

Sự chú ý kết hợp cộng với các thiết kế không gian trạng thái đang nổi lên như một công thức hàng đầu cho các mô hình bối cảnh dài hiệu quả và Jamba đã giúp phổ biến mô hình này. Mong đợi các mô hình biên giới và mở hơn sẽ áp dụng các ngăn xếp hỗn hợp, tinh chỉnh tỷ lệ chú ý trên SSM và kết hợp chúng với các thủ thuật MoE và KV-cache. Khi nhu cầu ngữ cảnh tăng lên tới hàng triệu mã thông báo, lợi thế bộ nhớ tuyến tính của các lớp không gian trạng thái khiến cho các kết hợp trở nên đặc biệt hấp dẫn đối với việc triển khai trên thiết bị và nhạy cảm với chi phí.

Triển khai trong thế giới thực

Xử lý đầu vào mã thông báo 256K như hồ sơ pháp lý dài hoặc kho lưu trữ mã lớn trên một GPU không thể vừa với bộ nhớ đệm KV của Transformer tương đương

Phục vụ trò chuyện theo ngữ cảnh dài có thông lượng cao trong đó trạng thái cố định của Mamba giữ cho bộ nhớ ổn định khi các cuộc hội thoại tăng lên

Phân tích tài liệu và tạo tăng cường truy xuất trên các cơ sở kiến thức rất lớn được đưa trực tiếp vào ngữ cảnh

Chạy LLM ngữ cảnh dài có trọng lượng mở (Jamba được phát hành với trọng lượng mở) để nghiên cứu về kiến trúc kết hợp

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jamba Hybrid Transformer-Mamba Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mô hình không gian trạng thái và Mamba

Câu hỏi thường gặp

Jamba Hybrid Transformer-Mamba Models là gì?

Jamba là một mô hình ngôn ngữ lớn của Phòng thí nghiệm AI21 xen kẽ các lớp chú ý của Transformer với các lớp không gian trạng thái Mamba (cộng với sự kết hợp của các chuyên gia) để đạt được hiệu quả ngữ cảnh lâu dài mà không làm giảm chất lượng của Transformer. Nó quan trọng vì nó cho thấy các kiến ​​trúc lai có thể đánh bại các Transformer thuần túy về bộ nhớ và thông lượng ở độ dài chuỗi dài.

Jamba xen kẽ hai loại lớp lõi nào?

Tính năng xác định của Jamba là xếp chồng các lớp không gian trạng thái Mamba cùng với số lượng lớp chú ý Transformer ít hơn.

Jamba sử dụng kỹ thuật bổ sung nào để tăng công suất trong khi vẫn giữ các thông số hoạt động ở mức thấp?

Jamba thêm các lớp MoE để chỉ một nhóm nhỏ chuyên gia hoạt động trên mỗi mã thông báo, tăng tổng công suất mà không tăng tỷ lệ tính toán theo tỷ lệ.

Tại sao Mamba có quy mô tốt hơn sự chú ý đối với các chuỗi dài?

Mamba giữ trạng thái nén, có kích thước cố định được cập nhật tuyến tính, tránh chi phí chú ý bậc hai và bộ nhớ đệm khóa-giá trị ngày càng tăng.

Mô hình Jamba đầu tiên hỗ trợ cửa sổ ngữ cảnh nào?

Jamba ra mắt với cửa sổ ngữ cảnh 256K mã thông báo, được kích hoạt phần lớn nhờ dấu chân bộ nhớ đệm KV nhỏ.

Tại sao Jamba giữ một số lớp chú ý thay vì sử dụng Mamba thuần túy?

Một số lớp được chú ý đầy đủ vẫn giữ được khả năng tra cứu chính xác và khả năng trong ngữ cảnh mà các mô hình không gian trạng thái thuần túy có thể bị trễ.