Mô hình cấp byte không có tokenizer
Các mô hình không có mã thông báo loại bỏ vốn từ vựng cố định của các từ và hoạt động trực tiếp trên byte thô, cho phép một mô hình xử lý bất kỳ ngôn ngữ, mã hoặc thậm chí văn bản ồn ào nào mà không cần bước tiền xử lý dễ hiểu.
Tổng quan
This matters because the tokenizer is one of the last hand-built, English-biased components in an otherwise learned pipeline.
Lặn sâu
Hầu hết các mô hình ngôn ngữ trước tiên sẽ cắt văn bản thành mã thông báo từ phụ bằng cách sử dụng từ vựng cố định được xây dựng bằng thuật toán như Mã hóa cặp byte (BPE). Mã thông báo này được quyết định một lần, trước khi đào tạo và không bao giờ học. Nó làm tăng chi phí cho các ngôn ngữ mà nó đại diện, làm sai số và các từ hiếm, đồng thời sửa lỗi chính tả. Thay vào đó, các mô hình cấp byte đọc trực tiếp các byte UTF-8 thô (256 giá trị có thể). Những nỗ lực ban đầu như ByT5 đã hoạt động nhưng chậm vì chuỗi byte dài hơn nhiều so với chuỗi mã thông báo. Các thiết kế mới hơn như nhóm Byte Latent Transformer (BLT) thành các 'bản vá' động dựa trên mức độ dự đoán của từng byte, tính toán chi tiêu ở những nơi khó đọc văn bản và đọc lướt ở những nơi dễ dàng. Kết quả là chất lượng cạnh tranh không có từ vựng nào cả.
Hiểu biết kỹ thuật
Thách thức cốt lõi là độ dài chuỗi: một câu có 20 mã thông báo có thể là hơn 100 byte và chi phí chú ý tăng theo độ dài. BLT giải quyết vấn đề này bằng bản vá dựa trên entropy. Mạng cấp byte nhỏ dự đoán từng byte tiếp theo; ở nơi mà độ không đảm bảo (entropy) của nó cao thì ranh giới bản vá sẽ được đặt. Các khu vực cứng, dày đặc thông tin nhận được các bản vá ngắn và tính toán nhiều hơn, trong khi các hoạt động có thể dự đoán được sẽ được hợp nhất. Sau đó, một máy biến áp lớn sẽ hoạt động trên các bản vá chứ không phải theo byte để khôi phục hiệu suất.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của các mô hình cấp byte không cần tokenizer
Dự kiến các phương pháp tiếp cận cấp byte sẽ lan truyền nhanh nhất trong các cài đặt đa ngôn ngữ, mã và đầu vào ồn ào, nơi các trình tạo mã thông báo gặp lỗi nặng nhất và trong các tác nhân kết hợp văn bản, dữ liệu có cấu trúc và các ký hiệu bất thường. Khi bản vá động hoàn thiện, sự cân bằng lâu dài giữa tính linh hoạt và tốc độ tiếp tục thu hẹp lại, khiến 'không có mã thông báo' trở thành một mặc định thực tế hơn là một sự tò mò nghiên cứu. Các thiết kế không cần mã hóa cũng đơn giản hóa việc triển khai vì một mô hình có thể phục vụ mọi tập lệnh mà không cần đào tạo lại vốn từ vựng.
Triển khai trong thế giới thực
Xử lý các ngôn ngữ có nguồn tài nguyên thấp như tiếng Amharic hoặc tiếng Khmer mà từ vựng BPE tiêu chuẩn chia thành các đoạn byte đơn không hiệu quả.
Xử lý mã nguồn trong đó khoảng trắng chính xác, thụt lề và các số nhận dạng hiếm gặp quan trọng và ranh giới mã thông báo thường không thẳng hàng.
Đọc văn bản trong thế giới thực ồn ào như đầu ra OCR, lỗi chính tả trên mạng xã hội và biểu tượng cảm xúc mà không có mô hình coi lỗi chính tả là mã thông báo không xác định.
Phục vụ một mô hình toàn cầu trên hàng trăm tập lệnh và hệ thống chữ viết mà không cần duy trì hoặc đào tạo lại trình mã thông báo riêng cho mỗi khu vực.
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tokenizer-Free Byte-Level Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mô hình TF-IDF và Bag-of-Words
Câu hỏi thường gặp
What is Tokenizer-Free Byte-Level Models?
Các mô hình không có mã thông báo loại bỏ vốn từ vựng cố định của các từ và hoạt động trực tiếp trên byte thô, cho phép một mô hình xử lý bất kỳ ngôn ngữ, mã hoặc thậm chí văn bản ồn ào nào mà không cần bước tiền xử lý dễ hiểu. Điều này quan trọng vì mã thông báo là một trong những thành phần thiên về tiếng Anh, được xây dựng thủ công cuối cùng trong một quy trình được học theo cách khác.
Mô hình cấp byte không có mã thông báo đọc đơn vị đầu vào là gì?
Các mô hình cấp byte hoạt động trực tiếp trên các byte văn bản thô, trong đó chỉ có 256 giá trị có thể, loại bỏ nhu cầu về bất kỳ từ vựng mã thông báo cố định nào.
Hạn chế thực tế chính của việc cung cấp byte thô cho máy biến áp tiêu chuẩn là gì?
Một đoạn có vài chục mã thông báo có thể trên một trăm byte và chi phí chú ý tăng theo độ dài chuỗi, do đó các mô hình byte ngây thơ sẽ chậm.
Làm thế nào để Bộ biến đổi tiềm ẩn Byte (BLT) quyết định vị trí nhóm byte thành các bản vá?
BLT đặt các ranh giới bản vá trong đó độ không đảm bảo về byte tiếp theo của mô hình nhỏ cao, giúp các vùng cứng có khả năng tính toán cao hơn và hợp nhất các lần chạy có thể dự đoán được.
Tại sao các token BPE truyền thống được coi là thiên về tiếng Anh?
Bởi vì từ vựng được xây dựng từ kho ngữ liệu chủ yếu là tiếng Anh, nên các ngôn ngữ có ít đại diện sẽ bị phân mảnh thành nhiều mã thông báo, làm tăng chi phí của chúng.
Ưu điểm chính của việc loại bỏ hoàn toàn mã thông báo là gì?
Không có từ vựng cố định, một mô hình cấp byte đơn có thể xử lý mọi hệ thống chữ viết và bộ ký hiệu mà không cần duy trì bộ mã thông báo cho mỗi ngôn ngữ.