Mã hóa mã thông báo và cặp byte
Mã thông báo chia văn bản thành các đơn vị nhỏ mà mô hình ngôn ngữ thực sự đọc và Mã hóa cặp byte (BPE) là phương pháp phổ biến để xây dựng vốn từ vựng đó.
Tổng quan
It balances having a manageable vocabulary against handling any word the model might encounter.
Lặn sâu
Mô hình ngôn ngữ không nhìn thấy các ký tự thô hoặc toàn bộ từ - chúng nhìn thấy mã thông báo, ID số nguyên được ánh xạ tới các đoạn văn bản. Việc chọn những phần đó là một sự đánh đổi: từ vựng cấp độ từ rất lớn và gây nghẹt thở cho những từ không nhìn thấy hoặc sai chính tả, trong khi những từ cấp độ ký tự tạo ra các chuỗi rất dài. Mã hóa cặp Byte đạt được điểm trung bình. Được mượn từ thuật toán nén dữ liệu những năm 1990, BPE bắt đầu từ các ký tự riêng lẻ (hoặc byte thô) và liên tục hợp nhất cặp liền kề thường xuyên nhất thành một mã thông báo mới, phát triển vốn từ vựng cho các từ phụ phổ biến. Các từ thường xuyên trở thành các mã thông báo đơn lẻ, trong khi các từ hiếm được chia thành các đoạn có thể sử dụng lại. BPE cấp byte, được các mô hình GPT sử dụng, hoạt động trên byte thô nên có thể biểu thị bất kỳ văn bản Unicode nào — bao gồm biểu tượng cảm xúc và bất kỳ ngôn ngữ nào — mà không gặp lỗi ngoài từ vựng.
Hiểu biết kỹ thuật
Đào tạo BPE mang tính tham lam và theo tần số. Bắt đầu từ một bảng chữ cái cơ sở, nó đếm các cặp ký hiệu liền kề trong một kho văn bản và hợp nhất cặp phổ biến nhất, ghi lại mỗi lần hợp nhất làm quy tắc. Việc lặp lại điều này hàng nghìn lần sẽ tạo ra một danh sách hợp nhất có thứ tự và một từ vựng cố định. Khi suy luận, văn bản được mã hóa bằng cách áp dụng các quy tắc hợp nhất đó theo thứ tự. Đây là lý do tại sao số lượng mã thông báo hiếm khi khớp với số lượng từ: dấu cách, cách viết hoa và các từ hiếm đều thay đổi cách các đoạn văn bản thành mã thông báo và một từ có thể trở thành nhiều mã thông báo.
Tác động chiến lược
Chi phí và ngân sách
Các quyết định về kiến trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.
Quyết định rõ ràng hơn
Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.
Kiểm soát chất lượng
Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.
Tương lai của mã thông báo và mã hóa cặp byte
Quá trình mã hóa đang được xem xét lại tích cực. Các mô hình cấp độ byte và ký tự như ByT5 cũng như các kiến trúc không có mã thông báo hoặc 'byte tiềm ẩn' mới nổi nhằm mục đích loại bỏ hoàn toàn các từ vựng cố định để các mô hình xử lý thống nhất mọi đầu vào và mọi ngôn ngữ. Các nhà nghiên cứu cũng đang giải quyết vấn đề công bằng trong quá trình mã hóa — nhiều ngôn ngữ không phải tiếng Anh và có nguồn tài nguyên thấp hiện có giá cao hơn nhiều mã thông báo cho mỗi câu, làm tăng giá và thu hẹp ngữ cảnh hiệu quả. Mong đợi các mã thông báo được điều chỉnh về mã, toán học và cân bằng đa ngôn ngữ, cộng với các thử nghiệm tiếp tục để đẩy ranh giới trở lại byte thô.
Triển khai trong thế giới thực
Các mô hình GPT và Llama sử dụng trình mã thông báo kiểu BPE để biến lời nhắc thành ID mã thông báo mà mạng xử lý.
Giá API và giới hạn cửa sổ ngữ cảnh được đo bằng mã thông báo, do đó, mã thông báo ảnh hưởng trực tiếp đến chi phí và mức độ phù hợp của văn bản.
Xử lý biểu tượng cảm xúc, mã và các từ hiếm một cách duyên dáng bằng cách chia chúng thành các đoạn byte hoặc từ phụ có thể tái sử dụng.
Hỗ trợ nhiều ngôn ngữ trong một mô hình mà không cần từ điển riêng cho mỗi ngôn ngữ, thông qua mã hóa cấp byte.
Rủi ro & lan can
Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.
Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.
Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.
Lộ trình thực hiện
Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.
Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.
Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.
Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tokenization and Byte Pair Encoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mã hóa cặp byte
Câu hỏi thường gặp
What is Tokenization and Byte Pair Encoding?
Mã thông báo chia văn bản thành các đơn vị nhỏ mà mô hình ngôn ngữ thực sự đọc và Mã hóa cặp byte (BPE) là phương pháp phổ biến để xây dựng vốn từ vựng đó. Nó cân bằng giữa việc có được từ vựng dễ quản lý và việc xử lý bất kỳ từ nào mà mô hình có thể gặp phải.
Mã thông báo tạo ra điều gì để mô hình ngôn ngữ có thể đọc được?
Mô hình hoạt động trên mã thông báo — ID số nguyên đại diện cho ký tự, từ phụ hoặc từ — thay vì chuỗi văn bản thô.
Mã hóa cặp Byte xây dựng vốn từ vựng của nó như thế nào?
BPE bắt đầu từ các ký tự hoặc byte và nhanh chóng hợp nhất các cặp liền kề thường xuyên nhất, dần dần hình thành các mã thông báo từ phụ phổ biến.
Các phương thức từ phụ như BPE giải quyết vấn đề gì so với mã thông báo cấp độ từ?
Từ vựng ở cấp độ từ không thể sử dụng được những từ không nhìn thấy được; Mã thông báo từ phụ chia các từ hiếm thành các phần đã biết, tránh các vấn đề về từ vựng trong khi vẫn quản lý được từ vựng.
Ưu điểm của BPE cấp byte được sử dụng trong các mô hình GPT là gì?
Hoạt động trên byte thô có nghĩa là mọi đầu vào có thể đều có thể được mã hóa, do đó không có ký tự thực sự không xác định nào bất kể ngôn ngữ hoặc ký hiệu.
Tại sao số lượng mã thông báo của mô hình thường khác với số từ trong câu?
Mã thông báo từ phụ có thể chia một từ thành nhiều đoạn và nhạy cảm với khoảng cách và chữ hoa chữ thường, do đó số lượng mã thông báo hiếm khi bằng số lượng từ.