Mã thông báo WordPiece
WordPiece là thuật toán mã hóa từ phụ hỗ trợ BERT và nhiều mô hình Google, chia các từ thành các đoạn có thể sử dụng lại để mô hình có thể xử lý bất kỳ văn bản nào có từ vựng cố định.
Tổng quan
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
Lặn sâu
WordPiece xây dựng vốn từ vựng theo đơn vị từ phụ thay vì toàn bộ từ hoặc ký tự đơn lẻ. Bắt đầu từ các ký tự riêng lẻ, nó hợp nhất một cách tham lam cặp ký hiệu làm tăng khả năng nhất của kho ngữ liệu huấn luyện, lặp lại cho đến khi đạt được kích thước từ vựng mục tiêu (BERT sử dụng khoảng 30.000 mã thông báo). Khi suy luận, nó mã hóa từ trái sang phải một cách tham lam, khớp với từ phụ dài nhất trong từ vựng, sau đó tiếp tục với phần còn lại. Các phần tiếp theo bên trong một từ được đánh dấu bằng tiền tố '##', vì vậy 'chơi' trở thành 'chơi' + '##ing'. Điều này giải quyết vấn đề hết từ vựng: các từ hiếm hoặc không nhìn thấy chỉ đơn giản phân hủy thành các đoạn đã biết, xuống thành các ký tự đơn nếu cần, trong khi các từ phổ biến vẫn ở dạng mã thông báo đơn lẻ để mang lại hiệu quả.
Hiểu biết kỹ thuật
WordPiece khác với Mã hóa cặp byte ở tiêu chí hợp nhất của nó. BPE hợp nhất cặp liền kề thường xuyên nhất; WordPiece hợp nhất cặp để tối đa hóa khả năng dữ liệu huấn luyện, chọn đại khái cặp có tần số chung vượt quá tích số tần số của các bộ phận của nó. Điểm đánh dấu '##' phân biệt các phần đầu tiên của từ với các phần tiếp theo, cho phép trình mã thông báo tái tạo lại các ranh giới từ một cách rõ ràng khi giải mã trở lại văn bản.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của mã thông báo WordPiece
Các mô hình ngôn ngữ lớn mới hơn ngày càng ưu tiên các mô hình unigram BPE (họ GPT) hoặc SentencePiece cấp byte, giúp tránh việc xử lý trước theo ngôn ngữ cụ thể và xử lý mọi đầu vào Unicode. WordPiece vẫn là nền tảng trong các bộ mã hóa có nguồn gốc từ BERT vẫn được triển khai rộng rãi để tìm kiếm và phân loại. Mong đợi việc tiếp tục sử dụng trong NLP sản xuất, cùng với nghiên cứu về các mô hình ký tự và byte không có mã thông báo mà cuối cùng có thể làm giảm hoàn toàn sự phụ thuộc vào các từ vựng từ phụ cố định.
Triển khai trong thế giới thực
BERT mã hóa các truy vấn tìm kiếm trong Google Tìm kiếm, chia các thuật ngữ không quen thuộc thành từ phụ để mô hình vẫn có thể khớp với các trang có liên quan.
BertTokenizer của Hugging Face sử dụng WordPiece để chuyển đổi văn bản thô thành ID mã thông báo được cung cấp cho BERT để phân tích cảm tính và nhận dạng thực thể được đặt tên.
BERT đa ngôn ngữ sử dụng từ vựng WordPiece được chia sẻ trên hơn 100 ngôn ngữ, cho phép sử dụng lại các đoạn trên các tập lệnh có liên quan.
Các biến thể của DistilBERT và lâm sàng/y sinh học kế thừa WordPiece, xử lý các thuật ngữ y tế hiếm gặp như 'bệnh viêm phổi' bằng cách chia chúng thành các phần đã biết.
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mã hóa từ phụ
Câu hỏi thường gặp
What is WordPiece Tokenization?
WordPiece là thuật toán mã hóa từ phụ hỗ trợ BERT và nhiều mô hình Google, chia các từ thành các đoạn có thể sử dụng lại để mô hình có thể xử lý bất kỳ văn bản nào có từ vựng cố định. Đó là lý do tại sao một người mẫu chưa từng nhìn thấy từ 'bất hạnh' vẫn có thể hiểu được bằng cách đọc 'un', '##happy' và '##ness'.
Tiền tố '##' biểu thị điều gì trong đầu ra WordPiece?
WordPiece đánh dấu phần tiếp theo của từ phụ bằng '##', vì vậy 'chơi' trở thành 'chơi' + '##ing', cho phép bộ giải mã tái tạo lại ranh giới từ.
Từ vựng WordPiece được BERT ban đầu sử dụng lớn đến mức nào?
BERT sử dụng từ vựng WordPiece khoảng 30.000 đơn vị từ phụ, cân bằng phạm vi bao phủ với kích thước bảng nhúng.
Tiêu chí hợp nhất của WordPiece khác với Mã hóa cặp byte tiêu chuẩn như thế nào?
BPE hợp nhất cặp liền kề thường xuyên nhất, trong khi WordPiece hợp nhất cặp làm tăng khả năng tập hợp nhiều nhất, ưu tiên các cặp có tần số chung vượt quá tích của các phần của chúng.
WordPiece xử lý một từ chưa từng thấy trong quá trình đào tạo như thế nào?
Các từ không nhìn thấy được chia thành các từ phụ phù hợp dài nhất đã biết, quay trở lại các ký tự đơn, giải quyết vấn đề hết từ vựng.
Tại thời điểm suy luận, WordPiece chọn cách tách một từ như thế nào?
WordPiece mã hóa một cách tham lam, khớp với mục từ vựng dài nhất bắt đầu ở vị trí hiện tại, sau đó lặp lại ở phần còn lại.