Mã thông báo SentencePiece
SentencePiece là một công cụ mã thông báo bất khả tri về ngôn ngữ, học cách chia văn bản thô thành các phần từ phụ trực tiếp từ dữ liệu mà không cần dựa vào dấu cách.
Tổng quan
It made multilingual models far easier to build by treating any language the same way.
Lặn sâu
Hầu hết các trình tạo mã thông báo đều cho rằng các từ được phân tách bằng dấu cách, điều này sẽ bị ngắt đối với các ngôn ngữ như tiếng Nhật, tiếng Trung hoặc tiếng Thái không sử dụng chúng. SentencePiece, do Google phát hành vào năm 2018, vượt qua điều này bằng cách xử lý dữ liệu đầu vào dưới dạng luồng ký tự thô — bao gồm khoảng trắng — và học từ vựng của các đơn vị từ phụ từ chính dữ liệu đó. Nó nổi tiếng thay thế các khoảng trắng bằng một điểm đánh dấu hiển thị (ký hiệu meta giống dấu gạch dưới) để quá trình mã hóa hoàn toàn có thể đảo ngược: bạn luôn có thể xây dựng lại văn bản gốc chính xác. SentencePiece hỗ trợ hai thuật toán chính, Mã hóa cặp byte (BPE) và mô hình ngôn ngữ Unigram, mô hình sau là phương thức chữ ký của nó. Bởi vì nó không cần mã hóa trước theo ngôn ngữ cụ thể nên cùng một quy trình hoạt động trên hàng trăm ngôn ngữ, đó là lý do tại sao các mô hình như T5, ALBERT và nhiều hệ thống đa ngôn ngữ dựa vào nó.
Hiểu biết kỹ thuật
Thuật toán Unigram của SentencePiece bắt đầu với một lượng từ vựng ứng viên lớn và lặp đi lặp lại việc cắt tỉa các phần đóng góp ít nhất vào khả năng của kho dữ liệu đào tạo bằng cách sử dụng quy trình Tối đa hóa Kỳ vọng. Dấu cách có thể nhìn thấy (ký hiệu meta) cho phép nó mã hóa và giải mã một cách dễ dàng. Nó cũng có thể hoạt động ở cấp độ byte, đảm bảo rằng bất kỳ ký tự nào - ngay cả biểu tượng cảm xúc hoặc tập lệnh không nhìn thấy - đều có thể biểu diễn được mà không gặp lỗi ngoài từ vựng.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của mã thông báo SentencePiece
SentencePiece vẫn là công cụ hỗ trợ cho các mô hình mã và đa ngôn ngữ vì tính đảo ngược và tính trung lập của ngôn ngữ. Lĩnh vực này đang dần dần khám phá các phương pháp tiếp cận cấp độ byte và không có mã thông báo, bỏ qua hoàn toàn các từ vựng từ phụ, nhằm mục đích loại bỏ các vấn đề về mã thông báo gây ảnh hưởng đến số học, ngôn ngữ hiếm và số dài. Mặc dù vậy, các thiết kế Unigram và byte dự phòng của SentencePiece vẫn tiếp tục ảnh hưởng đến các mã thông báo mới hơn và triết lý đào tạo từ văn bản thô, không mất dữ liệu của nó sẽ vẫn là nền tảng cho tương lai gần.
Triển khai trong thế giới thực
Mô hình T5 của Google, sử dụng từ vựng SentencePiece được đào tạo trên văn bản web đa ngôn ngữ.
Mã thông báo văn bản tiếng Nhật hoặc tiếng Trung không có khoảng cách giữa các từ, trong đó mã thông báo dựa trên từ không thành công.
Xây dựng một từ vựng chung duy nhất trên hơn 100 ngôn ngữ cho hệ thống dịch đa ngôn ngữ.
Tái tạo lại đầu vào ban đầu một cách dễ dàng (bao gồm cả khoảng cách) từ mã thông báo, hữu ích cho việc tạo mã khi có khoảng trắng quan trọng.
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SentencePiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mã hóa từ phụ
Câu hỏi thường gặp
What is SentencePiece Tokenization?
SentencePiece là một công cụ mã thông báo bất khả tri về ngôn ngữ, học cách chia văn bản thô thành các phần từ phụ trực tiếp từ dữ liệu mà không cần dựa vào dấu cách. Nó làm cho việc xây dựng các mô hình đa ngôn ngữ trở nên dễ dàng hơn nhiều bằng cách xử lý bất kỳ ngôn ngữ nào theo cùng một cách.
SentencePiece tránh giả định quan trọng nào mà các công cụ mã thông báo truyền thống dựa vào?
SentencePiece xử lý thông tin đầu vào dưới dạng luồng ký tự thô, do đó, nó hoạt động ngay cả đối với các ngôn ngữ không có khoảng cách giữa các từ.
Tại sao SentencePiece thay thế dấu cách bằng ký hiệu meta hiển thị?
Mã hóa khoảng trắng dưới dạng điểm đánh dấu hiển thị có nghĩa là văn bản gốc, bao gồm cả khoảng cách, luôn có thể được xây dựng lại một cách chính xác.
SentencePiece chủ yếu hỗ trợ hai thuật toán nào?
SentencePiece cung cấp Mã hóa cặp byte (BPE) và mô hình ngôn ngữ Unigram, với Unigram là phương thức đặc trưng của nó.
Mô hình Unigram xây dựng vốn từ vựng của nó như thế nào?
Unigram bắt đầu với nhiều phần ứng cử viên và lặp đi lặp lại loại bỏ những phần đóng góp ít nhất vào khả năng của kho dữ liệu bằng cách sử dụng Tối đa hóa kỳ vọng.
Mô hình nào nổi tiếng sử dụng mã thông báo SentencePiece?
T5 của Google sử dụng từ vựng SentencePiece, ALBERT và nhiều mô hình đa ngôn ngữ cũng vậy.