HƯỚNG DẪN AI về ngôn ngữ

Nhúng từ phụ FastText

FastText là một phương pháp AI của Facebook năm 2016, biểu thị mỗi từ dưới dạng một túi ký tự n-gram, do đó, nó có thể tạo vectơ ngay cả đối với những từ mà nó chưa từng thấy trong quá trình đào tạo.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Cách tiếp cận từ con này xuất sắc với các ngôn ngữ giàu hình thái, lỗi chính tả và những từ hiếm mà Word2Vec và GloVe lại thất bại.

Lặn sâu

FastText, được phát triển bởi Facebook AI Research (Bojanowski, Grave, Joulin, Mikolov) vào năm 2016, mở rộng mô hình Skip-Gram bằng cách chia từng từ thành ký tự n-gram. Từ "where" với n-gram có độ dài 3 trở thành <wh, whe, her, ere, re> cộng với mã thông báo từ đầy đủ, trong đó dấu ngoặc nhọn đánh dấu ranh giới từ. Vectơ của một từ là tổng của các vectơ n-gram của nó. Điều này có nghĩa là FastText có thể soạn một vectơ cho một từ không có từ vựng như "không thể tin được" từ các phần từ phụ quen thuộc và nó nắm bắt hình thái chung, do đó "chạy", "người chạy" và "chạy" có liên quan một cách tự nhiên. Dự án tương tự cũng cung cấp một trình phân loại văn bản tuyến tính nhanh, chính xác (chế độ giám sát "fastText") được sử dụng cho các tác vụ như nhận dạng và gắn thẻ ngôn ngữ ở quy mô lớn.

Hiểu biết kỹ thuật

Mỗi ký tự n-gram được băm vào một bảng nhóm có kích thước cố định và được gán vectơ riêng; cách biểu diễn của một từ là tổng của các vectơ n-gram cấu thành của nó, được huấn luyện với cùng mục tiêu Skip-Gram lấy mẫu âm như Word2Vec. Việc chia sẻ các tham số từ phụ giữa các từ là lý do tại sao việc chuyển đổi hình thái và tại sao các từ không nhìn thấy vẫn nhận được các vectơ hợp lý. Trình phân loại được giám sát sử dụng mô hình túi tính năng tương tự với softmax phân cấp, giúp nó hoạt động cực kỳ nhanh trên CPU.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của việc nhúng từ phụ FastText

Ý tưởng từ phụ của FastText đã được chứng minh là có tính nền tảng: các máy biến áp hiện đại sử dụng các kỹ thuật liên quan như Mã hóa Byte-Pair và mã thông báo WordPiece để xử lý bất kỳ dữ liệu đầu vào nào mà không cần từ vựng cố định. Facebook đã phát hành các vectơ FastText được đào tạo trước cho 157 ngôn ngữ, giữ cho nó trở thành nền tảng cơ bản cho NLP đa ngôn ngữ và tài nguyên thấp, nơi các mô hình lớn là không thực tế. Khi các mô hình nhỏ trên thiết bị và ở biên ngày càng trở nên quan trọng, thì dung lượng nhỏ và tốc độ CPU của FastText giúp nó phù hợp với việc phân loại văn bản sản xuất.

Triển khai trong thế giới thực

Tạo vectơ cho các từ sai chính tả hoặc chưa từng thấy trước đây như "thực sự" hoặc tên sản phẩm mới

Các vectơ được đào tạo trước nguồn mở của Facebook bao gồm 157 ngôn ngữ để tìm kiếm và gắn thẻ đa ngôn ngữ

Nhận dạng ngôn ngữ tốc độ cao và phân loại spam/chủ đề trên CPU mà không cần GPU

Xử lý các ngôn ngữ giàu hình thái như tiếng Phần Lan hoặc tiếng Thổ Nhĩ Kỳ trong đó các từ có nhiều dạng biến cách

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FastText Subword Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Nhúng đại diện Matryoshka

Câu hỏi thường gặp

Nhúng Subword FastText là gì?

FastText là một phương pháp AI của Facebook năm 2016, biểu thị mỗi từ dưới dạng một túi ký tự n-gram, do đó, nó có thể tạo vectơ ngay cả đối với những từ mà nó chưa từng thấy trong quá trình đào tạo. Cách tiếp cận từ phụ này vượt trội ở các ngôn ngữ, lỗi chính tả và các từ hiếm có hình thái phong phú mà Word2Vec và GloVe không thành công.

FastText thể hiện một từ như thế nào?

FastText phân tách mỗi từ thành các ký tự n-gram và tính tổng các vectơ của chúng để tạo thành cách biểu diễn của từ đó.

FastText khắc phục được hạn chế chính nào của Word2Vec và GloVe?

Vì FastText tổng hợp các vectơ từ các phần từ phụ nên nó có thể xây dựng cách biểu diễn cho các từ mà nó chưa từng thấy trong quá trình đào tạo.

Đối với từ "ở đâu" có n-gram gồm 3 ký tự, n-gram nào là hợp lệ (có dấu ranh giới)?

"ở đâu" mang lại các bát quái như <wh, whe, her, ere, re>, cộng với mã thông báo từ đầy đủ; "cái gì" là một trong số đó.

Mô hình nhúng của FastText xây dựng dựa trên mục tiêu đào tạo cơ bản nào?

FastText mở rộng Skip-Gram với mục tiêu lấy mẫu âm, thêm vectơ n-gram từ phụ.

Tại sao FastText đặc biệt hữu ích cho các ngôn ngữ như tiếng Phần Lan hoặc tiếng Thổ Nhĩ Kỳ?

Ngôn ngữ giàu hình thái tạo ra nhiều dạng từ; chia sẻ vectơ từ phụ cho phép FastText liên hệ chúng một cách tự nhiên.