Word2Vec Skip-Gram và CBOW
Word2Vec là một kỹ thuật năm 2013 của Google học các vectơ từ dày đặc bằng cách dự đoán các từ từ những từ lân cận, biến ngôn ngữ thành hình học trong đó các từ tương tự nằm gần nhau.
Tổng quan
Nó đã làm cho phép ẩn dụ nổi tiếng "vua - nam + phụ nữ ≈ hoàng hậu" trở nên khả thi và khởi đầu cho kỷ nguyên embedding hiện đại.
Lặn sâu
Word2Vec, được giới thiệu bởi Tomas Mikolov và các đồng nghiệp tại Google vào năm 2013, học một vectơ (thường là 100-300 số) cho mỗi từ bằng cách huấn luyện mạng thần kinh hai lớp nông trên cửa sổ ngữ cảnh trượt. Nó có hai hương vị. CBOW (Túi từ liên tục) lấy các từ ngữ cảnh xung quanh và dự đoán từ trung tâm bị thiếu, tính trung bình các vectơ ngữ cảnh với nhau. Skip-Gram lật ngược điều này: nó lấy từ trung tâm và cố gắng dự đoán từng từ ngữ cảnh xung quanh. Mô hình không bao giờ quan tâm đến nhiệm vụ dự đoán; mục tiêu là ma trận trọng số mà nó học trong suốt quá trình, các hàng của nó trở thành vectơ từ. Các từ xuất hiện trong các ngữ cảnh tương tự sẽ kết thúc với các vectơ tương tự, nắm bắt ý nghĩa hoàn toàn từ sự xuất hiện đồng thời.
Hiểu biết kỹ thuật
Quá trình đào tạo softmax đầy đủ trên một lượng từ vựng khổng lồ quá chậm, vì vậy Word2Vec sử dụng các thủ thuật như lấy mẫu phủ định, điều chỉnh lại dự đoán dưới dạng phân loại nhị phân: phân biệt một từ ngữ cảnh thực với một số từ "tiêu cực" ngẫu nhiên. Nó cũng lấy mẫu con các từ thường gặp như "the" và sử dụng phân phối unigram-tăng lên 0,75 để chọn các từ phủ định. CBOW nhanh hơn và tốt hơn cho các từ thường xuyên; Skip-Gram với tính năng lấy mẫu âm tính xử lý các từ hiếm và ngữ liệu nhỏ tốt hơn.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của Word2Vec Skip-Gram và CBOW
Các phần nhúng tĩnh như Word2Vec phần lớn đã được thay thế bằng các mô hình ngữ cảnh (ELMo, BERT, máy biến áp) cung cấp các vectơ khác nhau cho một từ tùy thuộc vào ngữ cảnh câu, giải quyết vấn đề đa nghĩa trong đó "ngân hàng" có một vectơ cố định. Tuy nhiên, Word2Vec vẫn tồn tại ở những nơi quan trọng là tốc độ, tính đơn giản và khả năng diễn giải: hệ thống đề xuất, tìm kiếm và làm nền tảng giảng dạy. Ý tưởng cốt lõi của nó, ý nghĩa đó xuất hiện từ thống kê sự xuất hiện đồng thời, vẫn là nền tảng khái niệm của tất cả các mô hình ngôn ngữ hiện đại.
Triển khai trong thế giới thực
Spotify và Airbnb đã điều chỉnh Skip-Gram để tìm hiểu cách nhúng các bài hát và danh sách ("item2vec") từ chuỗi phiên của người dùng để đưa ra đề xuất
Hỗ trợ tìm kiếm ngữ nghĩa và mở rộng từ đồng nghĩa để truy vấn "máy tính xách tay" cũng hiển thị "máy tính xách tay" và "máy tính"
Phát hiện sự tương đồng và mối quan hệ trong văn bản, như cặp thủ đô-quốc gia (Paris đối với Pháp còn Tokyo đối với Nhật Bản)
Đang khởi tạo lớp đầu vào của đường ống NLP lớn hơn để phân tích tình cảm và phân loại tài liệu trên dữ liệu hạn chế
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Word2Vec Skip-Gram and CBOW quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mạng lưới đường cao tốc và bỏ qua kết nối
Câu hỏi thường gặp
Word2Vec Skip-Gram và CBOW là gì?
Word2Vec là một kỹ thuật năm 2013 của Google học các vectơ từ dày đặc bằng cách dự đoán các từ từ những từ lân cận, biến ngôn ngữ thành hình học trong đó các từ tương tự nằm gần nhau. Nó làm cho sự tương tự nổi tiếng "vua - đàn ông + phụ nữ ≈ nữ hoàng" trở nên khả thi và khởi đầu kỷ nguyên nhúng hiện đại.
Kiến trúc Skip-Gram dự đoán điều gì?
Skip-Gram lấy một từ trung tâm duy nhất và cố gắng dự đoán từng từ ngữ cảnh xung quanh nó, ngược lại với CBOW.
Đầu ra hữu ích thực tế của việc đào tạo mô hình Word2Vec là gì?
Nhiệm vụ dự đoán chỉ là một phương tiện để đạt được mục đích; mục tiêu là ma trận trọng số đã học có các hàng trở thành các từ nhúng dày đặc.
Tại sao Word2Vec sử dụng lấy mẫu âm tính?
Lấy mẫu phủ định trình bày lại vấn đề dưới dạng phân loại nhị phân dựa trên một vài từ ngẫu nhiên, tránh việc sử dụng softmax tốn kém cho hàng chục nghìn từ.
Biến thể Word2Vec nào thường hoạt động tốt hơn trên các từ hiếm và tập dữ liệu nhỏ?
Skip-Gram với lấy mẫu âm có xu hướng thu thập các từ hiếm tốt hơn, trong khi CBOW nhanh hơn và ưu tiên các từ thường gặp.
Thuộc tính nổi tiếng nào của vectơ Word2Vec được minh họa bằng "vua - đàn ông + phụ nữ ≈ nữ hoàng"?
Các vectơ Word2Vec mã hóa các mối quan hệ để có thể giải quyết các vấn đề tương tự về ngữ nghĩa bằng phép cộng và trừ vectơ đơn giản.