Nhúng từ
Tính năng nhúng từ biến các từ thành danh sách các số để các từ được sử dụng theo cách tương tự sẽ ở gần nhau trong không gian toán học.
Tổng quan
Chúng là nền tảng cho phép máy tính xử lý ngôn ngữ như một thứ mà nó có thể đo lường và so sánh.
Lặn sâu
Việc nhúng từ thể hiện mỗi từ dưới dạng một vectơ — một danh sách dài các số, thường từ 100 đến 300 đối với các mô hình cổ điển. Những con số này được học từ số lượng lớn văn bản bằng cách nhận biết những từ nào xuất hiện gần nhau. Word2vec, do Tomas Mikolov và các đồng nghiệp tại Google phát hành vào năm 2013, đã phổ biến ý tưởng này bằng hai thủ thuật đào tạo: Skip-gram (dự đoán các từ xung quanh từ một từ mục tiêu) và CBOW (dự đoán mục tiêu từ các từ lân cận). GloVe của Stanford tiếp nối vào năm 2014, xây dựng các vectơ từ số lần xuất hiện của các từ trên toàn cầu. Kết quả nổi tiếng là phép toán vectơ nắm bắt được ý nghĩa: vua trừ đàn ông cộng với phụ nữ ở gần nữ hoàng. Các mô hình ngôn ngữ lớn ngày nay còn tiến xa hơn nữa, học cách nhúng các mã thông báo thay đổi theo ngữ cảnh.
Hiểu biết kỹ thuật
Việc nhúng được học chứ không phải mã hóa bằng tay. Trong quá trình huấn luyện, mô hình sẽ điều chỉnh vectơ của từng từ để các từ xuất hiện trong ngữ cảnh tương tự sẽ tiến gần nhau hơn, được đo bằng độ tương tự cosine (góc giữa các vectơ). Word2vec cổ điển và GloVe cung cấp cho mỗi từ một vectơ cố định bất kể câu nào. Thay vào đó, các mô hình máy biến áp hiện đại bắt đầu từ việc nhúng mã thông báo và sau đó định hình lại từng lớp, do đó, cùng một từ như 'ngân hàng' sẽ có các vectơ khác nhau trong 'bờ sông' so với 'ngân hàng tiết kiệm' — chúng được gọi là các từ nhúng theo ngữ cảnh.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của việc nhúng từ
Việc nhúng một vectơ cho mỗi từ tĩnh hiện nay chủ yếu là một khái niệm giảng dạy và là đường cơ sở nhanh; hệ thống sản xuất sử dụng các phần nhúng theo ngữ cảnh từ các mô hình máy biến áp. Biên giới ngày càng tăng là khả năng nhúng cho toàn bộ câu, tài liệu, hình ảnh và âm thanh được đóng gói vào một không gian chung, hỗ trợ quá trình tạo tăng cường truy xuất và tìm kiếm ngữ nghĩa. Mong đợi các phần nhúng sẽ ngày càng rẻ hơn khi tính toán, đa ngôn ngữ theo mặc định và tập trung vào cách các hệ thống AI tìm thấy thông tin liên quan thay vì ghi nhớ nó trong trọng lượng của chúng.
Triển khai trong thế giới thực
Công cụ tìm kiếm ngữ nghĩa trả về các tài liệu phù hợp với ý nghĩa của truy vấn, không chỉ đối sánh từ khóa chính xác.
Hệ thống đề xuất đề xuất các sản phẩm hoặc bài viết tương tự bằng cách so sánh các vectơ nhúng của chúng.
Hỗ trợ thế hệ tăng cường truy xuất (RAG), trong đó chatbot nhúng câu hỏi của bạn để lấy các đoạn văn bản phù hợp nhất từ cơ sở kiến thức.
Phân cụm và loại bỏ trùng lặp, chẳng hạn như nhóm các phiếu hỗ trợ gần giống nhau hoặc các câu chuyện tin tức theo mức độ gần nhau của vectơ.
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Word Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Nhúng văn bản
Câu hỏi thường gặp
Nhúng từ là gì?
Tính năng nhúng từ biến các từ thành danh sách các số để các từ được sử dụng theo cách tương tự sẽ ở gần nhau trong không gian toán học. Chúng là nền tảng cho phép máy tính xử lý ngôn ngữ như một thứ mà nó có thể đo lường và so sánh.
Một từ nhúng là gì?
Việc nhúng ánh xạ một từ vào một danh sách các số (một vectơ) để các từ được sử dụng tương tự sẽ ở gần nhau trong không gian số đó.
Làm cách nào để các mô hình như word2vec tìm hiểu nghĩa của một từ?
Word2vec học từ ngữ cảnh: các từ xuất hiện trong văn bản xung quanh tương tự sẽ có vectơ tương tự. Không cần định nghĩa của con người.
Sự khác biệt chính giữa phần nhúng word2vec/GloVe và phần nhúng bên trong các mô hình máy biến áp hiện đại là gì?
Các cách nhúng cổ điển chỉ định một vectơ duy nhất cho mỗi từ bất kể câu nào; máy biến áp điều chỉnh vectơ dựa trên bối cảnh xung quanh, do đó, 'ngân hàng' sẽ khác nhau tùy theo cách sử dụng.
Nhiệm vụ nào dựa trực tiếp nhất vào việc so sánh các vectơ nhúng?
Tìm kiếm ngữ nghĩa nhúng truy vấn và tài liệu, sau đó tìm các vectơ gần nhất, trả về kết quả khớp với ý nghĩa thay vì các từ chính xác.
Khoảng bao nhiêu số (kích thước) mà phần nhúng word2vec hoặc GloVe cổ điển thường sử dụng cho mỗi từ?
Các phần nhúng tĩnh cổ điển thường sử dụng theo thứ tự từ 100 đến 300 kích thước, đủ để nắm bắt các mối quan hệ phong phú mà không khó sử dụng.