HƯỚNG DẪN cơ bản

Nhúng

Việc nhúng biến các từ, hình ảnh hoặc dữ liệu khác thành danh sách các số (vectơ) để những thứ tương tự sẽ ở gần nhau trong không gian nhiều chiều.

Đọc trong 2 phútCập nhật lần cuối Một phần của lộ trình học Xây dựng với Hệ thống AI

Tổng quan

Chúng là cầu nối cho phép AI so sánh ý nghĩa về mặt toán học.

Lặn sâu

Máy tính không thể suy luận trực tiếp về văn bản thô, vì vậy trước tiên các mô hình sẽ chuyển đổi từng mã thông báo, câu hoặc hình ảnh thành một vectơ, một danh sách có thứ tự gồm hàng trăm hoặc hàng nghìn số. Các vectơ này được sắp xếp sao cho các mục tương tự nhau về mặt ngữ nghĩa nằm gần nhau: 'mèo' nằm gần 'mèo con' và câu hỏi nằm gần tài liệu trả lời nó. Mô hình học các vị trí này trong quá trình đào tạo chứ không phải bằng tay. Một minh họa nổi tiếng là toán học vectơ có thể nắm bắt được các mối quan hệ, trong đó 'vua' trừ 'đàn ông' cộng với 'phụ nữ' sẽ ở gần 'nữ hoàng'. Việc nhúng hỗ trợ tìm kiếm, đề xuất, phân cụm và bước truy xuất trong hệ thống RAG vì việc so sánh hai vectơ có điểm tương tự là nhanh chóng và có ý nghĩa. Điều quan trọng là các phần nhúng nắm bắt các mẫu thống kê từ dữ liệu huấn luyện, do đó chúng cũng có thể mang những thành kiến ​​của dữ liệu đó.

Hiểu biết kỹ thuật

Việc nhúng là một vectơ dày đặc trong một không gian liên tục; độ tương tự thường được đo bằng độ tương tự cosine (góc giữa các vectơ) hoặc tích số chấm, trong đó cao hơn có nghĩa là giống nhau hơn. Các mô hình tìm hiểu các phần nhúng bằng cách điều chỉnh các vectơ này trong quá trình đào tạo để các mục xuất hiện trong các bối cảnh tương tự sẽ di chuyển gần nhau hơn. Để tìm kiếm nhanh chóng hàng triệu vectơ, các hệ thống sử dụng các chỉ mục Lân cận gần nhất gần đúng (chẳng hạn như HNSW) bên trong cơ sở dữ liệu vectơ, đánh đổi một chút độ chính xác để đạt được tốc độ lớn so với so sánh mạnh mẽ.

Tác động chiến lược

Quyết định rõ ràng hơn

Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.

Chi phí và ngân sách

Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.

Nhóm và quy trình làm việc

Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.

Tương lai của nhúng

Việc nhúng ngày càng đa phương thức, ánh xạ văn bản, hình ảnh và âm thanh vào một không gian chung để bạn có thể tìm kiếm hình ảnh bằng từ hoặc ghép âm thanh với chú thích, như các mô hình như CLIP đã phổ biến. Mong đợi các phần nhúng tài liệu theo ngữ cảnh dài hơn, các mô hình nhỏ hơn và rẻ hơn chạy trên thiết bị cũng như xử lý tốt hơn các kiến ​​thức sai lệch và cũ. Khi thế hệ tăng cường truy xuất trở thành tiêu chuẩn, các phần nhúng chất lượng cao và cơ sở dữ liệu vectơ lưu trữ chúng sẽ vẫn là cơ sở hạ tầng cốt lõi để tạo nền tảng cho AI với thông tin thực tế, cập nhật.

Triển khai trong thế giới thực

Các công cụ tìm kiếm ngữ nghĩa nhúng truy vấn và tài liệu của bạn, sau đó trả về kết quả khớp gần nhất theo ý nghĩa thay vì từ khóa chính xác.

Hệ thống RAG nhúng cơ sở kiến ​​thức để chatbot có thể truy xuất những đoạn văn phù hợp nhất trước khi trả lời.

Hệ thống đề xuất (âm nhạc, sản phẩm, video) đặt người dùng và các mục dưới dạng vectơ lân cận để đề xuất nội dung tương tự.

Cụm phát hiện thư rác, trùng lặp và gần trùng lặp bằng cách nhúng tính tương đồng vào gắn cờ nội dung trông giống nhau.

Rủi ro & lan can

Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.

Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.

Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.

Lộ trình thực hiện

1

Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.

2

Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.

3

Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.

4

Ghi lại nơi phần nhúng giúp ích và nơi các phương pháp đơn giản hơn sẽ tốt hơn.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Tiếp theo trong xây dựng với hệ thống AI

Đại lý AI

Câu hỏi thường gặp

Embeddings là gì?

Việc nhúng biến các từ, hình ảnh hoặc dữ liệu khác thành danh sách các số (vectơ) để những thứ tương tự sẽ ở gần nhau trong không gian nhiều chiều. Chúng là cầu nối cho phép AI so sánh ý nghĩa về mặt toán học.

Về cơ bản, nhúng là gì?

Việc nhúng là một vectơ số dày đặc đặt một mục vào không gian nơi các mục tương tự ở gần nhau.

Số liệu nào thường được sử dụng để so sánh hai phần nhúng?

Độ tương tự cosine đo góc giữa các vectơ; giá trị cao hơn có nghĩa là các mục trỏ theo hướng giống nhau hơn.

Tại sao hệ thống sản xuất sử dụng chỉ mục Hàng xóm gần nhất gần nhất (ANN) để nhúng?

So sánh lực lượng vũ phu trên hàng triệu vectơ là chậm, do đó, các chỉ mục ANN như HNSW đánh đổi độ chính xác nhỏ để đạt được tốc độ lớn.

Ví dụ cổ điển về 'vua - đàn ông + phụ nữ ≈ nữ hoàng' chứng minh điều gì về các phần nhúng?

Nó cho thấy các phần nhúng mã hóa các mối quan hệ về mặt hình học, do đó, sự tương tự đôi khi có thể được biểu thị dưới dạng phép cộng và phép trừ vectơ.

Rủi ro thực sự khi sử dụng phần nhúng là gì?

Vì các phần nhúng học hỏi từ dữ liệu nên chúng có thể tiếp thu các thành kiến ​​của dữ liệu đó, những thành kiến ​​này có thể xuất hiện trong tìm kiếm và đề xuất.