Mất bộ ba và học số liệu
Mất bộ ba dạy mạng lưới thần kinh đặt các mục tương tự gần nhau và các mục khác nhau cách xa nhau trong một không gian nhúng.
Tổng quan
It is the foundation behind face recognition, image search, and recommendation systems that need to compare things rather than just classify them.
Lặn sâu
Học số liệu đào tạo một mô hình để tạo ra các vectơ nhúng trong đó khoảng cách phản ánh sự tương đồng. Mất bộ ba thực hiện điều này bằng cách sử dụng ba đầu vào cùng một lúc: một điểm neo, một điểm dương (cùng loại với điểm neo) và một điểm âm (khác lớp). Mục tiêu đẩy mỏ neo đến gần điểm tích cực hơn điểm tiêu cực ít nhất một khoảng cố định. Về mặt hình thức, tổn thất là max(0, d(a,p) - d(a,n) + lề), trong đó d thường là khoảng cách Euclide. FaceNet năm 2015 của Google đã phổ biến phương pháp này, học trực tiếp cách nhúng khuôn mặt 128 chiều. Sau khi được đào tạo, bạn so sánh hai mục bất kỳ bằng cách tính toán khoảng cách, không cần đào tạo lại cho danh tính mới. Khả năng thiết lập mở này là lý do tại sao việc phân loại nhiệm vụ truy xuất và xác minh khả năng học số liệu không thể dễ dàng xử lý.
Hiểu biết kỹ thuật
Tỷ lệ ký quỹ là yếu tố giúp cho việc thua lỗ gấp ba lần có hiệu quả. Nếu không có nó, mô hình có thể thu gọn tất cả các phần nhúng vào một điểm một cách tầm thường, khiến mọi khoảng cách bằng 0 và thứ tự trở nên vô nghĩa. Biên độ buộc một bộ đệm: số âm ít nhất phải xa hơn số dương trước khi mức lỗ bằng 0. Việc nhúng thường được chuẩn hóa L2 trên một siêu cầu đơn vị, do đó khoảng cách vẫn bị giới hạn và có thể so sánh được. Việc chọn lề (thường khoảng 0,2) sẽ đánh đổi mức độ phân cụm chặt chẽ giữa các lớp với sự phân tách giữa chúng.
Tác động chiến lược
Quyết định rõ ràng hơn
Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.
Chi phí và ngân sách
Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.
Nhóm và quy trình làm việc
Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.
Tương lai của mất ba lần và học số liệu
Mất ba bộ ba thuần túy ngày càng được thay thế bằng các mục tiêu trên toàn lô như đa tương tự, neo proxy và tổn thất tương phản (InfoNCE) để so sánh nhiều cặp trên mỗi bước và hội tụ nhanh hơn. Các phương pháp tự giám sát như SimCLR cho thấy việc học số liệu có thể hoạt động mà không cần nhãn bằng cách coi các lượt xem tăng cường là tích cực. Khi cơ sở dữ liệu vectơ và sự gia tăng thế hệ được tăng cường truy xuất, các phần nhúng đã học làm cơ sở cho việc tìm kiếm ngữ nghĩa ở quy mô hàng tỷ mục, do đó, ý tưởng cốt lõi về khoảng cách giống như sự tương đồng đang trở nên quan trọng hơn, ngay cả khi công thức bộ ba cụ thể mất dần.
Triển khai trong thế giới thực
Xác minh khuôn mặt kiểu FaceNet: điện thoại và cổng hộ chiếu xác nhận danh tính bằng cách kiểm tra xem hai lần nhúng khuôn mặt có nằm trong ngưỡng khoảng cách hay không.
Tìm kiếm sản phẩm trực quan: các trang web thương mại điện tử cho phép người mua hàng tải ảnh lên và truy xuất các mặt hàng tương tự về mặt hình ảnh bằng cách tra cứu nhúng hàng xóm gần nhất.
Xác minh người nói: trợ lý giọng nói nhúng mẫu giọng nói và so sánh nó với hồ sơ đã đăng ký để xác nhận ai đang nói.
Xác minh chữ ký và chữ viết tay: ngân hàng nhúng chữ ký tham chiếu và truy vấn cũng như giả mạo cờ khi khoảng cách vượt quá giới hạn đã học.
Rủi ro & lan can
Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.
Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.
Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.
Lộ trình thực hiện
Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.
Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.
Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.
Ghi lại nơi hỗ trợ Mất ba lần và Học số liệu cũng như nơi các phương pháp đơn giản hơn sẽ tốt hơn.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Triplet Loss and Metric Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mạng lưới Xiêm và mất ba lần
Câu hỏi thường gặp
What is Triplet Loss and Metric Learning?
Mất bộ ba dạy mạng lưới thần kinh đặt các mục tương tự gần nhau và các mục khác nhau cách xa nhau trong một không gian nhúng. Đó là nền tảng đằng sau các hệ thống nhận dạng khuôn mặt, tìm kiếm hình ảnh và đề xuất cần so sánh mọi thứ thay vì chỉ phân loại chúng.
Ba yếu tố đầu vào nào tạo nên một bộ ba trong tổn thất bộ ba?
Một bộ ba bao gồm một cái neo, một cái dương có chung lớp với cái neo và một cái âm từ một lớp khác.
Tại sao lỗ ba lần lại bao gồm thời hạn ký quỹ?
Nếu không có lề, mô hình có thể ánh xạ mọi thứ đến cùng một điểm, khiến tất cả khoảng cách bằng 0 và thỏa mãn sự mất mát một cách tầm thường. Lề buộc sự tách biệt thực sự.
Hệ thống nổi tiếng nào năm 2015 đã phổ biến tính năng mất bộ ba để nhận dạng khuôn mặt?
FaceNet của Google đã sử dụng tính năng mất bộ ba để tìm hiểu cách nhúng khuôn mặt nhỏ gọn và đặt điểm chuẩn trong xác minh khuôn mặt.
Mô hình học số liệu được đào tạo đưa ra kết quả gì cho mỗi đầu vào?
Mô hình ánh xạ đầu vào tới các vectơ nhúng; sau đó bạn so sánh các mục bằng cách đo khoảng cách giữa các phần nhúng của chúng.
Tại sao việc học số liệu lại rất phù hợp với các bài toán mở như thêm các khuôn mặt mới?
Vì nhận dạng dựa trên khoảng cách nhúng nên bạn có thể đăng ký danh tính mới chỉ bằng cách lưu trữ thông tin nhúng của nó mà không cần đào tạo lại mô hình.