CLIP và mô hình ngôn ngữ tầm nhìn
CLIP là mô hình của OpenAI học cách kết nối hình ảnh và văn bản bằng cách đặt cả hai vào cùng một không gian toán học.
Tổng quan
It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.
Lặn sâu
Được phát hành vào năm 2021, CLIP (Đào tạo trước về ngôn ngữ-hình ảnh tương phản) đã đào tạo khoảng 400 triệu cặp chú thích hình ảnh được lấy từ web. Nó sử dụng hai bộ mã hóa: một bộ biến hình ảnh thành vectơ, bộ còn lại biến văn bản thành vectơ và cả hai đều nằm trong không gian nhúng chung. Mô hình học cách sao cho ảnh một con chó và dòng chữ "ảnh con chó" nằm gần nhau, trong khi các cặp không khớp nhau nằm cách xa nhau. Điều này mở khóa phân loại không ảnh: để gắn nhãn cho một hình ảnh, bạn so sánh nó với mô tả văn bản của các danh mục ứng cử viên và chọn hình ảnh gần nhất mà không cần đào tạo bộ phân loại chuyên dụng. CLIP đã trở thành cơ sở hạ tầng nền tảng, hướng dẫn các trình tạo hình ảnh, hỗ trợ tìm kiếm hình ảnh ngữ nghĩa, lọc bộ dữ liệu và gieo mầm cho các mô hình ngôn ngữ tầm nhìn lớn hơn hiện nay như Flamingo, LLaVA và GPT-4V.
Hiểu biết kỹ thuật
CLIP được đào tạo với mục tiêu tương phản. Trong một loạt các cặp hình ảnh-văn bản, nó tính toán độ tương tự (thông qua độ tương tự cosine) giữa mọi hình ảnh và mọi chú thích, sau đó điều chỉnh bộ mã hóa để tối đa hóa điểm số cho các cặp đúng và giảm thiểu điểm số cho tất cả các kết hợp sai. Bộ mã hóa hình ảnh thường là Vision Transformer chia hình ảnh thành các mảng; bộ mã hóa văn bản là một Transformer over token. Bởi vì cả hai đều tạo ra các vectơ có thể so sánh được nên bạn có thể khớp bất kỳ hình ảnh nào với bất kỳ văn bản nào một cách nhanh chóng.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của CLIP và các mô hình ngôn ngữ tầm nhìn
Căn chỉnh kiểu CLIP hiện là một khối xây dựng bên trong các mô hình đa phương thức lớn hơn cũng có thể trò chuyện, suy luận và trả lời các câu hỏi về hình ảnh. Mong đợi các bộ đào tạo lớn hơn và rõ ràng hơn, hỗ trợ nhiều ngôn ngữ và mở rộng cho video và âm thanh. Các nhà nghiên cứu đang nỗ lực giảm bớt những thành kiến về mặt xã hội và nhân khẩu học CLIP hấp thụ từ dữ liệu web và để cải thiện sự hiểu biết chi tiết (đếm đồ vật, đọc văn bản, quan hệ không gian) trong đó các mô hình tương phản vẫn còn yếu. Khi các phiên bản mở như OpenCLIP hoàn thiện, chất kết dính văn bản-hình ảnh này sẽ tiếp tục lan rộng trên các công cụ tìm kiếm, robot và khả năng truy cập.
Triển khai trong thế giới thực
Tìm kiếm thư viện ảnh bằng các cụm từ tự nhiên như "hoàng hôn trên núi" thay vì thẻ tên tệp
Hướng dẫn trình tạo văn bản thành hình ảnh để kết quả đầu ra khớp với lời nhắc được yêu cầu
Gắn cờ hình ảnh không an toàn hoặc vi phạm chính sách bằng cách so sánh chúng với mô tả văn bản về nội dung bị cấm
Tự động sắp xếp hoặc chú thích các bộ dữ liệu hình ảnh lớn chưa được gắn nhãn cho nghiên cứu hoặc thương mại điện tử
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CLIP and Vision-Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mô hình hành động-ngôn ngữ-tầm nhìn cho robot
Câu hỏi thường gặp
What is CLIP and Vision-Language Models?
CLIP là mô hình của OpenAI học cách kết nối hình ảnh và văn bản bằng cách đặt cả hai vào cùng một không gian toán học. Đây là công cụ hỗ trợ thầm lặng đằng sau việc tìm kiếm hình ảnh, kiểm duyệt nội dung và nhiều trình tạo chuyển văn bản thành hình ảnh.
Ý tưởng cốt lõi đằng sau CLIP là gì?
CLIP ánh xạ cả hình ảnh và văn bản vào một không gian vectơ dùng chung để có thể đo trực tiếp độ tương tự của chúng.
CLIP sử dụng phương pháp đào tạo nào?
CLIP sử dụng mục tiêu tương phản: các cặp chú thích hình ảnh chính xác được kéo lại gần nhau trong khi các cặp không khớp sẽ bị đẩy ra xa nhau.
'Phân loại không bắn' bằng CLIP nghĩa là gì?
CLIP có thể gắn nhãn cho các hình ảnh mà nó chưa từng được đào tạo cụ thể để phân loại bằng cách so sánh chúng với mô tả văn bản của các danh mục ứng cử viên.
CLIP đo lường xem hình ảnh và chú thích có khớp nhau như thế nào không?
CLIP mã hóa từng vectơ thành một vectơ và tính toán độ tương tự cosin; độ tương tự cao hơn có nghĩa là sự trùng khớp về mặt ngữ nghĩa gần hơn.
CLIP đã đào tạo khoảng bao nhiêu dữ liệu?
CLIP đã học hỏi từ khoảng 400 triệu cặp chú thích hình ảnh được thu thập từ internet, mang lại cho nó kiến thức rộng rãi về ngôn ngữ hình ảnh.