HƯỚNG DẪN AI trực quan

Chú thích hình ảnh

Chú thích hình ảnh là nhiệm vụ tự động tạo ra một câu bằng ngôn ngữ tự nhiên mô tả nội dung trong hình ảnh.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It bridges vision and language, turning pixels into words that explain content, objects, and actions.

Lặn sâu

Hệ thống chú thích hình ảnh chụp ảnh và đưa ra mô tả trôi chảy, chẳng hạn như 'một con chó màu nâu đang bắt đĩa ném trên cỏ'. Các hệ thống ban đầu ghép nối một mạng tích chập trích xuất các đặc điểm hình ảnh với một mạng lặp lại (LSTM) tạo ra từng từ một, thường được hướng dẫn bởi sự chú ý để mô hình 'nhìn' vào các vùng có liên quan cho mỗi từ. Các hệ thống hiện đại sử dụng bộ mã hóa biến áp cho thị giác và bộ giải mã biến áp cho ngôn ngữ, đồng thời các mô hình ngôn ngữ thị giác lớn như BLIP-2 và GPT-4V có thể chú thích hình ảnh một cách trôi chảy đáng kể. Quá trình đào tạo dựa trên các bộ dữ liệu như MS COCO, trong đó mỗi hình ảnh có nhiều chú thích do con người viết. Chất lượng được đo bằng các số liệu như CIDEr, BLEU và CLIPScore dựa trên nhúng.

Hiểu biết kỹ thuật

Hầu hết người phụ đề đều tuân theo mẫu bộ mã hóa-giải mã. Bộ mã hóa chuyển đổi hình ảnh thành một tập hợp các vectơ đặc trưng; bộ giải mã tạo ra các từ tự động hồi quy, dự đoán từng mã thông báo dựa trên hình ảnh và các từ được tạo trước đó. Sự chú ý cho phép bộ giải mã cân nhắc các vùng hình ảnh khác nhau trên mỗi từ, cải thiện nền tảng. Quá trình đào tạo sử dụng entropy chéo trên các chú thích thực tế, đôi khi sau đó là học tăng cường để tối ưu hóa trực tiếp chỉ số chất lượng chú thích như CIDEr để giảm sai lệch hiển thị.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của chú thích hình ảnh

Chú thích đang hợp nhất thành các mô hình ngôn ngữ thị giác chung không chỉ mô tả mà còn trả lời các câu hỏi, lý do và làm theo hướng dẫn về hình ảnh. Mong đợi các chú thích dày đặc hơn, dễ kiểm soát hơn (độ dài, kiểu hoặc tiêu điểm có thể điều chỉnh), nền tảng thực tế tốt hơn để hạn chế các vật thể gây ảo giác và các công cụ trợ năng mạnh mẽ hơn để tường thuật thế giới hình ảnh trong thời gian thực. Tính năng chú thích video và đa ngôn ngữ sẽ được mở rộng, đồng thời các mẫu máy tích hợp sẵn sẽ mang đến những mô tả tức thì, riêng tư cho điện thoại và thiết bị đeo cho người dùng mù và thị lực kém.

Triển khai trong thế giới thực

Tạo mô tả văn bản thay thế của ảnh để trình đọc màn hình có thể giúp người dùng khiếm thị và thị lực kém

Tự động đề xuất chú thích và thẻ có thể tìm kiếm cho thư viện ảnh lớn và nền tảng hình ảnh có sẵn

Mô tả lớn môi trường xung quanh thông qua các ứng dụng như Microsoft See AI hoặc Be My Eyes

Lập chỉ mục các khung hình video có mô tả văn bản để cho phép tìm kiếm và kiểm duyệt nội dung trên quy mô lớn

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Captioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mô hình hình ảnh FLUX

Câu hỏi thường gặp

What is Image Captioning?

Chú thích hình ảnh là nhiệm vụ tự động tạo ra một câu bằng ngôn ngữ tự nhiên mô tả nội dung trong hình ảnh. Nó kết nối tầm nhìn và ngôn ngữ, biến các pixel thành các từ giải thích nội dung, đối tượng và hành động.

Hệ thống chú thích hình ảnh tạo ra kết quả gì?

Chú thích hình ảnh tạo ra một câu văn bản mô tả nội dung của hình ảnh.

Trong quy trình tạo phụ đề cổ điển, bộ mã hóa hình ảnh đóng vai trò gì?

Bộ mã hóa (thường là CNN hoặc bộ biến đổi tầm nhìn) biến hình ảnh thành các vectơ đặc trưng mà bộ giải mã ngôn ngữ sau đó sử dụng.

Tại sao sự chú ý lại hữu ích trong việc chú thích hình ảnh?

Sự chú ý giúp bộ giải mã “nhìn” được những phần phù hợp nhất của hình ảnh khi tạo ra từng từ, cải thiện nền tảng.

Tập dữ liệu nào được sử dụng rộng rãi để đào tạo và đánh giá chú thích hình ảnh?

MS COCO cung cấp từng hình ảnh được ghép nối với nhiều chú thích do con người viết, khiến nó trở thành tiêu chuẩn phụ đề tiêu chuẩn.

Việc bộ giải mã phụ đề tạo ra các từ 'tự động hồi phục' có ý nghĩa gì?

Thế hệ tự hồi quy tạo ra từng mã thông báo một, mỗi mã thông báo được điều chỉnh dựa trên các mã thông báo trước đó và hình ảnh.