HƯỚNG DẪN AI trực quan

Máy biến áp tầm nhìn

Vision Transformers (ViTs) áp dụng kiến ​​trúc máy biến áp hỗ trợ ChatGPT cho hình ảnh, xử lý hình ảnh dưới dạng một chuỗi các mảng thay vì một lưới pixel.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

Lặn sâu

Trong nhiều năm, mạng thần kinh tích chập (CNN) đã thống trị thị giác máy tính bằng cách quét các bộ lọc nhỏ trên một hình ảnh. Bài báo năm 2020 'Một hình ảnh có giá trị 16x16 từ' từ Google đã thách thức điều này bằng cách cắt một hình ảnh thành các mảng cố định, thường là 16x16 pixel, làm phẳng từng mảng thành một vectơ và đưa chuỗi kết quả vào một máy biến áp tiêu chuẩn. Mỗi bản vá sẽ trở thành một 'mã thông báo', giống như một từ trong câu. Sau đó, mô hình sử dụng tính năng tự chú ý để mỗi bản vá có thể liên quan trực tiếp đến mọi bản vá khác, nắm bắt các mối quan hệ tầm xa mà một bộ lọc tích chập nhỏ không thể nhìn thấy trong một bước. Điểm đáng lưu ý: ViT rất đói dữ liệu vì chúng thiếu các giả định có sẵn của CNN. Được đào tạo trên các bộ dữ liệu khổng lồ như JFT-300M, họ đã sánh ngang hoặc đánh bại các CNN tốt nhất, định hình lại hoạt động nghiên cứu thị giác hiện đại.

Hiểu biết kỹ thuật

ViT chia hình ảnh thành các miếng vá không chồng chéo, chiếu tuyến tính từng miếng vào một phần nhúng và thêm mã hóa vị trí để mô hình biết vị trí của từng miếng vá trong hình ảnh gốc. Một 'mã thông báo lớp' đặc biệt có thể học được được thêm vào trước; phân loại ổ đĩa đại diện cuối cùng của nó. Các lớp tự chú ý được xếp chồng lên nhau cho phép mỗi bản vá cân nhắc thông tin từ tất cả các bản vá khác, tạo ra một trường tiếp nhận toàn cầu từ lớp một. Vì sự chú ý tỉ lệ bậc hai với số lượng bản vá nên hình ảnh có độ phân giải cao trở nên đắt tiền, đó là lý do tại sao kích thước bản vá và các biến thể chú ý hiệu quả lại quan trọng.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của máy biến áp tầm nhìn

Sự kết hợp giữa ViT và biến áp CNN hiện cung cấp năng lượng cho các hệ thống thị giác hàng đầu và kiến ​​trúc củng cố các mô hình đa phương thức kết hợp hình ảnh với văn bản, như CLIP và các trợ lý ngôn ngữ thị giác hiện đại. Mong đợi công việc tiếp tục nhằm làm cho sự chú ý trở nên rẻ hơn đối với video và độ phân giải cao, cộng với việc đào tạo trước tự giám sát (chẳng hạn như tạo mô hình hình ảnh bị che) để làm giảm nhu cầu dữ liệu được dán nhãn khổng lồ. Khi điện toán phát triển, ranh giới giữa 'mô hình ngôn ngữ' và 'mô hình tầm nhìn' ngày càng mờ nhạt, với các máy biến áp đóng vai trò là xương sống chung giữa các phương thức thay vì các thiết kế chuyên biệt riêng biệt.

Triển khai trong thế giới thực

Hệ thống xếp hạng tìm kiếm và phân loại hình ảnh của Google sử dụng xương sống máy biến áp sau khi ViT tỏ ra cạnh tranh với CNN

CLIP và các mô hình văn bản hình ảnh khác sử dụng ViT để mã hóa hình ảnh để ảnh và chú thích có thể khớp với nhau trong một không gian chung

Nghiên cứu hình ảnh y tế sử dụng ViT để phát hiện các mẫu trên toàn bộ quá trình quét thay vì chỉ các kết cấu cục bộ

Các ngăn xếp nhận thức về xe tự lái và robot kết hợp sự chú ý kiểu ViT để hiểu được cảnh trên toàn bộ trường nhìn

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

CLIP và mô hình ngôn ngữ tầm nhìn

Câu hỏi thường gặp

What is Vision Transformers?

Vision Transformers (ViTs) áp dụng kiến trúc máy biến áp hỗ trợ ChatGPT cho hình ảnh, xử lý hình ảnh dưới dạng một chuỗi các mảng thay vì một lưới pixel. Họ đã chứng minh rằng bạn không cần phải tích chập để đạt được khả năng nhận dạng hình ảnh tiên tiến nhất.

Vision Transformer ban đầu xử lý hình ảnh đầu vào như thế nào?

ViT chia hình ảnh thành các mảng cố định (thường là 16x16 pixel), nhúng từng mảng dưới dạng mã thông báo và đưa chuỗi vào máy biến áp.

Cơ chế quan trọng nào cho phép ViT liên kết các phần ở xa của hình ảnh với nhau?

Tính năng tự chú ý cho phép mỗi bản vá trực tiếp cân nhắc thông tin từ mọi bản vá khác, mang lại cái nhìn tổng thể từ lớp đầu tiên.

Tại sao Vision Transformers đơn giản thường cần tập dữ liệu đào tạo rất lớn để vượt trội?

Không giống như CNN, ViT không giả sử bất biến cục bộ hoặc dịch mã, vì vậy chúng phải tìm hiểu các mẫu này từ một lượng lớn dữ liệu.

Mục đích của mã hóa vị trí trong Vision Transformer là gì?

Tự chú ý là bất khả tri về trật tự, vì vậy mã hóa vị trí sẽ khôi phục vị trí không gian của từng bản vá.

Câu nào phản ánh đúng nhất tác động của ViT lên thị giác máy tính?

ViT đã chứng minh rằng một máy biến áp thuần túy, có đủ dữ liệu và quy mô, có thể cạnh tranh hoặc vượt qua các mạng tích chập tốt nhất.