Máy biến áp quay
Swin Transformer là một Vision Transformer xử lý hình ảnh trong các cửa sổ phân cấp, dịch chuyển, giúp sự chú ý đủ hiệu quả để mở rộng quy mô trên các hình ảnh có độ phân giải cao.
Tổng quan
It works as a general-purpose backbone for classification, detection, and segmentation.
Lặn sâu
Standard Vision Transformers tính toán sự chú ý trên tất cả các mảng hình ảnh, chi phí này tăng theo phương trình bậc hai với kích thước hình ảnh, một trở ngại đối với các nhiệm vụ dày đặc như phát hiện. Được giới thiệu bởi Microsoft Nghiên cứu vào năm 2021, Swin (Shifted WINdows) thay vào đó chia hình ảnh thành các cửa sổ nhỏ không chồng chéo và chỉ tính toán sự chú ý trong mỗi cửa sổ, khiến chi phí tăng tuyến tính theo kích thước hình ảnh. Để cho phép thông tin vượt qua ranh giới cửa sổ, các lớp xen kẽ sẽ dịch chuyển lưới cửa sổ, do đó, các phần bị tách biệt giờ đây sẽ chia sẻ một cửa sổ. Swin cũng xây dựng một hệ thống phân cấp: nó bắt đầu với các bản vá nhỏ và dần dần hợp nhất chúng, tạo ra các bản đồ tính năng đa tỷ lệ giống như CNN, sắp xếp gọn gàng vào các khung phát hiện và phân đoạn hiện có.
Hiểu biết kỹ thuật
Hiệu quả của Swin đến từ khả năng tự chú ý nhiều đầu dựa trên cửa sổ (W-MSA): sự chú ý được giới hạn trong các cửa sổ cố định (ví dụ: các bản vá 7x7), do đó độ phức tạp tăng theo tuyến tính thay vì bậc hai theo số lượng bản vá. Khối tiếp theo sử dụng sự chú ý của cửa sổ đã dịch chuyển (SW-MSA), dịch chuyển phân vùng cửa sổ bằng một nửa cửa sổ để hình thành các kết nối giữa các cửa sổ. Các lớp hợp nhất bản vá nối các bản vá lân cận giữa các giai đoạn, giảm một nửa độ phân giải không gian và nhân đôi các kênh để xây dựng một kim tự tháp đặc trưng.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của máy biến áp Swin
Swin đã chứng minh rằng Transformers có tính phân cấp, nhận biết địa phương có thể cạnh tranh hoặc đánh bại CNN với tư cách là xương sống của tầm nhìn toàn cầu và Swin V2 đã đẩy điều này lên các mô hình hàng tỷ thông số và độ phân giải rất cao. Mong đợi sự kết hợp liên tục giữa các thành kiến quy nạp tích chập với sự chú ý, các biến thể chú ý hiệu quả hơn và xương sống kiểu Swin cung cấp các mô hình video và đa phương thức. Khi các mô hình nền tảng cho tầm nhìn đã hoàn thiện, các thiết kế phân cấp tạo ra các tính năng đa quy mô vẫn đặc biệt có giá trị đối với các nhiệm vụ dự đoán dày đặc.
Triển khai trong thế giới thực
Phân loại ImageNet có độ chính xác cao làm xương sống được huấn luyện trước
Xương sống phát hiện đối tượng và phân đoạn cá thể trong các khung như Mask R-CNN và Cascade R-CNN
Phân đoạn ngữ nghĩa của cảnh đường phố và hình ảnh vệ tinh
Phân tích hình ảnh y tế đòi hỏi độ phân giải cao và chi tiết đa tỷ lệ
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Swin Transformer quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Máy biến áp khuếch tán
Câu hỏi thường gặp
What is Swin Transformer?
Swin Transformer là một Vision Transformer xử lý hình ảnh trong các cửa sổ phân cấp, dịch chuyển, giúp sự chú ý đủ hiệu quả để mở rộng quy mô trên các hình ảnh có độ phân giải cao. Nó hoạt động như một xương sống có mục đích chung để phân loại, phát hiện và phân đoạn.
Chữ 'Swin' trong Swin Transformer có nghĩa là gì?
Swin là viết tắt của Shifted Windows, cơ chế cho phép các cửa sổ chú ý cục bộ trao đổi thông tin giữa các lớp.
Tại sao tính năng tự chú ý trong các cửa sổ cục bộ lại có lợi?
Việc giới hạn sự chú ý vào các cửa sổ có kích thước cố định làm cho chi phí tính toán tăng tuyến tính với kích thước hình ảnh, không giống như sự tăng trưởng bậc hai của sự chú ý toàn cầu.
Swin cho phép thông tin di chuyển giữa các cửa sổ riêng biệt như thế nào?
Các lớp xen kẽ sẽ dịch chuyển lưới cửa sổ đi một nửa cửa sổ, do đó các bản vá trước đó trong các cửa sổ khác nhau có thể liên kết với nhau.
Các lớp hợp nhất bản vá làm gì giữa các giai đoạn Swin?
Hợp nhất bản vá nối các bản vá lân cận để giảm một nửa độ phân giải không gian và độ sâu kênh đôi, xây dựng hệ thống phân cấp đa quy mô.
Tại sao đầu ra đa quy mô, phân cấp của Swin lại đặc biệt hữu ích?
Bản đồ tính năng nhiều tỷ lệ bắt chước xương sống CNN, vì vậy Swin tích hợp dễ dàng với các khung dự đoán dày đặc như Mask R-CNN.