คู่มือ AI แบบเห็นภาพ

หม้อแปลงสวิน

Swin Transformer คือ Vision Transformer ที่ประมวลผลภาพในหน้าต่างที่มีการเลื่อนแบบมีลำดับชั้น ทำให้ความสนใจมีประสิทธิภาพเพียงพอที่จะปรับขนาดภาพที่มีความละเอียดสูงได้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It works as a general-purpose backbone for classification, detection, and segmentation.

เจาะลึก

Standard Vision Transformers คำนวณความสนใจบนแพตช์รูปภาพทั้งหมด ซึ่งมีต้นทุนเพิ่มขึ้นเป็นกำลังสองตามขนาดรูปภาพ ซึ่งเป็นอุปสรรคสำหรับงานที่มีความหนาแน่นสูง เช่น การตรวจจับ Swin (Shifted WINdows) เปิดตัวโดยการวิจัย Microsoft ในปี 2021 โดยจะแบ่งรูปภาพออกเป็นหน้าต่างเล็กๆ ที่ไม่ทับซ้อนกัน และคำนวณความสนใจในตนเองเฉพาะในแต่ละหน้าต่าง ส่งผลให้ต้นทุนเพิ่มขึ้นเป็นเส้นตรงตามขนาดรูปภาพ เพื่อให้ข้อมูลข้ามขอบเขตของหน้าต่าง การสลับเลเยอร์จะเปลี่ยนตารางหน้าต่าง ดังนั้นแพตช์ที่แยกออกจากกันจึงแชร์หน้าต่างร่วมกัน Swin ยังสร้างลำดับชั้น โดยเริ่มต้นด้วยแพตช์เล็กๆ และค่อยๆ รวมเข้าด้วยกัน ทำให้เกิดแผนผังฟีเจอร์หลายขนาดเหมือนกับ CNN ซึ่งจัดวางอย่างเป็นระเบียบในเฟรมเวิร์กการตรวจจับและการแบ่งส่วนที่มีอยู่

ข้อมูลเชิงลึกทางเทคนิค

ประสิทธิภาพของ Swin มาจากการดูแลตนเองแบบหลายหัวโดยใช้หน้าต่าง (W-MSA): ความสนใจถูกจำกัดอยู่ที่หน้าต่างแบบตายตัว (เช่น แพตช์ 7x7) ดังนั้นความซับซ้อนจึงปรับขนาดเป็นเส้นตรงแทนที่จะเป็นกำลังสองตามจำนวนแพตช์ บล็อกถัดไปใช้ Shifted-window Attention (SW-MSA) โดยแทนที่พาร์ติชั่นหน้าต่างลงครึ่งหน้าต่าง ดังนั้นจึงเกิดการเชื่อมต่อข้ามหน้าต่าง เลเยอร์ที่ผสานแพตช์จะเชื่อมแพตช์ใกล้เคียงเข้าด้วยกันระหว่างขั้นตอน ลดความละเอียดเชิงพื้นที่ลงครึ่งหนึ่ง และเพิ่มช่องสัญญาณเป็นสองเท่าเพื่อสร้างฟีเจอร์ปิรามิด

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของ Swin Transformer

Swin แสดงให้เห็นว่า Transformers ที่คำนึงถึงพื้นที่และมีลำดับชั้นสามารถแข่งขันหรือเอาชนะ CNN ในฐานะแบ็คโบนการมองเห็นสากล และ Swin V2 ได้ผลักดันสิ่งนี้ไปสู่โมเดลพันล้านพารามิเตอร์และมีความละเอียดสูงมาก คาดว่าจะมีการผสมผสานอย่างต่อเนื่องของอคติแบบอุปนัยแบบบิดเบี้ยวเข้ากับความสนใจ รูปแบบความสนใจที่มีประสิทธิภาพมากขึ้น และแบ็คโบนสไตล์ Swin ที่ป้อนโมเดลหลายรูปแบบและวิดีโอ เนื่องจากแบบจำลองพื้นฐานสำหรับการมองเห็นมีความสมบูรณ์ การออกแบบแบบลำดับชั้นที่สร้างคุณสมบัติหลายขนาดยังคงมีคุณค่าโดยเฉพาะสำหรับงานทำนายที่มีความหนาแน่นสูง

การใช้งานจริงในโลกแห่งความเป็นจริง

การจำแนกประเภท ImageNet ที่มีความแม่นยำสูงเป็นแกนหลักที่ได้รับการฝึกอบรมมาแล้ว

การตรวจจับวัตถุและแบ็กโบนการแบ่งส่วนอินสแตนซ์ในเฟรมเวิร์ก เช่น Mask R-CNN และ Cascade R-CNN

การแบ่งส่วนความหมายของฉากถนนและภาพถ่ายดาวเทียม

การวิเคราะห์ภาพทางการแพทย์ที่ความละเอียดสูงและรายละเอียดหลายสเกลมีความสำคัญ

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Swin Transformer quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Swin Transformer?

Swin Transformer คือ Vision Transformer ที่ประมวลผลภาพในหน้าต่างที่มีการเลื่อนแบบมีลำดับชั้น ทำให้ความสนใจมีประสิทธิภาพเพียงพอที่จะปรับขนาดภาพที่มีความละเอียดสูงได้ โดยทำหน้าที่เป็นแกนหลักของวัตถุประสงค์ทั่วไปสำหรับการจำแนก การตรวจจับ และการแบ่งส่วน

'สวิน' ใน Swin Transformer ย่อมาจากอะไร?

Swin ย่อมาจาก Shifted Windows ซึ่งเป็นกลไกที่ช่วยให้หน้าต่างความสนใจในท้องถิ่นแลกเปลี่ยนข้อมูลข้ามเลเยอร์

เหตุใดการคำนวณความสนใจตนเองภายในหน้าต่างท้องถิ่นจึงมีประโยชน์

การจำกัดความสนใจไปที่หน้าต่างที่มีขนาดคงที่จะทำให้ต้นทุนในการคำนวณเพิ่มขึ้นเป็นเส้นตรงตามขนาดภาพ ซึ่งแตกต่างจากการเติบโตแบบกำลังสองของความสนใจทั่วโลก

Swin ปล่อยให้ข้อมูลเคลื่อนที่ระหว่างหน้าต่างที่แยกจากกันอย่างไร

การสลับเลเยอร์จะเลื่อนตารางหน้าต่างไปครึ่งหน้าต่าง ดังนั้นแพตช์ก่อนหน้านี้ในหน้าต่างที่แตกต่างกันจึงสามารถเชื่อมโยงถึงกันได้

เลเยอร์การรวมแพตช์ทำอะไรระหว่างขั้นตอน Swin?

การรวมแพตช์จะเชื่อมแพตช์ใกล้เคียงเข้าด้วยกันเพื่อลดความละเอียดเชิงพื้นที่และความลึกของช่องสัญญาณแบบคู่ลงครึ่งหนึ่ง สร้างลำดับชั้นแบบหลายขนาด

เหตุใดเอาต์พุตแบบหลายสเกลแบบลำดับชั้นของ Swin จึงมีประโยชน์อย่างยิ่ง

แมปฟีเจอร์หลายสเกลเลียนแบบแบ็คโบนของ CNN ดังนั้น Swin จึงผสานรวมกับเฟรมเวิร์กการทำนายหนาแน่น เช่น Mask R-CNN ได้อย่างง่ายดาย