คู่มือ AI แบบเห็นภาพ

วิสัยทัศน์หม้อแปลง

Vision Transformers (ViTs) ใช้สถาปัตยกรรมหม้อแปลงที่ขับเคลื่อน ChatGPT กับรูปภาพ โดยถือว่ารูปภาพเป็นลำดับของแพตช์ แทนที่จะเป็นตารางพิกเซล

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

เจาะลึก

เป็นเวลาหลายปีมาแล้วที่โครงข่ายประสาทเทียมแบบหมุนวน (CNN) ครอบงำคอมพิวเตอร์วิทัศน์โดยการสแกนฟิลเตอร์ขนาดเล็กทั่วทั้งภาพ บทความปี 2020 เรื่อง 'รูปภาพมีค่า 16x16 คำ' จาก Google ท้าทายสิ่งนี้ด้วยการตัดรูปภาพเป็นแพตช์คงที่ ซึ่งโดยทั่วไปแล้วจะมีขนาด 16x16 พิกเซล ทำให้แต่ละภาพแบนเป็นเวกเตอร์ และป้อนลำดับผลลัพธ์ลงในหม้อแปลงมาตรฐาน แต่ละแพตช์จะกลายเป็น 'โทเค็น' เหมือนกับคำในประโยค จากนั้น โมเดลจะใช้การเอาใจใส่ในตนเอง ดังนั้นทุกแพตช์จึงสามารถเชื่อมโยงโดยตรงกับแพตช์อื่นๆ ทั้งหมด โดยบันทึกความสัมพันธ์ระยะยาวที่ตัวกรองแบบเกลียวขนาดเล็กไม่สามารถมองเห็นได้ในขั้นตอนเดียว สิ่งที่จับได้: ViT เป็นที่ต้องการข้อมูลเนื่องจากขาดสมมติฐานในตัวของ CNN เมื่อฝึกฝนชุดข้อมูลขนาดมหึมาเช่น JFT-300M พวกเขาจับคู่หรือเอาชนะ CNN ที่ดีที่สุดได้ โดยเปลี่ยนโฉมการวิจัยด้านการมองเห็นสมัยใหม่

ข้อมูลเชิงลึกทางเทคนิค

ViT จะแบ่งรูปภาพออกเป็นแพตช์ที่ไม่ทับซ้อนกัน ฉายแต่ละแพตช์เป็นเส้นตรงในการฝัง และเพิ่มการเข้ารหัสตำแหน่งเพื่อให้โมเดลรู้ว่าแต่ละแพตช์อยู่ที่ใดในรูปภาพต้นฉบับ มีการเติม 'โทเค็นคลาส' ที่สามารถเรียนรู้พิเศษได้ การเป็นตัวแทนขั้นสุดท้ายทำให้เกิดการจำแนกประเภท เลเยอร์การเอาใจใส่ตนเองแบบซ้อนกันช่วยให้แต่ละแพตช์ชั่งน้ำหนักข้อมูลจากแพตช์อื่นๆ ทั้งหมด โดยให้ช่องรับข้อมูลทั่วโลกจากเลเยอร์ที่ 1 เนื่องจากความสนใจจะปรับขนาดเป็นกำลังสองตามจำนวนแพตช์ รูปภาพที่มีความละเอียดสูงจึงมีราคาแพง ซึ่งเป็นเหตุผลว่าทำไมขนาดแพตช์และรูปแบบความสนใจที่มีประสิทธิภาพจึงมีความสำคัญ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของวิสัยทัศน์ Transformers

ขณะนี้ ViT และหม้อแปลงลูกผสมของ CNN ขับเคลื่อนระบบการมองเห็นชั้นนำ และสถาปัตยกรรมก็สนับสนุนโมเดลหลายรูปแบบที่หลอมรวมรูปภาพเข้ากับข้อความ เช่น CLIP และระบบช่วยด้านภาษาการมองเห็นสมัยใหม่ คาดหวังการทำงานอย่างต่อเนื่องในการทำให้ความสนใจถูกลงสำหรับความละเอียดสูงและวิดีโอ บวกกับการฝึกอบรมล่วงหน้าแบบมีผู้ดูแลด้วยตนเอง (เช่น การสร้างแบบจำลองภาพพราง) ซึ่งจะช่วยลดความอยากข้อมูลที่มีป้ายกำกับจำนวนมหาศาล เมื่อการประมวลผลเติบโตขึ้น เส้นแบ่งระหว่าง 'แบบจำลองภาษา' และ 'แบบจำลองการมองเห็น' ก็เริ่มเบลอ โดยหม้อแปลงทำหน้าที่เป็นแกนหลักที่ใช้ร่วมกันในรูปแบบต่างๆ แทนที่จะแยกการออกแบบเฉพาะทาง

การใช้งานจริงในโลกแห่งความเป็นจริง

Google การจัดหมวดหมู่รูปภาพและระบบจัดอันดับการค้นหาที่ใช้แกนหลักของหม้อแปลงหลังจาก ViT พิสูจน์ให้เห็นว่าสามารถแข่งขันกับ CNN ได้

CLIP และโมเดลข้อความรูปภาพอื่นๆ ที่ใช้ ViT ในการเข้ารหัสรูปภาพ เพื่อให้สามารถจับคู่รูปภาพและคำบรรยายในพื้นที่ที่ใช้ร่วมกันได้

การวิจัยด้านภาพทางการแพทย์โดยใช้ ViT เพื่อระบุรูปแบบในการสแกนทั้งหมด ไม่ใช่แค่พื้นผิวเฉพาะที่

การรับรู้แบบขับเคลื่อนด้วยตนเองและหุ่นยนต์ที่ผสมผสานความสนใจแบบ ViT เพื่อการทำความเข้าใจฉากในขอบเขตการมองเห็นทั้งหมด

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

CLIP และโมเดลภาษาวิสัยทัศน์

คำถามที่พบบ่อย

What is Vision Transformers?

Vision Transformers (ViTs) ใช้สถาปัตยกรรมหม้อแปลงที่ขับเคลื่อน ChatGPT กับรูปภาพ โดยถือว่ารูปภาพเป็นลำดับของแพตช์ แทนที่จะเป็นตารางพิกเซล พวกเขาพิสูจน์ให้เห็นว่าคุณไม่จำเป็นต้องมีการโน้มน้าวใจเพื่อให้ได้การจดจำภาพที่ล้ำสมัย

Vision Transformer เริ่มประมวลผลภาพอินพุตอย่างไร

ViT แบ่งภาพออกเป็นแพตช์คงที่ (โดยทั่วไปคือ 16x16 พิกเซล) ฝังแต่ละแพตช์เป็นโทเค็น และป้อนซีเควนซ์ลงในหม้อแปลงไฟฟ้า

กลไกสำคัญใดที่ทำให้ ViT เชื่อมโยงส่วนที่ห่างไกลของภาพถึงกัน

การเอาใจใส่ในตนเองทำให้ทุกแพตช์ชั่งน้ำหนักข้อมูลจากแพตช์อื่นๆ ได้โดยตรง โดยให้มุมมองทั่วโลกจากเลเยอร์แรก

เหตุใด Vision Transformers ธรรมดาจึงต้องการชุดข้อมูลการฝึกอบรมขนาดใหญ่มากเพื่อให้เป็นเลิศ

ต่างจาก CNN ตรงที่ ViT จะไม่ถือว่าท้องถิ่นหรือการแปลไม่แปรผัน ดังนั้นพวกเขาจึงต้องเรียนรู้รูปแบบเหล่านี้จากข้อมูลจำนวนมาก

จุดประสงค์ของการเข้ารหัสตำแหน่งใน Vision Transformer คืออะไร

การใส่ใจในตนเองนั้นไม่เชื่อเรื่องพระเจ้า ดังนั้นการเข้ารหัสตำแหน่งจะคืนค่าตำแหน่งเชิงพื้นที่ของแต่ละแพตช์

ข้อความใดสะท้อนถึงผลกระทบของ ViT ต่อการมองเห็นคอมพิวเตอร์ได้ดีที่สุด

ViT แสดงให้เห็นว่าหม้อแปลงไฟฟ้าที่มีข้อมูลและขนาดเพียงพอ สามารถแข่งขันหรือเหนือกว่าเครือข่าย Convolutional ที่ดีที่สุดได้