คู่มือ AI แบบเห็นภาพ

เครือข่ายหม้อแปลงเชิงพื้นที่

Spatial Transformer Networks (STN) เป็นโมดูลที่สามารถเรียนรู้ได้ ซึ่งช่วยให้โครงข่ายประสาทเทียมสามารถบิดเบี้ยว หมุน ครอบตัด หรือปรับขนาดอินพุตใหม่เพื่อมุ่งเน้นไปที่สิ่งที่สำคัญได้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

They give CNNs a built-in sense of spatial attention and invariance.

เจาะลึก

เครือข่าย Convolutional แบบมาตรฐานมีความไม่แปรผันเพียงเล็กน้อยต่อการเปลี่ยนแปลงตำแหน่ง ขนาด และการหมุน โดยอาศัยการรวมกลุ่มกันเพื่อให้ยอมรับได้เพียงเล็กน้อย Spatial Transformer Networks เปิดตัวโดย Jaderberg และคณะ ในปี 2558 ให้แก้ไขปัญหานี้ด้วยการแทรกโมดูลที่สร้างความแตกต่างได้ซึ่งทำการแปลงทางเรขาคณิตอย่างชัดเจนบนแผนที่คุณลักษณะ โมดูลมีสามส่วน: เครือข่ายการแปลที่คาดการณ์พารามิเตอร์การแปลง ตัวสร้างกริดที่สร้างตารางการสุ่มตัวอย่างจากพารามิเตอร์เหล่านั้น และตัวเก็บตัวอย่างที่สอดแทรกอินพุตที่จุดกริด เนื่องจากทุกขั้นตอนมีความแตกต่างกัน หม้อแปลงทั้งหมดจึงได้รับการฝึกอบรมแบบครบวงจรโดยการกระจายกลับโดยไม่มีการควบคุมดูแลเป็นพิเศษ เครือข่ายเรียนรู้ เช่น การปรับตัวเลขที่เอียงให้ตรงหรือซูมเข้าในส่วนที่เกี่ยวข้อง ซึ่งช่วยเพิ่มความแม่นยำและความทนทาน

ข้อมูลเชิงลึกทางเทคนิค

เครือข่ายการแปลเป็นภาษาท้องถิ่นจะส่งออกพารามิเตอร์ (มักจะเป็นเมทริกซ์แอฟฟิน 2x3) สำหรับการแปล มาตราส่วน การหมุน และแรงเฉือน ตัวสร้างกริดจะแมปแต่ละพิกเซลเอาต์พุตกลับไปยังพิกัดต้นทางผ่านเมทริกซ์นั้น จากนั้นเครื่องสุ่มตัวอย่างจะอ่านอินพุตโดยใช้การประมาณค่าแบบไบลิเนียร์ ซึ่งสามารถหาอนุพันธ์ได้ ดังนั้นการไล่ระดับสีจึงไหลไปยังเครือข่ายการแปลเป็นภาษาท้องถิ่น ซึ่งช่วยให้โมดูลเรียนรู้การเปลี่ยนแปลงอย่างหมดจดจากการสูญเสียงาน การเข้าร่วมและการกำหนดขอบเขตภูมิภาคที่เกี่ยวข้อง

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของเครือข่ายหม้อแปลงเชิงพื้นที่

STN มีอิทธิพลต่อวิธีที่เครือข่ายจัดการกับเรขาคณิตและความสนใจ โดยป้อนเข้าสู่การบิดงอที่เปลี่ยนรูปได้และโมดูลการบิดงอที่เรียนรู้ได้ ในขณะที่หม้อแปลงการเอาใจใส่ตนเองมีอิทธิพลเหนือในปัจจุบัน การสุ่มตัวอย่างเชิงอนุพันธ์แบบ STN ยังคงอยู่ในงานที่ต้องการการจัดตำแหน่งทางเรขาคณิตที่ชัดเจน: การจดจำข้อความ การจำแนกประเภทอย่างละเอียด และก่อให้เกิดการทำให้เป็นมาตรฐาน คาดว่าการบิดเบี้ยวที่เปลี่ยนแปลงได้จะยังคงปรากฏในการมองเห็น 3 มิติ การเรนเดอร์ระบบประสาท และการลงทะเบียนภาพทางการแพทย์ ซึ่งมักจะรวมกับความสนใจมากกว่าที่จะถูกแทนที่ด้วยมัน

การใช้งานจริงในโลกแห่งความเป็นจริง

การปรับให้ตรงและจัดแนวข้อความโค้งหรือหมุนก่อนที่จะรับรู้ในระบบ OCR ข้อความในฉาก

ซูมเข้าไปในบริเวณที่เลือกปฏิบัติ (เช่น จงอยปากหรือปีกของนก) เพื่อการจัดหมวดหมู่ภาพที่ละเอียด

การปรับท่าทางและการจัดตำแหน่งใบหน้าให้เป็นมาตรฐานเป็นขั้นตอนก่อนการประมวลผลในไปป์ไลน์การจดจำใบหน้า

แก้ไขความผิดเพี้ยนและจัดแนวการสแกนในการลงทะเบียนภาพทางการแพทย์

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spatial Transformer Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การตรวจจับหม้อแปลง DETR

คำถามที่พบบ่อย

What is Spatial Transformer Networks?

Spatial Transformer Networks (STN) เป็นโมดูลที่สามารถเรียนรู้ได้ ซึ่งช่วยให้โครงข่ายประสาทเทียมสามารถบิดเบี้ยว หมุน ครอบตัด หรือปรับขนาดอินพุตใหม่เพื่อมุ่งเน้นไปที่สิ่งที่สำคัญได้ พวกเขาทำให้ CNN รู้สึกถึงความสนใจและความแปรปรวนเชิงพื้นที่ในตัว

Spatial Transformer Network เพิ่มความสามารถอะไรให้กับโครงข่ายประสาทเทียม?

STN แทรกโมดูลที่สามารถเรียนรู้ได้ซึ่งสามารถแปล หมุน ปรับขนาด หรือบิดเบี้ยวแผนผังคุณลักษณะเพื่อเน้นไปที่เนื้อหาที่เกี่ยวข้อง

ส่วนประกอบสามประการใดที่ประกอบเป็นโมดูลหม้อแปลงเชิงพื้นที่

STN ประกอบด้วยเครือข่ายการแปล (คาดการณ์พารามิเตอร์) ตัวสร้างกริด (สร้างพิกัดการสุ่มตัวอย่าง) และตัวเก็บตัวอย่าง (ประมาณค่าอินพุต)

เหตุใด Spatial Transformer Network จึงสามารถฝึกอบรมด้วย backpropagation แบบธรรมดาได้

การประมาณค่าแบบไบลิเนียร์ในตัวเก็บตัวอย่างนั้นสามารถสร้างความแตกต่างได้ ดังนั้นการไล่ระดับสีจึงไหลย้อนกลับผ่านตัวสร้างกริดไปยังเครือข่ายการแปลเป็นภาษาท้องถิ่น ซึ่งช่วยให้สามารถฝึกอบรมตั้งแต่ต้นทางถึงปลายทางได้

โดยทั่วไปแล้วเครือข่ายโลคัลไลเซชันจะส่งออกอะไรสำหรับการแปลงความสัมพันธ์

สำหรับการแปลงแบบแอฟฟิน เครือข่ายการแปลเฉพาะที่คาดการณ์ค่าหกค่าที่จัดเรียงเป็นการแปลการเข้ารหัสเมทริกซ์ 2x3 สเกล การหมุน และแรงเฉือน

เหตุใด CNN มาตรฐานจึงไม่เปลี่ยนแปลงเพียงเล็กน้อยต่อการเปลี่ยนแปลงเชิงพื้นที่ซึ่งเป็นแรงจูงใจให้ STN

ซีเอ็นเอ็นบรรลุความแปรปรวนเชิงพื้นที่เพียงเล็กน้อยเท่านั้นผ่านการรวมกลุ่ม STN เพิ่มวิธีการที่ชัดเจนและเรียนรู้ได้ในการจัดการตำแหน่ง ขนาด และการหมุน