คู่มือ AI แบบเห็นภาพ

แบ่งส่วนโมเดลอะไรก็ได้

Segment Anything Model (SAM) คือ Meta โมเดลพื้นฐานของ AI สำหรับการแบ่งส่วนภาพ: เมื่อพิจารณาจากจุด กล่อง หรือคำใบ้คร่าวๆ มันจะสรุปวัตถุที่เกี่ยวข้องทันที

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It was built to generalize to objects and images it never saw during training, making segmentation a promptable task.

เจาะลึก

SAM เปิดตัวโดย Meta AI ในปี 2023 โดยจะจัดเฟรมการแบ่งส่วนใหม่เป็นปัญหาที่สามารถแจ้งได้: คุณแจ้งพร้อมท์ (คลิก กล่อง มาสก์ หรือคำใบ้ที่ได้รับจากข้อความ) จากนั้นจะส่งคืนมาสก์ออบเจ็กต์อย่างน้อย 1 รายการ พลังของมันส่วนหนึ่งมาจากขนาด: ได้รับการฝึกฝนบน SA-1B ซึ่งเป็นชุดข้อมูลของมาสก์มากกว่า 1 พันล้านชิ้นจาก 11 ล้านภาพ สร้างขึ้นด้วยเครื่องมือคำอธิบายประกอบแบบ model-in-the-loop ในทางสถาปัตยกรรม SAM มีตัวเข้ารหัสรูปภาพจำนวนมากที่ทำงานหนึ่งครั้งต่อรูปภาพ ตัวเข้ารหัสพรอมต์น้ำหนักเบา และเครื่องถอดรหัสมาสก์ที่รวดเร็ว ดังนั้นรูปภาพที่ฝังตัวเดียวจึงสามารถแสดงพร้อมต์ซ้ำแบบโต้ตอบได้แบบเรียลไทม์ ช่วยให้สามารถถ่ายโอนงานจำนวนมากได้แบบ Zero-shot SAM 2 ซึ่งเปิดตัวในปี 2024 ขยายขอบเขตไปยังวิดีโอ โดยติดตามวัตถุข้ามเฟรม

ข้อมูลเชิงลึกทางเทคนิค

SAM ใช้ตัวเข้ารหัสรูปภาพ Vision Transformer (ViT) ซึ่งมักจะได้รับการฝึกล่วงหน้าด้วยการเข้ารหัสอัตโนมัติแบบมาสก์ เพื่อสร้างการฝังรูปภาพที่มีความหนาแน่นสูง พรอมต์จะถูกเข้ารหัสเป็นโทเค็น และตัวถอดรหัสที่ใช้หม้อแปลงพร้อมฟิวส์แบบสนใจข้ามจะโทเค็นพรอมต์พร้อมรูปภาพที่ฝังอยู่ในมาสก์เอาท์พุตพร้อมคะแนนความเชื่อมั่น เพื่อแก้ไขความคลุมเครือ (การคลิกอาจหมายถึงปุ่ม เสื้อเชิ้ต หรือบุคคล) SAM จะคาดการณ์มาสก์ที่ถูกต้องหลายรายการในคราวเดียว และจัดอันดับมาสก์เหล่านั้น โดยปล่อยให้การใช้งานดาวน์สตรีมหรือข้อความแจ้งเพิ่มเติมคลายความกำกวม

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการแบ่งส่วนโมเดลอะไรก็ได้

SAM ได้กลายเป็นแกนหลักเริ่มต้นสำหรับเครื่องมือคำอธิบายประกอบ การสร้างภาพทางการแพทย์ หุ่นยนต์ และไปป์ไลน์ AR ซึ่งมักจะจับคู่กับตัวตรวจจับหรือโมเดลข้อความสำหรับเวิร์กโฟลว์ 'แบ่งกลุ่มตามชื่อ' ของคำศัพท์แบบเปิด คาดว่าจะมีเวอร์ชันที่เบากว่าและเร็วกว่า (MobileSAM, EfficientSAM) สำหรับการใช้งานบนอุปกรณ์ การบูรณาการที่ลึกซึ้งยิ่งขึ้นกับภาษาสำหรับการแบ่งส่วนที่ขับเคลื่อนด้วยข้อความอย่างสมบูรณ์ และการขยายอย่างต่อเนื่องไปยังวิดีโอและ 3D ในฐานะแบบจำลองพื้นฐาน การฝังของมันจะถูกนำกลับมาใช้ใหม่มากขึ้นเรื่อยๆ เป็นชั้นการรับรู้ที่ป้อนระบบอื่นๆ

การใช้งานจริงในโลกแห่งความเป็นจริง

แพลตฟอร์มคำอธิบายประกอบรูปภาพใช้ SAM เพื่อให้ผู้ติดป้ายกำกับคลิกเพียงครั้งเดียว และสร้างมาสก์ออบเจ็กต์ที่แม่นยำโดยอัตโนมัติ ซึ่งช่วยลดเวลาการติดป้ายกำกับ

นักวิจัยปรับใช้ SAM (เช่น MedSAM) เพื่อร่างโครงร่างอวัยวะและเนื้องอกในการสแกน CT และ MRI

โปรแกรมตัดต่อรูปภาพและวิดีโอผสานรวม SAM เพื่อตัดหัวข้อหรือลบพื้นหลังด้วยการคลิกเพียงครั้งเดียว

SAM 2 ติดตามและแบ่งส่วนวัตถุในเฟรมวิดีโอสำหรับเอฟเฟกต์ AR และการรับรู้ของหุ่นยนต์

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Segment Anything Model quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

แบบจำลองความสม่ำเสมอ

คำถามที่พบบ่อย

What is Segment Anything Model?

Segment Anything Model (SAM) คือ Meta โมเดลพื้นฐานของ AI สำหรับการแบ่งส่วนภาพ: เมื่อพิจารณาจากจุด กล่อง หรือคำใบ้คร่าวๆ มันจะสรุปวัตถุที่เกี่ยวข้องทันที มันถูกสร้างขึ้นเพื่อสรุปวัตถุและภาพที่ไม่เคยเห็นระหว่างการฝึก ทำให้การแบ่งส่วนเป็นงานที่รวดเร็ว

แนวคิดหลักใดที่ทำให้ SAM เป็น 'แบบจำลองพื้นฐาน' สำหรับการแบ่งส่วน

SAM ปรับการแบ่งส่วนใหม่ตามความพร้อมและได้รับการออกแบบมาเพื่อการถ่ายโอนแบบ Zero-shot ไปยังวัตถุและรูปภาพที่อยู่นอกชุดการฝึก

ชุดข้อมูล SA-1B ที่ใช้ในการฝึก SAM มีขนาดประมาณเท่าใด

SA-1B มีมาสก์มากกว่า 1 พันล้านภาพในรูปภาพประมาณ 11 ล้านภาพ ซึ่งสร้างขึ้นด้วยเครื่องมือใส่คำอธิบายประกอบแบบ model-in-the-loop

เหตุใด SAM จึงแยกสถาปัตยกรรมออกเป็นตัวเข้ารหัสรูปภาพขนาดใหญ่และตัวเข้ารหัส/ตัวถอดรหัสพร้อมท์น้ำหนักเบา

การเข้ารหัสภาพที่มีราคาแพงจะทำงานเพียงครั้งเดียว จากนั้นการเข้ารหัสพร้อมท์ราคาถูกและการถอดรหัสมาสก์จะทำให้สามารถแสดงรูปภาพเดียวกันซ้ำแบบโต้ตอบได้อย่างรวดเร็ว

SAM จัดการกับพรอมต์ที่ไม่ชัดเจน เช่น การคลิกเพียงครั้งเดียวที่อาจหมายถึงหลายอ็อบเจ็กต์ได้อย่างไร

SAM ส่งออกมาสก์ผู้สมัครหลายรายการพร้อมคะแนน เพื่อให้สามารถแก้ไขความคลุมเครือได้โดยการจัดอันดับหรือพร้อมท์เพิ่มเติม

SAM ใช้แบ็คโบนประเภทใดในการเข้ารหัสอิมเมจอินพุต

ตัวเข้ารหัสภาพของ SAM คือ Vision Transformer ซึ่งมักจะได้รับการฝึกล่วงหน้าด้วยการเข้ารหัสอัตโนมัติแบบมาสก์ ทำให้เกิดการฝังภาพที่หนาแน่น