คู่มือ AI แบบเห็นภาพ

CLIP และโมเดลภาษาวิสัยทัศน์

CLIP เป็นแบบจำลองจาก OpenAI ที่เรียนรู้การเชื่อมโยงรูปภาพและข้อความโดยการวางทั้งสองอย่างไว้ในช่องว่างทางคณิตศาสตร์เดียวกัน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.

เจาะลึก

CLIP (การฝึกอบรมล่วงหน้าภาษาและรูปภาพที่ตัดกัน) เปิดตัวในปี 2021 โดยฝึกฝนคู่คำบรรยายภาพประมาณ 400 ล้านคู่ที่คัดลอกมาจากเว็บ ใช้ตัวเข้ารหัสสองตัว ตัวหนึ่งเปลี่ยนรูปภาพให้เป็นเวกเตอร์ อีกตัวเปลี่ยนข้อความเป็นเวกเตอร์ และทั้งสองตัวลงในพื้นที่ฝังที่ใช้ร่วมกัน แบบจำลองเรียนรู้โดยให้รูปถ่ายของสุนัขและคำว่า "รูปถ่ายของสุนัข" นั่งอยู่ใกล้กัน ในขณะที่คู่ที่ไม่ตรงกันจะนั่งห่างกัน วิธีนี้จะปลดล็อกการจัดหมวดหมู่แบบ Zero-shot: ในการติดป้ายกำกับรูปภาพ คุณจะเปรียบเทียบกับคำอธิบายข้อความของหมวดหมู่ผู้สมัคร และเลือกภาพที่ใกล้เคียงที่สุด โดยไม่ต้องฝึกตัวแยกประเภทเฉพาะ CLIP กลายเป็นโครงสร้างพื้นฐานพื้นฐาน นำทางเครื่องกำเนิดภาพ ขับเคลื่อนการค้นหาภาพเชิงความหมาย การกรองชุดข้อมูล และการสร้างโมเดลภาษาวิสัยทัศน์ที่ใหญ่ขึ้นในปัจจุบัน เช่น Flamingo, LLaVA และ GPT-4V

ข้อมูลเชิงลึกทางเทคนิค

CLIP ได้รับการฝึกอบรมโดยมีวัตถุประสงค์เชิงเปรียบเทียบ ในชุดคู่ข้อความรูปภาพ ระบบจะคำนวณความคล้ายคลึงกัน (ผ่านความคล้ายคลึงโคไซน์) ระหว่างทุกภาพและทุกคำบรรยาย จากนั้นจะปรับตัวเข้ารหัสเพื่อเพิ่มคะแนนสูงสุดสำหรับคู่ที่ถูกต้อง และลดคะแนนสำหรับการผสมที่ไม่ถูกต้องทั้งหมด โดยทั่วไปแล้วตัวเข้ารหัสรูปภาพจะเป็น Vision Transformer ซึ่งจะแยกรูปภาพออกเป็นแพตช์ ตัวเข้ารหัสข้อความเป็น Transformer บนโทเค็น เนื่องจากทั้งสองสร้างเวกเตอร์ที่เทียบเคียงได้ คุณจึงสามารถจับคู่รูปภาพกับข้อความใดๆ ได้ทันที

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของโมเดล CLIP และ Vision-Language

การจัดตำแหน่งแบบ CLIP กลายเป็นแบบเอกสารสำเร็จรูปภายในโมเดลหลายรูปแบบขนาดใหญ่ ซึ่งสามารถพูดคุย ให้เหตุผล และตอบคำถามเกี่ยวกับรูปภาพได้ คาดว่าจะมีชุดการฝึกอบรมที่ใหญ่ขึ้นและสะอาดขึ้น รองรับหลายภาษา และขยายไปยังวิดีโอและเสียง นักวิจัยกำลังทำงานเพื่อลดอคติทางสังคมและประชากร CLIP ที่ดูดซับจากข้อมูลเว็บ และเพื่อปรับปรุงความเข้าใจแบบละเอียด (การนับวัตถุ การอ่านข้อความ ความสัมพันธ์เชิงพื้นที่) ซึ่งแบบจำลองที่ตัดกันยังคงอ่อนแอ เมื่อเวอร์ชันเปิดอย่าง OpenCLIP เติบโตเต็มที่ กาวข้อความรูปภาพนี้จะกระจายไปทั่วเครื่องมือค้นหา หุ่นยนต์ และเครื่องมือช่วยการเข้าถึง

การใช้งานจริงในโลกแห่งความเป็นจริง

ค้นหาไลบรารีรูปภาพด้วยวลีที่เป็นธรรมชาติ เช่น "พระอาทิตย์ตกเหนือภูเขา" แทนแท็กชื่อไฟล์

แนะนำตัวสร้างข้อความเป็นรูปภาพเพื่อให้เอาต์พุตตรงกับพร้อมท์ที่ร้องขอ

การแจ้งรูปภาพที่ไม่ปลอดภัยหรือผิดนโยบายโดยเปรียบเทียบกับคำอธิบายข้อความของเนื้อหาที่ถูกแบน

การจัดระเบียบอัตโนมัติหรือใส่คำอธิบายชุดข้อมูลรูปภาพขนาดใหญ่ที่ไม่มีป้ายกำกับสำหรับการวิจัยหรืออีคอมเมิร์ซ

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

โมเดลการมองเห็น-ภาษา-การกระทำสำหรับวิทยาการหุ่นยนต์

คำถามที่พบบ่อย

What is CLIP and Vision-Language Models?

CLIP เป็นแบบจำลองจาก OpenAI ที่เรียนรู้การเชื่อมโยงรูปภาพและข้อความโดยการวางทั้งสองอย่างไว้ในช่องว่างทางคณิตศาสตร์เดียวกัน มันเป็นเครื่องมือเงียบๆ ที่อยู่เบื้องหลังการค้นหารูปภาพ การควบคุมเนื้อหา และเครื่องมือสร้างข้อความเป็นรูปภาพมากมาย

แนวคิดหลักเบื้องหลัง CLIP คืออะไร?

CLIP จับคู่ทั้งรูปภาพและข้อความในพื้นที่เวกเตอร์ที่ใช้ร่วมกัน เพื่อให้สามารถวัดความคล้ายคลึงกันได้โดยตรง

CLIP ใช้วิธีการฝึกอบรมแบบใด

CLIP ใช้วัตถุประสงค์เชิงเปรียบเทียบ: คู่คำอธิบายภาพที่ถูกต้องจะถูกดึงเข้ามาใกล้ ในขณะที่คู่ที่ไม่ตรงกันจะถูกผลักออกจากกัน

'การจำแนกประเภทซีโรช็อต' ด้วย CLIP หมายถึงอะไร

CLIP สามารถติดป้ายกำกับรูปภาพที่ไม่เคยได้รับการฝึกฝนเป็นพิเศษในการจัดประเภทโดยเปรียบเทียบกับคำอธิบายข้อความของหมวดหมู่ผู้สมัคร

CLIP วัดว่ารูปภาพและคำบรรยายตรงกันอย่างไร

CLIP เข้ารหัสแต่ละรายการเป็นเวกเตอร์และคำนวณความคล้ายคลึงโคไซน์ ความคล้ายคลึงกันที่สูงกว่าหมายถึงการจับคู่ความหมายที่ใกล้ชิดยิ่งขึ้น

CLIP มีการฝึกอบรมข้อมูลประมาณเท่าใด

CLIP เรียนรู้จากคู่คำบรรยายภาพประมาณ 400 ล้านคู่ที่รวบรวมจากอินเทอร์เน็ต ทำให้มีความรู้ด้านภาพในวงกว้าง