คู่มือ AI แบบเห็นภาพ

การตอบคำถามด้วยภาพ

การตอบคำถามด้วยภาพ (VQA) ช่วยให้ระบบตอบคำถามที่ใช้ภาษาธรรมชาติในรูปแบบอิสระเกี่ยวกับรูปภาพ เช่น "มีคนสวมหมวกกี่คน" ต้องใช้ความเข้าใจร่วมกันทั้งภาพและคำถามเพื่อให้ได้คำตอบที่ถูกต้อง

อ่าน 2 นาทีอัปเดตล่าสุด

เจาะลึก

การตอบคำถามด้วยภาพผสมผสานการมองเห็นของคอมพิวเตอร์และการประมวลผลภาษาธรรมชาติ เมื่อได้รับรูปภาพและคำถาม โมเดลจะส่งกลับคำตอบซึ่งอาจเป็นคำเดียว วลีสั้นๆ หรือการตอบกลับใช่/ไม่ใช่ งานนี้ได้รับความนิยมจากชุดข้อมูล VQA (Antol et al., 2015) และเวอร์ชัน VQA v2.0 ที่ได้รับการปรับปรุง ซึ่งให้คำตอบที่สมดุลเพื่อป้องกันไม่ให้โมเดลคาดเดาจากข้อความเพียงอย่างเดียว ระบบจะเข้ารหัสรูปภาพและคำถาม หลอมรวมการนำเสนอทั้งสอง จากนั้นทำนายคำตอบตามประวัติศาสตร์โดยการจำแนกคำศัพท์ที่มีคำตอบตายตัว ปัจจุบัน โมเดลภาษาการมองเห็นขนาดใหญ่ เช่น GPT-4V, LLaVA และ PaLI จัดการกับ VQA แบบปลายเปิด การให้เหตุผลเกี่ยวกับวัตถุ คุณลักษณะ จำนวน ความสัมพันธ์เชิงพื้นที่ และแม้แต่ข้อความที่เขียนภายในรูปภาพ

ข้อมูลเชิงลึกทางเทคนิค

โมเดล VQA ทั่วไปจะเข้ารหัสรูปภาพ (CNN หรือ Vision Transformer) และคำถาม (ตัวเข้ารหัสข้อความของ Transformer) จากนั้นจึงหลอมรวมเข้าด้วยกัน โดยมักจะมีการให้ความสนใจแบบข้าม ดังนั้นคำคำถามจะอยู่ที่บริเวณรูปภาพ เวกเตอร์ที่หลอมรวมจะป้อนตัวแยกประเภทเหนือคำตอบทั่วไปหรือตัวถอดรหัสภาษาสำหรับการตอบกลับแบบปลายเปิด ข้อผิดพลาดที่ทราบคืออคติทางภาษา: โมเดลสามารถใช้ประโยชน์จากสถิติของคำตอบและเพิกเฉยต่ออิมเมจ ซึ่งทำให้ชุดข้อมูลสมดุล เช่น VQA v2.0 ที่ตอบโต้โดยเฉพาะ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการตอบคำถามด้วยภาพ

VQA กำลังพัฒนาจากการจำแนกคำตอบสั้นๆ ไปสู่การใช้เหตุผลด้วยภาพแบบปลายเปิดและหลายขั้นตอนพร้อมคำอธิบาย คาดหวังการจัดการการนับ แผนภูมิ ไดอะแกรม และข้อความในภาพ (VQA ของเอกสาร) ที่แข็งแกร่งยิ่งขึ้น รวมถึงวิดีโอ VQA ที่ให้เหตุผลเมื่อเวลาผ่านไป การลดอคติทางลัดและภาพหลอนยังคงเป็นสิ่งสำคัญ เช่นเดียวกับคำตอบพื้นฐานในพื้นที่ภาพเฉพาะเพื่อความไว้วางใจ ผู้ช่วยหลายรูปแบบที่มีความสามารถจะตอบคำถามด้วยภาพผ่านการสนทนาทางโทรศัพท์ หุ่นยนต์ และในเครื่องมือช่วยการเข้าถึงที่ช่วยให้ผู้ใช้ซักถามสิ่งรอบตัวได้มากขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

ให้ผู้ใช้ตาบอดถ่ายรูปผลิตภัณฑ์และถามว่า 'นี่คือรสชาติอะไร' หรือ 'วันหมดอายุคือเมื่อใด'

ตอบคำถามเกี่ยวกับแผนภูมิ แบบฟอร์ม และเอกสารที่สแกน (เอกสาร VQA) ในขั้นตอนการทำงานทางธุรกิจ

ขับเคลื่อนผู้ช่วยค้าปลีกและอีคอมเมิร์ซที่ตอบสนองต่อคำถาม "แจ็คเก็ตตัวนี้มีฮู้ดหรือไม่" จากรูปถ่ายสินค้า

สนับสนุนการตรวจสอบภาพทางการแพทย์หรือทางวิทยาศาสตร์โดยการตอบคำถามที่ตรงเป้าหมายเกี่ยวกับการสแกนหรือภาพด้วยกล้องจุลทรรศน์

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual Question Answering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Visual Question Answering?

การตอบคำถามด้วยภาพ (VQA) ช่วยให้ระบบตอบคำถามที่ใช้ภาษาธรรมชาติในรูปแบบอิสระเกี่ยวกับรูปภาพ เช่น "มีคนสวมหมวกกี่คน" ต้องใช้ความเข้าใจร่วมกันทั้งภาพและคำถามเพื่อให้ได้คำตอบที่ถูกต้อง

ระบบตอบคำถามด้วยภาพใช้อินพุตสองอินพุตใด

VQA ใช้ทั้งรูปภาพและคำถามเกี่ยวกับรูปภาพ จากนั้นจึงสร้างคำตอบที่มีพื้นฐานอยู่ในรูปภาพ

เหตุใดชุดข้อมูล VQA v2.0 จึงถูกสร้างขึ้นด้วยคำตอบที่ 'สมดุล'

VQA เวอร์ชัน 2.0 จับคู่คำถามกับรูปภาพที่มีคำตอบต่างกัน บังคับให้โมเดลใช้การป้อนข้อมูลด้วยภาพจริง ๆ แทนที่จะใช้ประโยชน์จากสถิติแบบข้อความ

'อคติทางภาษา' ใน VQA คืออะไร

อคติทางภาษาเกิดขึ้นเมื่อโมเดลใช้ประโยชน์จากสถิติคำตอบที่เชื่อมโยงกับการใช้ถ้อยคำของคำถาม แทนที่จะมองที่รูปภาพ

โมเดล VQA จำนวนมากรวมข้อมูลรูปภาพและคำถามเข้าด้วยกันได้อย่างไร

โมเดล VQA เข้ารหัสแต่ละรูปแบบและหลอมรวมเข้าด้วยกัน โดยมักใช้การเอาใจใส่แบบข้าม ดังนั้นคำคำถามจะไปที่บริเวณรูปภาพที่เกี่ยวข้อง

ระบบ VQA แบบคลาสสิกมักสร้างคำตอบด้วยการทำอะไร

โมเดล VQA ยุคแรกๆ จำนวนมากถือว่างานนี้เป็นการจำแนกประเภทเหนือคำตอบที่พบบ่อยที่สุด แม้ว่าโมเดลสมัยใหม่จะสร้างข้อความปลายเปิดก็ตาม