คู่มือ AI แบบเห็นภาพ

คำบรรยายภาพ

คำบรรยายภาพเป็นหน้าที่ในการสร้างประโยคภาษาธรรมชาติที่อธิบายสิ่งที่อยู่ในรูปภาพโดยอัตโนมัติ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It bridges vision and language, turning pixels into words that explain content, objects, and actions.

เจาะลึก

ระบบคำบรรยายภาพจะถ่ายภาพและแสดงคำอธิบายได้คล่อง เช่น 'สุนัขสีน้ำตาลกำลังจับจานร่อนบนพื้นหญ้า' ระบบในยุคแรกๆ จับคู่เครือข่ายแบบหมุนวนที่แยกลักษณะทางการมองเห็นกับเครือข่ายแบบเกิดซ้ำ (LSTM) ที่สร้างคำทีละคำ ซึ่งมักจะได้รับคำแนะนำจากความสนใจ ดังนั้นแบบจำลองจะ 'ดู' ที่บริเวณที่เกี่ยวข้องสำหรับแต่ละคำ ระบบสมัยใหม่ใช้ตัวเข้ารหัสหม้อแปลงสำหรับการมองเห็นและตัวถอดรหัสหม้อแปลงสำหรับภาษา และโมเดลภาษาการมองเห็นขนาดใหญ่ เช่น BLIP-2 และ GPT-4V สามารถใส่คำบรรยายภาพได้อย่างคล่องแคล่วอย่างน่าทึ่ง การฝึกอบรมอาศัยชุดข้อมูล เช่น MS COCO ซึ่งแต่ละภาพมีคำบรรยายที่เขียนโดยมนุษย์หลายรายการ วัดคุณภาพด้วยหน่วยเมตริก เช่น CIDEr, BLEU และ CLIPScore ที่อิงจากการฝัง

ข้อมูลเชิงลึกทางเทคนิค

คำบรรยายภาพส่วนใหญ่ใช้รูปแบบตัวเข้ารหัส-ตัวถอดรหัส ตัวเข้ารหัสจะแปลงรูปภาพเป็นชุดของเวกเตอร์คุณลักษณะ ตัวถอดรหัสจะสร้างคำแบบถดถอยอัตโนมัติ โดยทำนายแต่ละโทเค็นที่มีเงื่อนไขบนรูปภาพและคำที่สร้างก่อนหน้านี้ ความสนใจช่วยให้ตัวถอดรหัสมีน้ำหนักบริเวณรูปภาพที่แตกต่างกันต่อคำ และปรับปรุงการต่อลงดิน การฝึกอบรมใช้เอนโทรปีข้ามกับคำบรรยายจากความจริงภาคพื้นดิน บางครั้งตามด้วยการเรียนรู้แบบเสริมที่ปรับเมตริกคุณภาพคำบรรยาย เช่น CIDEr โดยตรงเพื่อลดอคติในการเปิดเผย

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของคำบรรยายภาพ

คำบรรยายกำลังผสานเข้ากับโมเดลภาษาวิสัยทัศน์ทั่วไป ซึ่งไม่เพียงแต่อธิบาย แต่ยังตอบคำถาม เหตุผล และปฏิบัติตามคำแนะนำเกี่ยวกับรูปภาพอีกด้วย คาดว่าจะมีคำอธิบายภาพที่หนาแน่นและควบคุมได้มากขึ้น (ความยาว สไตล์ หรือโฟกัสที่ปรับได้) การระบุข้อเท็จจริงที่ดีขึ้นเพื่อควบคุมวัตถุหลอนประสาท และเครื่องมือช่วยการเข้าถึงที่แข็งแกร่งยิ่งขึ้น ซึ่งบรรยายโลกแห่งภาพแบบเรียลไทม์ คำบรรยายหลายภาษาและวิดีโอจะขยายออกไป และโมเดลในอุปกรณ์จะนำคำอธิบายแบบส่วนตัวทันทีมาสู่โทรศัพท์และอุปกรณ์สวมใส่สำหรับผู้ใช้ที่ตาบอดหรือมีปัญหาด้านการมองเห็น

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างคำอธิบายข้อความแสดงแทนของรูปภาพเพื่อให้โปรแกรมอ่านหน้าจอสามารถช่วยเหลือผู้ใช้ที่ตาบอดและมีความบกพร่องทางการมองเห็นได้

คำบรรยายอัตโนมัติและแท็กที่ค้นหาได้สำหรับคลังภาพขนาดใหญ่และแพลตฟอร์มภาพสต็อก

บรรยายเสียงรอบข้างผ่านแอป เช่น Microsoft เห็น AI หรือ Be My Eyes

การจัดทำดัชนีเฟรมวิดีโอด้วยคำอธิบายข้อความเพื่อให้สามารถค้นหาเนื้อหาและการกลั่นกรองในวงกว้าง

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Captioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Image Captioning?

คำบรรยายภาพเป็นหน้าที่ในการสร้างประโยคภาษาธรรมชาติที่อธิบายสิ่งที่อยู่ในรูปภาพโดยอัตโนมัติ โดยเชื่อมโยงการมองเห็นและภาษาเข้าด้วยกัน โดยเปลี่ยนพิกเซลให้เป็นคำที่อธิบายเนื้อหา วัตถุ และการกระทำ

ระบบคำบรรยายภาพสร้างอะไรเป็นเอาท์พุต?

คำบรรยายภาพจะสร้างประโยคข้อความที่อธิบายเนื้อหาของรูปภาพ

ในไปป์ไลน์คำบรรยายแบบคลาสสิก ตัวเข้ารหัสภาพมีบทบาทอย่างไร

ตัวเข้ารหัส (มักเป็น CNN หรือตัวแปลงการมองเห็น) เปลี่ยนรูปภาพให้เป็นเวกเตอร์คุณลักษณะที่ตัวถอดรหัสภาษาใช้

เหตุใดความสนใจจึงมีประโยชน์ในคำบรรยายภาพ

ความสนใจช่วยให้ตัวถอดรหัส 'ดู' ส่วนที่เกี่ยวข้องที่สุดของรูปภาพเมื่อสร้างแต่ละคำ และปรับปรุงการต่อลงดิน

ชุดข้อมูลใดที่ใช้กันอย่างแพร่หลายในการฝึกอบรมและประเมินคำบรรยายภาพ

MS COCO จัดเตรียมภาพที่แต่ละภาพจับคู่กับคำบรรยายที่เขียนโดยมนุษย์หลายรูป ทำให้เป็นเกณฑ์มาตรฐานสำหรับคำบรรยายมาตรฐาน

การถอดรหัสคำอธิบายภาพเพื่อสร้างคำว่า 'การถดถอยอัตโนมัติ' หมายความว่าอย่างไร

การสร้างแบบถดถอยอัตโนมัติจะสร้างโทเค็นทีละรายการ โดยแต่ละอันมีเงื่อนไขตามโทเค็นก่อนหน้าและรูปภาพ