การผกผันข้อความ
การกลับข้อความจะสอนให้โปรแกรมสร้างภาพทราบแนวคิดใหม่ล่าสุด เช่น แมว รูปแบบศิลปะ หรือผลิตภัณฑ์โดยเฉพาะ โดยการเรียนรู้คำศัพท์ใหม่ๆ เพียงคำเดียว โดยไม่ต้องเปลี่ยนตัวแบบ
ภาพรวม
It lets you put your own subject into AI art using just 3-5 example photos.
เจาะลึก
Textual Inversion ซึ่งเปิดตัวโดยนักวิจัยในปี 2022 ช่วยแก้ปัญหาการปรับเปลี่ยนในแบบของคุณ: คุณจะบอกแบบจำลองอย่าง Stable Diffusion ให้วาดสุนัข *ของคุณ* ได้อย่างไร ในเมื่อ 'สุนัข' เพียงอย่างเดียวไม่สามารถจับมันได้ แทนที่จะฝึกโครงข่ายประสาทเทียมขนาดใหญ่ขึ้นใหม่ มันจะหยุดการทำงานของโมเดลทั้งหมดและเรียนรู้สิ่งหนึ่ง นั่นคือการฝัง 'คำเทียม' ใหม่ ซึ่งเป็นเวกเตอร์ตัวเดียวในคำศัพท์ของตัวเข้ารหัสข้อความ ซึ่งมักเขียนเป็น S* คุณป้อนรูปภาพแนวคิด 3-5 ภาพ และการเพิ่มประสิทธิภาพจะดันเวกเตอร์นั้นจนกว่าโมเดลจะทำซ้ำหัวเรื่องได้อย่างน่าเชื่อถือเมื่อคุณพิมพ์คำใหม่ เนื่องจากเรียนรู้ได้เพียงเวกเตอร์ (ไม่กี่กิโลไบต์) ผลลัพธ์จึงมีขนาดเล็กและแบ่งปันได้ จากนั้นคุณสามารถเขียนข้อความเตือน เช่น 'S* ขี่สเก็ตบอร์ด ภาพวาดสีน้ำมัน' และแนวคิดจะปรากฏในบริบทใหม่
ข้อมูลเชิงลึกทางเทคนิค
เคล็ดลับก็คือโมเดลข้อความเป็นรูปภาพจะแปลงแต่ละคำเป็นเวกเตอร์ที่ฝังก่อนสร้าง การผกผันข้อความจะเพิ่มเวกเตอร์ใหม่ให้กับตารางที่ฝังนั้นและปรับให้เหมาะสมเท่านั้น โดยใช้การแพร่กระจายแบบเดียวกันที่ช่วยลดการสูญเสียในภาพตัวอย่างของคุณ การไล่ระดับสีจะไหลกลับไปยังการฝัง ในขณะที่ตุ้มน้ำหนักโมเดลทั้งหมดยังคงนิ่งอยู่ ผลลัพธ์ที่ได้คือเวกเตอร์ที่มีขนาดกะทัดรัด (ไม่กี่ KB) ที่อยู่ในพื้นที่คำศัพท์ที่มีอยู่ของโมเดล โดยไม่มีการเปลี่ยนแปลงน้ำหนัก ดังนั้นโมเดลพื้นฐานจึงเก็บความรู้เดิมทั้งหมดไว้
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของการผกผันข้อความ
การกลับข้อความยังคงได้รับความนิยมเนื่องจากขนาดไฟล์ที่เล็กและความสามารถในการแชร์ และชุมชนโอเพ่นซอร์สก็แลกเปลี่ยนการฝังเหล่านี้นับพัน แนวทางในอนาคตผสมผสานกับวิธีการอื่นๆ เช่น ซ้อนคำศัพท์ที่เรียนรู้ไว้หลายคำเพื่อฉากที่สมบูรณ์ยิ่งขึ้น รวมกับ LoRA หรือ DreamBooth เพื่อความเที่ยงตรงที่คมชัดยิ่งขึ้น และขยายแนวคิดไปยังเครื่องสร้างวิดีโอและ 3D คาดหวัง 'ไลบรารีแนวคิด' ที่ผู้ใช้ผสมผสานและจับคู่โทเค็นที่เรียนรู้ บวกกับการกลับกันที่เร็วขึ้นและเกือบจะทันที ดังนั้นการปรับเปลี่ยนในแบบของคุณจะเกิดขึ้นในเวลาไม่กี่วินาทีแทนที่จะเป็นนาที
การใช้งานจริงในโลกแห่งความเป็นจริง
ศิลปินเรียนรู้โทเค็นสำหรับสไตล์ภาพประกอบอันเป็นเอกลักษณ์ของตน จากนั้นนำไปใส่ในฉากใหม่หลายสิบฉากเพื่อให้ได้ผลงานที่สอดคล้องกัน
เจ้าของสัตว์เลี้ยงอัปโหลดรูปถ่ายสุนัขจำนวน 5 รูปเพื่อสร้างเป็นรูปนักบินอวกาศ ภาพวาดยุคเรอเนซองส์ หรือการ์ตูน
แบรนด์อีคอมเมิร์ซขนาดเล็กเรียนรู้คำศัพท์เกี่ยวกับผลิตภัณฑ์ของตน เพื่อให้สามารถแสดงผลในพื้นหลังทางการตลาดต่างๆ ได้โดยไม่ต้องถ่ายภาพ
สตูดิโอเกมจะบันทึกรูปลักษณ์ของตัวละครที่เกิดซ้ำเป็นโทเค็นที่นำมาใช้ซ้ำได้ เพื่อให้คอนเซปต์อาร์ตสอดคล้องกันทั่วทั้งทีม
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Textual Inversion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การผกผันข้อความ Null
คำถามที่พบบ่อย
What is Textual Inversion?
การกลับข้อความจะสอนให้โปรแกรมสร้างภาพทราบแนวคิดใหม่ล่าสุด เช่น แมว รูปแบบศิลปะ หรือผลิตภัณฑ์โดยเฉพาะ โดยการเรียนรู้คำศัพท์ใหม่ๆ เพียงคำเดียว โดยไม่ต้องเปลี่ยนตัวแบบ ช่วยให้คุณสามารถใส่วัตถุของคุณเองลงในงานศิลปะ AI โดยใช้ภาพถ่ายตัวอย่างเพียง 3-5 ภาพ
Textual Inversion เรียนรู้อะไรระหว่างการฝึก?
โดยจะปรับเวกเตอร์การฝังคำเทียมใหม่เพียงเวกเตอร์เดียวในขณะที่ยังคงรักษาโมเดลทั้งหมดไว้
โดยทั่วไปแล้ว Textual Inversion ต้องการรูปภาพตัวอย่างประมาณกี่ภาพ
รูปภาพแนวคิดจำนวนหนึ่งหยิบมือ โดยปกติแล้วจะมีรูปภาพ 3-5 รูปก็เพียงพอที่จะเรียนรู้โทเค็นที่ใช้งานได้
เหตุใดไฟล์ Textual Inversion จึงมีขนาดเล็ก (มักมีขนาดไม่กี่กิโลไบต์)
บันทึกเวกเตอร์ที่ฝังได้เพียงเวกเตอร์เดียว ดังนั้นไฟล์จึงมีขนาดเล็กและแชร์ได้ง่าย
อะไรจะไม่เปลี่ยนแปลงระหว่างการฝึก Textual Inversion
โมเดลพื้นฐานถูกแช่แข็ง มีการอัปเดตเฉพาะการฝังใหม่เท่านั้น ดังนั้นความรู้เดิมจึงยังคงอยู่
คุณจะใช้แนวคิดที่เรียนรู้หลังจากการผกผันของข้อความได้อย่างไร
คุณเพียงแค่ใส่โทเค็นใหม่ (เช่น S*) ลงในข้อความปกติเพื่อเรียกแนวคิด