คู่มือ AI แบบเห็นภาพ

โมเดลรูปภาพ FLUX

FLUX คือกลุ่มโมเดลการแปลงข้อความเป็นรูปภาพแบบเปิดจาก Black Forest Labs ซึ่งเป็นที่รู้จักในด้านรายละเอียดที่คมชัด การติดตามอย่างรวดเร็ว และข้อความที่เรนเดอร์ได้อย่างแม่นยำอย่างน่าประหลาดใจ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Built by ex-Stable Diffusion researchers, it quickly became a top open-weights image generator.

เจาะลึก

FLUX.1 เปิดตัวในเดือนสิงหาคม 2567 จาก Black Forest Labs ซึ่งเป็นสตาร์ทอัพที่ก่อตั้งโดยผู้สร้างหลักของ Stable Diffusion และ Latent Diffusion มีสามระดับ: FLUX.1 [pro] (คุณภาพสูงสุด, API เท่านั้น), FLUX.1 [dev] (น้ำหนักเปิดสำหรับการใช้งานที่ไม่ใช่เชิงพาณิชย์) และ FLUX.1 [schnell] (เวอร์ชันกลั่นที่รวดเร็วของ Apache-2.0) ด้วยพารามิเตอร์ 12 พันล้านตัว FLUX จึงเป็นเลิศในเรื่องการเกาะติดที่รวดเร็ว กายวิภาคเหมือนมือ รายละเอียดเล็กๆ น้อยๆ และการแสดงคำภายในภาพที่ชัดเจน ซึ่งเป็นจุดอ่อนที่มีมายาวนานของโมเดลการแพร่กระจายรุ่นก่อนๆ มันเทียบเคียงหรือเหนือกว่า Midjourney และ DALL-E 3 จากการเปรียบเทียบหลายๆ ครั้ง รุ่นต่อมาได้เพิ่ม FLUX.1 Kontext สำหรับการแก้ไขภาพในบริบท และ FLUX1.1 [pro] เพื่อความเร็วและคุณภาพที่สูงขึ้น ประสาน FLUX ให้เป็นระบบนิเวศการสร้างภาพแบบเปิดชั้นนำ

ข้อมูลเชิงลึกทางเทคนิค

FLUX ใช้หม้อแปลงกระแสแบบเรียงกระแสแทนแบบจำลองการแพร่กระจายแบบ U-Net แบบคลาสสิก โฟลว์ที่ถูกแก้ไขจะเรียนรู้เส้นทางที่ตรงมากขึ้นจากสัญญาณรบกวนไปยังรูปภาพ ทำให้มีคุณภาพสูงโดยใช้ขั้นตอนการสุ่มตัวอย่างน้อยลง ตัวแปร [schnell] ถูกกลั่นเพิ่มเติมเพื่อสร้างในหนึ่งถึงสี่ขั้นตอน สถาปัตยกรรมผสมผสานแกนหลักของหม้อแปลงขนาดใหญ่เข้ากับตัวเข้ารหัสข้อความ (รวมถึง T5) เพื่อตีความข้อความแจ้ง ซึ่งเป็นเหตุผลสำคัญที่ FLUX ปฏิบัติตามคำสั่งที่ซับซ้อนและแสดงข้อความได้ดีกว่าระบบการแพร่กระจายแฝงรุ่นก่อนมาก

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของโมเดลภาพ FLUX

Black Forest Labs กำลังขยาย FLUX จากรุ่นไปสู่การแก้ไขและการควบคุมเต็มรูปแบบ โดยที่ Kontext ช่วยให้สามารถแก้ไขรูปภาพแบบสนทนาและทำซ้ำได้ ในขณะเดียวกันก็รักษาเอกลักษณ์เอาไว้ คาดหวังการผสานรวมที่แนบแน่นยิ่งขึ้นในเครื่องมือสร้างสรรค์ รูปแบบเรียลไทม์ที่เร็วขึ้น การควบคุมที่แข็งแกร่งยิ่งขึ้นผ่านรูปภาพและเลย์เอาต์อ้างอิง และวิดีโอที่น่าจะเป็นไปได้ ในฐานะตัวเลือก open-weights ชั้นนำ FLUX จะยังคงขับเคลื่อนระบบนิเวศการแข่งขันที่มีการปรับแต่ง LoRA และเครื่องมือชุมชน โดยกดดันบริการแบบปิดเช่น Midjourney ทั้งในด้านคุณภาพและความเปิดกว้าง

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างกราฟิกทางการตลาดที่มีข้อความในภาพที่สามารถอ่านได้ เช่น โลโก้หรือสโลแกน

ศิลปินที่ใช้งาน FLUX.1 [dev] ในพื้นที่และฝึกอบรม LoRA แบบกำหนดเองเพื่อสไตล์ที่สอดคล้องกัน

คอนเซ็ปต์อาร์ตและสตอรี่บอร์ดที่รวดเร็วโดยใช้ตัวแปร [schnell] ที่รวดเร็วเพื่อการทำซ้ำอย่างรวดเร็ว

การแก้ไขรูปภาพที่มีอยู่แบบสนทนาด้วย FLUX.1 Kontext โดยยังคงรักษาเอกลักษณ์ของวัตถุไว้

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FLUX Image Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

แบบจำลองการแพร่กระจายแฝง

คำถามที่พบบ่อย

What is FLUX Image Models?

FLUX คือกลุ่มโมเดลการแปลงข้อความเป็นรูปภาพแบบเปิดจาก Black Forest Labs ซึ่งเป็นที่รู้จักในด้านรายละเอียดที่คมชัด การติดตามอย่างรวดเร็ว และข้อความที่เรนเดอร์ได้อย่างแม่นยำอย่างน่าประหลาดใจ สร้างโดยอดีตนักวิจัย Stable Diffusion ทำให้กลายเป็นเครื่องสร้างภาพ open-weights อันดับต้นๆ อย่างรวดเร็ว

บริษัทไหนสร้างโมเดลอิมเมจ FLUX?

FLUX ถูกสร้างขึ้นโดย Black Forest Labs ซึ่งเป็นสตาร์ทอัพที่ก่อตั้งโดยอดีตผู้พัฒนาหลักของ Stable Diffusion

ตัวแปร FLUX ใดที่เป็นเวอร์ชันกลั่นลิขสิทธิ์ที่รวดเร็วและมีลิขสิทธิ์ของ Apache-2.0

FLUX.1 [schnell] ('schnell' หมายถึง 'รวดเร็ว' ในภาษาเยอรมัน) เป็นเวอร์ชันกลั่นที่ได้รับลิขสิทธิ์ Apache-2.0 ที่สร้างขึ้นเพื่อความเร็ว

FLUX ใช้วิธีการทางสถาปัตยกรรมแบบใดแทนแบบจำลองการแพร่กระจาย U-Net แบบคลาสสิก

FLUX สร้างขึ้นบนหม้อแปลงกระแสแบบแก้ไข ซึ่งจะเรียนรู้เส้นทางสัญญาณรบกวนไปยังภาพที่ตรงยิ่งขึ้น และทำให้ขั้นตอนการสุ่มตัวอย่างน้อยลง

จุดอ่อนที่มีมายาวนานของโมเดลการแพร่กระจายก่อนหน้านี้ FLUX มีการปรับปรุงให้ดีขึ้นอย่างเห็นได้ชัดหรือไม่

FLUX ขึ้นชื่อในเรื่องการแสดงคำที่อ่านได้ง่ายภายในรูปภาพอย่างแม่นยำ ซึ่งเป็นสิ่งที่โมเดลก่อนหน้านี้ประสบปัญหา

FLUX.1 Kontext release จะเพิ่มอะไรเป็นหลัก?

FLUX.1 Kontext ช่วยให้สามารถแก้ไขภาพในบริบทเชิงสนทนา ซึ่งสามารถรักษาเอกลักษณ์ของหัวเรื่องในการแก้ไขได้