HƯỚNG DẪN AI trực quan

Mô hình hình ảnh FLUX

FLUX là một nhóm mô hình chuyển văn bản thành hình ảnh mở của Black Forest Labs nổi tiếng với chi tiết sắc nét, theo dõi lời nhắc mạnh mẽ và văn bản được hiển thị chính xác đến mức đáng ngạc nhiên.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Được xây dựng bởi các nhà nghiên cứu Stable Diffusion cũ, nó nhanh chóng trở thành một công cụ tạo ảnh trọng số mở hàng đầu.

Lặn sâu

FLUX.1 ra mắt vào tháng 8 năm 2024 từ Black Forest Labs, một công ty khởi nghiệp được thành lập bởi những người tạo ra cốt lõi của Khuếch tán ổn định và Khuếch tán tiềm ẩn. Nó có ba cấp: FLUX.1 [pro] (chất lượng hàng đầu, chỉ API), FLUX.1 [dev] (trọng lượng mở cho mục đích phi thương mại) và FLUX.1 [schnell] (phiên bản chắt lọc nhanh, Apache-2.0). Với 12 tỷ thông số, FLUX vượt trội về khả năng tuân thủ nhanh chóng, giải phẫu giống như bàn tay, chi tiết đẹp và hiển thị rõ ràng các từ bên trong hình ảnh, điểm yếu lâu đời của các mô hình khuếch tán trước đó. Nó cạnh tranh hoặc đánh bại Midjourney và DALL-E 3 trên nhiều so sánh. Các bản phát hành sau này đã bổ sung FLUX.1 Kontext để chỉnh sửa hình ảnh trong ngữ cảnh và FLUX1.1 [pro] để có tốc độ và chất lượng cao hơn, củng cố FLUX như một hệ sinh thái tạo hình ảnh mở hàng đầu.

Hiểu biết kỹ thuật

FLUX sử dụng máy biến dòng được chỉnh lưu thay vì mô hình khuếch tán U-Net cổ điển. Luồng đã chỉnh sửa học theo đường đi thẳng hơn từ nhiễu đến hình ảnh, cho phép chất lượng cao với ít bước lấy mẫu hơn; biến thể [schnell] được chắt lọc thêm để tạo ra chỉ trong một đến bốn bước. Kiến trúc kết hợp đường trục biến áp lớn với bộ mã hóa văn bản (bao gồm cả T5) để diễn giải lời nhắc, đây là lý do chính khiến FLUX tuân theo các hướng dẫn phức tạp và hiển thị văn bản tốt hơn nhiều so với các hệ thống khuếch tán tiềm ẩn trước đó.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của các mô hình hình ảnh FLUX

Black Forest Labs đang mở rộng FLUX từ thế hệ này sang chỉnh sửa và kiểm soát hoàn toàn, với Kontext cho phép chỉnh sửa hình ảnh lặp đi lặp lại trong khi vẫn giữ được danh tính. Mong đợi sự tích hợp chặt chẽ hơn vào các công cụ sáng tạo, các biến thể thời gian thực nhanh hơn, khả năng kiểm soát mạnh mẽ hơn thông qua hình ảnh và bố cục tham chiếu cũng như video. Là một lựa chọn trọng lượng mở hàng đầu, FLUX sẽ tiếp tục thúc đẩy một hệ sinh thái cạnh tranh gồm các tinh chỉnh, LoRA và các công cụ cộng đồng, gây áp lực lên các dịch vụ đóng như Midjourney về cả chất lượng và tính mở.

Triển khai trong thế giới thực

Tạo đồ họa tiếp thị bao gồm văn bản trên hình ảnh có thể đọc được như biểu tượng hoặc khẩu hiệu

Các nghệ sĩ chạy FLUX.1 [dev] tại địa phương và đào tạo LoRA tùy chỉnh để có phong cách nhất quán

Nghệ thuật khái niệm nhanh và bảng phân cảnh sử dụng biến thể [schnell] nhanh để lặp lại nhanh chóng

Chỉnh sửa ảnh hiện có bằng tính năng trò chuyện bằng FLUX.1 Kontext trong khi vẫn giữ được danh tính của chủ thể

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FLUX Image Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mô hình khuếch tán tiềm ẩn

Câu hỏi thường gặp

FLUX Image Models là gì?

FLUX là một nhóm mô hình chuyển văn bản thành hình ảnh mở của Black Forest Labs nổi tiếng với chi tiết sắc nét, theo dõi lời nhắc mạnh mẽ và văn bản được hiển thị chính xác đến mức đáng ngạc nhiên. Được xây dựng bởi các nhà nghiên cứu về Khuếch tán ổn định trước đây, nó nhanh chóng trở thành công cụ tạo hình ảnh có trọng lượng mở hàng đầu.

Công ty nào đã tạo ra các mô hình hình ảnh FLUX?

FLUX được tạo ra bởi Black Forest Labs, một công ty khởi nghiệp được thành lập bởi các nhà phát triển cốt lõi trước đây của Stable Diffusion.

Biến thể FLUX nào là phiên bản chưng cất nhanh, được cấp phép Apache-2.0?

FLUX.1 [schnell] ('schnell' có nghĩa là 'nhanh' trong tiếng Đức) là phiên bản được cấp phép Apache-2.0 được chắt lọc được xây dựng cho tốc độ.

FLUX sử dụng phương pháp kiến trúc nào thay vì mô hình khuếch tán U-Net cổ điển?

FLUX được xây dựng trên một máy biến dòng đã được chỉnh lưu, có khả năng tìm hiểu đường dẫn nhiễu tới hình ảnh thẳng hơn và cho phép thực hiện ít bước lấy mẫu hơn.

FLUX cải thiện đáng kể điểm yếu lâu năm nào của các mô hình khuếch tán trước đó?

FLUX được biết đến với khả năng hiển thị chính xác các từ có thể đọc được bên trong hình ảnh, điều mà các mô hình trước đó gặp khó khăn.

Bản phát hành FLUX.1 Kontext chủ yếu bổ sung những gì?

FLUX.1 Kontext cho phép chỉnh sửa hình ảnh trong ngữ cảnh, mang tính đàm thoại, có thể bảo toàn danh tính của chủ thể qua các chỉnh sửa.