HƯỚNG DẪN AI trực quan

SDXL và khuếch tán tầng

SDXL là mô hình chuyển văn bản thành hình ảnh có độ phân giải cao của AI ổn định, kết hợp bộ tạo cơ sở mạnh mẽ với bộ lọc, trong khi khuếch tán xếp tầng tạo chuỗi nhiều mô hình để xây dựng hình ảnh từ độ phân giải thấp đến cao.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Together they explain how modern open-source image generators hit photorealistic quality.

Lặn sâu

SDXL (Stable Diffusion XL) là mô hình khuếch tán khoảng 3,5 tỷ tham số, tạo ra hình ảnh 1024x1024 nguyên bản, một bước nhảy vọt so với Khuếch tán ổn định ban đầu 512x512. Nó sử dụng hai bộ mã hóa văn bản (OpenCLIP ViT-bigG và CLIP ViT-L) để hiểu nhanh hơn, cùng với kích thước và điều chỉnh cắt xén để mô hình biết độ phân giải mục tiêu và khung hình. SDXL được cung cấp dưới dạng quy trình gồm hai giai đoạn: mô hình cơ sở tạo ra hình ảnh tiềm ẩn, sau đó mô hình tinh chỉnh tùy chọn sẽ bổ sung thêm chi tiết đẹp trong các bước khử nhiễu cuối cùng. Khuếch tán theo tầng là ý tưởng rộng hơn đằng sau điều này: thay vì một mô hình làm mọi thứ, bạn xâu chuỗi một mô hình nhỏ tạo ra hình ảnh có độ phân giải thấp với các mô hình khuếch tán siêu phân giải nâng cấp nó, mỗi mô hình được đào tạo cho giai đoạn của nó. Imagen của Google đã phổ biến phương pháp phân tầng.

Hiểu biết kỹ thuật

Cả hai đều hoạt động trong một khuôn khổ khử nhiễu: bắt đầu từ tiếng ồn ngẫu nhiên và lặp đi lặp lại dự đoán và loại bỏ nó, được hướng dẫn bởi văn bản. SDXL hoạt động trong không gian tiềm ẩn được nén thông qua VAE, do đó việc khử nhiễu sẽ rẻ hơn so với làm việc trên các pixel thô. Bộ tinh chỉnh là một mô hình chuyên gia riêng biệt chỉ xử lý các bước cuối cùng, có độ ồn thấp. Trong một tầng thực sự, một mô hình cơ sở tạo ra một hình ảnh nhỏ, sau đó các mô hình khuếch tán siêu phân giải có điều kiện sẽ lấy mẫu lại, mỗi mô hình được điều chỉnh dựa trên đầu ra có độ phân giải thấp hơn, thường sử dụng khả năng tăng cường điều hòa nhiễu để duy trì hoạt động mạnh mẽ.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của SDXL và khuếch tán tầng

Xu hướng hướng tới ít bước hơn, nhanh hơn và kiến ​​trúc thống nhất. Các phương pháp chưng cất như SDXL Turbo và Mô hình nhất quán tiềm ẩn đã cắt giảm việc sản xuất xuống còn một đến bốn bước. Các máy biến áp khuếch tán (như trong Stable Diffusion 3 và FLUX) phần lớn đang thay thế đường trục U-Net và việc tạo ra độ phân giải cao từ đầu đến cuối đang giảm sự phụ thuộc vào các tầng rõ ràng. Mong đợi sự tích hợp tinh chỉnh chặt chẽ hơn, hiển thị văn bản tốt hơn và tổng hợp hình ảnh trên thiết bị theo thời gian thực khi hiệu quả không ngừng được cải thiện.

Triển khai trong thế giới thực

Tạo nghệ thuật khái niệm và tiếp thị 1024x1024 trực tiếp từ lời nhắc văn bản mà không cần công cụ nâng cấp riêng biệt

Sử dụng đường dẫn công cụ tinh chỉnh cơ sở SDXL để thêm chi tiết sắc nét vào bề mặt và kết cấu trong mô hình sản phẩm

Chạy SDXL Turbo để xem trước hình ảnh gần như ngay lập tức trong các công cụ thiết kế tương tác

Xây dựng tầng siêu phân giải tùy chỉnh để biến các bản phác thảo có độ phân giải thấp thành hình minh họa có độ phân giải cao

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SDXL and Cascaded Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Điều chỉnh đa khái niệm khuếch tán tùy chỉnh

Câu hỏi thường gặp

What is SDXL and Cascaded Diffusion?

SDXL là mô hình chuyển văn bản thành hình ảnh có độ phân giải cao của AI ổn định, kết hợp bộ tạo cơ sở mạnh mẽ với bộ lọc, trong khi khuếch tán xếp tầng tạo chuỗi nhiều mô hình để xây dựng hình ảnh từ độ phân giải thấp đến cao. Họ cùng nhau giải thích cách các trình tạo hình ảnh nguồn mở hiện đại đạt được chất lượng quang học.

SDXL tạo ra hình ảnh ở độ phân giải gốc nào so với Khuếch tán ổn định ban đầu?

SDXL thực sự tạo ra hình ảnh 1024x1024, diện tích lớn hơn bốn lần so với 512x512 của Stable Diffusion ban đầu.

Vai trò của mô hình máy lọc dầu của SDXL là gì?

Bộ tinh chỉnh là một mô hình chuyên gia riêng biệt được áp dụng ở cuối quy trình để làm sắc nét chi tiết sau khi mô hình cơ sở tạo ra hình ảnh tiềm ẩn.

SDXL sử dụng bao nhiêu bộ mã hóa văn bản?

SDXL sử dụng hai bộ mã hóa văn bản, OpenCLIP ViT-bigG và CLIP ViT-L, được kết hợp để mang lại khả năng hiểu nhanh hơn.

Ý tưởng cốt lõi của khuếch tán theo tầng là gì?

Khuếch tán theo tầng kết nối một bộ tạo cơ sở nhỏ với một hoặc nhiều mô hình khuếch tán siêu phân giải, mỗi mô hình được điều chỉnh dựa trên đầu ra có độ phân giải thấp hơn trước đó.

Tại sao SDXL khử nhiễu trong không gian tiềm ẩn thay vì trực tiếp trên pixel?

VAE nén hình ảnh vào một không gian tiềm ẩn nhỏ hơn, do đó quá trình khuếch tán rẻ hơn nhiều so với hoạt động trên các pixel thô có độ phân giải đầy đủ.