Mô hình khuếch tán
Các mô hình khuếch tán tạo ra hình ảnh bằng cách học cách đảo ngược quá trình nhiễu, từng bước biến tĩnh ngẫu nhiên thành hình ảnh chi tiết.
Tổng quan
They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.
Lặn sâu
Một mô hình khuếch tán được đào tạo theo hai hướng. Trong quá trình chuyển tiếp, một hình ảnh sạch sẽ dần dần bị hỏng bằng cách thêm một lượng nhỏ nhiễu ngẫu nhiên cho đến khi nó trở thành tĩnh thuần túy. Sau đó, mô hình sẽ học điều ngược lại: bắt đầu từ nhiễu, nó dự đoán và loại bỏ một chút nhiễu ở mỗi bước, lặp lại hàng chục hoặc hàng trăm lần cho đến khi xuất hiện hình ảnh sắc nét. Để làm cho điều này có thể điều khiển được, một lời nhắc văn bản sẽ hướng dẫn từng bước khử nhiễu, do đó, "một phi hành gia cưỡi ngựa" sẽ điều khiển tĩnh về phía hình ảnh đó. Các hệ thống hiện đại như Stable Diffusion chạy quá trình này trong không gian tiềm ẩn được nén thay vì trên các pixel thô, khiến quá trình này nhanh hơn rất nhiều. So với GAN, các mô hình khuếch tán huấn luyện ổn định hơn và tạo ra sự đa dạng hơn, đó là lý do tại sao chúng vượt qua GAN để trở thành phương pháp thống trị để tạo hình ảnh chất lượng cao vào khoảng năm 2022.
Hiểu biết kỹ thuật
Bí quyết quan trọng là mạng không bao giờ phải tạo hình ảnh trong một lần chụp; nó chỉ học cách dự đoán tiếng ồn được thêm vào ở một bước nhất định. Trong quá trình huấn luyện, một lượng nhiễu đã biết sẽ được thêm vào hình ảnh thực và mô hình được yêu cầu ước tính lượng nhiễu đó; sự khác biệt là lỗi đào tạo. Tại thời điểm tạo, mô hình liên tục loại bỏ nhiễu dự đoán, dần dần tiết lộ cấu trúc. Điều hòa văn bản được đưa vào thông qua chú ý chéo và hướng dẫn không có bộ phân loại sẽ khuếch đại mức độ mạnh mẽ của lời nhắc điều khiển đầu ra.
Tác động chiến lược
Quyết định rõ ràng hơn
Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.
Chi phí và ngân sách
Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.
Nhóm và quy trình làm việc
Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.
Tương lai của các mô hình khuếch tán
Khuếch tán là công nghệ hiện đại dành cho hình ảnh cũng như thế hệ video và âm thanh ngày càng phát triển, với các công cụ như Sora mở rộng nó sang chuyển động. Ưu điểm lớn nhất chính là tốc độ: các kỹ thuật như mô hình chưng cất và nhất quán nhằm mục đích cắt giảm hàng trăm bước khử nhiễu xuống còn một số ít hoặc thậm chí một bước, cho phép tạo ra theo thời gian thực. Mong đợi sự phổ biến sẽ mở rộng sang nội dung 3D, thiết kế khoa học như phân tử và protein cũng như khả năng chỉnh sửa có thể kiểm soát chặt chẽ, đồng thời trở nên đủ rẻ để chạy trên điện thoại.
Triển khai trong thế giới thực
Tạo tác phẩm nghệ thuật và hình ảnh gốc từ lời nhắc văn bản trong Stable Diffusion, DALL-E và Midjourney
Inpainting và outpainting, điền hoặc mở rộng các phần của bức ảnh một cách liền mạch
Tạo video từ văn bản trong các công cụ như OpenAI của Sora
Thiết kế các phân tử và cấu trúc protein mới cho nghiên cứu khám phá thuốc
Rủi ro & lan can
Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.
Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.
Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.
Lộ trình thực hiện
Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.
Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.
Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.
Tài liệu nơi Mô hình khuếch tán hữu ích và nơi các phương pháp đơn giản hơn sẽ tốt hơn.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mô hình khuếch tán GLIDE
Câu hỏi thường gặp
What is Diffusion Models?
Các mô hình khuếch tán tạo ra hình ảnh bằng cách học cách đảo ngược quá trình nhiễu, từng bước biến tĩnh ngẫu nhiên thành hình ảnh chi tiết. Chúng hỗ trợ các công cụ chuyển văn bản thành hình ảnh hàng đầu hiện nay như Stable Diffusion, DALL-E và Midjourney.
Ý tưởng cốt lõi đằng sau cách mô hình khuếch tán tạo ra hình ảnh là gì?
Mô hình khuếch tán học cách đảo ngược quá trình nhiễu, bắt đầu từ nhiễu thuần túy và khử nhiễu từng bước cho đến khi xuất hiện hình ảnh rõ nét.
Trong quá trình đào tạo, mô hình thực sự học được gì để dự đoán ở mỗi bước?
Mô hình được cung cấp một hình ảnh nhiễu và học cách ước tính nhiễu đã được thêm vào để sau này có thể loại bỏ nhiễu trong quá trình tạo.
Lời nhắc văn bản ảnh hưởng đến hình ảnh được tạo ra như thế nào?
Điều chỉnh văn bản (thông qua chú ý chéo và hướng dẫn) thúc đẩy từng bước khử nhiễu để hình ảnh nổi lên khớp với lời nhắc.
Tại sao Khuếch tán ổn định lại chạy quy trình trong 'không gian tiềm ẩn'?
Hoạt động trong không gian tiềm ẩn được nén thay vì pixel có độ phân giải đầy đủ giúp giảm đáng kể khả năng tính toán trong khi vẫn đảm bảo chất lượng.
Một lợi thế chính của mô hình khuếch tán so với GAN là gì?
Các mô hình khuếch tán tránh được trò chơi đối nghịch không ổn định và sự sụp đổ chế độ của GAN, mang lại kết quả đào tạo đáng tin cậy hơn và đầu ra đa dạng hơn.