HƯỚNG DẪN AI trực quan

Máy biến áp khuếch tán

Máy biến áp khuếch tán (DiTs) hoán đổi U-Net tích chập ở trung tâm của bộ tạo hình ảnh và video để lấy đường trục Transformer.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.

Lặn sâu

Các mô hình khuếch tán tạo ra hình ảnh bằng cách bắt đầu từ nhiễu thuần túy và khử nhiễu lặp đi lặp lại thành một hình ảnh mạch lạc. Trong nhiều năm, mạng thực hiện việc khử nhiễu đó là U-Net, một kiến ​​trúc tích chập. Máy biến áp khuếch tán, được Peebles và Xie giới thiệu vào năm 2022, thay thế U-Net bằng Máy biến áp. Đầu tiên, hình ảnh được nén vào một không gian tiềm ẩn, chia thành các mảng nhỏ và mỗi mảng trở thành một mã thông báo, giống như các từ trong mô hình ngôn ngữ. Sau đó, Transformer sẽ tự động xử lý các mã thông báo này ở mỗi bước khử nhiễu. Một phát hiện quan trọng là hiệu suất DiT cải thiện có thể dự đoán được khi bạn tăng kích thước mô hình và giảm kích thước bản vá, tuân theo các quy luật chia tỷ lệ rõ ràng. Khả năng mở rộng này là lý do tại sao các hệ thống chuyển văn bản thành video và chuyển văn bản thành hình ảnh cao cấp phần lớn đã chuyển sang xương sống của Transformer.

Hiểu biết kỹ thuật

Điểm đổi mới cốt lõi là cách DiT đưa điều kiện vào như dấu thời gian và lời nhắc văn bản. Thay vì ghép nối đơn giản, họ sử dụng chuẩn hóa lớp thích ứng (adaLN), trong đó mạng dự đoán các tham số tỷ lệ và dịch chuyển cho các lớp chuẩn hóa từ tín hiệu điều hòa. Biến thể adaLN-zero khởi tạo các khối này để mỗi khối bắt đầu như một hàm nhận dạng, ổn định quá trình đào tạo. Các bản vá được làm phẳng thành các token, được xử lý bởi các khối Transformer tiêu chuẩn với sự tự chú ý, sau đó được tập hợp lại và giải mã trở lại thành pixel.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của máy biến áp khuếch tán

Máy biến áp khuếch tán đang trở thành xương sống mặc định cho phương tiện tổng hợp. Thiết kế dựa trên mã thông báo của chúng khiến chúng trở nên tự nhiên trong việc thống nhất hình ảnh, video và thậm chí tạo ra đa phương thức theo một kiến ​​trúc có thể mở rộng. Nghiên cứu đang hướng tới video dài hơn, độ phân giải cao hơn và sự chú ý hiệu quả hơn để giảm chi phí bậc hai của nhiều token. Mong đợi sự hội tụ giữa các mô hình ngôn ngữ và tầm nhìn, trong đó các công thức và cơ sở hạ tầng mở rộng quy mô Transformer tương tự phục vụ cả hai, thúc đẩy tiến bộ trong các mô hình thế giới và video tương tác.

Triển khai trong thế giới thực

OpenAI của Sora sử dụng xương sống Transformer trên các bản vá không thời gian để tạo video dài một phút, có độ trung thực cao từ lời nhắc bằng văn bản.

Stable Diffusion 3 sử dụng Biến áp khuếch tán đa phương thức (MMDiT) để căn chỉnh tốt hơn các hình ảnh được tạo ra với các mô tả văn bản chi tiết.

Các nhà nghiên cứu chia tỷ lệ DiT thành hàng tỷ thông số và quan sát sự cải thiện chất lượng hình ảnh có thể dự đoán được, từ đó hướng dẫn các quyết định về ngân sách điện toán.

Một studio sử dụng mô hình dựa trên DiT để mở rộng các đoạn clip ngắn, xử lý các khung hình video bổ sung dưới dạng mã thông báo vá bổ sung để khử nhiễu.

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mạng biến áp không gian

Câu hỏi thường gặp

What is Diffusion Transformers?

Máy biến áp khuếch tán (DiTs) hoán đổi U-Net tích chập ở trung tâm của bộ tạo hình ảnh và video để lấy đường trục Transformer. Kiến trúc này hỗ trợ các hệ thống hàng đầu như Stable Diffusion 3 và Sora của OpenAI, đồng thời nó có quy mô rất tốt khi bạn thêm điện toán.

Máy biến áp khuếch tán thay thế thành phần nào so với các mẫu máy khuếch tán truyền thống?

DiT thay thế U-Net, mạng tích chập thực hiện khử nhiễu, bằng đường trục Transformer.

DiT biến hình ảnh thành thứ gì đó mà Transformer có thể xử lý bằng cách nào?

Hình ảnh tiềm ẩn được chia thành các mảng nhỏ và mỗi mảng trở thành một mã thông báo, tương tự như các từ trong mô hình ngôn ngữ.

Bài báo DiT ban đầu đã tìm thấy gì về việc chia tỷ lệ?

Chất lượng DiT cải thiện một cách rõ ràng, có thể dự đoán được khi bạn tăng cường tính toán mô hình và sử dụng các bản vá nhỏ hơn, tuân theo quy luật chia tỷ lệ.

DiT thường đưa điều hòa như dấu thời gian và lời nhắc văn bản vào như thế nào?

DiT sử dụng chuẩn hóa lớp thích ứng để dự đoán các tham số tỷ lệ và dịch chuyển cho các lớp chuẩn hóa từ tín hiệu điều hòa.

Việc khởi tạo 'adaLN-zero' thực hiện điều gì?

adaLN-zero khởi tạo quá trình điều chế để mỗi khối ban đầu đóng vai trò nhận dạng, giúp ổn định và cải thiện quá trình đào tạo.