HƯỚNG DẪN AI trực quan

Chuyển văn bản thành hình ảnh

Imagen là hệ thống chuyển văn bản thành hình ảnh của Google giúp biến mô tả bằng văn bản thành hình ảnh chân thực.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Its headline finding was that a large frozen language model, not a bigger image network, was the biggest driver of quality.

Lặn sâu

Được công bố bởi Google Nghiên cứu vào năm 2022, Imagen đã chỉ ra rằng việc hiểu sâu sắc lời nhắc cũng quan trọng như việc vẽ nó tốt. Thay vì bộ mã hóa văn bản kiểu CLIP, Imagen sử dụng bộ mã hóa văn bản được huấn luyện trước lớn (T5-XXL) được giữ cố định, sau đó đưa các phần nhúng ngôn ngữ phong phú đó vào mô hình khuếch tán. Nó tạo ra một hình ảnh nhỏ 64x64 và sử dụng hai giai đoạn khuếch tán siêu phân giải để nâng cấp lên 1024x1024. Nhóm cũng đã giới thiệu 'ngưỡng động' để giữ cho màu sắc ổn định ở hướng dẫn cao và xây dựng DrawBench, một chuẩn mực kiểm tra các lời nhắc phức tạp khi đếm, quan hệ không gian và các kết hợp hiếm. Các phiên bản sau này, Imagen 2 và Imagen 3, làm sắc nét chi tiết, hiển thị văn bản và độ trung thực nhanh chóng, đồng thời giờ đây hỗ trợ các công cụ hình ảnh của Google.

Hiểu biết kỹ thuật

Lựa chọn nổi bật của Imagen là mở rộng bộ mã hóa văn bản thay vì trình tạo hình ảnh. T5-XXL, chỉ được đào tạo về văn bản, tạo ra các phần nhúng nắm bắt ngôn ngữ có sắc thái và các nhà nghiên cứu nhận thấy rằng việc phóng to nó giúp cải thiện sự liên kết giữa hình ảnh và văn bản hơn là mở rộng mô hình khuếch tán. Quá trình tạo được xếp tầng: mô hình khuếch tán cơ sở tạo ra hình ảnh có độ phân giải thấp, sau đó các mô hình khuếch tán siêu phân giải sẽ nâng cấp dần dần hình ảnh đó, với các giá trị pixel kẹp ngưỡng động để tránh kết quả bị xóa theo hướng dẫn mạnh mẽ.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của hình ảnh chuyển văn bản thành hình ảnh

Dòng dõi của Imagen đang hướng tới việc hiển thị văn bản bên trong hình ảnh tốt hơn, theo dõi lời nhắc chặt chẽ hơn đối với các cảnh phức tạp và lấy mẫu nhanh hơn. Mong đợi sự kết hợp sâu hơn với các mô hình ngôn ngữ để hệ thống 'suy luận' về yêu cầu trước khi vẽ, cộng với hình mờ mạnh hơn như SynthID để xác định nguồn gốc. Khi tích hợp trên các sản phẩm của Google và hệ sinh thái Gemini, trọng tâm sẽ chuyển sang thế hệ đáng tin cậy, an toàn, có thể kiểm soát thay vì tính mới thô sơ.

Triển khai trong thế giới thực

Tạo hình ảnh tiếp thị chân thực từ bản tóm tắt bằng văn bản mà không cần chụp ảnh

Tạo minh họa khái niệm để kể chuyện hoặc sách thiếu nhi từ các câu mô tả

Sản xuất mô hình sản phẩm và các biến thể cảnh cho danh sách thương mại điện tử

Hình dung các ý tưởng khoa học hoặc giáo dục, giống như bản vẽ của một nghệ sĩ được mô tả bằng ngôn ngữ đơn giản

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen Text-to-Image quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Hình ảnh 2 và Khuếch tán điều chỉnh phần thưởng

Câu hỏi thường gặp

What is Imagen Text-to-Image?

Imagen là hệ thống chuyển văn bản thành hình ảnh của Google giúp biến mô tả bằng văn bản thành hình ảnh chân thực. Phát hiện tiêu đề của nó là mô hình ngôn ngữ cố định lớn chứ không phải mạng hình ảnh lớn hơn mới là động lực lớn nhất cho chất lượng.

Phát hiện có ảnh hưởng nhất của Imagen là gì?

Imagen cho thấy rằng việc mở rộng khả năng hiểu ngôn ngữ thông qua T5-XXL đã cải thiện kết quả nhiều hơn so với việc mở rộng mô hình khuếch tán.

Imagen dựa vào bộ mã hóa văn bản nào?

Imagen sử dụng bộ mã hóa T5-XXL được huấn luyện trước chỉ có văn bản lớn, được giữ cố định trong quá trình huấn luyện.

Làm thế nào để Imagen đạt được độ phân giải cao?

Nó tạo ra hình ảnh 64x64 sau đó nâng cấp thông qua các mô hình khuếch tán siêu phân giải lên 1024x1024.

'Ngưỡng động' được sử dụng để làm gì trong Imagen?

Ngưỡng động sẽ kẹp các giá trị pixel để hướng dẫn cao không tạo ra hình ảnh bị mờ.

DrawBench là gì?

DrawBench là điểm chuẩn Google được giới thiệu cùng với Imagen để kiểm tra khả năng đếm, quan hệ không gian và các lời nhắc hiếm gặp.