Thế hệ nối đất GLIGEN
GLIGEN (Tạo ngôn ngữ nền tảng thành hình ảnh) cho phép bạn kiểm soát chính xác vị trí các đối tượng xuất hiện trong hình ảnh được tạo bằng cách cung cấp các hộp và nhãn giới hạn mô hình cùng với lời nhắc văn bản.
Tổng quan
It turns vague text-to-image into precise, layout-controllable synthesis.
Lặn sâu
Các mô hình chuyển văn bản thành hình ảnh tiêu chuẩn gặp khó khăn với việc kiểm soát không gian: yêu cầu 'một con mèo ở bên trái con chó' và bạn thường đặt sai vị trí. GLIGEN, được giới thiệu vào năm 2023, giải quyết vấn đề này bằng cách thêm các đầu vào nền tảng như hộp giới hạn được ghép nối với các thực thể văn bản hoặc hình ảnh, điểm chính hoặc hình ảnh tham chiếu. Điều quan trọng là nó đóng băng trọng lượng của mô hình khuếch tán được huấn luyện trước ban đầu và đưa vào các lớp tự chú ý có kiểm soát mới có thể huấn luyện được để hấp thụ các mã thông báo nối đất. Điều này có nghĩa là nó được xây dựng trên một mô hình như Khuếch tán ổn định mà không phá hủy kiến thức đã học và việc kiểm soát bắt đầu gần bằng 0 để hành vi của mô hình cơ sở được duy trì sớm trong quá trình đào tạo. Kết quả là tạo ra thế hệ nối đất trong thế giới mở: bạn có thể đặt các đối tượng được mô tả tùy ý tại các vị trí được chỉ định và nó khái quát hóa các khái niệm và bố cục không được nhìn thấy trong quá trình đào tạo nối đất.
Hiểu biết kỹ thuật
GLIGEN đại diện cho mỗi thực thể nối đất dưới dạng một mã thông báo kết hợp việc nhúng văn bản hoặc hình ảnh với thông tin không gian của nó, chẳng hạn như bốn tọa độ của hộp giới hạn được mã hóa thông qua các tính năng Fourier. Các mã thông báo nối đất này đi vào U-Net khuếch tán đông lạnh thông qua các lớp tự chú ý có cổng mới được chèn giữa các khối tự chú ý và chú ý chéo hiện có. Một cổng có thể học được, được khởi tạo bằng 0, kiểm soát mức độ ảnh hưởng của việc nối đất đến việc tạo ra, do đó, việc bổ sung khả năng kiểm soát sẽ giảm đi một cách nhẹ nhàng và quá trình đào tạo vẫn ổn định.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của thế hệ nối đất GLIGEN
Thế hệ nối đất và có thể kiểm soát bố cục đang trở thành tiêu chuẩn trong các công cụ sản xuất. Mong đợi điều hòa không gian kiểu GLIGEN sẽ hợp nhất với các phương pháp điều khiển khác như ControlNet và nhắc nhở khu vực, đồng thời mở rộng sang video và 3D, nơi vị trí đối tượng theo thời gian và không gian thậm chí còn quan trọng hơn. Khi các mô hình áp dụng giao diện tuân theo hướng dẫn, điều khiển bố cục kéo và thả và biểu đồ cảnh được chỉ định theo ngôn ngữ sẽ giúp có thể truy cập bố cục chính xác mà không cần thủ thuật kỹ thuật nhắc nhở.
Triển khai trong thế giới thực
Đặt logo hoặc sản phẩm vào một vùng chính xác của quảng cáo được tạo bằng hộp giới hạn
Soạn các cảnh phức tạp bằng cách chỉ định vị trí của từng nhân vật hoặc đối tượng trước khi kết xuất
Tạo dữ liệu huấn luyện để phát hiện đối tượng với các vị trí hộp sự thật đã biết
Đưa đối tượng được mô tả vào vùng do người dùng vẽ trên ảnh hiện có
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GLIGEN Grounded Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Thế hệ chuyển văn bản thành 3D
Câu hỏi thường gặp
What is GLIGEN Grounded Generation?
GLIGEN (Tạo ngôn ngữ nền tảng thành hình ảnh) cho phép bạn kiểm soát chính xác vị trí các đối tượng xuất hiện trong hình ảnh được tạo bằng cách cung cấp các hộp và nhãn giới hạn mô hình cùng với lời nhắc văn bản. Nó biến văn bản thành hình ảnh mơ hồ thành sự tổng hợp chính xác, có thể kiểm soát được về bố cục.
GLIGEN chủ yếu giải quyết vấn đề gì?
GLIGEN bổ sung thêm các đầu vào nối đất như hộp giới hạn để bạn có thể kiểm soát chính xác vị trí đặt đối tượng mà lời nhắc bằng văn bản thuần túy xử lý kém.
GLIGEN bảo tồn kiến thức về mô hình khuếch tán đã được huấn luyện trước như thế nào?
GLIGEN đóng băng mô hình cơ sở và đưa vào các lớp tự chú ý có kiểm soát mới, do đó kiến thức đã học ban đầu vẫn được giữ nguyên.
Đầu vào nối đất điển hình mà GLIGEN chấp nhận là gì?
GLIGEN hỗ trợ nối đất thông qua các hộp giới hạn với các thực thể văn bản/hình ảnh, điểm chính và hình ảnh tham chiếu.
Tại sao cổng trong các lớp chú ý mới của GLIGEN được khởi tạo bằng 0?
Cổng không được khởi tạo có nghĩa là việc nối đất ban đầu không có tác dụng, bảo toàn mô hình ban đầu và giữ cho quá trình huấn luyện ổn định khi mức điều khiển tăng lên.
Thế hệ căn cứ 'thế giới mở' có ý nghĩa gì trong GLIGEN?
GLIGEN khái quát hóa ngoài tập huấn luyện nối đất của nó, đặt các đối tượng được mô tả mới tại các vị trí được chỉ định.