DreamBooth
DreamBooth tinh chỉnh toàn bộ mô hình hình ảnh trên một số ít ảnh để nó 'ghi nhớ' sâu sắc một chủ đề cụ thể—khuôn mặt, thú cưng hoặc sản phẩm của bạn—và có thể đặt nó vào bất kỳ cảnh nào.
Tổng quan
It trades larger file sizes for higher fidelity than lighter personalization methods.
Lặn sâu
DreamBooth, do các nhà nghiên cứu Google xuất bản vào năm 2022, cá nhân hóa mô hình chuyển văn bản thành hình ảnh bằng cách tinh chỉnh trọng lượng của mạng trên 3-5 hình ảnh của một chủ đề. Nó liên kết chủ thể với một mã thông báo hiếm được ghép nối với một từ lớp—ví dụ: 'ảnh về con chó sks'—để mô hình hiểu rằng 'sks' có nghĩa là *con chó cụ thể* này. Thách thức cốt lõi là 'sự trôi dạt ngôn ngữ' và trang bị quá mức: luyện tập quá chăm chỉ và người mẫu quên cách vẽ những con chó khác hoặc chỉ tái tạo các tư thế huấn luyện. Cách khắc phục chính của DreamBooth là lỗi bảo tồn trước: nó cũng đào tạo dựa trên hình ảnh về những con chó chung do chính mô hình tạo ra, cố định khái niệm 'chó' rộng hơn trong khi mã thông báo hiếm tiếp thu chủ đề cụ thể. Lợi ích mang lại là tính hiện thực và tính linh hoạt nổi bật, cho phép chủ thể xuất hiện trong ánh sáng, tư thế và phong cách mới lạ.
Hiểu biết kỹ thuật
DreamBooth cập nhật trọng số của mô hình khuếch tán chứ không chỉ là phần nhúng, đó là lý do tại sao độ trung thực cao. Nó ghép một mã định danh duy nhất (một mã thông báo hiếm như 'sks') với một danh từ lớp để mô hình đính kèm các chi tiết về giao diện mới vào mã thông báo đồng thời tận dụng kiến thức về lớp hiện có. Sự mất mát bảo tồn trước đồng thời phù hợp với các hình ảnh lớp được tạo tự động, chống lại việc trang bị quá mức và 'sự trôi dạt ngôn ngữ' để mô hình tiếp tục tạo ra các thành viên đa dạng của lớp đó.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của DreamBooth
DreamBooth đặt ra tiêu chuẩn cho việc cá nhân hóa có độ trung thực cao và nó ngày càng được hợp nhất với LoRA để cắt giảm dung lượng lưu trữ và tính toán nặng nề—'DreamBooth-LoRA' hiện là mặc định trong nhiều công cụ. Mong đợi quá trình đào tạo nhanh hơn, các buổi học đa chủ đề giúp học nhiều người cùng một lúc và bảo vệ danh tính chặt chẽ hơn cho hình đại diện video và 3D. Khi các ứng dụng dành cho người tiêu dùng áp dụng nó, hãy chú ý đến các biện pháp bảo vệ xung quanh sự đồng ý và sự giống nhau, vì độ trung thực tương tự cho phép hình đại diện tùy chỉnh cũng làm tăng mối lo ngại về giả mạo sâu và mạo danh.
Triển khai trong thế giới thực
Tạo ảnh chụp chân dung chuyên nghiệp của một người trong nhiều trang phục và bối cảnh chỉ từ một vài bức ảnh selfie.
Đặt một đôi giày thể thao hoặc túi xách cụ thể vào vô số cảnh quảng cáo trong khi vẫn giữ nguyên thiết kế chính xác của nó.
Tạo linh vật minh họa nhất quán cho thương hiệu trên các áp phích, bài đăng trên mạng xã hội và bao bì.
Sản xuất các gói hình đại diện tùy chỉnh trong đó khuôn mặt của người dùng xuất hiện dưới dạng siêu anh hùng, họa sĩ hoặc phi hành gia.
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamBooth quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Nhận dạng hành động
Câu hỏi thường gặp
What is DreamBooth?
DreamBooth tinh chỉnh toàn bộ mô hình hình ảnh trên một số ít ảnh để nó 'ghi nhớ' sâu sắc một chủ đề cụ thể—khuôn mặt, thú cưng hoặc sản phẩm của bạn—và có thể đặt nó vào bất kỳ cảnh nào. Nó giao dịch kích thước tệp lớn hơn để có độ trung thực cao hơn các phương pháp cá nhân hóa nhẹ hơn.
DreamBooth sửa đổi điều gì mà Đảo ngược văn bản không sửa đổi?
DreamBooth tinh chỉnh trọng số của mạng, trong khi Textual Inversion chỉ học cách nhúng.
Mục đích của việc mất bảo quản trước của DreamBooth là gì?
Việc đào tạo về hình ảnh lớp được tạo tự động sẽ củng cố khái niệm chung để mô hình không quên cách vẽ các thành viên khác trong lớp.
Chủ đề thường được nhắc đến trong lời nhắc đào tạo của DreamBooth như thế nào?
Một mã định danh hiếm duy nhất được ghép nối với một danh từ lớp để mô hình đính kèm các chi tiết mới vào mã thông báo.
DreamBooth cần khoảng bao nhiêu hình ảnh chủ đề?
Giống như các phương pháp cá nhân hóa vài bức ảnh khác, DreamBooth hoạt động chỉ từ một vài hình ảnh.
Sự đánh đổi phổ biến khi sử dụng DreamBooth là gì?
Bởi vì nó tinh chỉnh trọng lượng, các tệp DreamBooth lớn hơn và việc đào tạo đòi hỏi khắt khe hơn so với Đảo ngược văn bản.