Tiếp theoHướng dẫn tiếp theo
Tính nhất quán về thời gian và độ nhấp nháy trong video AI
AI trực quan
HƯỚNG DẪN AI trực quan
Tính nhất quán của nhân vật có nghĩa là giữ cho khuôn mặt, cơ thể, tóc, quần áo và phong cách của cùng một nhân vật có thể nhận biết được trên nhiều hình ảnh và cảnh do AI tạo ra.
Chỉ riêng lời nhắc bằng văn bản thì không thể thực hiện điều này một cách đáng tin cậy, vì vậy người sáng tạo sử dụng hình ảnh tham chiếu, LoRA ký tự và bộ mã hóa danh tính. Điều quan trọng đối với truyện tranh, kịch bản phân cảnh, sách tranh và linh vật của thương hiệu là nơi người đọc phải nhận ra một nhân vật từ khung hình này sang khung hình khác.
Chỉ riêng lời nhắc đã thất bại vì mọi thế hệ đều bắt đầu từ tiếng ồn ngẫu nhiên mới và mô tả như "một người phụ nữ với mái tóc ngắn màu đỏ và áo khoác màu xanh lá cây" phù hợp với hàng triệu khuôn mặt khác nhau. Ngay cả với một hạt giống cố định, việc thay đổi dấu nhắc sẽ thay đổi đường dẫn khử nhiễu, do đó bề mặt cũng thay đổi. Các học viên sử dụng ba nhóm kỹ thuật chính. Điều hòa hình ảnh tham chiếu chuyển một hoặc nhiều hình ảnh của ký tự thông qua bộ mã hóa hình ảnh và đưa các đặc điểm thu được vào dọc theo văn bản. IP-Adapter (Tencent, 2023) là một ví dụ mở được sử dụng rộng rãi và Midjourney đã thêm tham số tham chiếu ký tự vào năm 2024. Nó không cần đào tạo và nắm bắt tốt cái nhìn tổng thể. Tuy nhiên, các chi tiết nhỏ như hình xăm, đồ trang sức và hoa văn in có xu hướng bị trôi và trọng lượng tham chiếu cao cũng có thể sao chép tư thế và ánh sáng của tham chiếu. LoRA ký tự và phương pháp DreamBooth liên quan sẽ tinh chỉnh mô hình trên một tập hợp hình ảnh của ký tự (thường là 10 đến 30 hoặc nhiều hơn) và gắn kết quả với mã thông báo kích hoạt hiếm. Đây thường là lựa chọn trung thực nhất cho các thiết kế phức tạp, bao gồm cả trang phục và các nhân vật không phải con người. Chi phí là thời gian đào tạo và hai chế độ thất bại. Một LoRA mặc vừa vặn lặp lại các tư thế, biểu cảm hoặc hình nền từ tập huấn luyện của nó. Một người không đủ sức khỏe sẽ mất đi bản sắc. Việc sử dụng hai LoRA ký tự trong một hình ảnh thường làm trộn lẫn các đặc điểm của chúng. Các bộ mã hóa nhận dạng như InstantID, PhotoMaker và IP-Adapter FaceID trích xuất các phần nhúng kiểu nhận dạng khuôn mặt từ một ảnh duy nhất. Họ bảo tồn bản sắc khuôn mặt một cách mạnh mẽ, nhưng chỉ có khuôn mặt: tóc, quần áo và hình dáng cơ thể không bị khóa. Họ cũng gặp khó khăn với các nhân vật hoạt hình hoặc cách điệu, bởi vì công nghệ nhận dạng khuôn mặt đằng sau họ đã được đào tạo trên ảnh thật. Các mô hình hình ảnh đa phương thức mới hơn có thể lấy hình ảnh làm bối cảnh và thực hiện theo các hướng dẫn chỉnh sửa như "cùng một nhân vật, hiện đang ngồi". Một quan niệm sai lầm phổ biến là bất kỳ phương pháp nào cũng giải quyết được tính nhất quán. Trong thực tế, các cảnh có một số nhân vật vẫn có các thuộc tính bị rò rỉ giữa chúng và hầu hết các quy trình làm việc chuyên nghiệp đều kết hợp các phương pháp rồi sửa lỗi trôi dạt còn lại bằng tay.
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Các mô hình hình ảnh chấp nhận hình ảnh tham chiếu trong ngữ cảnh và làm theo hướng dẫn chỉnh sửa đang được cải thiện nhanh chóng, giúp giảm nhu cầu đào tạo LoRA tùy chỉnh cho các dự án đơn giản. Giữ ổn định một số nhân vật riêng biệt trong một cảnh, nắm giữ các chi tiết trang phục chính xác và duy trì sự nhất quán giữa các phong cách nghệ thuật rất khác nhau vẫn là những vấn đề còn bỏ ngỏ. Khi thế hệ video trưởng thành, thách thức tương tự sẽ kéo dài theo thời gian, trong đó danh tính phải giữ từng khung hình. Quyền đồng ý và quyền giống nhau sẽ quan trọng hơn vì bộ mã hóa danh tính giúp dễ dàng sử dụng lại khuôn mặt của người thật từ một bức ảnh.
Một họa sĩ minh họa sách tranh huấn luyện nhân vật LoRA dựa trên khoảng 20 bức vẽ về một anh hùng cáo đã được phê duyệt, sau đó đặt từ kích hoạt của nó vào mỗi dấu nhắc trang để các dấu hiệu của con cáo và chiếc khăn màu xanh lá cây vẫn giữ nguyên.
Một nghệ sĩ kịch bản phân cảnh đưa một ảnh chụp cận cảnh vào bộ mã hóa nhận dạng chẳng hạn như InstantID để đưa cùng một khuôn mặt vào 12 ảnh với các góc máy và ánh sáng khác nhau.
Nhóm tiếp thị sử dụng tính năng hình ảnh tham chiếu để giữ hình dáng của linh vật trong khi thay đổi hình nền theo mùa, sau đó sửa biểu tượng nổi trên áo của linh vật bằng cách sơn vào.
Một tác giả truyện tranh tạo một bảng nhân vật với các mặt trước, mặt bên và mặt sau, sau đó đưa nó cho người chỉnh sửa hình ảnh để làm theo hướng dẫn và yêu cầu tạo các tư thế mới trong cùng một bộ trang phục.
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Tính nhất quán của nhân vật có nghĩa là giữ cho khuôn mặt, cơ thể, tóc, quần áo và phong cách của cùng một nhân vật có thể nhận biết được trên nhiều hình ảnh và cảnh do AI tạo ra. Chỉ riêng lời nhắc bằng văn bản thì không thể thực hiện điều này một cách đáng tin cậy, vì vậy người sáng tạo sử dụng hình ảnh tham chiếu, LoRA ký tự và bộ mã hóa danh tính. Điều quan trọng đối với truyện tranh, kịch bản phân cảnh, sách tranh và linh vật của thương hiệu là nơi người đọc phải nhận ra một nhân vật từ khung hình này sang khung hình khác.
Hạt giống khắc phục tiếng ồn ban đầu nhưng lời nhắc sẽ điều khiển từng bước khử nhiễu. Thay đổi lời nhắc và đường dẫn thay đổi, khuôn mặt cũng vậy.
LoRA nhân vật tinh chỉnh các bản cập nhật có trọng lượng xếp hạng thấp trên 10 đến 30 hình ảnh trở lên của nhân vật và liên kết chúng với một mã thông báo kích hoạt hiếm.
Bộ mã hóa nhận dạng trích xuất các đặc điểm khuôn mặt từ một bức ảnh. Không có gì bên ngoài khuôn mặt bị khóa nên trang phục và tóc có thể bị trôi.
Bộ chuyển đổi IP thêm các phép chiếu giá trị và khóa hình ảnh riêng biệt. Đầu ra chú ý của họ được thu nhỏ và thêm vào đầu ra chú ý chéo của văn bản.
Một LoRA trang bị quá mức đã ghi nhớ các tính năng ngẫu nhiên trong tập huấn luyện của nó, chẳng hạn như tư thế và bối cảnh, cũng như nhân vật.
Tiếp tục học hỏi
Đã chọn thêm hướng dẫn cho chủ đề này
Tiếp theoHướng dẫn tiếp theo
Tính nhất quán về thời gian và độ nhấp nháy trong video AI
AI trực quan