Hình ảnh tự phát của Parti Pathways
Parti (Con đường chuyển văn bản thành hình ảnh tự động hồi quy) tạo ra hình ảnh theo cách các mô hình ngôn ngữ viết câu: mỗi lần một mã thông báo hình ảnh, dự đoán mã tiếp theo từ tất cả các mã thông báo trước đó.
Tổng quan
It matters because it showed that simply scaling a sequence model can produce strikingly detailed, prompt-faithful images.
Lặn sâu
Parti coi việc tạo hình ảnh là một vấn đề dịch theo trình tự, giống như dịch máy. Trình mã thông báo ViT-VQGAN trước tiên mã hóa hình ảnh thành một chuỗi mã thông báo riêng biệt được rút ra từ sách mã đã học. Bộ mã hóa Transformer đọc lời nhắc văn bản và sau đó, bộ giải mã Transformer tạo ra các mã thông báo hình ảnh một cách tự động, mỗi mã thông báo được điều chỉnh dựa trên văn bản và trên các mã thông báo đã phát ra trước đó. Sau khi tất cả các mã thông báo được tạo ra, bộ giải mã của mã thông báo sẽ tái tạo lại các pixel. Google đã chia tỷ lệ Parti từ 350 triệu lên tới 20 tỷ tham số, đồng thời chất lượng hình ảnh và căn chỉnh văn bản được cải thiện đều đặn theo kích thước. Mô hình 20B xử lý các lời nhắc dài, có bố cục, hiển thị văn bản dễ đọc và các chi tiết đẹp được tôn trọng. Parti cũng giới thiệu tiêu chuẩn PartiPrompts, một bộ hơn 1.600 lời nhắc thử thách trải dài trên nhiều danh mục và mức độ khó.
Hiểu biết kỹ thuật
Tính năng xác định là tính năng tự hồi quy thuần túy đối với các mã thông báo hình ảnh rời rạc: mô hình phân tích hình ảnh dưới dạng sản phẩm của các xác suất mã thông báo tiếp theo có điều kiện, giống hệt với việc tạo văn bản kiểu GPT. Điều này thống nhất tầm nhìn và ngôn ngữ theo một công thức đào tạo và cho phép nó kế thừa các thủ thuật mô hình hóa trình tự trong hàng thập kỷ. Chi phí là giải mã tuần tự, vì mã thông báo phải được tạo theo thứ tự, điều này làm cho việc tạo mã chậm hơn so với các phương pháp song song, nhưng nó có quy mô có thể dự đoán được và hưởng lợi trực tiếp từ các mô hình lớn hơn.
Tác động chiến lược
Tốc độ và tỷ lệ
Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.
Xây dựng lựa chọn
Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.
Nhóm và quy trình làm việc
Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.
Tương lai của hình ảnh tự hồi quy của Parti Pathways
Hình ảnh tự hồi quy đang được hồi sinh vì cùng một xương sống có thể mô hình hóa văn bản, hình ảnh, âm thanh và video dưới dạng một luồng mã thông báo, cho phép các mô hình đa phương thức thực sự thống nhất. Nghiên cứu đang giải quyết điểm yếu chính của nó, lấy mẫu tuần tự chậm, với giải mã đầu cơ, dự đoán mã thông báo song song và mã thông báo tốt hơn. Mong đợi các lõi tự hồi quy bên trong các trợ lý chung xen kẽ việc đọc, suy luận và tạo hình ảnh, đồng thời xem các quy luật chia tỷ lệ sẽ đẩy độ chính xác về bố cục và khả năng hiển thị văn bản trong hình ảnh đáng tin cậy hơn nữa.
Triển khai trong thế giới thực
Hiển thị các cảnh đa đối tượng phức tạp từ các gợi ý mô tả dài, chẳng hạn như sự sắp xếp cụ thể của động vật, đồ vật và hình nền.
Tạo hình ảnh bao gồm các từ hoặc ký hiệu được viết dễ đọc, trong đó thứ tự tự hồi quy giúp đánh vần văn bản một cách chính xác.
Đo điểm chuẩn và kiểm tra sức chịu đựng của các hệ thống chuyển văn bản thành hình ảnh bằng bộ PartiPrompts trên các danh mục như kiến thức thế giới và các khái niệm trừu tượng.
Tạo các hình minh họa chi tiết cho các lời nhắc yêu cầu đếm chính xác và mối quan hệ không gian giữa nhiều yếu tố.
Rủi ro & lan can
Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.
Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.
Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.
Lộ trình thực hiện
Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.
Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.
Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.
Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Parti Pathways Autoregressive Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Tạo hình ảnh tự động
Câu hỏi thường gặp
What is Parti Pathways Autoregressive Imaging?
Parti (Con đường chuyển văn bản thành hình ảnh tự động hồi quy) tạo ra hình ảnh theo cách các mô hình ngôn ngữ viết câu: mỗi lần một mã thông báo hình ảnh, dự đoán mã tiếp theo từ tất cả các mã thông báo trước đó. Nó quan trọng vì nó cho thấy rằng chỉ cần mở rộng quy mô mô hình chuỗi có thể tạo ra những hình ảnh trung thực, nhanh chóng và chi tiết đến kinh ngạc.
Parti tạo ra một hình ảnh như thế nào?
Parti có tính tự hồi quy: nó tạo ra các mã thông báo hình ảnh một cách tuần tự, mỗi mã thông báo được điều chỉnh dựa trên văn bản và trên các mã thông báo được tạo trước đó.
Parti sử dụng khung hình tổng thể nào cho tác vụ chuyển văn bản thành hình ảnh?
Parti coi việc tạo giống như dịch máy: bộ mã hóa đọc văn bản và bộ giải mã phát ra mã thông báo hình ảnh, một thiết lập theo trình tự cổ điển.
Việc mở rộng Parti lên tới 20 tỷ tham số đã chứng tỏ điều gì?
Khi Parti tăng thông số từ 350M lên 20B, cả độ trung thực và độ trung thực của lời nhắc đều được cải thiện, bao gồm các lời nhắc về bố cục tốt hơn và văn bản dễ đọc hơn.
Điều gì chuyển đổi hình ảnh thành các mã thông báo riêng biệt cho Parti?
Parti sử dụng ViT-VQGAN để mã hóa hình ảnh thành các chuỗi mã thông báo riêng biệt mà bộ giải mã Transformer sau đó học cách dự đoán.
Nhược điểm chính của giải mã tự hồi quy của Parti là gì?
Bởi vì mỗi mã thông báo phụ thuộc vào các mã trước đó nên việc tạo mã thông báo diễn ra tuần tự và chậm hơn so với các phương pháp song song, mặc dù quy mô của nó có thể dự đoán được.