HƯỚNG DẪN AI trực quan

DALL-E

DALL-E là nhóm mô hình chuyển văn bản thành hình ảnh của OpenAI biến mô tả bằng văn bản thành ảnh gốc.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.

Lặn sâu

DALL-E ra mắt vào tháng 1 năm 2021, tạo ra hình ảnh từ văn bản bằng cách dự đoán từng mã thông báo hình ảnh một lần, giống như mô hình ngôn ngữ cho pixel. DALL-E 2 (2022) đã chuyển sang phương pháp khuếch tán được hướng dẫn bởi phần nhúng CLIP, tạo ra kết quả sắc nét hơn, chân thực hơn. DALL-E 3 (tháng 10 năm 2023) đã thắt chặt tính năng theo dõi lời nhắc và được tích hợp vào ChatGPT, do đó, chatbot có thể viết lại yêu cầu sơ bộ của bạn thành lời nhắc rất chi tiết trước khi tạo. Một cải tiến nổi bật là hiển thị văn bản có thể đọc được bên trong hình ảnh, như bảng hiệu và nhãn, mà các mẫu trước đó đã bị cắt xén. DALL-E cũng hỗ trợ inpainting (chỉnh sửa một phần của hình ảnh) và outpainting (mở rộng nó ra ngoài đường viền ban đầu của nó). Nó tạo ra nhiều biến thể từ một lời nhắc duy nhất, giúp người dùng khám phá các tùy chọn sáng tạo một cách nhanh chóng.

Hiểu biết kỹ thuật

DALL-E 3 là một mô hình khuếch tán: nó bắt đầu từ tiếng ồn ngẫu nhiên và loại bỏ nó từng bước, được điều khiển theo từng bước bằng cách mã hóa lời nhắc văn bản của bạn, cho đến khi xuất hiện hình ảnh mạch lạc. Nó đào tạo về các cặp chú thích hình ảnh khổng lồ, tìm hiểu cách các từ liên kết với các đặc điểm hình ảnh, cách sắp xếp không gian và phong cách. Một thủ thuật quan trọng là chú thích được cải thiện trong quá trình đào tạo cộng với mô hình ngôn ngữ giúp mở rộng lời nhắc ngắn gọn của bạn thành lời nhắc chi tiết, đó là lý do tại sao DALL-E 3 tuân theo hướng dẫn một cách trung thực hơn nhiều so với các phiên bản tiền nhiệm.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của DALL-E

Dòng DALL-E đang tập hợp thành các hệ thống đa phương thức, rộng hơn, trong đó một mô hình xử lý văn bản, hình ảnh và chỉnh sửa cùng nhau thay vì như một công cụ riêng biệt. Mong đợi việc chỉnh sửa hội thoại chặt chẽ hơn ("làm cho bầu trời có màu cam, giữ nguyên mọi thứ khác"), hiển thị văn bản tốt hơn và độ phân giải cao hơn. Các tín hiệu chứng minh như siêu dữ liệu C2PA và hình mờ sẽ trở thành tiêu chuẩn để gắn cờ các hình ảnh do AI tạo ra. Sự cạnh tranh từ các mô hình của Midjourney, Khuếch tán ổn định và Google đang thúc đẩy chất lượng tăng nhanh chóng, trong khi các cuộc tranh luận về dữ liệu đào tạo, sự đồng ý của nghệ sĩ và bản quyền sẽ tiếp tục định hình những gì các hệ thống này được phép học hỏi.

Triển khai trong thế giới thực

Một blogger tạo hình minh họa tiêu đề tùy chỉnh cho bài viết thay vì tìm kiếm thư viện ảnh lưu trữ

Giáo viên tạo các sơ đồ đơn giản có chú thích để giải thích khái niệm khoa học cho học sinh nhỏ tuổi

Một doanh nghiệp nhỏ mô phỏng một số ý tưởng về logo và bao bì trước khi thuê một nhà thiết kế để tinh chỉnh một ý tưởng

Một nhà thiết kế trò chơi nhanh chóng tạo ra ý tưởng nghệ thuật cho các nhân vật và môi trường để đưa ra ý tưởng

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DALL-E quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Trường bức xạ thần kinh

Câu hỏi thường gặp

What is DALL-E?

DALL-E là nhóm mô hình chuyển văn bản thành hình ảnh của OpenAI biến mô tả bằng văn bản thành ảnh gốc. Nó biến việc "gõ một câu, lấy hình ảnh" trở thành một ý tưởng chủ đạo và đẩy việc tạo hình ảnh từ các bản demo nghiên cứu thành các công cụ hàng ngày.

DALL-E 3 chủ yếu làm gì?

DALL-E là một hệ thống chuyển văn bản thành hình ảnh: bạn mô tả một cảnh bằng từ ngữ và nó tạo ra một hình ảnh mới khớp với mô tả đó.

DALL-E 3 sử dụng kỹ thuật cơ bản nào để tạo hình ảnh?

DALL-E 3 là mô hình khuếch tán bắt đầu từ nhiễu ngẫu nhiên và tinh chỉnh từng bước, theo lời nhắc của bạn, thành một hình ảnh mạch lạc.

Tại sao DALL-E 3 làm theo lời nhắc tốt hơn khi sử dụng bên trong ChatGPT?

Trong ChatGPT, mô hình ngôn ngữ viết lại yêu cầu ngắn gọn thành lời nhắc phong phú hơn, cụ thể hơn, cải thiện mức độ trung thực của hình ảnh với những gì bạn mong muốn.

Điểm cải tiến đáng chú ý của DALL-E 3 so với các phiên bản trước đó là gì?

Các mẫu trước đó bị cắt xén văn bản trong hình ảnh, nhưng DALL-E 3 có thể hiển thị các từ dễ đọc trên bảng hiệu, nhãn và áp phích một cách đáng tin cậy hơn nhiều.

'Inpainting' cho phép bạn làm gì với hình ảnh DALL-E?

Inpainting chỉnh sửa một phần đã chọn của hình ảnh (ví dụ: hoán đổi một đối tượng) trong khi vẫn giữ nguyên khu vực xung quanh.