HƯỚNG DẪN AI trực quan

Khoảng cách khởi đầu của Fréchet

Khoảng cách bắt đầu của Fréchet (FID) là số liệu tiêu chuẩn để đánh giá mức độ thực tế và đa dạng của một tập hợp hình ảnh được tạo ra.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Nó so sánh số liệu thống kê của hình ảnh thật và hình ảnh được tạo ra trong một không gian đặc trưng sâu – điểm số thấp hơn có nghĩa là hàng giả trông gần giống với vật thật hơn.

Lặn sâu

FID, được giới thiệu bởi Heusel et al. vào năm 2017, đã sửa một lỗ hổng quan trọng trong Điểm khởi đầu trước đó: nó không bao giờ so sánh hình ảnh được tạo với dữ liệu thực tế. FID cung cấp cả hình ảnh thực và hình ảnh được tạo thông qua mạng Inception-v3 đã được huấn luyện trước và đọc vectơ đặc trưng 2048 chiều từ lớp gộp sâu cho mỗi hình ảnh. Sau đó, nó mô hình hóa từng bộ đặc trưng dưới dạng Gaussian đa biến, tóm tắt chúng bằng vectơ trung bình và ma trận hiệp phương sai. Khoảng cách giữa hai Gaussian được tính bằng khoảng cách Fréchet (còn gọi là khoảng cách 2-Wasserstein). FID thấp hơn có nghĩa là giá trị trung bình và độ lan truyền của phân phối được tạo ra rất khớp với hình ảnh thực, nắm bắt được cả độ trung thực (chúng trông có thật không?) và tính đa dạng (chúng có bao gồm nhiều loại dữ liệu thực không?).

Hiểu biết kỹ thuật

Công thức FID là hiệu bình phương của hai vectơ trung bình cộng dấu vết của (tổng hiệp phương sai trừ hai lần căn bậc hai ma trận của tích của chúng). Bởi vì nó sử dụng hiệp phương sai đầy đủ, FID sẽ xử phạt cả đầu ra mờ, không thực tế và sự sụp đổ chế độ trong đó mô hình tạo ra quá ít sự đa dạng. Nó nhạy cảm với kích thước mẫu - quá ít hình ảnh sẽ làm sai lệch ước tính lên trên - vì vậy những người thực hành thường tính toán nó trên hàng chục nghìn hình ảnh, thường là 50.000.

Tác động chiến lược

Tốc độ và tỷ lệ

Visual AI có thể tự động hóa các nhiệm vụ kiểm tra, phát hiện và gắn thẻ trên quy mô lớn.

Xây dựng lựa chọn

Các nhóm sáng tạo có thể tạo nguyên mẫu nhanh hơn với ít sửa đổi thủ công hơn.

Nhóm và quy trình làm việc

Các hoạt động có thể sử dụng tín hiệu hình ảnh và video mà trước đây khó xử lý.

Tương lai của Fréchet Inception Khoảng cách

FID vẫn là mặc định của trường, nhưng điểm yếu của nó là thúc đẩy các lựa chọn thay thế. Các nhà nghiên cứu đã chỉ ra rằng nó kế thừa các thành kiến ​​ImageNet từ Inception-v3 và có thể không đồng ý với phán đoán của con người, dẫn đến các số liệu như FID được tính toán trên các tính năng CLIP (đôi khi được gọi là FDD hoặc CMMD), Khoảng cách khởi động hạt nhân (KID) cho các mẫu nhỏ và các số liệu về độ chính xác/thu hồi giúp tách biệt độ trung thực khỏi tính đa dạng. Mong đợi sự đánh giá phong phú hơn, không dựa trên tính năng cốt lõi và phù hợp về mặt nhận thức, đặc biệt là khi việc tạo văn bản thành hình ảnh và video phát triển nhanh hơn các bản tóm tắt bằng một số.

Triển khai trong thế giới thực

Đo điểm chuẩn các GAN như StyleGAN, nơi các nhóm báo cáo FID trên các bộ dữ liệu như FFHQ để so sánh chất lượng tạo khuôn mặt.

Theo dõi tiến trình huấn luyện của mô hình khuếch tán bằng cách tính toán FID tại các điểm kiểm tra để xem khi nào chất lượng hình ảnh ngừng cải thiện.

So sánh các mô hình chuyển văn bản thành hình ảnh cạnh tranh trên tập dữ liệu COCO, trong đó FID thấp hơn được coi là bằng chứng về kết quả đầu ra thực tế hơn.

Phát hiện sự sụp đổ chế độ trong một trình tạo, do thuật ngữ hiệp phương sai của FID tăng lên khi mô hình tạo ra quá ít sự đa dạng của hình ảnh.

Rủi ro & lan can

Quyền và sự đồng ý về hình ảnh có thể trở thành rủi ro pháp lý nếu nguồn gốc xuất xứ không rõ ràng.

Hiệu suất của mô hình có thể khác nhau tùy theo ánh sáng, nhân khẩu học và môi trường.

Kết quả dương tính giả có thể không được chú ý trừ khi ngưỡng tin cậy được theo dõi.

Lộ trình thực hiện

1

Xác định tiêu chí chấp nhận về độ chính xác, thu hồi và chi phí lỗi.

2

Kiểm tra với dữ liệu phù hợp với điều kiện sản xuất thực tế.

3

Thêm đánh giá của con người đối với những dự đoán có độ tin cậy thấp hoặc tác động cao.

4

Theo dõi sự trôi dạt của mô hình và xác nhận lại sau khi thay đổi máy ảnh hoặc tập dữ liệu.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fréchet Inception Distance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Hàm khoảng cách đã ký

Câu hỏi thường gặp

Khoảng cách khởi đầu của Fréchet là gì?

Khoảng cách bắt đầu của Fréchet (FID) là số liệu tiêu chuẩn để đánh giá mức độ thực tế và đa dạng của một tập hợp hình ảnh được tạo ra. Nó so sánh số liệu thống kê của hình ảnh thật và hình ảnh được tạo ra trong một không gian đặc trưng sâu – điểm số thấp hơn có nghĩa là hàng giả trông gần giống với vật thật hơn.

Điểm FID thấp hơn cho biết điều gì?

FID đo khoảng cách giữa phân phối đối tượng thực và được tạo, do đó giá trị thấp hơn có nghĩa là tập hợp được tạo khớp chặt chẽ hơn với dữ liệu thực về độ chính xác và đa dạng.

FID tiêu chuẩn sử dụng mạng được huấn luyện trước nào để trích xuất các đặc điểm hình ảnh?

FID truyền hình ảnh qua mạng Inception-v3 đã được huấn luyện trước và sử dụng các tính năng lớp tổng hợp 2048 chiều của nó cho cả hình ảnh thực và hình ảnh được tạo.

FID tóm tắt từng bộ đặc điểm hình ảnh như thế nào trước khi so sánh chúng?

Mỗi bộ tính năng được mô hình hóa dưới dạng Gaussian đa biến và FID tính toán khoảng cách Fréchet (2-Wasserstein) giữa hai Gaussian.

FID đã giải quyết nhược điểm chính nào của Điểm khởi đầu?

Điểm khởi đầu chỉ đánh giá các hình ảnh được tạo một cách riêng biệt; FID đã cải thiện nó bằng cách so sánh trực tiếp các phân phối hình ảnh được tạo và thực.

Tại sao FID tăng khi máy phát điện bị sập chế độ?

FID sử dụng hiệp phương sai đầy đủ của các tính năng, do đó, khi một mô hình tạo ra quá ít sự đa dạng, mức độ lan truyền của nó sẽ khác với dữ liệu thực, đẩy điểm số lên cao.