ভিজ্যুয়াল এআই গাইড

ফ্রেচেট ইনসেপশন দূরত্ব

ফ্রেচেট ইনসেপশন ডিসট্যান্স (এফআইডি) হল তৈরি করা ছবির সেট কতটা বাস্তবসম্মত এবং বৈচিত্র্যপূর্ণ তা বিচার করার জন্য আদর্শ মেট্রিক।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It compares the statistics of real and generated images in a deep feature space — lower scores mean the fakes look closer to the real thing.

গভীর ডুব

FID, Heusel et al দ্বারা প্রবর্তিত। 2017 সালে, আগের ইনসেপশন স্কোরের একটি মূল ত্রুটি সংশোধন করেছে: এটি প্রকৃত বাস্তব ডেটার সাথে জেনারেট করা চিত্রগুলির তুলনা করে না। FID একটি পূর্বপ্রশিক্ষিত ইনসেপশন-ভি3 নেটওয়ার্কের মাধ্যমে বাস্তব এবং উত্পন্ন উভয় ছবিই ফিড করে এবং প্রতিটি ছবির জন্য একটি গভীর পুলিং স্তর থেকে একটি 2048-মাত্রিক বৈশিষ্ট্য ভেক্টর পড়ে। এটি তারপর বৈশিষ্ট্যগুলির প্রতিটি সেটকে একটি মাল্টিভেরিয়েট গাউসিয়ান হিসাবে মডেল করে, একটি গড় ভেক্টর এবং কোভেরিয়েন্স ম্যাট্রিক্স দ্বারা তাদের সংক্ষিপ্ত করে। দুই গাউসিয়ানদের মধ্যে দূরত্বকে ফ্রেচেট দূরত্ব (এটিকে 2-ওয়াসারস্টেইন দূরত্বও বলা হয়) দিয়ে গণনা করা হয়। কম এফআইডি মানে জেনারেট করা ডিস্ট্রিবিউশনের গড় এবং স্প্রেড বাস্তব চিত্রের সাথে ঘনিষ্ঠভাবে মেলে, বিশ্বস্ততা (এগুলি কি বাস্তব দেখায়?) এবং বৈচিত্র্য (এগুলি কি বাস্তব তথ্যের বিভিন্নতা কভার করে?) উভয়কেই ক্যাপচার করে।

প্রযুক্তিগত অন্তর্দৃষ্টি

FID সূত্র হল দুটি গড় ভেক্টরের বর্গীয় পার্থক্য এবং এর ট্রেস (কোভেরিয়েন্সের যোগফল তাদের গুণফলের ম্যাট্রিক্স বর্গমূলের দ্বিগুণ বিয়োগ)। যেহেতু এটি সম্পূর্ণ কোভ্যারিয়েন্স ব্যবহার করে, FID অস্পষ্ট, অবাস্তব আউটপুট এবং মোড ভেঙে যাওয়া উভয়কেই শাস্তি দেয় যেখানে একটি মডেল খুব কম বৈচিত্র্য তৈরি করে। এটি নমুনার আকারের প্রতি সংবেদনশীল — খুব কম ছবি অনুমানকে ঊর্ধ্বমুখী করে — তাই অনুশীলনকারীরা সাধারণত এটিকে কয়েক হাজার চিত্রের উপর গণনা করে, প্রায়শই 50,000।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।

পছন্দগুলি তৈরি করুন

সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।

টিম এবং ওয়ার্কফ্লো

অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।

ফ্রেচেট ইনসেপশন ডিসটেন্সের ভবিষ্যত

FID ক্ষেত্রের ডিফল্ট রয়ে গেছে, কিন্তু এর দুর্বলতাগুলি বিকল্পগুলিকে চালনা করছে৷ গবেষকরা দেখিয়েছেন যে এটি Inception-v3 থেকে ইমেজনেট পক্ষপাতের উত্তরাধিকারসূত্রে রয়েছে এবং মানুষের রায়ের সাথে একমত হতে পারে না, CLIP বৈশিষ্ট্যের উপর FID গণনা করা (কখনও কখনও FDD বা CMMD বলা হয়), ছোট নমুনার জন্য কার্নেল ইনসেপশন ডিসট্যান্স (KID), এবং নির্ভুলতা/রিকল মেট্রিক্স যা বিশ্বস্ততা থেকে ভিন্নতাকে পৃথক করে। আরও সমৃদ্ধ, বৈশিষ্ট্য-ব্যাকবোন-অজ্ঞেয়বাদী এবং অনুধাবনযোগ্যভাবে সারিবদ্ধ মূল্যায়নের প্রত্যাশা করুন, বিশেষ করে পাঠ্য থেকে চিত্র এবং ভিডিও প্রজন্মের একক-সংখ্যার সারাংশকে ছাড়িয়ে যায়।

বাস্তব-বিশ্ব বাস্তবায়ন

বেঞ্চমার্কিং GAN যেমন StyleGAN, যেখানে দলগুলি FFHQ-এর মতো ডেটাসেটে FID রিপোর্ট করে মুখ-প্রজন্মের গুণমানের তুলনা করতে।

ছবির গুণমান কখন উন্নতি করা বন্ধ করে তা দেখতে চেকপয়েন্টে FID কম্পিউট করে একটি ডিফিউশন মডেলের প্রশিক্ষণের অগ্রগতি ট্র্যাক করা।

COCO ডেটাসেটে প্রতিযোগী টেক্সট-টু-ইমেজ মডেলের তুলনা করা, যেখানে কম FID আরও বাস্তবসম্মত আউটপুটের প্রমাণ হিসেবে উল্লেখ করা হয়েছে।

একটি জেনারেটরে মোডের পতন শনাক্ত করা, যেহেতু মডেলটি খুব কম চিত্র বৈচিত্র্য তৈরি করে তখন FID-এর কোভেরিয়েন্স শব্দটি বেড়ে যায়।

ঝুঁকি এবং প্রহরী

প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।

মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।

আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।

2

প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।

3

কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।

4

মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fréchet Inception Distance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

স্বাক্ষরিত দূরত্ব ফাংশন

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Fréchet Inception Distance?

ফ্রেচেট ইনসেপশন ডিসট্যান্স (এফআইডি) হল তৈরি করা ছবির সেট কতটা বাস্তবসম্মত এবং বৈচিত্র্যপূর্ণ তা বিচার করার জন্য আদর্শ মেট্রিক। এটি একটি গভীর বৈশিষ্ট্যযুক্ত স্থানে বাস্তব এবং উত্পন্ন চিত্রগুলির পরিসংখ্যানের তুলনা করে — কম স্কোর মানে নকলগুলি আসল জিনিসের কাছাকাছি দেখায়৷

কম FID স্কোর কি নির্দেশ করে?

FID বাস্তব এবং উত্পাদিত বৈশিষ্ট্য বিতরণের মধ্যে দূরত্ব পরিমাপ করে, তাই কম মানের মানে হল যে তৈরি করা সেটটি বিশ্বস্ততা এবং বৈচিত্র্যের সাথে বাস্তব ডেটার সাথে আরও ঘনিষ্ঠভাবে মেলে।

কোন পূর্বপ্রশিক্ষিত নেটওয়ার্ক স্ট্যান্ডার্ড এফআইডি চিত্র বৈশিষ্ট্যগুলি বের করতে ব্যবহার করে?

এফআইডি একটি পূর্বপ্রশিক্ষিত ইনসেপশন-ভি3 নেটওয়ার্কের মাধ্যমে ছবিগুলিকে পাস করে এবং বাস্তব এবং জেনারেট করা ছবি উভয়ের জন্যই এর 2048-মাত্রিক পুলিং-লেয়ার বৈশিষ্ট্যগুলি ব্যবহার করে৷

এফআইডি কীভাবে চিত্র বৈশিষ্ট্যগুলির প্রতিটি সেটকে তুলনা করার আগে সংক্ষিপ্ত করে?

প্রতিটি বৈশিষ্ট্য সেট একটি মাল্টিভেরিয়েট গাউসিয়ান হিসাবে মডেল করা হয়েছে, এবং FID দুই গাউসিয়ানদের মধ্যে ফ্রেচেট (2-ওয়াসারস্টেইন) দূরত্ব গণনা করে।

ইনসেপশন স্কোরের কী কী ঘাটতি FID সম্বোধন করেছে?

ইনসেপশন স্কোর শুধুমাত্র বিচ্ছিন্নভাবে জেনারেট করা ছবিকে মূল্যায়ন করে; সরাসরি উত্পন্ন এবং বাস্তব চিত্র বিতরণের তুলনা করে FID এর উন্নতি করেছে।

একটি জেনারেটর মোড পতনের শিকার হলে কেন FID বৃদ্ধি পায়?

এফআইডি বৈশিষ্ট্যগুলির সম্পূর্ণ সমন্বিততা ব্যবহার করে, তাই যখন একটি মডেল খুব কম বৈচিত্র্য তৈরি করে তখন এটির স্প্রেড বাস্তব ডেটা থেকে বিচ্ছিন্ন হয়, স্কোরকে ঠেলে দেয়।