টেক্সচুয়াল ইনভার্সন
টেক্সচুয়াল ইনভার্সন একটি ইমেজ জেনারেটরকে একটি একেবারে নতুন ধারণা শেখায়—যেমন একটি নির্দিষ্ট বিড়াল, শিল্প শৈলী, বা পণ্য-এর জন্য একটি নতুন শব্দ শেখার মাধ্যমে, মডেলটি পরিবর্তন না করেই৷
ওভারভিউ
It lets you put your own subject into AI art using just 3-5 example photos.
গভীর ডুব
টেক্সচুয়াল ইনভার্সন, 2022 সালে গবেষকদের দ্বারা প্রবর্তিত, একটি ব্যক্তিগতকরণ সমস্যার সমাধান করে: আপনি কীভাবে স্টেবল ডিফিউশনের মতো একটি মডেলকে *আপনার* কুকুরকে আঁকতে বলবেন, যখন 'কুকুর' একা এটি ক্যাপচার করবে না? দৈত্যাকার নিউরাল নেটওয়ার্ককে পুনরায় প্রশিক্ষণ দেওয়ার পরিবর্তে, এটি সম্পূর্ণ মডেলটিকে হিমায়িত করে এবং একটি জিনিস শিখে: একটি নতুন 'ছদ্ম-শব্দ' এম্বেডিং-টেক্সট এনকোডারের শব্দভান্ডারে একটি একক ভেক্টর, প্রায়শই S* হিসাবে লেখা হয়। আপনি এটিকে ধারণার 3-5টি চিত্র প্রদান করেন এবং অপ্টিমাইজেশান সেই একটি ভেক্টরকে নাজেন যতক্ষণ না আপনি নতুন শব্দ টাইপ করার সময় মডেলটি নির্ভরযোগ্যভাবে বিষয় পুনরুত্পাদন করে। কারণ শুধুমাত্র একটি ভেক্টর (কয়েক কিলোবাইট) শেখা হয়, ফলাফলগুলি ক্ষুদ্র এবং ভাগ করা যায়। তারপর আপনি 'S* রাইডিং এ স্কেটবোর্ড, অয়েল পেইন্টিং' এর মতো প্রম্পট লিখতে পারেন এবং ধারণাটি নতুন প্রসঙ্গে উপস্থিত হয়।
প্রযুক্তিগত অন্তর্দৃষ্টি
কৌশলটি হল যে টেক্সট-টু-ইমেজ মডেলগুলি তৈরি করার আগে প্রতিটি শব্দকে এমবেডিং ভেক্টরে রূপান্তর করে। টেক্সচুয়াল ইনভার্সন সেই এম্বেডিং টেবিলে একটি নতুন ভেক্টর যোগ করে এবং আপনার উদাহরণের চিত্রগুলিতে একই ডিফিউশন ডিনোইসিং লস ব্যবহার করে শুধুমাত্র এটিকে অপ্টিমাইজ করে। গ্রেডিয়েন্টগুলি এম্বেডিংয়ে ফিরে আসে যখন সমস্ত মডেলের ওজন হিমায়িত থাকে৷ ফলাফল হল একটি কমপ্যাক্ট ভেক্টর (কয়েক কেবি) যা মডেলের বিদ্যমান শব্দভান্ডারের জায়গায় থাকে—কোনও ওজনের পরিবর্তন হয় না, তাই বেস মডেলটি তার সমস্ত পূর্ব জ্ঞান রাখে।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
পছন্দগুলি তৈরি করুন
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
টিম এবং ওয়ার্কফ্লো
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
পাঠ্য পরিবর্তনের ভবিষ্যত
টেক্সচুয়াল ইনভার্সন তার ক্ষুদ্র ফাইলের আকার এবং শেয়ারযোগ্যতার জন্য জনপ্রিয় রয়ে গেছে, এবং ওপেন সোর্স সম্প্রদায় এই হাজার হাজার এম্বেডিংয়ের ব্যবসা করে। ভবিষ্যতের দিকনির্দেশগুলি এটিকে অন্যান্য পদ্ধতির সাথে মিশ্রিত করে — সমৃদ্ধ দৃশ্যের জন্য একাধিক শেখা শব্দ স্ট্যাক করা, তীক্ষ্ণ বিশ্বস্ততার জন্য এটিকে LoRA বা DreamBooth-এর সাথে একত্রিত করা এবং ভিডিও এবং 3D জেনারেটরে ধারণাটি প্রসারিত করা। 'ধারণা লাইব্রেরি' প্রত্যাশা করুন যেখানে ব্যবহারকারীরা শেখা টোকেনগুলিকে মিশ্রিত করে এবং মেলে, এবং আরও দ্রুত, কাছাকাছি-তাত্ক্ষণিক বিপরীত যাতে ব্যক্তিগতকরণ মিনিটের চেয়ে সেকেন্ডে ঘটে।
বাস্তব-বিশ্ব বাস্তবায়ন
একজন শিল্পী তাদের সিগনেচার ইলাস্ট্রেশন শৈলীর জন্য একটি টোকেন শেখেন, তারপর একটি সামঞ্জস্যপূর্ণ পোর্টফোলিওর জন্য কয়েক ডজন নতুন দৃশ্যে তা প্রম্পট করেন।
একজন পোষা প্রাণীর মালিক তাদের কুকুরের পাঁচটি ফটো আপলোড করে যাতে এটি একটি মহাকাশচারী, একটি রেনেসাঁ পেইন্টিং বা একটি কার্টুন হিসাবে তৈরি হয়৷
একটি ছোট ই-কমার্স ব্র্যান্ড তার পণ্যের জন্য একটি শব্দ শেখে যাতে এটি ফটোশুট ছাড়াই অনেক মার্কেটিং ব্যাকগ্রাউন্ডে রেন্ডার করতে পারে।
একটি গেম স্টুডিও একটি পুনঃব্যবহারযোগ্য টোকেন হিসাবে একটি পুনরাবৃত্ত চরিত্রের চেহারা ক্যাপচার করে যাতে পুরো দল জুড়ে ধারণা শিল্প সামঞ্জস্যপূর্ণ থাকে।
ঝুঁকি এবং প্রহরী
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
বাস্তবায়ন রোডম্যাপ
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Textual Inversion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
নাল-টেক্সট ইনভার্সন
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Textual Inversion?
টেক্সচুয়াল ইনভার্সন একটি ইমেজ জেনারেটরকে একটি একেবারে নতুন ধারণা শেখায়—যেমন একটি নির্দিষ্ট বিড়াল, শিল্প শৈলী, বা পণ্য-এর জন্য একটি নতুন শব্দ শেখার মাধ্যমে, মডেলটি পরিবর্তন না করেই৷ এটি আপনাকে মাত্র 3-5টি উদাহরণ ফটো ব্যবহার করে আপনার নিজের বিষয়কে এআই শিল্পে রাখতে দেয়।
প্রশিক্ষণের সময় টেক্সচুয়াল ইনভার্সন ঠিক কী শিখে?
এটি সম্পূর্ণ মডেলটিকে হিমায়িত রেখে শুধুমাত্র একটি নতুন ছদ্ম-শব্দ এম্বেডিং ভেক্টরকে অপ্টিমাইজ করে।
টেক্সচুয়াল ইনভারশনের জন্য সাধারণত কতগুলি উদাহরণের চিত্র প্রয়োজন?
একটি ছোট মুষ্টিমেয়, সাধারণত 3-5টি ধারণার ছবি, একটি ব্যবহারযোগ্য টোকেন শেখার জন্য যথেষ্ট।
টেক্সচুয়াল ইনভার্সন ফাইল এত ছোট কেন (প্রায়শই কয়েক কিলোবাইট)?
শুধুমাত্র একটি একক এম্বেডিং ভেক্টর সংরক্ষণ করা হয়, তাই ফাইলটি ছোট এবং ভাগ করা সহজ।
টেক্সচুয়াল ইনভার্সন প্রশিক্ষণের সময় কি অপরিবর্তিত থাকে?
বেস মডেল হিমায়িত হয়; শুধুমাত্র নতুন এমবেডিং আপডেট করা হয়, তাই পূর্বের জ্ঞান সংরক্ষণ করা হয়।
টেক্সচুয়াল ইনভার্সনের পরে আপনি কীভাবে একটি শেখা ধারণা ব্যবহার করবেন?
ধারণাটি তলব করার জন্য আপনি সাধারণ পাঠ্য প্রম্পটে নতুন টোকেন (যেমন S*) অন্তর্ভুক্ত করুন।