VQ-VAE и дискретни латенти
VQ-VAE компресира изображения, аудио или видео в малка мрежа от дискретни кодове, извлечени от научена кодова книга, вместо непрекъснати числа.
Преглед
This discrete bottleneck lets powerful sequence models like Transformers treat media as 'tokens', much like words.
Дълбоко гмуркане
VQ-VAE (Vector Quantized Variational Autoencoder), въведен от van den Oord и колеги от DeepMind през 2017 г., е автоенкодер, чието латентно пространство е дискретно. Енкодерът превръща изображението в мрежа от непрекъснати вектори; след това всеки вектор се прихваща до най-близкия си запис в научена кодова книга на вграждания (векторно квантуване). Декодерът реконструира изображението от тези квантувани кодове. Тъй като латентите вече са ограничен речник от индекси, отделен модел може да научи тяхното разпределение и да генерира ново съдържание. Тази двуетапна рецепта захранва DALL-E 1, Jukebox за музика и VQGAN, което добавя перцептивна и конкурентна загуба за по-отчетливи реконструкции. VQ-VAE-2 подреди множество разделителни способности, за да създаде изображения с висока прецизност.
Техническа информация
Стъпката на квантуване (argmin търсене на най-близкия съсед) е недиференцируема, така че VQ-VAE използва директен оценител: градиентите се копират директно от входа на декодера обратно към изхода на енкодера, сякаш квантуване е идентичността. Обучението съчетава загуба на реконструкция, загуба на кодова книга, изтегляща вграждания към изходите на енкодера, и загуба на ангажираност, поддържаща енкодера ангажиран с избраните от него кодове. Често срещана повреда е колапсът на кодовата книга, при който се използват само няколко кода.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на VQ-VAE и дискретните латенти
Дискретните латенти са централни за натиска към унифицирани мултимодални модели, които токенизират изображения, аудио и видео в същия речник като текста. Подобрения като остатъчно и крайно скаларно квантуване, по-големи кодови книги и по-добро балансиране на използването намаляват колапса и повишават точността. Тъй като моделите се стремят както да разбират, така и да генерират различни модалности, стабилните токенизатори, изградени върху идеите на VQ-VAE, ще останат основополагаща съставка, все по-конкурентна и съчетаваща се с подходи за непрекъсната латентна дифузия.
Внедряване в реалния свят
DALL-E 1 използва дискретен VQ-VAE токенизатор, така че Transformer да може да генерира изображения като последователности от индекси на кодова книга.
VQGAN комбинира VQ-VAE със съпернически и перцептивни загуби, за да произведе ясни изображения с висока разделителна способност за генериране на изкуство.
Jukebox на OpenAI приложи VQ-VAE към необработено аудио, компресирайки музика в дискретни кодове за генеративно моделиране.
VQ-VAE-2 подрежда йерархични дискретни латенти, за да синтезира разнообразни, висококачествени изображения, съперничещи на GAN от своята ера.
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQ-VAE and Discrete Latents quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Латентно смесване и интерполация на изображения
Frequently asked questions
What is VQ-VAE and Discrete Latents?
VQ-VAE компресира изображения, аудио или видео в малка мрежа от дискретни кодове, извлечени от научена кодова книга, вместо непрекъснати числа. Това дискретно тясно място позволява на мощни модели на последователност като Transformers да третират медиите като „токени“, подобно на думите.
Какво прави латентното пространство на VQ-VAE различно от стандартните VAE?
VQ-VAE заменя непрекъснатите латенти с дискретни кодове, извлечени от научена кодова книга чрез векторно квантуване.
Как VQ-VAE преминава градиенти през недиференцируемата стъпка на квантуване?
Правият оценител копира входния градиент на декодера директно към изхода на енкодера, като третира квантуването като идентичност за обратното преминаване.
Какво е „свиване на кодовата книга“?
Колапсът на кодовата книга се случва, когато моделът разчита само на няколко кода, губейки по-голямата част от кодовата книга и вреди на разнообразието.
Защо дискретните латенти са полезни за генеративно моделиране с Transformers?
Дискретните индекси образуват краен речник, така че моделите на последователности като Transformers могат да научат и да изпробват тяхното разпределение точно като думи.
Какво добави VQGAN към основната рецепта за VQ-VAE?
VQGAN допълва VQ-VAE с дискриминатор и перцептивна загуба, което дава по-ясни, по-подробни реконструирани токени.