Free AI library

Visuell AI guiderFree forever.

133 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

133Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Börja här

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

133 av 1019 guides shown. Filter by track or search above.

Visuell AI

Bildharmonisering och sammansättning

Bildharmonisering justerar automatiskt ett inklistrat förgrundsobjekt så att dess färg, ljus och ton matchar den nya bakgrunden, vilket gör att kompositer ser verkliga ut.

2 min readLäs
Visuell AI

SDXL och Cascaded Diffusion

SDXL är Stability AI:s högupplösta text-till-bild-modell som parar ihop en kraftfull basgenerator med en raffinör, medan kaskadspridningskedjor flera...

2 min readLäs
Visuell AI

GLIGEN Grounded Generation

GLIGEN (Grounded-Language-to-Image Generation) låter dig styra exakt var objekt visas i en genererad bild genom att mata in modellens begränsningsrutor...

2 min readLäs
Visuell AI

T2I-adapter för Multi-Conditional Diffusion Control

Lär dig T2I-adapter för diffusionskontroll med flera villkor: hur den styr Stabil diffusion med kanter, djup, pose och andra förhållanden med hjälp av en lätt...

2 min readLäs
Visuell AI

Null-Text Inversion

Null-text inversion är en teknik som låter dig redigera ett riktigt foto med en textdriven diffusionsmodell som Stable Diffusion samtidigt som du behåller allt du...

2 min readLäs
Visuell AI

Custom Diffusion Multi-Concept Tuning

Custom Diffusion är en lätt finjusteringsmetod som lär en text-till-bild-modell nya personliga koncept, som din hund eller en specifik stol, från bara...

2 min readLäs
Visuell AI

Latent blandning och bildinterpolation

Latent blandning blandar bilder genom att kombinera deras komprimerade representationer inuti en modells latenta utrymme istället för att beräkna genomsnittet av råpixlar.

2 min readLäs
Visuell AI

Vision-Language-Action Models for Robotics

Vision-Language-Action (VLA)-modeller är stora neurala nätverk som tar in kamerabilder plus en skriftlig instruktion och direkt matar ut robotmotorkommandon.

2 min readLäs
Visuell AI

Diffusionspolicy för robotkontroll

Diffusionspolicyn tillämpar samma nedbrytande idé bakom bildgeneratorer som Stable Diffusion på robotstyrning: istället för att förutsäga en enda nästa åtgärd...

2 min readLäs
Visuell AI

Gör-en-video text-till-video

Make-A-Video är Metas 2022-system som förvandlar en textuppmaning till ett kort videoklipp utan att behöva träna på märkta text-video-par.

2 min readLäs
Visuell AI

Bild Video Cascades

Imagen Video är Googles text-till-video-system från 2022 som bygger ett klipp genom en kaskad av sju diffusionsmodeller, som var och en lägger till fler bildrutor eller mer upplösning.

2 min readLäs
Visuell AI

CogVideo och CogVideoX

CogVideo (2022) var den första storskaliga öppna text-till-video-modellen, och CogVideoX (2024) är dess mycket mer kapabla efterträdare med öppen källkod från Tsinghua/Zhipu AI.

2 min readLäs

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.