Bezpłatna biblioteka AI

Wizualna sztuczna inteligencja przewodnikiZa darmo na zawsze.

133 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

133Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

133 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Wizualna sztuczna inteligencja

Optyczne rozpoznawanie znaków

Optyczne rozpoznawanie znaków (OCR) przekształca obrazy tekstu — zeskanowane dokumenty, zdjęcia znaków, pliki PDF — w tekst nadający się do odczytu maszynowego i edytowalny.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Przepływ optyczny

Przepływ optyczny szacuje, w jaki sposób każdy piksel przemieszcza się pomiędzy kolejnymi klatkami wideo, tworząc gęstą mapę wektorów ruchu.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Szacowanie głębokości jednoocznej

Jednooczna szacowana głębia przewiduje, jak daleko każdy piksel znajduje się od pojedynczego zwykłego zdjęcia — nie jest wymagana kamera stereo, lidar ani czujnik głębokości.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Modele dyfuzji utajonej

Modele dyfuzji utajonej generują obrazy, uruchamiając proces dyfuzji w skompresowanej przestrzeni utajonej zamiast w surowych pikselach, co pozwala obniżyć koszty obliczeń.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Sieć kontrolna

ControlNet to dodatek, który zapewnia precyzyjną kontrolę strukturalną modeli generujących obrazy, umożliwiając sterowanie wynikami za pomocą krawędzi, pozycji, map głębi lub bazgrołów.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Wskazówki bez klasyfikatorów

Naprowadzanie bez klasyfikatorów to technika, która sprawia, że modele dyfuzji faktycznie podążają za wskazówkami, zamieniając pewną różnorodność na znacznie większą przyczepność.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Wizualny SLAM

Visual SLAM pozwala poruszającej się kamerze stworzyć mapę nieznanej przestrzeni, jednocześnie śledząc własną pozycję na tej mapie.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Sora i zamiana tekstu na wideo

Sora to model zamiany tekstu na wideo firmy OpenAI, który zamienia pisemną zachętę w krótki klip wideo o wysokiej rozdzielczości.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Modele dyfuzji wideo

Modele dyfuzji wideo generują ruchome obrazy poprzez stopniowe przekształcanie losowego szumu w spójne klatki, rozszerzając ideę dyfuzji z obrazów na czas.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Generowanie tekstu na 3D

Generowanie tekstu na 3D zamienia pisemny monit, taki jak „skórzany fotel w stylu vintage”, w pełny model 3D, który można obracać, oświetlać i upuszczać do gry lub sceny.

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Różniczkowe renderowanie

Różniczkowe renderowanie sprawia, że ​​proces przekształcania sceny 3D w obraz 2D jest w pełni różnicowalny, dzięki czemu można obliczyć gradienty na podstawie wyrenderowanych pikseli…

2 min. przeczytajPrzeczytaj
Wizualna sztuczna inteligencja

Architektura U-Net

U-Net to splotowa sieć neuronowa w kształcie litery „U”, która doskonale nadaje się do tworzenia wyników precyzyjnych co do piksela, pierwotnie przeznaczonych do segmentacji obrazu biomedycznego.

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.