ПОСІБНИК З ОСНОВ

Зменшення розмірності

Зменшення розмірності скорочує дані з багатьох стовпців (об’єктів) до кількох, зберігаючи важливу структуру.

2 хвилини читанняОстаннє оновлення

Огляд

It fights the 'curse of dimensionality,' speeds up models, and lets you actually visualize complex data in 2D or 3D.

Глибоке занурення

Справжні набори даних часто мають сотні чи тисячі функцій: кожен піксель зображення, кожне слово у словнику, кожен датчик на машині. У таких просторах великої розмірності точки даних стають розрідженими та віддаленими одна від одної, вимірювання відстані стають ненадійними, а моделі мають тенденцію до надмірного шуму. Це прокляття розміреності. Зменшення розмірності відображає дані в набагато меншій кількості вимірів, зберігаючи значущі зв’язки. PCA робить це лінійно, знаходячи напрямки найбільшої дисперсії. t-SNE і UMAP є нелінійними і відмінно підходять для виявлення кластерів для візуалізації. Зменшення розмірів усуває надлишкові або зашумлені функції, скорочує обсяг пам’яті та обчислень і часто покращує точність моделі, що йде за потоком, оскільки менше нерелевантного сигналу, який би заплутував її.

Технічне розуміння

PCA працює шляхом обчислення коваріації ознак і знаходження власних векторів, «головних компонентів», які вказують уздовж напрямків максимальної дисперсії. Ви зберігаєте кілька верхніх компонентів і проектуєте на них дані, відкидаючи напрямки з низькою дисперсією, які здебільшого є шумом. Натомість t-SNE та UMAP моделюють сусідські відносини: вони намагаються зберегти точки, які були близькими у високих вимірах, близькими на низьковимірній карті. UMAP будує графік найближчих точок, що робить його швидшим, ніж t-SNE, і краще зберігає ширшу глобальну структуру.

Стратегічний вплив

Чіткіші рішення

Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.

Вартість і бюджет

Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.

Команда та робочий процес

Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.

Майбутнє зменшення розмірності

Зменшення розмірності тепер є рутинним кроком у великих конвеєрах ШІ, а не окремим завданням. UMAP значною мірою став стандартним для вивчення вбудовування з великих мовних і візуальних моделей, коли інженери проектують тисячі вимірів у 2D-карту, щоб перевірити, чого навчилася модель. Очікуйте тіснішої інтеграції з інтерактивними інформаційними панелями, швидшої реалізації з прискоренням графічного процесора для наборів даних із мільярдами рядків і зростаючого використання в роботі з інтерпретацією, де дослідники зменшують внутрішні активації моделі, щоб зрозуміти та налагодити її поведінку.

Реалізація в реальному світі

Побудуйте вбудовані слова чи речення з мовної моделі в 2D за допомогою UMAP, щоб побачити, які концепції модель групує разом

Стиснення тисяч вимірювань експресії генів на пацієнта в кілька компонентів перед групуванням підтипів захворювань

Зменшення функцій зображення перед подачею їх до класифікатора, щоб навчання було швидшим і менш схильним до переобладнання

Візуалізація поведінки клієнтів за сотнями показників у вигляді двовимірної діаграми розсіювання для визначення окремих сегментів ринку

Ризики та огорожі

Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.

Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.

Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.

Дорожня карта впровадження

1

Почніть із простого визначення необхідного результату.

2

Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.

3

Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.

4

Задокументуйте, де зменшення розмірності допомагає, а де простіші методи кращі.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dimensionality Reduction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Близнюки Барлоу та скорочення надмірності

Часті запитання

What is Dimensionality Reduction?

Зменшення розмірності скорочує дані з багатьох стовпців (об’єктів) до кількох, зберігаючи важливу структуру. Він бореться з «прокляттям розмірності», прискорює моделі та дозволяє фактично візуалізувати складні дані у 2D або 3D.

Що таке «прокляття розмірності»?

У просторі з дуже великими розмірами точки розходяться далеко одна від одної, а вимірювання відстані руйнуються, тому моделям важко знайти закономірності та вони мають тенденцію до надлишку.

Як PCA вирішує, які напрямки зберегти?

PCA знаходить головні компоненти, осі найбільшої дисперсії, і зберігає верхні, оскільки вони несуть найбільше інформації.

Чому PCA називається «лінійним» методом?

Кожен головний компонент є лінійною комбінацією оригінальних функцій, тому PCA не може вловити вигнуту нелінійну структуру так, як це може зробити t-SNE або UMAP.

У чому особливо хороші t-SNE та UMAP?

Обидва є нелінійними методами, які зберігають найближчі точки поблизу на низьковимірній карті, роблячи кластери видимими у 2D або 3D.