Капсулни мрежи
Капсулните мрежи са невронна архитектура, която групира неврони в „капсули“, които извеждат вектори, кодиращи както съществуването на характеристика, така и нейната поза (позиция, ориентация, мащаб).
Преглед
They aim to fix a core blindness in standard convolutional networks: losing track of spatial relationships between parts.
Дълбоко гмуркане
Предложени от Geoffrey Hinton, Sara Sabour и Nicholas Frosst през 2017 г., капсулните мрежи заменят изхода на скаларния неврон с вектор. Дължината на вектора представлява вероятността да присъства обект (като око или нос), докато неговата ориентация кодира параметрите на позата. Капсулите от по-ниско ниво предвиждат позицията на капсулите от по-високо ниво чрез матрици за трансформация и процес, наречен динамично маршрутизиране по споразумение, решава на кои прогнози да се довери. Когато множество частични капсули се споразумеят за едно и също цяло, маршрутизирането укрепва тази връзка. Оригиналният CapsNet постигна силни резултати на MNIST и беше особено устойчив на припокриващи се цифри и афинни трансформации, адресирайки „проблема на Пикасо“, при който CNN приемат объркани черти на лицето като валидно лице.
Техническа информация
Ключовият механизъм е нелинейност на „скуош“, която свива късите вектори към нула и дългите вектори към дължина едно, така че величината на вектора се чете като вероятност. Динамичното маршрутизиране след това изпълнява няколко итерации на стъпка на съгласуване с претеглено меко максимално ниво: всяка по-ниска капсула изпраща своята прогноза нагоре и коефициентите на свързване се увеличават за по-високи капсули, чийто изход се подравнява (чрез точков продукт) с тази прогноза. Това замества максималното обединяване, като запазва прецизна пространствена информация, вместо да я изхвърля.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на капсулните мрежи
Капсулните мрежи остават по-скоро изследователска посока, отколкото разгърнат стандарт, до голяма степен защото динамичното маршрутизиране е скъпо от изчислителна гледна точка и се мащабира слабо до големи изображения като ImageNet. По-късна работа изследва EM маршрутизирането (Matrix Capsules) и маршрутизирането, базирано на самовниманието, за подобряване на ефективността. С нарастването на интереса към еквивариантността, ефективността на пробите и интерпретируемите йерархии част-цяло, идеите за капсули продължават да влияят върху изследванията, включително по-късното предложение на Хинтън GLOM, дори когато Трансформърс доминират в масовата визия.
Внедряване в реалния свят
Класифицирането на ръкописни цифри в MNIST, докато реконструира входа от капсулни вектори, показвайки, че параметрите на позата са смислени.
Разделяне на две припокриващи се цифри (задачата MultiMNIST) чрез сегментиране кои пиксели на кой обект принадлежат.
Медицински образни изследвания с използване на капсули за откриване на белодробни възли или мозъчни тумори, където пространствените отношения част-цяло имат значение.
Разпознаване на обекти от нови гледни точки с по-малко примери за обучение, като се използва вградената в архитектурата еквивариантност на гледната точка.
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Capsule Networks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Магистрални мрежи и пропускащи връзки
Frequently asked questions
What is Capsule Networks?
Капсулните мрежи са невронна архитектура, която групира неврони в „капсули“, които извеждат вектори, кодиращи както съществуването на характеристика, така и нейната поза (позиция, ориентация, мащаб). Те имат за цел да поправят основната слепота в стандартните конволюционни мрежи: загуба на представа за пространствените отношения между частите.
В капсулна мрежа какво представлява ДЪЛЖИНАТА на изходния вектор на капсулата?
Дължината (величината) на вектора кодира вероятността, че обектът съществува, докато неговата ориентация кодира параметри на позата като позиция и ротация.
За какъв проблем със стандартните CNN бяха специално предназначени капсулните мрежи?
CNN с максимално обединяване отхвърлят точните пространствени връзки, така че лице с неправилно поставени черти все още може да получи висок резултат. Това е „проблемът с Пикасо“, който капсулите се опитват да поправят.
Какво е името на алгоритъма, който решава кои капсули от по-ниско ниво се свързват с кои капсули от по-високо ниво?
Динамичното маршрутизиране по споразумение итеративно укрепва връзките между капсулите, чиито прогнози са съгласни с по-високата производителност на капсулата.
Кой представи капсулната мрежа с динамично маршрутизиране през 2017 г.?
Документът от 2017 г. „Динамично маршрутизиране между капсули“ е автор на Сара Сабур, Никълъс Фрос и Джефри Хинтън.
Каква е целта на функцията „скуош“ в капсулна мрежа?
Нелинейността на скуош свива късите вектори към нула и ограничава дългите вектори близо до дължина едно, така че величината може да се чете като вероятност, докато ориентацията (позата) се запазва.