기술 가이드

캡슐 네트워크

캡슐 네트워크는 뉴런을 특징의 존재 여부와 포즈(위치, 방향, 크기)를 모두 인코딩하는 벡터를 출력하는 '캡슐'로 그룹화하는 신경 아키텍처입니다.

2분 읽기마지막 업데이트

개요

They aim to fix a core blindness in standard convolutional networks: losing track of spatial relationships between parts.

심층 분석

2017년 Geoffrey Hinton, Sara Sabour 및 Nicholas Frosst가 제안한 캡슐 네트워크는 스칼라 뉴런 출력을 벡터로 대체합니다. 벡터의 길이는 개체(예: 눈이나 코)가 존재할 확률을 나타내며, 방향은 포즈 매개변수를 인코딩합니다. 하위 수준 캡슐은 변환 행렬을 통해 상위 수준 캡슐의 위치를 ​​예측하고 동의에 따른 동적 라우팅이라는 프로세스를 통해 어떤 예측을 신뢰할지 결정합니다. 여러 부분 캡슐이 동일한 전체에 동의하면 라우팅이 해당 연결을 강화합니다. 원본 CapsNet은 MNIST에서 강력한 결과를 얻었으며 특히 겹치는 숫자와 아핀 변환에 강력하여 CNN이 뒤죽박죽된 얼굴 특징을 유효한 얼굴로 받아들이는 '피카소 문제'를 해결했습니다.

기술적 통찰력

핵심 메커니즘은 짧은 벡터를 0으로 축소하고 긴 벡터를 길이 1로 축소하는 '스쿼시' 비선형성이므로 벡터 크기는 확률로 읽혀집니다. 그런 다음 동적 라우팅은 소프트맥스 가중치 일치 단계를 몇 번 반복합니다. 각각의 하위 캡슐은 예측을 위로 보내고 출력이 해당 예측과 (내적을 통해) 일치하는 상위 캡슐의 결합 계수가 증가합니다. 이는 최대 풀링을 대체하여 정확한 공간 정보를 폐기하는 대신 보존합니다.

전략적 영향

비용 및 예산

아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.

더 명확한 결정들

기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.

품질 관리

더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.

캡슐 네트워크의 미래

캡슐 네트워크는 배포된 표준보다 더 많은 연구 방향으로 남아 있습니다. 그 이유는 동적 라우팅이 계산 비용이 많이 들고 ImageNet과 같은 대규모 이미지에 적합하지 않기 때문입니다. 이후 작업에서는 효율성을 향상시키기 위해 EM 라우팅(Matrix Capsules)과 Self-Attention 기반 라우팅을 탐색했습니다. 등분산, 표본 효율성 및 해석 가능한 부분-전체 계층 구조에 대한 관심이 커지면서 Transformers가 주류 비전을 지배하더라도 캡슐 아이디어는 Hinton의 이후 GLOM 제안을 포함한 연구에 계속 영향을 미치고 있습니다.

실제 구현

캡슐 벡터에서 입력을 재구성하는 동안 MNIST에서 손으로 쓴 숫자를 분류하여 포즈 매개변수를 표시하는 것은 의미가 있습니다.

어떤 픽셀이 어떤 엔터티에 속하는지 분할하여 두 개의 겹치는 숫자를 분리합니다(MultiMNIST 작업).

부분-전체 공간 관계가 중요한 폐결절이나 뇌종양을 감지하기 위해 캡슐을 사용하는 의료 영상 연구입니다.

아키텍처에 내장된 관점 등분산을 활용하여 더 적은 수의 훈련 예제를 사용하여 새로운 관점에서 객체를 인식합니다.

위험 및 가드레일

하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.

인프라 및 유지 관리 비용은 종종 과소평가됩니다.

시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.

구현 로드맵

1

구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.

2

현실적인 로드 및 데이터 조건에서 벤치마킹합니다.

3

오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.

4

확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Capsule Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

고속도로 네트워크 및 스킵 연결

자주 묻는 질문

What is Capsule Networks?

캡슐 네트워크는 뉴런을 특징의 존재 여부와 포즈(위치, 방향, 크기)를 모두 인코딩하는 벡터를 출력하는 '캡슐'로 그룹화하는 신경 아키텍처입니다. 그들은 표준 컨벌루션 네트워크의 핵심 맹목성, 즉 부분 간의 공간적 관계를 추적하지 못하는 문제를 해결하는 것을 목표로 합니다.

캡슐 네트워크에서 캡슐 출력 벡터의 LENGTH는 무엇을 나타냅니까?

벡터의 길이(크기)는 엔터티가 존재할 확률을 인코딩하고, 방향은 위치 및 회전과 같은 포즈 매개변수를 인코딩합니다.

표준 CNN의 어떤 문제를 해결하기 위해 특별히 설계된 캡슐 네트워크가 있었나요?

최대 풀링을 사용하는 CNN은 정확한 공간 관계를 무시하므로 특징이 잘못 배치된 얼굴도 여전히 높은 점수를 받을 수 있습니다. 이것이 바로 '피카소 문제' 캡슐이 고치려고 하는 것입니다.

어떤 하위 수준 캡슐이 어떤 상위 수준 캡슐에 연결되는지 결정하는 알고리즘의 이름은 무엇입니까?

동의에 따른 동적 라우팅은 예측이 더 높은 캡슐의 출력과 일치하는 캡슐 간의 연결을 반복적으로 강화합니다.

2017년에 누가 동적 라우팅 기능을 갖춘 캡슐 네트워크를 도입했습니까?

2017년 논문 'Dynamic Routing Between Capsules'는 Sara Sabour, Nicholas Frosst 및 Geoffrey Hinton이 저술했습니다.

캡슐 네트워크에서 '스쿼시' 기능의 목적은 무엇입니까?

스쿼시 비선형성은 짧은 벡터를 0으로 축소하고 긴 벡터를 길이 1 근처로 제한하므로 방향(자세)이 유지되는 동안 크기를 확률로 읽을 수 있습니다.