비주얼 AI 가이드

광학 흐름

광학 흐름은 각 픽셀이 연속 비디오 프레임 사이에서 어떻게 이동하는지 추정하여 조밀한 모션 벡터 맵을 생성합니다.

2분 읽기마지막 업데이트

개요

이것이 바로 기계가 영상에서 움직임, 속도, 방향을 인식하는 방식입니다.

심층 분석

광학 흐름은 모든 픽셀에 작은 모션 화살표를 할당하여 한 프레임에서 다음 프레임으로 이동하는 것처럼 보이는 위치를 설명합니다. 고전적인 방법은 Lucas-Kanade(희소) 및 Horn-Schunck(밀집) 알고리즘에서와 같이 매끄러움 제약 조건과 결합된 '밝기 불변성' 가정(점이 이동할 때 동일한 밝기를 유지함)을 기반으로 합니다. 이는 작고 부드러운 모션에는 잘 작동하지만 빠른 움직임, 폐색 및 텍스처가 없는 넓은 영역에서는 어려움을 겪습니다. 딥 러닝은 분야를 변화시켰습니다. FlowNet, PWC-Net, 특히 RAFT와 같은 네트워크는 프레임 전반에 걸쳐 기능을 일치시키고 흐름장을 반복적으로 개선하는 방법을 학습합니다. 출력은 단지 '프레임에 무엇이 있는가?'라는 질문이 아닌 모든 곳에서 비디오 이해를 촉진합니다. 하지만 '어떻게 움직이고 있지?'

기술적 통찰력

랜드마크 접근 방식인 RAFT는 프레임 1의 모든 픽셀이 프레임 2의 모든 픽셀과 얼마나 잘 일치하는지 점수를 매기는 4D '비용 볼륨'을 구축한 다음 반복 업데이트 연산자(GRU)를 사용하여 더 나은 일치를 향해 반복적으로 화살표를 이동하는 것과 같은 여러 작은 단계에 걸쳐 흐름 추정치를 구체화합니다. 하나의 큰 추측이 아닌 이러한 반복적인 개선은 큰 변위와 미세한 디테일에 대해서도 선명하고 정확한 흐름을 제공하며 다양한 장면에서 잘 일반화됩니다.

전략적 영향

속도와 규모

Visual AI는 대규모 검사, 감지 및 태그 지정 작업을 자동화할 수 있습니다.

빌드 선택

크리에이티브 팀은 수동 수정 횟수를 줄여 컨셉의 프로토타입을 더 빠르게 제작할 수 있습니다.

팀과 워크플로우

이전에는 처리하기 어려웠던 이미지 및 비디오 신호를 작업에 사용할 수 있습니다.

광학 흐름의 미래

광학 흐름은 에지 장치의 실시간 고해상도 추정, 깊이 및 3D 장면 흐름과의 긴밀한 통합, 값비싼 실측 레이블 없이 원본 비디오에서 학습하는 자가 감독 교육 방향으로 이동하고 있습니다. 자율 시스템과 로봇은 보다 풍부한 모션 이해를 요구하므로 흐름이 객체 추적 및 예측과 융합되어 기계가 현재 모션을 볼 뿐만 아니라 폐색 및 빠른 카메라 움직임을 통해 사물이 다음에 어디로 갈지 예측할 수 있습니다.

실제 구현

흔들리는 핸드헬드 모션을 상쇄하는 휴대폰 및 액션 카메라의 비디오 안정화

비디오를 더 부드럽게 보이거나 슬로우 모션으로 실행하기 위해 프레임 사이에 생성하는 프레임 보간

주변 자동차와 보행자의 속도와 방향을 추정하는 운전자 지원 및 자율주행 자동차

비디오를 보다 효율적으로 저장하기 위해 프레임 간 움직임을 예측하는 비디오 압축 코덱

위험 및 가드레일

출처가 불분명할 경우 이미지 권리 및 동의는 법적 위험이 될 수 있습니다.

모델 성능은 조명, 인구통계, 환경에 따라 달라질 수 있습니다.

신뢰도 임계값을 모니터링하지 않으면 거짓양성이 발견되지 않을 수 있습니다.

구현 로드맵

1

정밀도, 재현율, 오류 비용에 대한 허용 기준을 정의합니다.

2

실제 생산 조건과 일치하는 데이터로 테스트합니다.

3

신뢰도가 낮거나 영향력이 큰 예측에 대해 인적 검토를 추가합니다.

4

모델 드리프트를 추적하고 카메라 또는 데이터 세트가 변경된 후 재검증합니다.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optical Flow quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

광학 흐름이란 무엇인가요?

광학 흐름은 각 픽셀이 연속 비디오 프레임 사이에서 어떻게 이동하는지 추정하여 조밀한 모션 벡터 맵을 생성합니다. 이는 기계가 비디오에서 움직임, 속도 및 방향을 인식하는 방식입니다.

광학 흐름은 실제로 무엇을 추정합니까?

광학 흐름은 각 픽셀이 한 프레임에서 다음 프레임으로 이동하는 방식을 설명하는 모션 벡터를 생성합니다.

고전적인 광학 흐름에서 사용되는 '밝기 불변성' 가정은 무엇입니까?

고전적인 방법에서는 물리적 지점의 밝기가 이동하면서 일정하게 유지된다고 가정하여 프레임 간에 밝기를 일치시킬 수 있습니다.

비용 볼륨과 반복 업데이트를 사용하여 반복적인 흐름 개선으로 알려진 최신 딥 러닝 방법은 무엇입니까?

RAFT는 4D 비용 볼륨을 구축하고 반복 연산자를 사용하여 여러 작은 단계에 걸쳐 흐름을 개선하여 최첨단 정확도를 달성합니다.

고전적인 광학 흐름 방법이 크고 빠른 움직임을 처리하는 데 어려움을 겪는 이유는 무엇입니까?

작은 동작 가정을 기반으로 구축된 방법은 픽셀이 프레임 사이에서 멀리 이동할 때 추적을 잃어 오류가 발생합니다.

프레임 간 모션 추정에 직접적으로 의존하는 애플리케이션은 무엇입니까?

프레임 보간은 추정된 픽셀 모션을 사용하여 중간 프레임을 합성하여 더 부드럽거나 슬로우 모션 비디오를 생성합니다.