애플리케이션 가이드

입술 읽기 및 시각적 음성 인식의 AI

시각적 음성 인식은 AI를 사용하여 입술을 읽고, 때로는 오디오 없이 사람의 입, 턱, 얼굴의 움직임을 통해 음성 단어를 예측합니다.

2분 읽기마지막 업데이트

개요

It matters for noisy environments, accessibility, and combining with sound for more robust speech recognition.

심층 분석

입술에서는 많은 소리가 동일하게 보이기 때문에 입술 읽기는 인간에게도 어렵습니다. 예를 들어 /p/, /b/ 및 /m/ 소리는 시각적으로 구별할 수 없는 단일 'viseme' 그룹을 형성하므로 맥락이 필수적입니다. Google DeepMind의 LipNet 및 이후의 'Watch, Attend and Spell' 시스템과 같은 AI 모델은 입 영역 비디오 프레임의 시퀀스를 문자 또는 단어에 매핑하는 방법을 학습하며 때로는 벤치마크 데이터 세트에서 전문 인간 입술 판독기보다 성능이 뛰어납니다. 가장 강력한 시스템은 시청각 시스템입니다. 입술의 영상과 오디오 신호를 융합하여 소음으로 인해 사운드가 손상될 때 시각적 흐름이 그 공백을 채웁니다. 어두운 조명, 머리 회전, 손이나 마스크와 같은 폐쇄, 익숙하지 않은 스피커로 인해 성능이 여전히 급격히 떨어집니다.

기술적 통찰력

일반적인 모델은 입 주위의 좁은 영역을 자른 다음 3D 컨볼루셔널 프런트 엔드를 통해 프레임 시퀀스를 전달하여 짧은 모션 패턴을 캡처한 다음 더 긴 시간적 맥락을 모델링하는 변환기 또는 순환 네트워크를 따릅니다. 출력은 CTC 또는 주의 기반 시퀀스 간 방법을 사용하여 텍스트로 디코딩됩니다. 시청각 융합은 두 가지 양식을 결합하여 서로의 약점을 보완할 수 있습니다.

전략적 영향

빌드 선택

애플리케이션 수준 설계는 AI가 실제 결과를 개선하는지 여부를 결정합니다.

팀과 워크플로우

훌륭한 워크플로우 통합은 사용자가 신뢰할 수 있는 생산성 향상을 가져옵니다.

위험과 안전

범위가 적절한 사용 사례는 변경 피로도와 구현 위험을 줄여줍니다.

입술 읽기 및 시각적 음성 인식 분야의 AI의 미래

입술 읽기는 독립 실행형 도구가 아닌 대부분 오디오 시스템의 도우미로 내장되어 시끄러운 장소에서 음성 지원 및 캡션 기능을 향상할 것으로 예상됩니다. 스피커 독립적 모델, 저조도 견고성 및 개인 정보 보호를 위한 기기 내 처리에 대한 작업이 계속됩니다. 은밀한 입술 읽기는 분명한 감시 우려를 불러일으키기 때문에 거버넌스 및 동의 규범은 기술 자체만큼이나 이를 배포할 수 있는 위치를 형성할 가능성이 높습니다.

실제 구현

시끄러운 자동차나 혼잡한 방에서 오디오와 함께 화자의 입술을 읽어 음성 지원 정확도를 높입니다.

입의 움직임을 읽어 목소리를 잃은 사람들의 언어 회복을 돕습니다.

마이크가 심한 배경 소음을 포착할 때 자동 캡션 개선

무성 영상이나 소리가 잘 들리지 않는 영상에서 대화를 복구하려는 법의학 또는 보관 분석

위험 및 가드레일

손상된 프로세스를 자동화하면 기존 문제가 증폭될 수 있습니다.

팀은 필요한 인간 판단을 과도하게 자동화하고 제거할 수 있습니다.

출력을 지속적으로 평가하지 않으면 품질이 달라질 수 있습니다.

구현 로드맵

1

현재 워크플로를 매핑하고 마찰이 가장 큰 단계를 식별합니다.

2

완전 자동화 전에 휴먼 체크포인트를 정의하세요.

3

프롬프트, 에스컬레이션 경로, 품질 표준에 대해 사용자를 교육합니다.

4

작업 수준 결과를 추적하여 지속적인 가치를 확인하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI in Lip Reading and Visual Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

음성 감정 인식

자주 묻는 질문

What is AI in Lip Reading and Visual Speech Recognition?

시각적 음성 인식은 AI를 사용하여 입술을 읽고, 때로는 오디오 없이 사람의 입, 턱, 얼굴의 움직임을 통해 음성 단어를 예측합니다. 시끄러운 환경, 접근성 및 보다 강력한 음성 인식을 위한 사운드와의 결합이 중요합니다.

'비짐'이란 무엇인가요?

/p/, /b/, /m/ 같은 소리는 입 모양이 똑같기 때문에 하나의 비짐을 형성하는데, 이것이 문맥 없이 입술 읽기가 모호해지는 이유입니다.

시청각 모델이 입술 전용 또는 오디오 전용 모델보다 더 강력한 이유는 무엇입니까?

비디오와 오디오를 융합하면 각 형식이 다른 형식을 보완하므로 오디오를 망치는 큰 소음이 입술로 상쇄될 수 있습니다.

입술 읽기 모델의 3D 컨볼루션 프런트 엔드는 무엇을 포착하는 데 도움이 됩니까?

3D 컨볼루션은 여러 프레임을 함께 처리하여 단일 정적 이미지가 아닌 짧은 시간 동안 입이 움직이는 방식을 캡처합니다.

입술 읽기 정확도를 가장 저하시키는 조건은 무엇입니까?

폐색이나 조명 불량 등 입 영역을 숨기거나 왜곡하는 요소는 정확도를 크게 떨어뜨립니다.