뉴스로 돌아가기
제품AI Understanding 브리핑

Google 수화 AI를 Gboard 및 음성 자막 변환에 도입

Google DeepMind는 이제 자사의 SL2T 모델이 실제 오류와 한계를 문서화하는 동시에 번역을 위한 포즈 랜드마크를 사용하여 Pixel 11에서 ASL-영어 받아쓰기를 지원한다고 말합니다.

6 min readRead the primary source
기본 소스 문서녹음된 소스
출판사
Google DeepMind's SL2T announcement
소스 링크
deepmind.googlehttps://deepmind.google/blog/putting-sign-language-ai-into-users-hands/
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

주석
기계 학습 모델을 훈련하거나 평가하는 데 사용되는 사람이 추가한 레이블 또는 메타데이터입니다.
분류기
분류 작업을 위해 특별히 설계된 모델입니다.
벤치마크
모델 성능을 측정하고 비교하는 데 사용되는 표준화된 테스트 또는 데이터 세트입니다.
자신을 테스트해 보세요수화 번역 퀴즈의 AI

무슨 일이 일어났나요?

Google DeepMind는 이제 Pixel 11의 Gboard 및 Live Transcribe에서 미국 수화를 영어로 받아쓰기를 지원하는 수화-텍스트 번역 모델인 SL2T를 통해 수화 AI를 소비자 제품으로 옮기고 있다고 밝혔습니다. 회사는 출시를 첫 번째 단계로 구성합니다. 더 많은 기기가 출시되고 추가 수화가 계획되어 있지만 이번 발표에서는 Android 하드웨어 전반에 걸친 보편적인 출시에 대해 설명하지 않습니다. Gboard에서 사용자는 웹을 검색하거나 메시지나 문서를 작성할 때를 포함하여 일반적으로 입력하는 위치에 서명할 수 있습니다. Live Transcribe에서는 입력된 영어로 다시 전환하지 않고 대화 중에 응답에 서명하는 용도로 사용됩니다.

이 릴리스는 수화 번역을 실험실 시연으로만 제시하는 것이 아니라 연구 모델을 일상적인 입력 표면에 연결한다는 점에서 주목할 만합니다. Google DeepMind는 SL2T가 사람이 서명하는 동안 스트리밍 텍스트를 생성할 수 있으며 Android 통합은 추가 비용 없이 Pixel 11에서 먼저 사용할 수 있다고 말합니다. 소스에서는 ASL에서 영어로의 첫 번째 지원 방향을 설명합니다. 이 기능이 모든 수화 사이를 번역하거나, 텍스트를 다시 수화로 변환하거나, 중요한 상황에서 전문 통역사를 대체한다는 의미는 아닙니다.

Google에 따르면 SL2T는 50개 이상의 수화에 걸쳐 100,000시간 이상의 데이터를 학습했으며 해당 데이터의 약 4분의 1이 ASL로 구성되어 있습니다. 팀은 언어, 방언 ​​및 숙련도 수준에 걸친 공동 훈련을 통해 모델이 각 언어를 격리된 동작 목록으로 처리하는 대신 공유 구조를 학습하는 데 도움이 된다고 말합니다. 수화는 자체 문법과 어휘를 갖춘 독립적인 자연어이기 때문에 디자인 선택이 중요합니다. 또한 손, 팔, 몸통, 머리 및 얼굴의 동시 움직임을 통해 의미를 표현하므로 작업이 단순한 제스처 일치가 아닌 시각적 인식과 번역의 조합이 됩니다.

모델의 프라이버시 디자인도 제품 주장의 일부입니다. Google DeepMind는 온디바이스 MediaPipe Holistic 모델이 포즈 랜드마크를 추적하고 번역 서비스가 원시 카메라 피드가 아닌 기하학적 좌표를 수신한다고 말합니다. 회사에서는 원본 영상을 즉시 폐기할 수 있다고 밝혔습니다. SL2T는 먼저 서명을 중간 광택 표현으로 변환하는 대신 랜드마크 시퀀스를 텍스트로 직접 변환합니다. 이는 어휘 및 주석 제약의 단일 소스를 줄일 수 있지만 공개 발표에서는 보존, 원격 측정, 오류 처리 또는 모든 장치 수준 구현 세부 사항에 대한 독립적인 감사를 제공하지 않습니다.

보고된 성능에 대해 Google DeepMind는 SL2T가 FLEURS-ASL sd 테스트에서 70 BLEURT의 제로 샷 점수에 도달했다고 밝혔습니다. 이는 이전에 보고된 점수보다 높은 것으로 설명됩니다. 이 회사는 또한 스트리밍 지연, 비수화 입력 환각, 왼손 수화, 다른 손이 전화기를 들고 있을 때 한 손 수화 등을 연구했다고 밝혔습니다. 그 예는 희귀 기호, 빠른 손가락 철자법, 수동적 구성, 분류자 묘사 및 문맥에 따라 달라지는 시제에 남아 있는 오류를 보여줍니다. 따라서 이번 릴리스에는 강력한 벤치마크 주장과 벤치마크 품질이 신뢰할 수 있는 대화와 동일하지 않다는 명시적인 경고가 결합되어 있습니다.

소스 세부정보: Google DeepMind's SL2T announcement ↗

왜 중요한가요?

실질적인 변화는 AI가 수화 클립을 인식할 수 있는지 묻는 것에서 서명이 익숙한 전화 작업 흐름에서 사용 가능한 입력 방법이 될 수 있는지 묻는 것입니다. 청각 장애가 있는 사용자의 경우 도구의 가치는 대화 속도로 작동하는지, 언어 구조를 존중하는지, 실제 변형을 처리하는지, 공유 내용을 사람들이 제어할 수 있는지 여부에 따라 결정됩니다. Gboard 및 Live Transcribe에 나타나는 모델은 이러한 질문을 연구원뿐만 아니라 일반 사용자에게도 표시합니다.

수화 지원은 음성 받아쓰기와 접근성 부담이 다릅니다. 음성 언어 전사는 시간순으로 정렬된 사운드 스트림을 텍스트로 매핑하는 반면, 수화 시스템은 움직임, 공간, 얼굴 표정 및 문법 구조를 동시에 해석해야 합니다. 일차 자료에서는 수화는 손으로 표현되는 영어가 아니라는 점을 강조한다. 이러한 구별은 제품 디자인에 중요합니다. 시스템은 수동 표시가 아닌 표시, 공간 참조, 분류자 또는 문장의 의미를 전달하는 시제 변화가 여전히 누락되어 유창하게 나타날 수 있습니다.

랜드마크 파이프라인은 카메라 기반 접근성 기능에 대한 구체적인 개인 정보 보호 방향을 제공합니다. 신체점 좌표만 장치에서 나가는 경우 서비스는 모든 번역 요청에 대해 원본 비디오를 수신할 필요가 없습니다. 이는 특히 집, 직장 또는 공개 대화에서 서명이 이루어지는 경우 업스트림으로 전송되는 데이터의 민감도를 줄일 수 있습니다. 완전한 개인 정보 보호가 보장되는 것은 아닙니다. 포즈 좌표는 여전히 사람과 사람의 행동을 설명할 수 있으며 사용자에게는 로그, 계정 연결, 모델 개선, 보존 및 장치가 입력을 로컬에서 처리할 수 없는 경우 발생하는 상황에 대한 명확한 정보가 필요합니다.

또한 제품 예에서는 유용성이 헤드라인 정확도 수치보다 더 중요한 이유를 보여줍니다. 검색을 위해 서명하거나 메시지를 작성하거나 Gemini에게 작업을 완료하도록 요청하면 반복되는 입력 단계가 제거될 수 있습니다. Live Transcribe 내에서 응답에 서명하면 짧은 대화가 더욱 유동적으로 이루어질 수 있습니다. 그러나 이름, 부정, 숫자 또는 명령이 잘못 번역되어 사용자가 이를 전송하기 전에 알아차리지 못하는 경우 동일한 편의성으로 인해 오류 비용이 증가합니다. 따라서 올바른 표준은 스트리밍 텍스트가 자동으로 정확하다는 가정이 아니라 가시적이고 편집 가능한 출력이며 구문을 수정하거나 반복하는 빠른 방법입니다.

이 발표는 모델을 구축하고 배송하는 회사에서 나온 것이므로 벤치마크와 테스터 비교는 독립적인 검증이 아닌 소스 주장으로 읽어야 합니다. Google DeepMind는 유용한 제한을 제공하며 청각 장애인 조직 및 주제 전문가와 함께 AI 수화 자문 위원회를 만들었으며 릴리스에 대한 공동 영향 보고서를 만들었다고 말합니다. 이러한 참여 프로세스는 의미 있는 신호이지만 계획된 출시 전반에 걸쳐 서명자, 방언, 조명, 카메라 각도, 서명 속도 또는 대화 컨텍스트에 따라 성능이 어떻게 달라지는지 아직 대중에게 알려주지 않습니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
대화형 개념 확인+10 Points
AI in Sign Language Translation Quiz

Why is sign language translation harder than simply matching gestures to English words?

다음에 무엇을 볼 것인가

다음 증거는 SL2T가 발사대에서 통제된 사례 외부에서 여전히 유용한지 여부를 보여야 합니다. 실제 장치 출시, 커뮤니티 피드백, 오류 복구, 개인정보 보호 문서, 서명자와 수화에 대한 독립적인 테스트를 시청하세요. 이번 출시는 중요한 제품 단계이지만 수화 번역이 인간 통역이나 음성 언어 받아쓰기와 동등한 수준에 이르렀다는 증거는 아닙니다.

먼저 어떤 장치와 언어가 지원되는지, 언제 지원되는지 살펴보세요. Google DeepMind는 Pixel 11이 출발점이며 더 많은 장치와 언어가 뒤따를 것이라고 말하지만 발표에서 공개 시간표나 전체 호환성 목록을 제공하지 않습니다. 의미 있는 출시는 지역별 가용성, 지원되는 카메라 조건, 언어 및 방언 범위, 장치 처리 요구 사항, 하드웨어 세대 전반에 걸쳐 동일한 개인 정보 보호 동작이 유지되는지 여부를 공개해야 합니다. 이러한 세부 사항은 릴리스가 광범위하게 유용한 접근성 기능인지 아니면 하나의 전화선에 연결된 좁은 쇼케이스인지를 결정합니다.

둘째, 단지 정해진 벤치마크가 아닌 실제 의사소통을 측정하는 평가를 찾으세요. 유용한 보고는 서명자, 방언, 숙련도, 손 사용, 한 손 사용, 속도, 조명, 프레임 및 배경 동작에 따라 단어 및 의미 오류를 분류합니다. 여기에는 대기 시간, 비서명 오탐, 수정, 회전 감소 및 오류 복구에 필요한 시간이 포함되어야 합니다. FLEURS-ASL 점수는 구체적인 출발점이지만 소스 자체의 예는 왜 희귀 부호, 손가락 철자법, 분류자 및 문맥 의존 시제에 별도의 주의가 필요한지를 보여줍니다.

셋째, 이 기능이 다른 Google 제품에 연결될 때 개인 정보 보호 및 안전 경계를 관찰하세요. Gemini에 작업 실행을 검색, 초안 또는 요청할 수 있는 서명-텍스트 스트림은 특히 번역이 불확실한 경우 외부 작업 전에 명확한 확인이 필요합니다. 사용자는 캡처된 내용을 확인하고, 보내기 전에 편집하고, 관련 기록을 삭제하고, 좌표나 파생 텍스트가 유지되는지 이해할 수 있어야 합니다. 공개 릴리스에서는 획기적인 접근 방식을 설명하지만 권한, 진단, 클라우드 처리 또는 계정 수준 데이터 제어와 관련된 제품 질문을 해결하지는 않습니다.

마지막으로, 시스템이 더 많은 사람들에게 도달함에 따라 공동 영향 보고서, 독립적인 재생산 및 청각 장애인 커뮤니티의 피드백을 찾아보세요. Google DeepMind는 자문 위원회가 개발 우선순위에 영향을 미칠 것이며 주요 릴리스에 대한 접근 방식을 계속 유지할 계획이라고 밝혔습니다. 가장 강력한 후속 조치는 이러한 약속을 측정 가능하게 만들 것입니다. 즉, 언어 및 설정에 따른 제한 사항을 게시하고, 보고된 오류가 로드맵을 어떻게 변경하는지 보여주고, 사용자가 실험적인 번역 지원과 신뢰할 수 있는 통역사 대체를 구별할 수 있도록 합니다. 해당 증거가 도착할 때까지 SL2T는 의미 있고 공개적으로 언급된 불확실성을 지닌 유망한 최초의 소비자 배포로 가장 잘 이해됩니다.

관련 가이드 및 퀴즈

수화 번역의 AI일상생활 속의 AIAI 모델 설명AI 윤리알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?