언어 AI 가이드

인코더-디코더 아키텍처

인코더-디코더 아키텍처는 모델을 두 부분으로 나눕니다. 하나는 입력을 읽고 풍부한 내부 표현으로 압축하는 부분이고 다른 하나는 그로부터 출력을 생성하는 부분입니다.

2분 읽기마지막 업데이트

개요

This design powers translation, summarization, and any task where the input and output are different sequences.

심층 분석

인코더-디코더 모델은 두 단계로 문제를 처리합니다. 인코더는 전체 입력 시퀀스(예: 영어 문장)를 읽고 의미를 포착하는 일련의 상황별 벡터로 변환합니다. 그런 다음 디코더는 한 번에 하나의 토큰씩 출력 시퀀스(예: 프랑스어)를 생성하고 이전 출력과 인코더의 표현을 다시 살펴봅니다. 원래 2017 Transformer는 번역용으로 제작된 인코더-디코더였습니다. T5 및 BART와 같은 모델은 이 모양을 사용하여 모든 작업을 텍스트 입력, 텍스트 출력으로 구성합니다. 인코더는 전체 입력을 한 번에 볼 수 있고(양방향 컨텍스트) 디코더는 왼쪽에서 오른쪽으로 생성하므로 분할은 강력합니다. 이는 출력 길이와 내용이 입력과 다른 시퀀스 간 문제에 자연스럽게 적합한 디자인을 만듭니다.

기술적 통찰력

인코더는 양방향 self-attention을 사용하므로 모든 입력 토큰이 다른 모든 토큰을 동시에 처리합니다. 디코더는 자동회귀적이며 Masked Self-Attention을 사용합니다. 즉, 각 위치는 인과관계 생성을 보존하기 위해 이전 위치만 볼 수 있음을 의미합니다. 이를 연결하는 것은 교차 주의입니다. 디코더 레이어는 인코더의 최종 숨겨진 상태를 쿼리합니다. 이러한 분리를 통해 디코더는 한 번에 하나의 토큰에 커밋하는 동안 인코더는 완전하고 순서 독립적인 이해를 구축할 수 있습니다.

전략적 영향

속도와 규모

일관성을 유지하면서 언어 워크플로를 더 빠르게 진행할 수 있습니다.

접근 및 도달

언어와 의사소통 스타일 전반에 걸쳐 접근성을 확장합니다.

더 명확한 결정들

자동화가 반복을 처리하는 동안 팀은 판단에 더 많은 시간을 할애할 수 있습니다.

인코더-디코더 아키텍처의 미래

단일 스택이 간단하게 확장되고 메시지를 통해 많은 작업을 처리하기 때문에 GPT와 같은 디코더 전용 모델은 이제 범용 채팅을 지배합니다. 그러나 인코더-디코더 설계는 음성 인식(속삭임), 문서 요약, 비전 인코더와 텍스트 디코더를 결합하는 다중 모드 시스템 등 입력 이해와 출력 생성이 완전히 구분되는 곳에서 지속됩니다. 특히 모델이 텍스트, 오디오 및 이미지를 융합할 때 디코더 유연성을 유지하면서 검색 및 접지를 위해 인코더의 양방향 이해력을 빌려오는 하이브리드 아키텍처를 기대하십시오.

실제 구현

Google Translate 및 DeepL은 인코더-디코더 변환기를 사용하여 한 언어의 문장을 다른 언어로 매핑합니다.

OpenAI의 Whisper는 오디오 스펙트로그램을 인코딩하고 이를 전사 또는 번역된 텍스트로 디코딩합니다.

T5 및 BART는 긴 기사를 짧은 요약으로 압축하여 추상적인 요약을 제공합니다.

이미지 캡션 시스템은 비전 인코더와 텍스트 디코더를 결합하여 사진을 단어로 설명합니다.

위험 및 가드레일

환각 사실은 보고서, 지원 흐름 또는 연구 결과에 조용히 포함될 수 있습니다.

신속한 민감도는 유사한 요청 간에 일관되지 않은 결과를 초래할 수 있습니다.

액세스 제어가 약한 경우 민감한 텍스트 데이터가 노출될 수 있습니다.

구현 로드맵

1

출시 전에 출력 형식, 톤, 품질 표준을 정의하세요.

2

정확성이 중요할 때마다 신뢰할 수 있는 출처를 통해 대응하세요.

3

고위험 결과물에 대한 인적 검토 체크포인트를 유지합니다.

4

실패 패턴을 추적하고 프롬프트나 워크플로를 정기적으로 재교육하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Encoder-Decoder Architectures quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

크로스 인코더와 바이 인코더

자주 묻는 질문

What is Encoder-Decoder Architectures?

인코더-디코더 아키텍처는 모델을 두 부분으로 나눕니다. 하나는 입력을 읽고 풍부한 내부 표현으로 압축하는 부분이고 다른 하나는 그로부터 출력을 생성하는 부분입니다. 이 설계는 번역, 요약 및 입력과 출력이 서로 다른 시퀀스인 모든 작업을 지원합니다.

인코더-디코더 모델에서 인코더의 주요 역할은 무엇입니까?

인코더는 전체 입력 시퀀스를 소비하고 해당 의미를 캡처하는 상황별 벡터를 생성한 다음 디코더에서 사용합니다.

디코더가 마스크된(인과적) self-attention을 사용하는 이유는 무엇입니까?

마스킹은 왼쪽에서 오른쪽으로의 자동 회귀 생성 순서를 유지하면서 각 출력 위치가 이전 위치에만 주의를 기울이도록 보장합니다.

디코더를 인코더의 표현에 연결하는 메커니즘은 무엇입니까?

교차 주의를 통해 각 디코더 계층은 인코더의 숨겨진 상태를 쿼리하여 입력 이해를 출력 생성과 연결합니다.

다음 중 인코더-디코더(시퀀스-시퀀스) 아키텍처는 무엇입니까?

T5(및 BART)는 작업을 텍스트 대 텍스트로 구성하는 고전적인 인코더-디코더 모델입니다. BERT는 인코더 전용이고 GPT-3은 디코더 전용입니다.

인코더-디코더 설계가 번역에 자연스럽게 적합한 이유는 무엇입니까?

번역은 하나의 시퀀스를 다른 시퀀스에 매핑하므로 전체 소스(인코더)를 읽고 새 대상(디코더)을 생성하는 것이 완벽하게 맞습니다.