Kiến trúc bộ mã hóa-giải mã
Kiến trúc bộ mã hóa-giải mã chia mô hình thành hai nửa: một nửa đọc và nén đầu vào thành biểu diễn bên trong phong phú và một nửa tạo ra đầu ra từ nó.
Tổng quan
Thiết kế này hỗ trợ dịch thuật, tóm tắt và bất kỳ nhiệm vụ nào trong đó đầu vào và đầu ra là các trình tự khác nhau.
Lặn sâu
Mô hình bộ mã hóa-giải mã xử lý một vấn đề theo hai giai đoạn. Bộ mã hóa đọc toàn bộ chuỗi đầu vào (chẳng hạn như một câu tiếng Anh) và biến nó thành một tập hợp các vectơ ngữ cảnh để nắm bắt ý nghĩa. Sau đó, bộ giải mã tạo ra chuỗi đầu ra (giả sử là tiếng Pháp) một mã thông báo tại một thời điểm, nhìn lại các đầu ra trước đó của chính nó và các biểu diễn của bộ mã hóa. Transformer 2017 ban đầu là một bộ mã hóa-giải mã được thiết kế để dịch thuật. Các mô hình như T5 và BART sử dụng hình dạng này và đóng khung mọi tác vụ dưới dạng văn bản vào, văn bản ra. Khả năng phân chia mạnh mẽ vì bộ mã hóa có thể nhìn thấy toàn bộ đầu vào cùng một lúc (bối cảnh hai chiều), trong khi bộ giải mã tạo từ trái sang phải. Điều này làm cho thiết kế phù hợp một cách tự nhiên với các vấn đề tuần tự trong đó độ dài và nội dung đầu ra khác với đầu vào.
Hiểu biết kỹ thuật
Bộ mã hóa sử dụng tính năng tự chú ý hai chiều, do đó, mọi mã thông báo đầu vào sẽ xử lý mọi mã thông báo khác cùng một lúc. Bộ giải mã có tính tự hồi phục và sử dụng khả năng tự chú ý một cách ẩn giấu, nghĩa là mỗi vị trí chỉ có thể nhìn thấy các vị trí trước đó để duy trì khả năng tạo nhân quả. Việc kết nối chúng là sự chú ý chéo: các lớp giải mã truy vấn trạng thái ẩn cuối cùng của bộ mã hóa. Sự tách biệt này cho phép bộ mã hóa xây dựng sự hiểu biết hoàn chỉnh, không phụ thuộc vào thứ tự trong khi bộ giải mã cam kết sử dụng một mã thông báo tại một thời điểm.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của kiến trúc mã hóa-giải mã
Các mô hình chỉ dành cho bộ giải mã như GPT hiện thống trị cuộc trò chuyện có mục đích chung vì một ngăn xếp duy nhất có thể mở rộng quy mô một cách đơn giản và xử lý nhiều tác vụ thông qua lời nhắc. Tuy nhiên, các thiết kế bộ mã hóa-giải mã vẫn tồn tại trong đó khả năng hiểu đầu vào và tạo đầu ra thực sự khác biệt: nhận dạng giọng nói (Thì thầm), tóm tắt tài liệu và hệ thống đa phương thức ghép nối bộ mã hóa hình ảnh với bộ giải mã văn bản. Yêu cầu các kiến trúc kết hợp mượn khả năng hiểu hai chiều của bộ mã hóa để truy xuất và nối đất trong khi vẫn giữ được tính linh hoạt của bộ giải mã, đặc biệt khi các mô hình hợp nhất văn bản, âm thanh và hình ảnh.
Triển khai trong thế giới thực
Google Translate và DeepL sử dụng Transformers bộ mã hóa-giải mã để ánh xạ một câu trong ngôn ngữ này sang ngôn ngữ khác.
OpenAI's Whisper mã hóa phổ âm thanh và giải mã chúng thành văn bản được phiên âm hoặc dịch.
T5 và BART có khả năng tóm tắt trừu tượng mạnh mẽ, cô đọng các bài viết dài thành những bản tóm tắt ngắn.
Hệ thống chú thích hình ảnh kết hợp bộ mã hóa hình ảnh với bộ giải mã văn bản để mô tả ảnh bằng từ ngữ.
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Encoder-Decoder Architectures quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Bộ mã hóa chéo và bộ mã hóa kép
Câu hỏi thường gặp
Kiến trúc bộ mã hóa-giải mã là gì?
Kiến trúc bộ mã hóa-giải mã chia mô hình thành hai nửa: một nửa đọc và nén đầu vào thành biểu diễn bên trong phong phú và một nửa tạo ra đầu ra từ nó. Thiết kế này hỗ trợ dịch thuật, tóm tắt và bất kỳ nhiệm vụ nào trong đó đầu vào và đầu ra là các trình tự khác nhau.
Công việc chính của bộ mã hóa trong mô hình bộ mã hóa-giải mã là gì?
Bộ mã hóa sử dụng toàn bộ chuỗi đầu vào và tạo ra các vectơ ngữ cảnh nắm bắt ý nghĩa của nó, sau đó bộ giải mã sẽ sử dụng.
Tại sao bộ giải mã lại sử dụng tính năng tự chú ý bị che giấu (nhân quả)?
Việc che dấu đảm bảo mỗi vị trí đầu ra chỉ tham gia vào các vị trí trước đó, duy trì thứ tự tạo tự hồi quy từ trái sang phải.
Cơ chế nào kết nối bộ giải mã với các biểu diễn của bộ mã hóa?
Sự chú ý chéo cho phép mỗi lớp bộ giải mã truy vấn các trạng thái ẩn của bộ mã hóa, liên kết việc hiểu đầu vào với việc tạo đầu ra.
Mô hình nào trong số này là kiến trúc bộ mã hóa-giải mã (chuỗi nối tiếp)?
T5 (và BART) là các mô hình mã hóa-giải mã cổ điển đóng khung các tác vụ dưới dạng chuyển văn bản thành văn bản. BERT chỉ dành cho bộ mã hóa và GPT-3 chỉ dành cho bộ giải mã.
Tại sao thiết kế bộ mã hóa-giải mã lại phù hợp tự nhiên cho dịch thuật?
Bản dịch ánh xạ một chuỗi sang một chuỗi khác, do đó việc đọc toàn bộ nguồn (bộ mã hóa) và tạo ra mục tiêu mới (bộ giải mã) hoàn toàn phù hợp.