สถาปัตยกรรมตัวเข้ารหัส-ตัวถอดรหัส
สถาปัตยกรรมตัวเข้ารหัส-ตัวถอดรหัสแบ่งโมเดลออกเป็นสองซีก: ส่วนแรกอ่านและบีบอัดอินพุตให้เป็นการนำเสนอภายในที่สมบูรณ์ และอีกส่วนสร้างเอาต์พุตจากนั้น
ภาพรวม
This design powers translation, summarization, and any task where the input and output are different sequences.
เจาะลึก
โมเดลตัวเข้ารหัส-ตัวถอดรหัสจะประมวลผลปัญหาในสองขั้นตอน ตัวเข้ารหัสจะอ่านลำดับอินพุตทั้งหมด (เช่น ประโยคภาษาอังกฤษ) และเปลี่ยนให้เป็นชุดของเวกเตอร์บริบทที่จับความหมาย จากนั้นตัวถอดรหัสจะสร้างลำดับเอาต์พุต (เช่น ภาษาฝรั่งเศส) ทีละโทเค็น โดยมองย้อนกลับไปที่เอาต์พุตก่อนหน้าของตัวเองและการแสดงแทนของตัวเข้ารหัส Transformer ดั้งเดิมปี 2017 เป็นตัวเข้ารหัส-ตัวถอดรหัสที่สร้างขึ้นสำหรับการแปล โมเดลอย่าง T5 และ BART ใช้รูปร่างนี้และจัดเฟรมทุกงานเป็นข้อความเข้าและข้อความออก การแยกมีประสิทธิภาพมากเนื่องจากตัวเข้ารหัสสามารถดูอินพุตทั้งหมดได้ในคราวเดียว (บริบทแบบสองทิศทาง) ในขณะที่ตัวถอดรหัสจะสร้างจากซ้ายไปขวา ทำให้การออกแบบมีความพอดีอย่างเป็นธรรมชาติสำหรับปัญหาแบบลำดับต่อลำดับที่ความยาวของเอาต์พุตและเนื้อหาแตกต่างจากอินพุต
ข้อมูลเชิงลึกทางเทคนิค
ตัวเข้ารหัสใช้การเอาใจใส่ตนเองแบบสองทิศทาง ดังนั้นโทเค็นอินพุตทุกตัวจะเข้าร่วมกับโทเค็นอื่น ๆ ในคราวเดียว ตัวถอดรหัสเป็นแบบถดถอยอัตโนมัติและใช้การเอาใจใส่ตนเองแบบปกปิด ซึ่งหมายความว่าแต่ละตำแหน่งจะมองเห็นเฉพาะตำแหน่งก่อนหน้าเท่านั้นเพื่อรักษาการสร้างสาเหตุไว้ การเชื่อมต่อสิ่งเหล่านี้ถือเป็นการให้ความสนใจข้ามมิติ: ชั้นตัวถอดรหัสจะสอบถามสถานะที่ซ่อนอยู่สุดท้ายของตัวเข้ารหัส การแยกนี้ช่วยให้ตัวเข้ารหัสสร้างความเข้าใจที่สมบูรณ์และไม่ขึ้นอยู่กับลำดับ ในขณะที่ตัวถอดรหัสยอมรับโทเค็นทีละอัน
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของสถาปัตยกรรมตัวเข้ารหัส-ตัวถอดรหัส
ขณะนี้โมเดลที่ใช้ตัวถอดรหัสเท่านั้นเช่น GPT ครองการแชทแบบทั่วไป เนื่องจากสแต็กเดียวจะขยายขนาดและจัดการงานต่างๆ มากมายผ่านการแจ้ง แต่การออกแบบตัวเข้ารหัสและตัวถอดรหัสยังคงมีอยู่ โดยที่ความเข้าใจอินพุตและการสร้างเอาต์พุตมีความแตกต่างกันอย่างแท้จริง เช่น การรู้จำเสียงพูด (กระซิบ) การสรุปเอกสาร และระบบหลายรูปแบบที่จับคู่ตัวเข้ารหัสการมองเห็นกับตัวถอดรหัสข้อความ คาดว่าจะมีสถาปัตยกรรมแบบไฮบริดที่ยืมความเข้าใจแบบสองทิศทางของตัวเข้ารหัสเพื่อการดึงและการต่อสายดิน ในขณะเดียวกันก็รักษาความยืดหยุ่นของตัวถอดรหัส โดยเฉพาะอย่างยิ่งเมื่อโมเดลหลอมรวมข้อความ เสียง และรูปภาพ
การใช้งานจริงในโลกแห่งความเป็นจริง
Google แปลและ DeepL ใช้ Transformers ตัวเข้ารหัสเพื่อจับคู่ประโยคในภาษาหนึ่งไปยังอีกภาษาหนึ่ง
Whisper ของ OpenAI เข้ารหัสสเปกตรัมเสียงและถอดรหัสเป็นข้อความที่ถอดเสียงหรือแปล
T5 และ BART ขับเคลื่อนการสรุปเชิงนามธรรม โดยย่อบทความยาวๆ ให้เป็นบทสรุปสั้นๆ
ระบบคำบรรยายภาพจะจับคู่ตัวเข้ารหัสการมองเห็นกับตัวถอดรหัสข้อความเพื่ออธิบายรูปภาพเป็นคำพูด
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Encoder-Decoder Architectures quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
Cross-Encoder และ Bi-Encoder
คำถามที่พบบ่อย
What is Encoder-Decoder Architectures?
สถาปัตยกรรมตัวเข้ารหัส-ตัวถอดรหัสแบ่งโมเดลออกเป็นสองซีก: ส่วนแรกอ่านและบีบอัดอินพุตให้เป็นการนำเสนอภายในที่สมบูรณ์ และอีกส่วนสร้างเอาต์พุตจากนั้น การออกแบบนี้ขับเคลื่อนการแปล การสรุป และงานใดๆ ที่อินพุตและเอาท์พุตมีลำดับต่างกัน
งานหลักของตัวเข้ารหัสในโมเดลตัวเข้ารหัส-ตัวถอดรหัสคืออะไร?
ตัวเข้ารหัสใช้ลำดับอินพุตทั้งหมดและสร้างเวกเตอร์ตามบริบทเพื่อจับความหมายของมัน ซึ่งตัวถอดรหัสจะใช้
เหตุใดตัวถอดรหัสจึงใช้การเอาใจใส่ตนเองแบบปกปิด (เชิงสาเหตุ)
การมาสก์ช่วยให้แน่ใจว่าแต่ละตำแหน่งเอาต์พุตจะเข้าร่วมเฉพาะตำแหน่งก่อนหน้า โดยรักษาลำดับการสร้างการถดถอยอัตโนมัติจากซ้ายไปขวา
กลไกใดที่เชื่อมต่อตัวถอดรหัสกับตัวแทนของตัวเข้ารหัส?
ความสนใจแบบข้ามช่วยให้แต่ละชั้นของตัวถอดรหัสสามารถสืบค้นสถานะที่ซ่อนอยู่ของตัวเข้ารหัสได้ โดยเชื่อมโยงความเข้าใจของอินพุตเข้ากับการสร้างเอาต์พุต
โมเดลใดต่อไปนี้เป็นสถาปัตยกรรมตัวเข้ารหัส-ตัวถอดรหัส (ลำดับต่อลำดับ)
T5 (และ BART) เป็นโมเดลตัวเข้ารหัสและตัวถอดรหัสแบบคลาสสิกที่จัดเฟรมงานเป็นข้อความเป็นข้อความ BERT เป็นตัวเข้ารหัสเท่านั้นและ GPT-3 เป็นตัวถอดรหัสเท่านั้น
เหตุใดการออกแบบตัวเข้ารหัส-ตัวถอดรหัสจึงเหมาะสมอย่างเป็นธรรมชาติสำหรับการแปล
การแปลจะจับคู่ลำดับหนึ่งกับอีกลำดับหนึ่ง ดังนั้นการอ่านแหล่งที่มาทั้งหมด (ตัวเข้ารหัส) และการสร้างเป้าหมายใหม่ (ตัวถอดรหัส) จึงเหมาะสมอย่างยิ่ง